Skip to content

Repository files navigation

MindSpore ONE

This repository contains SoTA algorithms, models, and interesting projects in the area of multimodal understanding and content generation.

ONE is short for "ONE for all"

News

  • [2025.04.10] We release v0.3.0. More than 15 SoTA generative models are added, including Flux, CogView4, OpenSora2.0, Movie Gen 30B , CogVideoX 5B~30B. Have fun!
  • [2025.02.21] We support DeepSeek Janus-Pro, a SoTA multimodal understanding and generation model. See here
  • [2024.11.06] v0.2.0 is released

Quick tour

To install v0.3.0, please install MindSpore 2.5.0 and run pip install mindone

Alternatively, to install the latest version from the master branch, please run.

git clone https://github.com/mindspore-lab/mindone.git
cd mindone
pip install -e .

We support state-of-the-art diffusion models for generating images, audio, and video. Let's get started using Stable Diffusion 3 as an example.

Hello MindSpore from Stable Diffusion 3!

sd3
importmindsporefrommindone.diffusersimportStableDiffusion3Pipelinepipe=StableDiffusion3Pipeline.from_pretrained(
"stabilityai/stable-diffusion-3-medium-diffusers",
mindspore_dtype=mindspore.float16,
)
prompt="A cat holding a sign that says 'Hello MindSpore'"image=pipe(prompt)[0][0]
image.save("sd3.png")

run hf diffusers on mindspore

  • mindone diffusers is under active development, most tasks were tested with mindspore 2.5.0 on Ascend Atlas 800T A2 machines.
  • compatibale with hf diffusers 0.32.2
componentfeatures
pipelinesupport text-to-image,text-to-video,text-to-audio tasks 160+
modelssupport audoencoder & transformers base models same as hf diffusers 50+
schedulerssupport diffusion schedulers (e.g., ddpm and dpm solver) same as hf diffusers 35+

supported models under mindone/examples

taskmodelinferencefinetunepretraininstitute
Image-to-Videohunyuanvideo-i2v 🔥🔥✖️✖️Tencent
Text/Image-to-Videowan2.1 🔥🔥🔥✖️✖️Alibaba
Text/Image/Speech-to-Videowan2.2 🔥🔥🔥✖️✖️Alibaba
Text-to-Imagecogview4 🔥🔥🔥✖️✖️Zhipuai
Text-to-Videostep_video_t2v 🔥🔥✖️✖️StepFun
Image-Text-to-Textqwen2_vl 🔥🔥🔥✖️✖️Alibaba
Any-to-Anyjanus 🔥🔥🔥DeepSeek
Any-to-Anyemu3 🔥🔥BAAI
Class-to-Imagevar🔥🔥ByteDance
Text/Image-to-Videohpcai open sora 1.2/2.0 🔥🔥HPC-AI Tech
Text/Image-to-Videocogvideox 1.5 5B~30B 🔥🔥Zhipu
Text-to-Videoopen sora plan 1.3 🔥🔥PKU
Text-to-Videohunyuanvideo 🔥🔥Tencent
Text-to-Videomovie gen 30B 🔥🔥Meta
Video-Encode-DecodemagvitGoogle
Text-to-Imagestory_diffusion✖️✖️ByteDance
Image-to-Videodynamicrafter✖️✖️Tencent
Video-to-Videovenhancer✖️✖️Shanghai AI Lab
Text-to-Videot2v_turboGoogle
Image-to-VideosvdStability AI
Text-to-Videoanimate diffCUHK
Text/Image-to-Videovideo composerAlibaba
Text-to-Imageflux 🔥✖️Black Forest Lab
Text-to-Imagestable diffusion 3 🔥✖️Stability AI
Text-to-Imagekohya_sd_scripts✖️kohya
Text-to-Imagestable diffusion xlStability AI
Text-to-Imagestable diffusionStability AI
Text-to-Imagehunyuan_ditTencent
Text-to-Imagepixart_sigmaHuawei
Text-to-ImagefitShanghai AI Lab
Class-to-VideolatteShanghai AI Lab
Class-to-ImageditMeta
Text-to-Imaget2i-adapterShanghai AI Lab
Text-to-Imageip adapterTencent
Text-to-3DmvdreamByteDance
Image-to-3DinstantmeshTencent
Image-to-3Dsv3dStability AI
Text/Image-to-3Dhunyuan3d-1.0Tencent

supported captioner

taskmodelinferencefinetunepretrainfeatures
Image-Text-to-Textpllava 🔥✖️✖️support video and image captioning

About

one for all, Optimal generator with No Exception

Resources

Code of conduct

Contributing

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages