VideoX-Fun

September 24, 2026 · View on GitHub

😊 ようこそ!

CogVideoX-Fun: Hugging Face Spaces

Wan-Fun: Hugging Face Spaces

English | 简体中文 | 日本語

目次

一、紹介

VideoX-Funはビデオ生成のパイプラインであり、AI画像やビデオの生成、Diffusion TransformerのベースラインモデルとLoraモデルのトレーニングに使用できます。我々は、すでに学習済みのベースラインモデルから直接予測を行い、異なる解像度、秒数、FPSのビデオを生成することをサポートしています。また、ユーザーが独自のベースラインモデルやLoraモデルをトレーニングし、特定のスタイル変換を行うこともサポートしています。

二、クイックスタートと使用

1. 環境準備

1.1 クラウド使用: AliyunDSW

DSWには無料のGPU時間があり、ユーザーは一度申請でき、申請後3か月間有効です。

AliyunはFreetierで無料のGPU時間を提供しています。取得してAliyun PAI-DSWで使用し、5分以内にCogVideoX-Funを開始できます!

DSW Notebook

1.2 ローカル依存のインストール

以下の環境でこのライブラリの実行を確認しています:

Windowsの詳細:

  • OS: Windows 10
  • python: python3.10 & python3.11
  • pytorch: torch2.2.0
  • CUDA: 11.8 & 12.1
  • CUDNN: 8+
  • GPU: Nvidia-3060 12G & Nvidia-3090 24G

Linuxの詳細:

  • OS: Ubuntu 20.04, CentOS
  • python: python3.10 & python3.11
  • pytorch: torch2.2.0
  • CUDA: 11.8 & 12.1
  • CUDNN: 8+
  • GPU:Nvidia-V100 16G & Nvidia-A10 24G & Nvidia-A100 40G & Nvidia-A100 80G

重みを保存するために約60GBのディスクスペースが必要です。確認してください!

1.3 Dockerの使用

Dockerを使用する場合、マシンにグラフィックスカードドライバとCUDA環境が正しくインストールされていることを確認してください。

次のコマンドをこの方法で実行します:

# イメージをプル
docker pull mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun

# イメージに入る
docker run -it -p 7860:7860 --network host --gpus all --security-opt seccomp:unconfined --shm-size 200g mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun

# コードをクローン
git clone https://github.com/aigc-apps/VideoX-Fun.git

# VideoX-Funのディレクトリに入る
cd VideoX-Fun

# 重みをダウンロード
mkdir models/Diffusion_Transformer
mkdir models/Personalized_Model

# Please use the hugginface link or modelscope link to download the model.
# CogVideoX-Fun
# https://huggingface.co/alibaba-pai/CogVideoX-Fun-V1.1-5b-InP
# https://modelscope.cn/models/PAI/CogVideoX-Fun-V1.1-5b-InP

# Wan
# https://huggingface.co/alibaba-pai/Wan2.1-Fun-V1.1-14B-InP
# https://modelscope.cn/models/PAI/Wan2.1-Fun-V1.1-14B-InP

1.4 重みの配置

重みを指定されたパスに配置することをお勧めします:

ComfyUIを通じて: モデルをComfyUIの重みフォルダ ComfyUI/models/Fun_Models/ に入れます:

📦 ComfyUI/
├── 📂 models/
│   └── 📂 Fun_Models/
│       ├── 📂 CogVideoX-Fun-V1.1-2b-InP/
│       ├── 📂 CogVideoX-Fun-V1.1-5b-InP/
│       ├── 📂 Wan2.1-Fun-V1.1-14B-InP
│       └── 📂 Wan2.1-Fun-V1.1-1.3B-InP/

独自のpythonファイルまたはUIインターフェースを実行:

📦 models/
├── 📂 Diffusion_Transformer/
│   ├── 📂 CogVideoX-Fun-V1.1-2b-InP/
│   ├── 📂 CogVideoX-Fun-V1.1-5b-InP/
│   ├── 📂 Wan2.1-Fun-V1.1-14B-InP
│   └── 📂 Wan2.1-Fun-V1.1-1.3B-InP/
├── 📂 Personalized_Model/
│   └── あなたのトレーニング済みのトランスフォーマーモデル / あなたのトレーニング済みのLoraモデル(UIロード用)

2. 推論生成

ビデオモデルと画像モデルの推論入口は完全に一致しており、examples/{model_name}/下のスクリプトまたはUIから実行します。

2.1 入口の選択

使用入口適用シーン設定粒度
Pythonファイルバッチ生成、スクリプト内でパラメータを調整全パラメータ
WebUI対話的な体験、モデルの迅速な切り替えよく使うパラメータのみ
ComfyUI既存のComfyUIワークフローノードパラメータ

表:推論入口の選択

2.2 顕存節約方案

Wan2.1のパラメータが非常に大きいため、GPUメモリを節約し、コンシューマー向けGPUに適応させる必要があります。各予測ファイルにはGPU_memory_modeを提供しており、model_cpu_offload、model_cpu_offload_and_qfloat8、sequential_cpu_offloadの中から選択できます。この方法はCogVideoX-Funの生成にも適用されます。

  • model_cpu_offload: モデル全体が使用後にCPUに移動し、一部のGPUメモリを節約します。
  • model_cpu_offload_and_qfloat8: モデル全体が使用後にCPUに移動し、Transformerモデルに対してfloat8の量子化を行い、より多くのGPUメモリを節約します。
  • sequential_cpu_offload: モデルの各層が使用後にCPUに移動します。速度は遅くなりますが、大量のGPUメモリを節約します。

qfloat8はモデルの性能を部分的に低下させる可能性がありますが、より多くのGPUメモリを節約できます。十分なGPUメモリがある場合は、model_cpu_offloadの使用をお勧めします。

2.3 Pythonファイルから

i. 単一GPUでの推論:
  • ステップ1: 対応する重みをダウンロードし、modelsフォルダに配置します。
  • ステップ2: 異なる重みと予測目標に基づいて、異なるファイルを使用して予測を行います。現在、このライブラリはCogVideoX-Fun、Wan2.1、およびWan2.1-Funをサポートしています。examplesフォルダ内のフォルダ名で区別され、異なるモデルがサポートする機能が異なりますので、状況に応じて区別してください。以下はCogVideoX-Funを例として説明します。
    • テキストからビデオ:
      • examples/cogvideox_fun/predict_t2v.pyファイルでprompt、neg_prompt、guidance_scale、seedを変更します。
      • 次に、examples/cogvideox_fun/predict_t2v.pyファイルを実行し、結果が生成されるのを待ちます。結果はsamples/cogvideox-fun-videosフォルダに保存されます。
    • 画像からビデオ:
      • examples/cogvideox_fun/predict_i2v.pyファイルでvalidation_image_start、validation_image_end、prompt、neg_prompt、guidance_scale、seedを変更します。
      • validation_image_startはビデオの開始画像、validation_image_endはビデオの終了画像です。
      • 次に、examples/cogvideox_fun/predict_i2v.pyファイルを実行し、結果が生成されるのを待ちます。結果はsamples/cogvideox-fun-videos_i2vフォルダに保存されます。
    • ビデオからビデオ:
      • examples/cogvideox_fun/predict_v2v.pyファイルでvalidation_video、validation_image_end、prompt、neg_prompt、guidance_scale、seedを変更します。
      • validation_videoはビデオ生成のための参照ビデオです。以下のデモビデオを使用して実行できます:デモビデオ
      • 次に、examples/cogvideox_fun/predict_v2v.pyファイルを実行し、結果が生成されるのを待ちます。結果はsamples/cogvideox-fun-videos_v2vフォルダに保存されます。
    • 通常の制御付きビデオ生成(Canny、Pose、Depthなど):
      • examples/cogvideox_fun/predict_v2v_control.pyファイルでcontrol_video、validation_image_end、prompt、neg_prompt、guidance_scale、seedを変更します。
      • control_videoは、Canny、Pose、Depthなどの演算子で抽出された制御用ビデオです。以下のデモビデオを使用して実行できます:デモビデオ
      • 次に、examples/cogvideox_fun/predict_v2v_control.pyファイルを実行し、結果が生成されるのを待ちます。結果はsamples/cogvideox-fun-videos_v2v_controlフォルダに保存されます。
  • ステップ3: 自分でトレーニングした他のバックボーンやLoraを組み合わせたい場合は、必要に応じてexamples/{model_name}/predict_t2v.pyやexamples/{model_name}/predict_i2v.py、lora_pathを修正します。
ii. 複数GPUでの推論:

多カードでの推論を行う際は、xfuserリポジトリのインストールに注意してください。xfuser==0.4.2 と yunchang==0.6.2 のインストールが推奨されます。

pip install xfuser==0.4.2 --progress-bar off -i https://mirrors.aliyun.com/pypi/simple/
pip install yunchang==0.6.2 --progress-bar off -i https://mirrors.aliyun.com/pypi/simple/

ulysses_degree と ring_degree の積が使用する GPU 数と一致することを確認してください。たとえば、8つのGPUを使用する場合、ulysses_degree=2 と ring_degree=4、または ulysses_degree=4 と ring_degree=2 を設定することができます。

  • ulysses_degree はヘッド(head)に分割した後の並列化を行います。
  • ring_degree はシーケンスに分割した後の並列化を行います。

ring_degree は ulysses_degree よりも通信コストが高いため、これらのパラメータを設定する際には、シーケンス長とモデルのヘッド数を考慮する必要があります。

8GPUでの並列推論を例に挙げます:

  • Wan2.1-Fun-V1.1-14B-InP はヘッド数が40あります。この場合、ulysses_degree は40で割り切れる値(例:2, 4, 8など)に設定する必要があります。したがって、8GPUを使用して並列推論を行う場合、ulysses_degree=8 と ring_degree=1 を設定できます。

  • Wan2.1-Fun-V1.1-1.3B-InP はヘッド数が12あります。この場合、ulysses_degree は12で割り切れる値(例:2, 4など)に設定する必要があります。したがって、8GPUを使用して並列推論を行う場合、ulysses_degree=4 と ring_degree=2 を設定できます。

パラメータの設定が完了したら、以下のコマンドで並列推論を実行してください:

torchrun --nproc-per-node=8 examples/wan2.1_fun/predict_t2v.py

2.4 UIインターフェースから

WebUIは、テキストからビデオ、画像からビデオ、ビデオからビデオ、および通常の制御付きビデオ生成(Canny、Pose、Depthなど)をサポートします。現在、このライブラリはCogVideoX-Fun、Wan2.1、およびWan2.1-Funをサポートしており、examplesフォルダ内のフォルダ名で区別されています。異なるモデルがサポートする機能が異なるため、状況に応じて区別してください。以下はCogVideoX-Funを例として説明します。

  • ステップ1: 対応する重みをダウンロードし、modelsフォルダに配置します。
  • ステップ2: examples/cogvideox_fun/app.pyファイルを実行し、Gradioページに入ります。
  • ステップ3: ページ上で生成モデルを選択し、prompt、neg_prompt、guidance_scale、seedなどを入力し、「生成」をクリックして結果が生成されるのを待ちます。結果はsampleフォルダに保存されます。

2.5 ComfyUIから

詳細はComfyUI READMEをご覧ください。

3. モデルのトレーニング

完全なモデルトレーニングパイプラインは、データ前処理とVideo DiTトレーニングで構成されます。

3.1 データ前処理

各モデルの訓練ドキュメントはscripts/{model_name}/下に統一されています。詳細は3.3 各モデルの訓練ドキュメントを参照してください。

長いビデオのセグメンテーション、クリーニング、説明のための完全なデータ前処理リンクは、ビデオキャプションセクションのREADMEを参照してください。

テキストから画像およびビデオ生成モデルをトレーニングしたい場合。この形式でデータセットを配置する必要があります。

📦 project/
├── 📂 datasets/
│   ├── 📂 internal_datasets/
│       ├── 📂 train/
│       │   ├── 📄 00000001.mp4
│       │   ├── 📄 00000002.jpg
│       │   └── 📄 .....
│       └── 📄 json_of_internal_datasets.json

json_of_internal_datasets.jsonは標準のJSONファイルです。json内のfile_pathは相対パスとして設定できます。以下のように:

[
    {
      "file_path": "train/00000001.mp4",
      "text": "スーツとサングラスを着た若い男性のグループが街の通りを歩いている。",
      "type": "video"
    },
    {
      "file_path": "train/00000002.jpg",
      "text": "スーツとサングラスを着た若い男性のグループが街の通りを歩いている。",
      "type": "image"
    },
    .....
]

次のように絶対パスとして設定することもできます:

[
    {
      "file_path": "/mnt/data/videos/00000001.mp4",
      "text": "スーツとサングラスを着た若い男性のグループが街の通りを歩いている。",
      "type": "video"
    },
    {
      "file_path": "/mnt/data/train/00000001.jpg",
      "text": "スーツとサングラスを着た若い男性のグループが街の通りを歩いている。",
      "type": "image"
    },
    .....
]

3.2 Video DiTのトレーニング

各モデルの訓練スクリプトと起動shはscripts/{model_name}/下にあり、shの名称はタスクによって異なります(例:train.sh、train_lora.sh、train_control.sh、train_control_distill.shなど)。ディレクトリ内の実際のファイルを基準としてください。

データ前処理時にデータ形式が相対パスの場合、scripts/{model_name}/train.shを次のように設定します。

export DATASET_NAME="datasets/internal_datasets/"
export DATASET_META_NAME="datasets/internal_datasets/json_of_internal_datasets.json"

データ形式が絶対パスの場合、同じスクリプトで次のように設定します(このときDATASET_NAMEは空にし、データセットディレクトリのプレフィックスを連結しません)。

export DATASET_NAME=""
export DATASET_META_NAME="/mnt/data/json_of_internal_datasets.json"

最後に対応するスクリプトを実行します。

sh scripts/{model_name}/train.sh

3.3 各モデルの訓練ドキュメント

パラメータ設定の詳細について、各モデルの訓練ドキュメントはscripts/{model_name}/下に統一されています。

モデルベーストレーニングLoRAトレーニングその他
Wan2.1-FunEN / ZHEN / ZHControl ZH、Reward LoRA
Wan2.2EN / ZHEN / ZHDistill ZH、S2V、Animate
Wan2.2-FunEN / ZHEN / ZHControl LoRA ZH
CogVideoX-FunEN / ZHEN / ZHControl ZH、Reward LoRA
Qwen-ImageEN / ZHEN / ZHEdit ZH
Qwen-Image-2.1EN / ZH-Control EN / ZH
Z-ImageEN / ZHEN / ZHGRPO LoRA

その他のモデルも同様に、対応するscripts/{model_name}/下のREADMEを参照してください。

三、サポート済みモデル

下表は、現在サポートされているモデル系列と重みをまとめたものです。ビデオモデルと画像モデルは同じ推論・訓練インターフェースを共有しています。各行は1つのモデル系列を表し、第4列は4列のHTML埋め込みテーブル(重み、Hugging Face、ModelScope、説明)です。🤗 は Hugging Face、🤖 は ModelScope(中国国内ネットワーク向け)、- は該当チャネルに対応リポジトリがないか、ログイン認証が必要なことを示します。各モデルの訓練ドキュメントについては3.3 各モデルの訓練ドキュメントを参照してください。

モデル系列モダリティサポートタスク重み / ダウンロード / 説明
Wan2.2-Funビデオ本プロジェクトがWan2.2で訓練した系列。テキスト/画像から動画、首尾画像、制御生成、カメラ制御をカバー
Wan2.2-Fun-A14B-InP🤗🤖Wan2.2-Fun-14Bのテキスト・画像から動画を生成するモデルの重み。複数の解像度で学習されており、動画の最初と最後のフレームの予測をサポートしています。
Wan2.2-Fun-A14B-Control🤗🤖Wan2.2-Fun-14Bの動画制御用重み。Canny、Depth、Pose、MLSDなどのさまざまな制御条件に対応しており、軌跡制御もサポートしています。512、768、1024の複数解像度での動画生成が可能で、81フレーム、16fpsで学習されています。多言語対応の予測もサポートしています。
Wan2.2-Fun-A14B-Control-Camera🤗🤖14B Controlにカメラモーション制御を追加
Wan2.2-Fun-5B-InP🤗🤖Wan2.2-Fun-5B テキストから動画生成用の重み。121フレーム、24 FPSで学習され、先頭/末尾フレーム予測をサポート。
Wan2.2-Fun-5B-Control🤗🤖Wan2.2-Fun-5B 動画制御用重み。Canny、Depth、Pose、MLSDなどの制御条件や軌道制御をサポート。121フレーム、24 FPSで学習され、多言語予測に対応。
Wan2.2-Fun-5B-Control-Camera🤗🤖Wan2.2-Fun-5B カメラレンズ制御用重み。121フレーム、24 FPSで学習され、多言語予測に対応。
Wan2.2-Fun-Reward-LoRAs🤗🤖Wan2.2-Fun生成動画を報酬逆伝播で最適化するReward LoRA集合
Wan2.2-VACE-Funビデオ本プロジェクトがVACE方式で訓練した系列。制御生成と主題参照をカバー
Wan2.2-VACE-Fun-A14B🤗🤖VACE方式でトレーニングされたWan2.2の制御ウェイト(ベースモデルはWan2.2-T2V-A14B)。Canny、Depth、Pose、MLSD、軌道制御などの異なる制御条件をサポートします。対象を指定して動画生成が可能です。多解像度(512、768、1024)の動画予測をサポートし、81フレームで16FPSでトレーニングされています。多言語予測にも対応しています。
Wan2.2ビデオWan公式重み。テキスト/画像から動画、音声駆動、キャラクターアニメーションをカバー。Wan2.2-Fun系列の訓練基線としても使用可能
Wan2.2-TI2V-5B🤗🤖Wan2.2-5B テキスト/画像から動画生成重み
Wan2.2-T2V-A14B🤗🤖Wan2.2-14B テキストから動画生成重み
Wan2.2-I2V-A14B🤗🤖Wan2.2-14B 画像から動画生成重み
Wan2.2-S2V-14B🤗🤖Wan2.2-14B 音声から動画生成重み、話者駆動デジタルヒューマン
Wan2.2-Animate-14B🤗🤖Wan2.2-14B キャラクター置換・モーション転移重み。リポジトリに複数精度ファイルを含む
Wan2.1-Fun V1.1ビデオ本プロジェクトがWan2.1で訓練したV1.1系列。マルチ解像度(512/768/1024)、81フレーム16fps、テキスト/画像から動画、首尾画像、制御生成、カメラ制御をカバー
Wan2.1-Fun-V1.1-1.3B-InP🤗🤖Wan2.1-Fun-V1.1-1.3Bのテキスト・画像から動画生成の重み。マルチ解像度で訓練され、最初と最後の画像予測をサポートします。
Wan2.1-Fun-V1.1-14B-InP🤗🤖Wan2.1-Fun-V1.1-14Bのテキスト・画像から動画生成の重み。マルチ解像度で訓練され、最初と最後の画像予測をサポートします。
Wan2.1-Fun-V1.1-1.3B-Control🤗🤖Wan2.1-Fun-V1.1-1.3Bのビデオ制御重み。Canny、Depth、Pose、MLSDなどの異なる制御条件に対応し、参照画像+制御条件を使用した制御や軌跡制御をサポートします。512、768、1024のマルチ解像度での動画予測をサポートし、81フレーム、毎秒16フレームで訓練されています。多言語予測に対応しています。
Wan2.1-Fun-V1.1-14B-Control🤗🤖Wan2.1-Fun-V1.1-14Bのビデオ制御重み。Canny、Depth、Pose、MLSDなどの異なる制御条件に対応し、参照画像+制御条件を使用した制御や軌跡制御をサポートします。512、768、1024のマルチ解像度での動画予測をサポートし、81フレーム、毎秒16フレームで訓練されています。多言語予測に対応しています。
Wan2.1-Fun-V1.1-1.3B-Control-Camera🤗🤖Wan2.1-Fun-V1.1-1.3Bのカメラレンズ制御重み。512、768、1024のマルチ解像度での動画予測をサポートし、81フレーム、毎秒16フレームで訓練されています。多言語予測に対応しています。
Wan2.1-Fun-V1.1-14B-Control-Camera🤗🤖Wan2.1-Fun-V1.1-14Bのカメラレンズ制御重み。512、768、1024のマルチ解像度での動画予測をサポートし、81フレーム、毎秒16フレームで訓練されています。多言語予測に対応しています。
Wan2.1-Fun V1.0ビデオ本プロジェクトがWan2.1で訓練したV1.0系列。V1.1と同じ能力だがカメラ制御は非対応
Wan2.1-Fun-1.3B-InP🤗🤖Wan2.1-Fun-1.3Bのテキスト・画像から動画生成する重み。マルチ解像度で学習され、開始・終了画像予測をサポート。
Wan2.1-Fun-14B-InP🤗🤖Wan2.1-Fun-14Bのテキスト・画像から動画生成する重み。マルチ解像度で学習され、開始・終了画像予測をサポート。
Wan2.1-Fun-1.3B-Control🤗🤖Wan2.1-Fun-1.3Bのビデオ制御ウェイト。Canny、Depth、Pose、MLSDなどの異なる制御条件をサポートし、トラジェクトリ制御も利用可能。512、768、1024のマルチ解像度でのビデオ予測をサポートし、81フレーム(1秒間に16フレーム)でトレーニング済みで、多言語予測にも対応しています。
Wan2.1-Fun-14B-Control🤗🤖Wan2.1-Fun-14Bのビデオ制御ウェイト。Canny、Depth、Pose、MLSDなどの異なる制御条件をサポートし、トラジェクトリ制御も利用可能。512、768、1024のマルチ解像度でのビデオ予測をサポートし、81フレーム(1秒間に16フレーム)でトレーニング済みで、多言語予測にも対応しています。
Wan2.1-Fun-Reward-LoRAs🤗🤖報酬逆伝播で訓練された整列LoRA
Wan2.1ビデオWan公式重み。テキスト/画像から動画、音声駆動、制御生成をカバー。Wan2.1-Fun系列の訓練基線としても使用可能
Wan2.1-T2V-1.3B🤗🤖1.3B文生视频
Wan2.1-T2V-14B🤗🤖14B文生视频
Wan2.1-I2V-14B-480P🤗🤖480P图生视频,是InfiniteTalk的基础模型
Wan2.1-I2V-14B-720P🤗🤖万象2.1-14B-720P 画像→動画モデルの重み
Wan2.1-VACE-1.3B🤗🤖1.3B VACE制御と主題参照
Wan2.1-VACE-14B🤗🤖14B VACE制御と主題参照
Self-Forcing / Causal-Forcing / Flex-Forcingビデオ自己回帰蒸留方案。ストリーミング生成、インタラクティブ生成、チャンク単位の注意をカバー
Self-Forcing🤗🤖自己回帰蒸留重み、Wan2.1-T2Vと組み合わせて流式・インタラクティブ生成に対応;Flex-Forcing(チャンク単位の因果/双方向注意)の重みはscripts/wan2.1_flex_forcingで訓練して生成
TurboWan / TurboDiffusionビデオTurboDiffusion方案が公開した少ステップ蒸留重み
TurboWan2.1-T2V-1.3B-480P🤗🤖1.3Bテキストから動画生成の蒸留重み。公式は.pth形式で公開、リポジトリに量子化版も含む
TurboWan2.2-I2V-A14B-720P🤗🤖14B画像から動画生成の蒸留重み。リポジトリにlow/highの2種類のノイズモデル(量子化版も含む)を含み、Personalized_Modelに配置しpredictファイルのtransformer_path/transformer_high_pathで指定
CogVideoX-Fun V1.5ビデオ公式CogVideoX-Fun V1.5重み。マルチ解像度(512/768/1024)、85フレーム8fps、画像から動画と報酬整列をカバー
CogVideoX-Fun-V1.5-5b-InP🤗🤖公式のグラフ生成ビデオモデルは、複数の解像度(512、768、1024)でビデオを予測できます。85フレーム、8フレーム/秒でトレーニングされています。
CogVideoX-Fun-V1.5-Reward-LoRAs🤗🤖公式の報酬逆伝播技術モデルで、CogVideoX-Fun-V1.5が生成するビデオを最適化し、人間の嗜好によりよく合うようにする。
CogVideoX-Fun V1.1ビデオ公式CogVideoX-Fun V1.1重み。マルチ解像度(512/768/1024/1280)、49フレーム8fps、画像から動画、ポーズ制御、制御生成、報酬整列をカバー
CogVideoX-Fun-V1.1-2b-InP🤗🤖公式のグラフ生成ビデオモデルは、複数の解像度(512、768、1024、1280)でビデオを予測できます。49フレーム、8フレーム/秒でトレーニングされています。参照画像にノイズが追加され、V1.0と比較して動きの幅が広がっています。
CogVideoX-Fun-V1.1-5b-InP🤗🤖公式のグラフ生成ビデオモデルは、複数の解像度(512、768、1024、1280)でビデオを予測できます。49フレーム、8フレーム/秒でトレーニングされています。参照画像にノイズが追加され、V1.0と比較して動きの幅が広がっています。
CogVideoX-Fun-V1.1-2b-Pose🤗🤖公式のポーズコントロールビデオモデルは、複数の解像度(512、768、1024、1280)でビデオを予測できます。49フレーム、8フレーム/秒でトレーニングされています。
CogVideoX-Fun-V1.1-5b-Pose🤗🤖公式のポーズコントロールビデオモデルは、複数の解像度(512、768、1024、1280)でビデオを予測できます。49フレーム、8フレーム/秒でトレーニングされています。
CogVideoX-Fun-V1.1-2b-Control🤗🤖公式のコントロールビデオモデルは、複数の解像度(512、768、1024、1280)でビデオを予測できます。49フレーム、8フレーム/秒でトレーニングされています。Canny、Depth、Pose、MLSDなどのさまざまなコントロール条件をサポートします。
CogVideoX-Fun-V1.1-5b-Control🤗🤖公式のコントロールビデオモデルは、複数の解像度(512、768、1024、1280)でビデオを予測できます。49フレーム、8フレーム/秒でトレーニングされています。Canny、Depth、Pose、MLSDなどのさまざまなコントロール条件をサポートします。
CogVideoX-Fun-V1.1-Reward-LoRAs🤗🤖公式の報酬逆伝播技術モデルで、CogVideoX-Fun-V1.1が生成するビデオを最適化し、人間の嗜好によりよく合うようにする。
CogVideoX-Fun V1.0ビデオ旧版重み。49フレーム8fpsで訓練。V1.1/V1.5に置き換え済み
CogVideoX-Fun-2b-InP🤗🤖公式のグラフ生成ビデオモデルは、複数の解像度(512、768、1024、1280)でビデオを予測できます。49フレーム、8フレーム/秒でトレーニングされています。
CogVideoX-Fun-5b-InP🤗🤖公式のグラフ生成ビデオモデルは、複数の解像度(512、768、1024、1280)でビデオを予測できます。49フレーム、8フレーム/秒でトレーニングされています。
HunyuanVideoビデオ公式diffusers形式重み。本プロジェクトは推論とLoRA訓練を直接サポート
HunyuanVideo🤗🤖文生视频
HunyuanVideo-I2V🤗🤖图生视频
MiniMax-H3ビデオ公式動画生成重みと本プロジェクトが訓練したControlNet
MiniMax-H3🤗🤖MiniMax-H3公式T2V/I2V重み
MiniMax-H3-Fun-Controlnet-Union🤗🤖本プロジェクトが訓練したControlNet。複数制御条件と軌跡制御をサポート
MiniMax-H3-Fun-Controlnet-Union-2.0🤗🤖本プロジェクトが訓練したControlNet(2.0版)。複数制御条件、軌跡制御、inpaint重みをサポート
TaoMate-H3ビデオ+音声MiniMax-H3をベースにした公式ストリーミング音声・動画生成アダプタ
TaoMate-H3-Adapter🤗🤖公式rank 128アダプタ(step-3000 EMA)。3ステップ蒸留サンプリングスケジュールを内蔵し、ストリーミング音声駆動生成に対応;MiniMax-H3基盤重みと組み合わせて使用
LTX-2ビデオ+音声公式DiT音声・動画共同生成重み
LTX-2🤗🤖音声・動画共同生成の公式重み。リポジトリに複数精度ファイルを含む
LTX-2.3-Diffusers🤗-v2.3はコミュニティ変換のdiffusers形式重みを使用。公式重みはLightricks/LTX-2.3を参照
LongCat-Videoビデオ公式長尺動画生成重み。LoRA訓練をサポート
LongCat-Video🤗🤖LongCat-Video公式T2V重み
LongCat-Video-Avatar🤗🤖LongCat-Video公式アバター/デジタルヒューマン重み
FantasyTalking音声駆動ビデオ音声条件付き増分重み。基盤ビデオ重みと音声エンコーダが必要
FantasyTalking🤗🤖需搭配Wan2.1-I2V-14B-720P使用
wav2vec2-base-960h🤗🤖音频编码器,放入基础权重目录并命名为audio_encoder
InfiniteTalk音声駆動ビデオ音声条件付き増分重み。基盤ビデオ重みと音声エンコーダが必要
InfiniteTalk🤗🤖InfiniteTalk公式オーディオ駆動重み
chinese-wav2vec2-base🤗🤖中国語音声エンコーダ
FlashHead音声駆動ビデオ公式高品質頭部動作デジタルヒューマン重み
SoulX-FlashHead-1_3B🤗🤖SoulX FlashHead 1.3B 音声駆動頭部重み。wav2vec音声エンコーダが必要
MOVAビデオ+音声公式MOVA重み
MOVA-360p🤗🤖画像から動画と音声・動画共同生成
LingBotビデオカメラ制御可能なワールドモデル。ディレクトリ構造はWan2.2-I2V-A14Bと一致
lingbot-world-base-cam🤗🤖カメラ制御基線重み
lingbot-video-rewriter-lora🤗🤖rewriter LoRA。Qwen3.6-27Bで構造化キャプションを生成して使用
lingbot-video-dense-1.3b🤗🤖1.3B dense版動画生成重み。1〜2枚のGPUで訓練可能
lingbot-video-moe-30b-a3b🤗🤖30B MoE(3Bアクティブ)動画生成重み。訓練には8×80GB以上を推奨
lingbot-world-fast🤗🤖蒸留少ステップワールドモデル(transformerは16シャード)。VAE/T5はlingbot-world-base-camを再利用し、推論にはFlow_Unipcサンプラーを使用
Phantomビデオ複数主体参照による動画生成の増分重み。Wan2.1-T2Vベース
Phantom-Wan-1.3B🤗-1.3B版。公式は.pth形式で公開。Personalized_Modelに配置しpredictファイルのtransformer_pathで指定
Phantom-Wan-14B🤗-14B版。公式は分割safetensors形式で公開
Qwen-Image画像公式テキストから画像生成・画像編集重み。基線とLoRA訓練をサポート
Qwen-Image🤗🤖文生图基础权重
Qwen-Image-2512🤗🤖テキストから画像生成の更新版
Qwen-Image-Edit🤗🤖图像编辑
Qwen-Image-Edit-2509🤗🤖图像编辑更新版本
Qwen-Image-Layered🤗🤖画像レイヤー分解重み。画像を複数の編集可能なRGBAレイヤーに分解可能
Qwen-Image-2.1画像公式次世代テキストから画像生成重み。シングルストリームblock-causal構造、プレフィックスKV cacheに対応
Qwen-Image-2.1🤗🤖シングルストリームblock-causal構造。全パラメータ訓練をサポート、プレフィックスKV cacheで推論を高速化
Qwen-Image ControlNet画像画像制御生成。Canny、Depth、Pose、MLSD、Scribbleをサポート
Qwen-Image-2512-Fun-Controlnet-Union🤗🤖Qwen-Image-2512のControlNet重み。Canny、Depth、Pose、MLSD、Scribbleなど、複数の制御条件をサポートします。
Qwen-Image-2.1-Fun-Controlnet-Union🤗🤖本プロジェクトがQwen-Image 2.1向けに訓練したControlNet-Union。Canny、Depth、Pose、MLSDなどの制御条件と画像補完(inpaint)をサポートします。
Qwen-Image-ControlNet-Union🤗🤖InstantX提供の同種ControlNet
Z-Image画像公式テキストから画像生成重み
Z-Image🤗🤖基础版
Z-Image-Turbo🤗🤖加速版
Z-Image-Fun画像本プロジェクトがZ-Imageで訓練したControlNetと蒸留LoRA。Canny、Depth、Pose、MLSD、Scribble、Grayをサポート
Z-Image-Fun-Controlnet-Union-2.1🤗🤖Z-ImageのControlNet重み、Canny、Depth、Pose、MLSD、ScribbleおよびGrayなど複数の制御条件に対応。
Z-Image-Turbo-Fun-Controlnet-Union🤗🤖Z-Image-Turbo用のControlNet重み。Canny、Depth、Pose、MLSDなど複数の制御条件をサポート。
Z-Image-Turbo-Fun-Controlnet-Union-2.1🤗🤖Z-Image-TurboのControlNet重み。第1版と比較して、より多くの層に追加され、より長時間トレーニングされています。Canny、Depth、Pose、MLSDなど、複数の制御条件をサポートしています。
Z-Image-Fun-Lora-Distill🤗🤖これはZ-Image用の蒸留LoRAで、ステップ数とCFGの両方を蒸留します。このモデルはCFGを必要とせず、推論には8ステップを使用します。
Flux画像公式FLUX.1/FLUX.2重みと本プロジェクトが訓練したControlNet
FLUX.1-dev🤗🤖文生图与图像编辑
FLUX.2-dev🤗🤖第二代官方权重
FLUX.2-dev-Fun-Controlnet-Union🤗🤖FLUX.2-dev用ControlNet重み
ERNIE-Image画像Baidu公式テキストから画像生成重み
ERNIE-Image🤗🤖ERNIE-Image公式画像生成重み
Lens画像Microsoft公式カメラ制御重み
Lens-🤖Lens公式カメラ制御重み
補助モデル-生成モデルではなく、報酬整列、データアノテーション、高速デコードに使用
HPSv3🤗🤖報酬逆伝播で使用されるスコアリングモデル
Qwen2-VL-7B-Instruct🤗🤖動画キャプション生成パイプラインで使用されるマルチモーダルエンコーダ
taew2_1 / taew2_2--Tiny AutoEncoder(約20MB)。Wan2.1/Wan2.2 VAEと同じlatent空間を共有し、デコード速度は完全なVAEの約100倍で、高速プレビューや低メモリ生成に使用;重みはmadebyollin/taehvより

補足説明:

  • 音声駆動・参照系モデル(FantasyTalking、InfiniteTalk、Phantom、TaoMate-H3)は増分重みであり、対応する基盤ビデオ重みと音声エンコーダを同時にダウンロードする必要があります。
  • TurboDiffusion方案はTurboWan系列の蒸留重みを公開済みです(上表参照)。Flex-Forcing、PDDなどその他の蒸留方案は公開重みがなく、scripts/{model_name}/README_TRAIN*.mdで訓練後、transformer_pathに指定して使用できます。
  • 重み名はmodels/Diffusion_Transformer/下のフォルダ名と一対一で対応します。同じ系列内の各重みは互換性がないため、推論タスクに応じて選択してください。ここに掲載されていない重みは、本プロジェクトの訓練成果物、または上流の公式リポジトリから取得する必要があります。

四、ビデオ作品

Wan2.1-Fun-V1.1-14B-InP && Wan2.1-Fun-V1.1-1.3B-InP

Wan2.1-Fun-V1.1-14B-Control && Wan2.1-Fun-V1.1-1.3B-Control

汎用制御動画 + 参照画像:

参照画像 制御動画 Wan2.1-Fun-V1.1-14B-Control Wan2.1-Fun-V1.1-1.3B-Control

汎用制御動画(Canny、Pose、Depth など)と軌跡制御:

Wan2.1-Fun-V1.1-14B-Control-Camera && Wan2.1-Fun-V1.1-1.3B-Control-Camera
Pan Up Pan Left Pan Right
Pan Down Pan Up + Pan Left Pan Up + Pan Right
CogVideoX-Fun-V1.1-5B

解像度-1024

解像度-768

解像度-512

CogVideoX-Fun-V1.1-5B-Control
美しい澄んだ目と金髪の若い女性が白い服を着て体をひねり、カメラは彼女の顔に焦点を合わせています。高品質、傑作、最高品質、高解像度、超微細、夢のような。 美しい澄んだ目と金髪の若い女性が白い服を着て体をひねり、カメラは彼女の顔に焦点を合わせています。高品質、傑作、最高品質、高解像度、超微細、夢のような。 若いクマ。

五、参考文献

六、引用

研究やプロジェクトでVideoX-Funを使用する場合は、以下の形式で引用してください:

@misc{aigc_apps_VideoX_Fun_2026,
  author = {aigc-apps},
  title = {VideoX-Fun: A Video Generation Pipeline for Diffusion Transformer},
  year = {2026},
  publisher = {GitHub},
  url = {https://github.com/aigc-apps/VideoX-Fun}
}

七、制限とリスク

  • 生成された動画には、特に複雑なシーンでアーティファクトや品質の問題がある場合があります。
  • モデルは、細かい詳細、テキストのレンダリング、または特定の芸術スタイルで苦労する場合があります。
  • パフォーマンスは、入力プロンプトの品質、解像度、その他のパラメータによって異なります。
  • この技術は、誤解を招くコンテンツ(例:ディープフェイク)を作成するために悪用される可能性があります。ユーザーは倫理的な使用に責任を持ちます。
  • モデルは、トレーニングデータに存在するバイアスを反映する可能性があります。
  • ユーザーは、実在の人物の画像や動画を使用する際、プライバシーと著作権を尊重する必要があります。

責任ある使用を推奨し、本番環境でのセーフガードの実装をお勧めします。

八、ライセンス

このプロジェクトはApache License (Version 2.0)の下でライセンスされています。

CogVideoX-2Bモデル(対応するTransformersモジュール、VAEモジュールを含む)は、Apache 2.0ライセンスの下でリリースされています。

CogVideoX-5Bモデル(Transformersモジュール)は、CogVideoXライセンスの下でリリースされています。