VideoX-Fun
September 24, 2026 · View on GitHub
😊 ようこそ!
目次
一、紹介
VideoX-Funはビデオ生成のパイプラインであり、AI画像やビデオの生成、Diffusion TransformerのベースラインモデルとLoraモデルのトレーニングに使用できます。我々は、すでに学習済みのベースラインモデルから直接予測を行い、異なる解像度、秒数、FPSのビデオを生成することをサポートしています。また、ユーザーが独自のベースラインモデルやLoraモデルをトレーニングし、特定のスタイル変換を行うこともサポートしています。
二、クイックスタートと使用
1. 環境準備
1.1 クラウド使用: AliyunDSW
DSWには無料のGPU時間があり、ユーザーは一度申請でき、申請後3か月間有効です。
AliyunはFreetierで無料のGPU時間を提供しています。取得してAliyun PAI-DSWで使用し、5分以内にCogVideoX-Funを開始できます!
1.2 ローカル依存のインストール
以下の環境でこのライブラリの実行を確認しています:
Windowsの詳細:
- OS: Windows 10
- python: python3.10 & python3.11
- pytorch: torch2.2.0
- CUDA: 11.8 & 12.1
- CUDNN: 8+
- GPU: Nvidia-3060 12G & Nvidia-3090 24G
Linuxの詳細:
- OS: Ubuntu 20.04, CentOS
- python: python3.10 & python3.11
- pytorch: torch2.2.0
- CUDA: 11.8 & 12.1
- CUDNN: 8+
- GPU:Nvidia-V100 16G & Nvidia-A10 24G & Nvidia-A100 40G & Nvidia-A100 80G
重みを保存するために約60GBのディスクスペースが必要です。確認してください!
1.3 Dockerの使用
Dockerを使用する場合、マシンにグラフィックスカードドライバとCUDA環境が正しくインストールされていることを確認してください。
次のコマンドをこの方法で実行します:
# イメージをプル
docker pull mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun
# イメージに入る
docker run -it -p 7860:7860 --network host --gpus all --security-opt seccomp:unconfined --shm-size 200g mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun
# コードをクローン
git clone https://github.com/aigc-apps/VideoX-Fun.git
# VideoX-Funのディレクトリに入る
cd VideoX-Fun
# 重みをダウンロード
mkdir models/Diffusion_Transformer
mkdir models/Personalized_Model
# Please use the hugginface link or modelscope link to download the model.
# CogVideoX-Fun
# https://huggingface.co/alibaba-pai/CogVideoX-Fun-V1.1-5b-InP
# https://modelscope.cn/models/PAI/CogVideoX-Fun-V1.1-5b-InP
# Wan
# https://huggingface.co/alibaba-pai/Wan2.1-Fun-V1.1-14B-InP
# https://modelscope.cn/models/PAI/Wan2.1-Fun-V1.1-14B-InP
1.4 重みの配置
重みを指定されたパスに配置することをお勧めします:
ComfyUIを通じて:
モデルをComfyUIの重みフォルダ ComfyUI/models/Fun_Models/ に入れます:
📦 ComfyUI/
├── 📂 models/
│ └── 📂 Fun_Models/
│ ├── 📂 CogVideoX-Fun-V1.1-2b-InP/
│ ├── 📂 CogVideoX-Fun-V1.1-5b-InP/
│ ├── 📂 Wan2.1-Fun-V1.1-14B-InP
│ └── 📂 Wan2.1-Fun-V1.1-1.3B-InP/
独自のpythonファイルまたはUIインターフェースを実行:
📦 models/
├── 📂 Diffusion_Transformer/
│ ├── 📂 CogVideoX-Fun-V1.1-2b-InP/
│ ├── 📂 CogVideoX-Fun-V1.1-5b-InP/
│ ├── 📂 Wan2.1-Fun-V1.1-14B-InP
│ └── 📂 Wan2.1-Fun-V1.1-1.3B-InP/
├── 📂 Personalized_Model/
│ └── あなたのトレーニング済みのトランスフォーマーモデル / あなたのトレーニング済みのLoraモデル(UIロード用)
2. 推論生成
ビデオモデルと画像モデルの推論入口は完全に一致しており、examples/{model_name}/下のスクリプトまたはUIから実行します。
2.1 入口の選択
| 使用入口 | 適用シーン | 設定粒度 |
|---|---|---|
| Pythonファイル | バッチ生成、スクリプト内でパラメータを調整 | 全パラメータ |
| WebUI | 対話的な体験、モデルの迅速な切り替え | よく使うパラメータのみ |
| ComfyUI | 既存のComfyUIワークフロー | ノードパラメータ |
表:推論入口の選択
2.2 顕存節約方案
Wan2.1のパラメータが非常に大きいため、GPUメモリを節約し、コンシューマー向けGPUに適応させる必要があります。各予測ファイルにはGPU_memory_modeを提供しており、model_cpu_offload、model_cpu_offload_and_qfloat8、sequential_cpu_offloadの中から選択できます。この方法はCogVideoX-Funの生成にも適用されます。
model_cpu_offload: モデル全体が使用後にCPUに移動し、一部のGPUメモリを節約します。model_cpu_offload_and_qfloat8: モデル全体が使用後にCPUに移動し、Transformerモデルに対してfloat8の量子化を行い、より多くのGPUメモリを節約します。sequential_cpu_offload: モデルの各層が使用後にCPUに移動します。速度は遅くなりますが、大量のGPUメモリを節約します。
qfloat8はモデルの性能を部分的に低下させる可能性がありますが、より多くのGPUメモリを節約できます。十分なGPUメモリがある場合は、model_cpu_offloadの使用をお勧めします。
2.3 Pythonファイルから
i. 単一GPUでの推論:
- ステップ1: 対応する重みをダウンロードし、
modelsフォルダに配置します。 - ステップ2: 異なる重みと予測目標に基づいて、異なるファイルを使用して予測を行います。現在、このライブラリはCogVideoX-Fun、Wan2.1、およびWan2.1-Funをサポートしています。
examplesフォルダ内のフォルダ名で区別され、異なるモデルがサポートする機能が異なりますので、状況に応じて区別してください。以下はCogVideoX-Funを例として説明します。- テキストからビデオ:
examples/cogvideox_fun/predict_t2v.pyファイルでprompt、neg_prompt、guidance_scale、seedを変更します。- 次に、
examples/cogvideox_fun/predict_t2v.pyファイルを実行し、結果が生成されるのを待ちます。結果はsamples/cogvideox-fun-videosフォルダに保存されます。
- 画像からビデオ:
examples/cogvideox_fun/predict_i2v.pyファイルでvalidation_image_start、validation_image_end、prompt、neg_prompt、guidance_scale、seedを変更します。validation_image_startはビデオの開始画像、validation_image_endはビデオの終了画像です。- 次に、
examples/cogvideox_fun/predict_i2v.pyファイルを実行し、結果が生成されるのを待ちます。結果はsamples/cogvideox-fun-videos_i2vフォルダに保存されます。
- ビデオからビデオ:
examples/cogvideox_fun/predict_v2v.pyファイルでvalidation_video、validation_image_end、prompt、neg_prompt、guidance_scale、seedを変更します。validation_videoはビデオ生成のための参照ビデオです。以下のデモビデオを使用して実行できます:デモビデオ- 次に、
examples/cogvideox_fun/predict_v2v.pyファイルを実行し、結果が生成されるのを待ちます。結果はsamples/cogvideox-fun-videos_v2vフォルダに保存されます。
- 通常の制御付きビデオ生成(Canny、Pose、Depthなど):
examples/cogvideox_fun/predict_v2v_control.pyファイルでcontrol_video、validation_image_end、prompt、neg_prompt、guidance_scale、seedを変更します。control_videoは、Canny、Pose、Depthなどの演算子で抽出された制御用ビデオです。以下のデモビデオを使用して実行できます:デモビデオ- 次に、
examples/cogvideox_fun/predict_v2v_control.pyファイルを実行し、結果が生成されるのを待ちます。結果はsamples/cogvideox-fun-videos_v2v_controlフォルダに保存されます。
- テキストからビデオ:
- ステップ3: 自分でトレーニングした他のバックボーンやLoraを組み合わせたい場合は、必要に応じて
examples/{model_name}/predict_t2v.pyやexamples/{model_name}/predict_i2v.py、lora_pathを修正します。
ii. 複数GPUでの推論:
多カードでの推論を行う際は、xfuserリポジトリのインストールに注意してください。xfuser==0.4.2 と yunchang==0.6.2 のインストールが推奨されます。
pip install xfuser==0.4.2 --progress-bar off -i https://mirrors.aliyun.com/pypi/simple/
pip install yunchang==0.6.2 --progress-bar off -i https://mirrors.aliyun.com/pypi/simple/
ulysses_degree と ring_degree の積が使用する GPU 数と一致することを確認してください。たとえば、8つのGPUを使用する場合、ulysses_degree=2 と ring_degree=4、または ulysses_degree=4 と ring_degree=2 を設定することができます。
ulysses_degreeはヘッド(head)に分割した後の並列化を行います。ring_degreeはシーケンスに分割した後の並列化を行います。
ring_degree は ulysses_degree よりも通信コストが高いため、これらのパラメータを設定する際には、シーケンス長とモデルのヘッド数を考慮する必要があります。
8GPUでの並列推論を例に挙げます:
-
Wan2.1-Fun-V1.1-14B-InP はヘッド数が40あります。この場合、
ulysses_degreeは40で割り切れる値(例:2, 4, 8など)に設定する必要があります。したがって、8GPUを使用して並列推論を行う場合、ulysses_degree=8とring_degree=1を設定できます。 -
Wan2.1-Fun-V1.1-1.3B-InP はヘッド数が12あります。この場合、
ulysses_degreeは12で割り切れる値(例:2, 4など)に設定する必要があります。したがって、8GPUを使用して並列推論を行う場合、ulysses_degree=4とring_degree=2を設定できます。
パラメータの設定が完了したら、以下のコマンドで並列推論を実行してください:
torchrun --nproc-per-node=8 examples/wan2.1_fun/predict_t2v.py
2.4 UIインターフェースから
WebUIは、テキストからビデオ、画像からビデオ、ビデオからビデオ、および通常の制御付きビデオ生成(Canny、Pose、Depthなど)をサポートします。現在、このライブラリはCogVideoX-Fun、Wan2.1、およびWan2.1-Funをサポートしており、examplesフォルダ内のフォルダ名で区別されています。異なるモデルがサポートする機能が異なるため、状況に応じて区別してください。以下はCogVideoX-Funを例として説明します。
- ステップ1: 対応する重みをダウンロードし、
modelsフォルダに配置します。 - ステップ2:
examples/cogvideox_fun/app.pyファイルを実行し、Gradioページに入ります。 - ステップ3: ページ上で生成モデルを選択し、
prompt、neg_prompt、guidance_scale、seedなどを入力し、「生成」をクリックして結果が生成されるのを待ちます。結果はsampleフォルダに保存されます。
2.5 ComfyUIから
詳細はComfyUI READMEをご覧ください。
3. モデルのトレーニング
完全なモデルトレーニングパイプラインは、データ前処理とVideo DiTトレーニングで構成されます。
3.1 データ前処理
各モデルの訓練ドキュメントはscripts/{model_name}/下に統一されています。詳細は3.3 各モデルの訓練ドキュメントを参照してください。
長いビデオのセグメンテーション、クリーニング、説明のための完全なデータ前処理リンクは、ビデオキャプションセクションのREADMEを参照してください。
テキストから画像およびビデオ生成モデルをトレーニングしたい場合。この形式でデータセットを配置する必要があります。
📦 project/
├── 📂 datasets/
│ ├── 📂 internal_datasets/
│ ├── 📂 train/
│ │ ├── 📄 00000001.mp4
│ │ ├── 📄 00000002.jpg
│ │ └── 📄 .....
│ └── 📄 json_of_internal_datasets.json
json_of_internal_datasets.jsonは標準のJSONファイルです。json内のfile_pathは相対パスとして設定できます。以下のように:
[
{
"file_path": "train/00000001.mp4",
"text": "スーツとサングラスを着た若い男性のグループが街の通りを歩いている。",
"type": "video"
},
{
"file_path": "train/00000002.jpg",
"text": "スーツとサングラスを着た若い男性のグループが街の通りを歩いている。",
"type": "image"
},
.....
]
次のように絶対パスとして設定することもできます:
[
{
"file_path": "/mnt/data/videos/00000001.mp4",
"text": "スーツとサングラスを着た若い男性のグループが街の通りを歩いている。",
"type": "video"
},
{
"file_path": "/mnt/data/train/00000001.jpg",
"text": "スーツとサングラスを着た若い男性のグループが街の通りを歩いている。",
"type": "image"
},
.....
]
3.2 Video DiTのトレーニング
各モデルの訓練スクリプトと起動shはscripts/{model_name}/下にあり、shの名称はタスクによって異なります(例:train.sh、train_lora.sh、train_control.sh、train_control_distill.shなど)。ディレクトリ内の実際のファイルを基準としてください。
データ前処理時にデータ形式が相対パスの場合、scripts/{model_name}/train.shを次のように設定します。
export DATASET_NAME="datasets/internal_datasets/"
export DATASET_META_NAME="datasets/internal_datasets/json_of_internal_datasets.json"
データ形式が絶対パスの場合、同じスクリプトで次のように設定します(このときDATASET_NAMEは空にし、データセットディレクトリのプレフィックスを連結しません)。
export DATASET_NAME=""
export DATASET_META_NAME="/mnt/data/json_of_internal_datasets.json"
最後に対応するスクリプトを実行します。
sh scripts/{model_name}/train.sh
3.3 各モデルの訓練ドキュメント
パラメータ設定の詳細について、各モデルの訓練ドキュメントはscripts/{model_name}/下に統一されています。
| モデル | ベーストレーニング | LoRAトレーニング | その他 |
|---|---|---|---|
| Wan2.1-Fun | EN / ZH | EN / ZH | Control ZH、Reward LoRA |
| Wan2.2 | EN / ZH | EN / ZH | Distill ZH、S2V、Animate |
| Wan2.2-Fun | EN / ZH | EN / ZH | Control LoRA ZH |
| CogVideoX-Fun | EN / ZH | EN / ZH | Control ZH、Reward LoRA |
| Qwen-Image | EN / ZH | EN / ZH | Edit ZH |
| Qwen-Image-2.1 | EN / ZH | - | Control EN / ZH |
| Z-Image | EN / ZH | EN / ZH | GRPO LoRA |
その他のモデルも同様に、対応するscripts/{model_name}/下のREADMEを参照してください。
三、サポート済みモデル
下表は、現在サポートされているモデル系列と重みをまとめたものです。ビデオモデルと画像モデルは同じ推論・訓練インターフェースを共有しています。各行は1つのモデル系列を表し、第4列は4列のHTML埋め込みテーブル(重み、Hugging Face、ModelScope、説明)です。🤗 は Hugging Face、🤖 は ModelScope(中国国内ネットワーク向け)、- は該当チャネルに対応リポジトリがないか、ログイン認証が必要なことを示します。各モデルの訓練ドキュメントについては3.3 各モデルの訓練ドキュメントを参照してください。
| モデル系列 | モダリティ | サポートタスク | 重み / ダウンロード / 説明 | ||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Wan2.2-Fun | ビデオ | 本プロジェクトがWan2.2で訓練した系列。テキスト/画像から動画、首尾画像、制御生成、カメラ制御をカバー |
| ||||||||||||||||||||||||||||
| Wan2.2-VACE-Fun | ビデオ | 本プロジェクトがVACE方式で訓練した系列。制御生成と主題参照をカバー |
| ||||||||||||||||||||||||||||
| Wan2.2 | ビデオ | Wan公式重み。テキスト/画像から動画、音声駆動、キャラクターアニメーションをカバー。Wan2.2-Fun系列の訓練基線としても使用可能 |
| ||||||||||||||||||||||||||||
| Wan2.1-Fun V1.1 | ビデオ | 本プロジェクトがWan2.1で訓練したV1.1系列。マルチ解像度(512/768/1024)、81フレーム16fps、テキスト/画像から動画、首尾画像、制御生成、カメラ制御をカバー |
| ||||||||||||||||||||||||||||
| Wan2.1-Fun V1.0 | ビデオ | 本プロジェクトがWan2.1で訓練したV1.0系列。V1.1と同じ能力だがカメラ制御は非対応 |
| ||||||||||||||||||||||||||||
| Wan2.1 | ビデオ | Wan公式重み。テキスト/画像から動画、音声駆動、制御生成をカバー。Wan2.1-Fun系列の訓練基線としても使用可能 |
| ||||||||||||||||||||||||||||
| Self-Forcing / Causal-Forcing / Flex-Forcing | ビデオ | 自己回帰蒸留方案。ストリーミング生成、インタラクティブ生成、チャンク単位の注意をカバー |
| ||||||||||||||||||||||||||||
| TurboWan / TurboDiffusion | ビデオ | TurboDiffusion方案が公開した少ステップ蒸留重み |
| ||||||||||||||||||||||||||||
| CogVideoX-Fun V1.5 | ビデオ | 公式CogVideoX-Fun V1.5重み。マルチ解像度(512/768/1024)、85フレーム8fps、画像から動画と報酬整列をカバー |
| ||||||||||||||||||||||||||||
| CogVideoX-Fun V1.1 | ビデオ | 公式CogVideoX-Fun V1.1重み。マルチ解像度(512/768/1024/1280)、49フレーム8fps、画像から動画、ポーズ制御、制御生成、報酬整列をカバー |
| ||||||||||||||||||||||||||||
| CogVideoX-Fun V1.0 | ビデオ | 旧版重み。49フレーム8fpsで訓練。V1.1/V1.5に置き換え済み |
| ||||||||||||||||||||||||||||
| HunyuanVideo | ビデオ | 公式diffusers形式重み。本プロジェクトは推論とLoRA訓練を直接サポート |
| ||||||||||||||||||||||||||||
| MiniMax-H3 | ビデオ | 公式動画生成重みと本プロジェクトが訓練したControlNet |
| ||||||||||||||||||||||||||||
| TaoMate-H3 | ビデオ+音声 | MiniMax-H3をベースにした公式ストリーミング音声・動画生成アダプタ |
| ||||||||||||||||||||||||||||
| LTX-2 | ビデオ+音声 | 公式DiT音声・動画共同生成重み |
| ||||||||||||||||||||||||||||
| LongCat-Video | ビデオ | 公式長尺動画生成重み。LoRA訓練をサポート |
| ||||||||||||||||||||||||||||
| FantasyTalking | 音声駆動ビデオ | 音声条件付き増分重み。基盤ビデオ重みと音声エンコーダが必要 |
| ||||||||||||||||||||||||||||
| InfiniteTalk | 音声駆動ビデオ | 音声条件付き増分重み。基盤ビデオ重みと音声エンコーダが必要 |
| ||||||||||||||||||||||||||||
| FlashHead | 音声駆動ビデオ | 公式高品質頭部動作デジタルヒューマン重み |
| ||||||||||||||||||||||||||||
| MOVA | ビデオ+音声 | 公式MOVA重み |
| ||||||||||||||||||||||||||||
| LingBot | ビデオ | カメラ制御可能なワールドモデル。ディレクトリ構造はWan2.2-I2V-A14Bと一致 |
| ||||||||||||||||||||||||||||
| Phantom | ビデオ | 複数主体参照による動画生成の増分重み。Wan2.1-T2Vベース |
| ||||||||||||||||||||||||||||
| Qwen-Image | 画像 | 公式テキストから画像生成・画像編集重み。基線とLoRA訓練をサポート |
| ||||||||||||||||||||||||||||
| Qwen-Image-2.1 | 画像 | 公式次世代テキストから画像生成重み。シングルストリームblock-causal構造、プレフィックスKV cacheに対応 |
| ||||||||||||||||||||||||||||
| Qwen-Image ControlNet | 画像 | 画像制御生成。Canny、Depth、Pose、MLSD、Scribbleをサポート |
| ||||||||||||||||||||||||||||
| Z-Image | 画像 | 公式テキストから画像生成重み |
| ||||||||||||||||||||||||||||
| Z-Image-Fun | 画像 | 本プロジェクトがZ-Imageで訓練したControlNetと蒸留LoRA。Canny、Depth、Pose、MLSD、Scribble、Grayをサポート |
| ||||||||||||||||||||||||||||
| Flux | 画像 | 公式FLUX.1/FLUX.2重みと本プロジェクトが訓練したControlNet |
| ||||||||||||||||||||||||||||
| ERNIE-Image | 画像 | Baidu公式テキストから画像生成重み |
| ||||||||||||||||||||||||||||
| Lens | 画像 | Microsoft公式カメラ制御重み |
| ||||||||||||||||||||||||||||
| 補助モデル | - | 生成モデルではなく、報酬整列、データアノテーション、高速デコードに使用 |
|
補足説明:
- 音声駆動・参照系モデル(FantasyTalking、InfiniteTalk、Phantom、TaoMate-H3)は増分重みであり、対応する基盤ビデオ重みと音声エンコーダを同時にダウンロードする必要があります。
- TurboDiffusion方案はTurboWan系列の蒸留重みを公開済みです(上表参照)。Flex-Forcing、PDDなどその他の蒸留方案は公開重みがなく、
scripts/{model_name}/README_TRAIN*.mdで訓練後、transformer_pathに指定して使用できます。- 重み名は
models/Diffusion_Transformer/下のフォルダ名と一対一で対応します。同じ系列内の各重みは互換性がないため、推論タスクに応じて選択してください。ここに掲載されていない重みは、本プロジェクトの訓練成果物、または上流の公式リポジトリから取得する必要があります。
四、ビデオ作品
Wan2.1-Fun-V1.1-14B-InP && Wan2.1-Fun-V1.1-1.3B-InP
Wan2.1-Fun-V1.1-14B-Control && Wan2.1-Fun-V1.1-1.3B-Control
汎用制御動画 + 参照画像:
| 参照画像 | 制御動画 | Wan2.1-Fun-V1.1-14B-Control | Wan2.1-Fun-V1.1-1.3B-Control |
|
|
汎用制御動画(Canny、Pose、Depth など)と軌跡制御:
Wan2.1-Fun-V1.1-14B-Control-Camera && Wan2.1-Fun-V1.1-1.3B-Control-Camera
| Pan Up | Pan Left | Pan Right |
| Pan Down | Pan Up + Pan Left | Pan Up + Pan Right |
CogVideoX-Fun-V1.1-5B
解像度-1024
解像度-768
解像度-512
CogVideoX-Fun-V1.1-5B-Control
| 美しい澄んだ目と金髪の若い女性が白い服を着て体をひねり、カメラは彼女の顔に焦点を合わせています。高品質、傑作、最高品質、高解像度、超微細、夢のような。 | 美しい澄んだ目と金髪の若い女性が白い服を着て体をひねり、カメラは彼女の顔に焦点を合わせています。高品質、傑作、最高品質、高解像度、超微細、夢のような。 | 若いクマ。 |
五、参考文献
- CogVideo: https://github.com/THUDM/CogVideo/
- EasyAnimate: https://github.com/aigc-apps/EasyAnimate
- Wan2.1: https://github.com/Wan-Video/Wan2.1/
- Wan2.2: https://github.com/Wan-Video/Wan2.2/
- Diffusers: https://github.com/huggingface/diffusers
- Qwen-Image: https://github.com/QwenLM/Qwen-Image
- Self-Forcing: https://github.com/guandeh17/Self-Forcing
- Flux: https://github.com/black-forest-labs/flux
- Flux2: https://github.com/black-forest-labs/flux2
- HunyuanVideo: https://github.com/Tencent-Hunyuan/HunyuanVideo
- ComfyUI-KJNodes: https://github.com/kijai/ComfyUI-KJNodes
- ComfyUI-EasyAnimateWrapper: https://github.com/kijai/ComfyUI-EasyAnimateWrapper
- ComfyUI-CameraCtrl-Wrapper: https://github.com/chaojie/ComfyUI-CameraCtrl-Wrapper
- CameraCtrl: https://github.com/hehao13/CameraCtrl
六、引用
研究やプロジェクトでVideoX-Funを使用する場合は、以下の形式で引用してください:
@misc{aigc_apps_VideoX_Fun_2026,
author = {aigc-apps},
title = {VideoX-Fun: A Video Generation Pipeline for Diffusion Transformer},
year = {2026},
publisher = {GitHub},
url = {https://github.com/aigc-apps/VideoX-Fun}
}
七、制限とリスク
- 生成された動画には、特に複雑なシーンでアーティファクトや品質の問題がある場合があります。
- モデルは、細かい詳細、テキストのレンダリング、または特定の芸術スタイルで苦労する場合があります。
- パフォーマンスは、入力プロンプトの品質、解像度、その他のパラメータによって異なります。
- この技術は、誤解を招くコンテンツ(例:ディープフェイク)を作成するために悪用される可能性があります。ユーザーは倫理的な使用に責任を持ちます。
- モデルは、トレーニングデータに存在するバイアスを反映する可能性があります。
- ユーザーは、実在の人物の画像や動画を使用する際、プライバシーと著作権を尊重する必要があります。
責任ある使用を推奨し、本番環境でのセーフガードの実装をお勧めします。
八、ライセンス
このプロジェクトはApache License (Version 2.0)の下でライセンスされています。
CogVideoX-2Bモデル(対応するTransformersモジュール、VAEモジュールを含む)は、Apache 2.0ライセンスの下でリリースされています。
CogVideoX-5Bモデル(Transformersモジュール)は、CogVideoXライセンスの下でリリースされています。
