ComfyUIで初めて動画生成する手順|Windows導入からWan 2.2 5Bの初回出力まで
AIで短い動画を作るため、Windows PCにComfyUIを導入しました。使ったのはComfy Desktopと動画生成モデルのWan 2.2 5Bです。
初めてだと、保存先、CloudとLocalの選択、赤いモデルエラーの直し方で迷います。この記事では、実際の画面をもとに、Windowsへの導入から初回動画の再生までを紹介します。
本記事は2026年9月27日に始めた導入と、2026-10-03時点で確認した初回生成の記録です。画面や選択肢はバージョンによって変わる場合があります。
画面キャプチャについて:記事内の25枚は、筆者が自身のPCで操作中に撮影し、原画像をトリミングや加工をせず掲載しています。操作箇所や発生した状態を説明するためのもので、ComfyUI/Comfy DesktopおよびWindowsのUIなどに関する権利は、それぞれの権利者に帰属します。公式資料は本文中のリンクから確認できます。
ComfyUIで初めての動画生成に挑戦してできたこと
先に結果を書くと、Local環境と必要な3モデルを用意し、約2秒と表示される縦動画を出力・再生できました。
再生すると品質には課題が残り、指定したプリンとは違って見えました。今回の到達点は初回の生成と再生です。保存や画質改善へは進まず、まず一度動かすための操作に絞ります。
今回使ったPCとインストール先
今回のPC構成は次の通りです。Wan 2.2 5Bの公式ガイドでは、native offloadingにより5B版はVRAM 8GBに適合する見込みと説明されています。ただし、全環境での動作や速度を保証するものではありません。
| 項目 | 今回の環境 |
|---|---|
| OS | Windows 11 Home 25H2 |
| CPU | Intel Core i5-13600KF |
| メモリー | 32GB |
| GPU | NVIDIA GeForce RTX 3060 Ti |
| VRAM | 8GB |
| Cドライブ | 約1TBのSSD。空き容量は確認時に約416GB、その後の画面で388.30GB |
| Dドライブ | 8TBのHDD。空き容量は確認時に約7.26TB |
空き容量の大きいDへ入れるか迷いましたが、CはSSD、DはHDDでした。今回は環境とモデルをCドライブへ導入しました。

画面キャプチャ:筆者撮影(未加工)
この後にComfyUIの実行環境と動画生成モデルも入るため、インストーラー本体だけでなく、モデル用の空き容量も確認しておきます。

画面キャプチャ:筆者撮影(未加工)
ドライブの種類を見るだけなら、ここで最適化を実行する必要はありません。
Comfy DesktopをLocalでセットアップする
Windows版の導入方法はComfyUI公式のDesktop手順で確認できます。ここでは、今回表示されたComfy Desktopインストーラー1.1.3の画面に沿って進めます。
インストール後にComfy Desktopを起動すると、「How do you want to run Comfy?」と表示されました。今回は自分のPCで処理するため、右側の Local を選択します。最終的に、Express InstallはOFF、利用規約への同意はON、匿名利用データの共有とベータ機能はOFFにしました。

画面キャプチャ:筆者撮影(未加工)
これは今回の選択で、全員に必須の組み合わせではありません。利用規約を確認し、任意項目を選んで「Continue」を押します。
続く「Create a New Instance」では、インスタンス名を ComfyUI-Shorts としました。画面上ではPublic Builds、Stable(Recommended)v0.38.2、NVIDIA、Python 3.13.12が選ばれています。これらは今回の画面で見えた値であり、常に使うべき固定バージョンではありません。

画面キャプチャ:筆者撮影(未加工)
保存先はCドライブ内の Comfy-Desktop\ComfyUI-Installs です。画面では空き388.30GB、必要容量約4.96GBでした。NVIDIAと保存先を確認して「Continue」へ進みます。
スターターモデルの画面にはVideo、Image、3D、Audioの候補が並びましたが、目的のWan 2.2 5Bはここで選びませんでした。右下の Skip & Install を押し、まずComfyUIの実行環境だけを入れます。

画面キャプチャ:筆者撮影(未加工)
「Downloading ComfyUI…」へ移ったら、ダウンロードと展開が終わるまで待ちます。所要時間は通信環境で変わります。

画面キャプチャ:筆者撮影(未加工)
Wan 2.2 5Bのテンプレートを開く
ComfyUIが起動すると、テンプレート一覧が表示されました。検索欄へ最初に wan2.2 と入れたところ、14B版を含む複数の候補が出たため、さらに wan2.2 5B で絞り込みます。

画面キャプチャ:筆者撮影(未加工)
3つの候補から、ギターを弾く人物のサムネイルが付いた 「Wan 2.2 5Bビデオ生成」 を選びました。Fun ControlやInpaintingとは別のカードです。
開いたワークフローのタブ名は video_wan2_2_5B_ti2v でした。初回はテンプレートを使い、必要なモデルと入力欄を順に確認します。
不足している3つのモデルをダウンロードする
テンプレートを開くと、「3件のエラーが見つかりました」と表示され、モデル読み込み部分のノードが赤枠になりました。右上の「詳細を表示」を押すと、ワークフローに必要なモデルが3つ不足していると分かります。

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)
| ファイル名 | 種類・配置先 | 画面の容量 |
|---|---|---|
wan2.2_vae.safetensors |
VAE/models/vae/ |
1.31GB |
umt5_xxl_fp8_e4m3fn_scaled.safetensors |
テキストエンコーダー/models/text_encoders/ |
6.27GB |
wan2.2_ti2v_5B_fp16.safetensors |
動画生成モデル/models/diffusion_models/ |
9.31GB |
ファイル名と配置先は公式Wan 2.2ガイドの5B版と一致します。「すべてダウンロード(16.9GB)」を押しました。この16.9GBは3ファイルの保存容量で、VRAM使用量ではありません。
進み具合は右上の下向き矢印から確認できます。3ファイルすべてにチェックマークが付くまで待ちます。

画面キャプチャ:筆者撮影(未加工)
完了後も不足モデルの表示が残ったため、Downloadsを閉じ、不足モデル欄の右にある ↻(更新アイコン) を押しました。問題タブと赤枠が消えたら、次の設定へ進みます。

画面キャプチャ:筆者撮影(未加工)
縦向きのサイズとプロンプトを設定する
「Video Size & length」内の Wan22ImageToVideoLatent の数値欄を探します。読みにくい場合はノードにマウスを置き、ホイールで拡大します。初期値は幅1280、高さ704、長さ121、バッチサイズ1でした。
数字をダブルクリックして次の値へ変更し、Enterで確定します。
| 項目 | 今回の値 | 意味 |
|---|---|---|
| width(幅) | 512 | 縦動画の横幅 |
| height(高さ) | 896 | 縦動画の高さ |
| length(長さ) | 49 | 総フレーム数 |
| batch_size | 1 | 生成する本数 |

画面キャプチャ:筆者撮影(未加工)
length 49は秒数ではなく、生成する総フレーム数です。今回のプレーヤーには約2秒と表示されましたが、画面からFPSを確認できていないため、「49フレームだから必ず何秒」とは換算しません。
続いて、「Step3-Prompt」の緑色のPositive Promptへ、作りたい内容を英語で入力しました。
A cute small orange kitten gently taps a large wobbly pudding with one paw. The pudding jiggles, and the kitten tilts its head in surprise. Cozy kitchen, soft lighting, fixed camera, single continuous shot.
小さなオレンジ色の子猫がプリンを前足でたたき、揺れに驚いて首をかしげる場面を意図しています。キッチン、照明、固定カメラ、1つながりのショットも指定しました。

画面キャプチャ:筆者撮影(未加工)
下の茶色い欄はNegative Promptです。ComfyUIのKSampler資料では、Positiveは含めたい条件、Negativeは避けたい条件として説明されています。今回のNegative Promptには「字幕」「低质量」「细节模糊不清」などの中国語がありましたが、出力する動画の言語を中国語にする指定ではありません。
今回はNegative Promptを初期値のまま使い、まず生成結果を見ることにしました。
Runを押して初めての動画を再生した結果
モデル、サイズ、Positive Promptを確認し、右上の 「実行する(Run)」 を1回押しました。しばらくするとワークフロー右側に縦長の動画プレーヤーが現れ、約2秒のプレビューが表示されました。プレーヤーの再生ボタンを押し、生成した動画が再生できるところまで確認しています。

画面キャプチャ:筆者撮影(未加工)
今回は生成が10秒未満で終わりました。これは私が今回操作したときの記録で、実行ログや計測方法を検証したベンチマークではありません。導入やモデルのダウンロード時間は含まず、別の環境や実行でも同じ時間になるとは限りません。
再生すると、品質には課題が残りました。プレビューには子猫と大きなオレンジ色の物体が見えますが、指定したプリンとは違って見えます。静止画だけでは、子猫の動きや物体の揺れが自然だったかは判断できません。
まだ原因は切り分けられていません。次回はプロンプトや生成設定を確認します。今回は追加の保存操作をせず、初回出力と再生で区切りました。
初回で迷った点と次に試したいこと
初回に迷った点は、次の3つへ整理できます。
- 5B版が見つからない:
wan2.2だけでは14B版も表示されたため、wan2.2 5Bで検索し、「Wan 2.2 5Bビデオ生成」を選びました。 - モデル不足の赤いエラーが消えない:3ファイルのダウンロード完了を確認した後、不足モデル欄の↻を押して再読み込みしました。
- 中国語の文章を消すべきか迷う:下段は避けたい要素を指定するNegative Promptでした。今回は初期値のまま試しました。
この3点を越えれば、ノードを最初から組まずに、サイズ、フレーム数、プロンプトを確認してRunまで進められました。
次の記事では同じ題材を使い、設定とプロンプトを見直して動画の品質を改善します。今回の結果を基準にして比較できるように、原因を決めつけず一つずつ変更する予定です。
作業中の補足キャプチャ
本文では操作の節目になる14枚を使いました。ここには、設定途中やダウンロード途中を確認した11枚を時系列で残します。
補足キャプチャ11枚を開く

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)

画面キャプチャ:筆者撮影(未加工)
まとめ
WindowsのComfy DesktopでLocal環境を作り、Wan 2.2 5Bのテンプレートと不足していた3モデルを用意することで、初めての縦動画を生成・再生できました。設定は幅512、高さ896、49フレーム、バッチサイズ1です。
再生結果の品質には課題が残りました。今回の出力を基準に、次は同じ子猫とプリンを題材として、設定とプロンプトを見直し、品質改善を試します。
