ComfyUIでキャラクターの一貫性を維持する方法:オープンソースモデルとAPIの活用ガイド
こんにちは、AI生成ツールに興味のある皆さん。キャラクターの見た目がバラバラになってしまう、そんな悩みを抱えていませんか? 今回は、X(旧Twitter)でComfyUIさんが配信した動画の内容を基に、ComfyUIを使ってキャラクターの一貫性を保つテクニックを日本語で詳しくまとめます。この動画は、ComfyUIの開発者であるPersさんとJulianさんがホストを務め、キャラクターの見た目を一貫させたままさまざまなバリエーションを作成する方法を解説しています。動画はストリーミング形式で進行し、実際のワークフローを画面共有しながら説明されています。
※この記事は動画の文字起こしを元に、
AIを利用して要約・修正されています。
実践前に最新情報を確認を。
動画のテーマは、生成したキャラクターの画像を基に、表情、ポーズ、背景などを変更しつつ、一貫性を保つことです。これにより、ストーリーボード作成やLoRAのトレーニングデータ生成などに活用できます。主にオープンソースのローカルモデル(Quen Image Edit 2509やFlux Dev Context)とAPIベースのモデル(Google Gemini FlashやCdream)を比較しながら紹介されています。ローカルモデルは無料で使用可能ですが、処理が遅くVRAMを多く消費する一方、APIモデルは高速で並列処理が可能ですが、有料(ただし非常に安価)です。
以下では、動画の流れに沿ってステップバイステップで説明します。ComfyUIのノードベースのワークフローを中心に、具体的な設定方法やTipsを詳述します。ComfyUIの初心者の方も参考にしやすいよう、用語を簡潔に解説しながら進めます。例えば、「VRAM」とはビデオRAMの略で、グラフィックカードのメモリ容量を指し、AI処理で大量に消費されるものです。「LoRA」はLow-Rank Adaptationの略で、モデルを微調整するための追加モジュールです。「サブグラフ」は、複数のノードを1つのまとまったノードに変換する機能で、ワークフローを簡潔にします。
基本コンセプト:画像編集モデルを使ったキャラクターの一貫性維持
動画の冒頭で、Persさんはキャラクターの一貫性を保つのが長年の課題だったと述べています。解決策として、既存の画像を入力し、指示(プロンプト)に基づいて編集する「指示ベースの画像編集モデル」を活用します。これらのモデルは、Vision Language Model(VLM)と組み合わせることで、画像を分析し、新しいバリエーションを生成します。VLMは、画像を「見て」理解し、テキストで応答するモデルで、例えば「この画像の次のシーンを記述せよ」と指示できます。
オープンソースモデル(ローカル実行):Quen Image Edit 2509やFlux Dev Context。これらは無料でダウンロード可能で、ComfyUIのテンプレートから簡単にセットアップできます。ただし、処理が逐次実行されるため時間がかかり、VRAMの管理が課題です。例えば、VRAMが不足すると処理が止まるので、ハイスペックPCをおすすめします。
APIモデル:Google Gemini Flash(Nano Bananaとも呼ばれる)やCdream。これらは高解像度で高速、並列処理が可能。API呼び出しは安価(例: Cdreamは1画像あたり数セント)で、MacBookなどの低スペックPCでも使用できます。ただし、閉鎖モデルなので検閲(censorship)が適用される場合があります。
Persさんは、APIを推奨する理由として、並列生成の速さを挙げています。例えば8枚の画像を同時に生成可能で、時間短縮に有効です。一方、ローカルモデルは検閲なしで自由度が高いため、用途に応じて選択を勧めています。
また、プロンプト生成にLLM(Large Language Model)を使用することを提案。画像をLLMに投入し、複数のバリエーション・プロンプトを自動生成します。ローカルLLMはVRAMを消費するので、API(Gemini Flashなど)が便利です。LLMは大規模言語モデルで、ChatGPTのようなもので、画像付きの指示に応じてテキストを生成します。
Quen Image Edit 2509を使ったローカルワークフローのセットアップ
動画の最初のデモは、Quen Image Edit 2509のデフォルトワークフローです。ComfyUIのメニューから「Image」→「Quen Image Edit 2509 default workflow」をロードします。欠落モデルがあればダウンロードし、適切なフォルダ(models/diffusion_models、LoRa、VAE、text_encoders)に配置します。
モデル選択:Quen Image Edit Lightning、Quen 2.5、Quen Image VAEを選択。
基本操作:入力画像をアップロードし、プロンプトで編集を指示(例: 「Replace the man with a turkey」)。モデルは画像を分析し、指示通りに編集します。
結果の例:Persさんの写真を入力し、ターキーに置き換えるデモ。成功率は高くない場合があり、同じ画像が出力されることもあります。カメラアングル変更(例: サイドプロファイル、トップダウン)では失敗しやすいため、LLMで多様なプロンプトを生成することを推奨。
Persさんは、このモデルをサブグラフに変換する方法を示します。ワークフローのノードを選択し、右クリックで「Convert to Subgraph」を実行。これにより、複雑なワークフローを1つのノードにまとめ、複数コピーして並列的に使用しやすくなります。例えば、複数のバリエーションを生成する際に便利です。
サブグラフのプロモート:入力画像とプロンプトをサブグラフの外部に露出させる。Load Imageノードを削除し、Scale Imageの入力に直接接続。
複数実行の例:サブグラフを3つコピーし、各々に異なるプロンプト(サイドショット、トップダウン、低アングル)を入力。Save Imageノードを追加して出力。
これにより、キャラクターの異なるアングルを生成。アニメスタイルの画像にも対応し、LoRA(例: リライティングLoRA、2000年代携帯写真風LoRA)を追加可能。Persさんは、これをLoRAトレーニングのデータ拡張に活用することを提案します。
LLMを使ったプロンプト自動生成と複数バリエーション作成
手動でプロンプトを書くのが面倒な場合、LLMで自動生成します。動画ではGoogle Gemini Flashを使用(ローカル代替としてVLM Nodesパックを推奨)。
ノードパック導入:James Walkerの「ComfyUI-Various」パックをインストール。String Get Lineノードで、LLM出力の複数行テキストを分割。
Gemini設定:画像を入力し、プロンプトで指示(例: 「You are a video director. Describe the next scene from the image. Generate 3 prompts, new line separated, no spaces between.」)。出力は3行のプロンプト。
分割と適用:String Get LineでIndex 0,1,2を抽出し、各Quen Image Editサブグラフに接続。
デモでは、Persさんの画像を入力し、次シーンを記述したプロンプトを生成(例: 視線が鋭くなり、笑顔で手を挙げる)。結果として、キャラクターが手を振る画像などが生成され、ストーリーボードやアニメーションの基盤に活用可能。
ローカルLLMの課題として、VRAM消費を指摘。APIの方が安価で高速(Gemini Flashは画像分析可能)。無料で試す場合、ChatGPTやClaudeに画像をアップロードし、プロンプトをコピーしてMulti-Line Stringノードに貼り付けます。
APIモデルへの切り替え:Google Gemini Flash(Nano Banana)の使用
次に、APIモデルへ移行。QuenをGemini Imageノードに置き換えます。
設定:入力画像とプロンプトを接続。Geminiはアスペクト比を自動調整。
並列実行:3つのGemini Imageノードを同時実行。ローカルより大幅に高速。
出力グリッド作成:Image Stitchノードで4枚の画像(オリジナル+3バリエーション)をグリッド化。
デモ画像(例: バナナを食べる人、猫と戦う人)で次シーンを生成。結果はキャラクターの一貫性が高く、ストーリー性のあるバリエーション(例: 爆発の光に振り返る)。
Persさんは、ワークフローを線形に整理する方法を示し、ノードの重なりを避けてわかりやすくします。
Cdreamを使ったAPIワークフローの拡張
動画の後半では、ByteDanceのCdreamモデルを導入します。これはGemini Flashと同様のAPIベースですが、より高解像度(例: 4K可能)で、1画像あたり数セントと非常に安価です。Geminiとは異なり、アスペクト比の自動調整がないため、プリセットを選択する必要があります。アスペクト比とは、画像の横縦比(例: 16:9は横長のワイド画面)を指します。
セットアップ:Cdreamノードを3つ作成。入力画像を接続し、プロンプトをString Get Lineから供給。アスペクト比を16:9に設定(入力画像に合わせる)。ウォーターマークを無効化して「AI generated」の表示を避けます。
実行:Gemini同様、並列で3つのノードを同時実行。ローカルモデルより高速で、キャラクターの同一性保持が優れています。
デモ結果:スパゲッティの画像を入力し、次シーンを生成。キャラクターの表情や行動が一貫しつつ、背景や照明が変わる例(例: 爆発の青い光が後ろから差し込む)。Persさんは、出力のクオリティを称賛しつつ、指の描写などの細部で時折エラーが起きる点を指摘します。
Persさんは、APIノードの価格表示をオンにする方法を示します(ComfyUIメニューから「Show API Pricing Badge」を有効化)。これにより、各ノードのコストが確認可能で、Gemini Flashが特に安価であることを強調します。また、API使用がComfyUIの開発をサポートする点も触れています。
Cdreamの代替として、複数画像生成を直接リクエストする方法もありますが、Persさんは並列ノードの方が速いと経験から述べています。ワークフローを共有し、ユーザーが好みのモデルを選択できるように提案します。
追加のTipsと応用例
動画では、視聴者の質問に答えながらTipsを追加しています。以下に箇点でまとめます:
サブグラフのプロモート詳細:サブグラフ内でLoad ImageをScale Imageに接続し、入力ポートを外部に露出させる方法をデモ。EscapeキーでメインWorkflowに戻るショートカットも紹介。例えば、Escapeキーは「迷子になったワークフローを素早く脱出する魔法の鍵」のようなものです。
バッチ処理とループ:ComfyUIの強みとして、画像配列を連続処理可能。出力画像を次の入力に使用して無限ループを作成(ただし、画像が劣化する可能性あり)。これで数百枚のバリエーションを自動生成。
マルチGPU対応:複数GPUでLLMと画像生成を分担可能。Discordで議論を推奨。
ローカル代替:LLMとしてFlorenceやQuen VL Localを提案。プロンプト生成をComfyUI外(ChatGPTなど)で行い、Multi-Line Stringノードに貼り付ける方法でAPIを避けられる。
カスタムノードの信頼性:GitHubのスター数、作者の履歴、ダウンロード数を確認。未知のものは他人がテストしてから使用。
ステップ数の調整:QuenでLightning LoRAを使用し4ステップで高速化。ただし、品質向上のため20-25ステップに増やせば可能(時間が増す)。
Persさんは、ストリーミング中のVRAM問題やモデルロードの遅さを指摘し、APIの利便性を再確認します。また、プロンプトに「no spaces between」を追加すると、モデルによっては文字間スペースが消える面白いエラーが起きる例を共有。
以下は、主要モデルの比較テーブルです(動画のポイントを基にまとめ):
| モデルタイプ | 例 | 利点 | 欠点 | 推奨用途 |
|--------------|----|------|------|----------|
| ローカル(オープンソース) | Quen Image Edit 2509 | 無料、検閲なし、自由度高 | 処理遅い、VRAM消費大 | 検閲回避、LoRAトレーニング |
| API | Google Gemini Flash | 高速、並列可能、安価 | 有料、検閲あり | 速いバリエーション生成、Macユーザー |
| API | Cdream | 高解像度、安価 | アスペクト比指定必要 | 高品質画像、ストーリーボード |
まとめ:ComfyUIでキャラクターの世界を構築しよう
動画の締めくくりで、Persさんはこのワークフローの創造的な可能性を強調します。生成したバリエーションを使って、キャラクターの世界を構築したり、ストーリーを展開したりできます。例として、フェルト製のPersさんバージョンのビデオを共有(同じワークフローで作成)。新しい衣装、場所、表情をLLMに指示して多様なシーンを生成。
オープンソースは無料・検閲なしの利点があり、APIは速度・利便性が高い。用途に応じて組み合わせを勧め、MacBookユーザーでもAPIで実行可能と励まします。最後に、「Get Comfy with Comfy」動画を参考にし、週末に創作を楽しむよう呼びかけます。
このテクニックは、AIアート作成の効率を大幅に向上させます。ComfyUIのモジュール性のおかげで、誰でもカスタマイズ可能。興味のある方は、今すぐComfyUIをインストールして試してみてください! まずは公式サイトからダウンロードし、簡単なワークフローを組んでみましょう。動画の詳細はXのComfyUIアカウントで確認を。さあ、あなたもComfyUIで独自のキャラクター世界を構築しよう!
※この記事は動画の文字起こしを元に、
AIを利用して要約・修正されています。
実践前に最新情報を確認を。


コメント