見出し画像

ComfyUIでキャラクターの一貫性を維持する方法:オープンソースモデルとAPIの活用ガイド

こんにちは、AI生成ツールに興味のある皆さん。キャラクターの見た目がバラバラになってしまう、そんな悩みを抱えていませんか? 今回は、X(旧Twitter)でComfyUIさんが配信した動画の内容を基に、ComfyUIを使ってキャラクターの一貫性を保つテクニックを日本語で詳しくまとめます。この動画は、ComfyUIの開発者であるPersさんとJulianさんがホストを務め、キャラクターの見た目を一貫させたままさまざまなバリエーションを作成する方法を解説しています。動画はストリーミング形式で進行し、実際のワークフローを画面共有しながら説明されています。

※この記事は動画の文字起こしを元に、
 AIを利用して要約・修正されています。
 実践前に最新情報を確認を。

動画のテーマは、生成したキャラクターの画像を基に、表情、ポーズ、背景などを変更しつつ、一貫性を保つことです。これにより、ストーリーボード作成やLoRAのトレーニングデータ生成などに活用できます。主にオープンソースのローカルモデル(Quen Image Edit 2509やFlux Dev Context)とAPIベースのモデル(Google Gemini FlashやCdream)を比較しながら紹介されています。ローカルモデルは無料で使用可能ですが、処理が遅くVRAMを多く消費する一方、APIモデルは高速で並列処理が可能ですが、有料(ただし非常に安価)です。

以下では、動画の流れに沿ってステップバイステップで説明します。ComfyUIのノードベースのワークフローを中心に、具体的な設定方法やTipsを詳述します。ComfyUIの初心者の方も参考にしやすいよう、用語を簡潔に解説しながら進めます。例えば、「VRAM」とはビデオRAMの略で、グラフィックカードのメモリ容量を指し、AI処理で大量に消費されるものです。「LoRA」はLow-Rank Adaptationの略で、モデルを微調整するための追加モジュールです。「サブグラフ」は、複数のノードを1つのまとまったノードに変換する機能で、ワークフローを簡潔にします。

基本コンセプト:画像編集モデルを使ったキャラクターの一貫性維持

動画の冒頭で、Persさんはキャラクターの一貫性を保つのが長年の課題だったと述べています。解決策として、既存の画像を入力し、指示(プロンプト)に基づいて編集する「指示ベースの画像編集モデル」を活用します。これらのモデルは、Vision Language Model(VLM)と組み合わせることで、画像を分析し、新しいバリエーションを生成します。VLMは、画像を「見て」理解し、テキストで応答するモデルで、例えば「この画像の次のシーンを記述せよ」と指示できます。

  • オープンソースモデル(ローカル実行):Quen Image Edit 2509やFlux Dev Context。これらは無料でダウンロード可能で、ComfyUIのテンプレートから簡単にセットアップできます。ただし、処理が逐次実行されるため時間がかかり、VRAMの管理が課題です。例えば、VRAMが不足すると処理が止まるので、ハイスペックPCをおすすめします。

  • APIモデル:Google Gemini Flash(Nano Bananaとも呼ばれる)やCdream。これらは高解像度で高速、並列処理が可能。API呼び出しは安価(例: Cdreamは1画像あたり数セント)で、MacBookなどの低スペックPCでも使用できます。ただし、閉鎖モデルなので検閲(censorship)が適用される場合があります。

Persさんは、APIを推奨する理由として、並列生成の速さを挙げています。例えば8枚の画像を同時に生成可能で、時間短縮に有効です。一方、ローカルモデルは検閲なしで自由度が高いため、用途に応じて選択を勧めています。

また、プロンプト生成にLLM(Large Language Model)を使用することを提案。画像をLLMに投入し、複数のバリエーション・プロンプトを自動生成します。ローカルLLMはVRAMを消費するので、API(Gemini Flashなど)が便利です。LLMは大規模言語モデルで、ChatGPTのようなもので、画像付きの指示に応じてテキストを生成します。

Quen Image Edit 2509を使ったローカルワークフローのセットアップ

動画の最初のデモは、Quen Image Edit 2509のデフォルトワークフローです。ComfyUIのメニューから「Image」→「Quen Image Edit 2509 default workflow」をロードします。欠落モデルがあればダウンロードし、適切なフォルダ(models/diffusion_models、LoRa、VAE、text_encoders)に配置します。

  • モデル選択:Quen Image Edit Lightning、Quen 2.5、Quen Image VAEを選択。

  • 基本操作:入力画像をアップロードし、プロンプトで編集を指示(例: 「Replace the man with a turkey」)。モデルは画像を分析し、指示通りに編集します。

  • 結果の例:Persさんの写真を入力し、ターキーに置き換えるデモ。成功率は高くない場合があり、同じ画像が出力されることもあります。カメラアングル変更(例: サイドプロファイル、トップダウン)では失敗しやすいため、LLMで多様なプロンプトを生成することを推奨。

Persさんは、このモデルをサブグラフに変換する方法を示します。ワークフローのノードを選択し、右クリックで「Convert to Subgraph」を実行。これにより、複雑なワークフローを1つのノードにまとめ、複数コピーして並列的に使用しやすくなります。例えば、複数のバリエーションを生成する際に便利です。

  • サブグラフのプロモート:入力画像とプロンプトをサブグラフの外部に露出させる。Load Imageノードを削除し、Scale Imageの入力に直接接続。

  • 複数実行の例:サブグラフを3つコピーし、各々に異なるプロンプト(サイドショット、トップダウン、低アングル)を入力。Save Imageノードを追加して出力。

これにより、キャラクターの異なるアングルを生成。アニメスタイルの画像にも対応し、LoRA(例: リライティングLoRA、2000年代携帯写真風LoRA)を追加可能。Persさんは、これをLoRAトレーニングのデータ拡張に活用することを提案します。

LLMを使ったプロンプト自動生成と複数バリエーション作成

手動でプロンプトを書くのが面倒な場合、LLMで自動生成します。動画ではGoogle Gemini Flashを使用(ローカル代替としてVLM Nodesパックを推奨)。

  • ノードパック導入:James Walkerの「ComfyUI-Various」パックをインストール。String Get Lineノードで、LLM出力の複数行テキストを分割。

  • Gemini設定:画像を入力し、プロンプトで指示(例: 「You are a video director. Describe the next scene from the image. Generate 3 prompts, new line separated, no spaces between.」)。出力は3行のプロンプト。

  • 分割と適用:String Get LineでIndex 0,1,2を抽出し、各Quen Image Editサブグラフに接続。

デモでは、Persさんの画像を入力し、次シーンを記述したプロンプトを生成(例: 視線が鋭くなり、笑顔で手を挙げる)。結果として、キャラクターが手を振る画像などが生成され、ストーリーボードやアニメーションの基盤に活用可能。

ローカルLLMの課題として、VRAM消費を指摘。APIの方が安価で高速(Gemini Flashは画像分析可能)。無料で試す場合、ChatGPTやClaudeに画像をアップロードし、プロンプトをコピーしてMulti-Line Stringノードに貼り付けます。

APIモデルへの切り替え:Google Gemini Flash(Nano Banana)の使用

次に、APIモデルへ移行。QuenをGemini Imageノードに置き換えます。

  • 設定:入力画像とプロンプトを接続。Geminiはアスペクト比を自動調整。

  • 並列実行:3つのGemini Imageノードを同時実行。ローカルより大幅に高速。

  • 出力グリッド作成:Image Stitchノードで4枚の画像(オリジナル+3バリエーション)をグリッド化。

デモ画像(例: バナナを食べる人、猫と戦う人)で次シーンを生成。結果はキャラクターの一貫性が高く、ストーリー性のあるバリエーション(例: 爆発の光に振り返る)。

Persさんは、ワークフローを線形に整理する方法を示し、ノードの重なりを避けてわかりやすくします。

Cdreamを使ったAPIワークフローの拡張

動画の後半では、ByteDanceのCdreamモデルを導入します。これはGemini Flashと同様のAPIベースですが、より高解像度(例: 4K可能)で、1画像あたり数セントと非常に安価です。Geminiとは異なり、アスペクト比の自動調整がないため、プリセットを選択する必要があります。アスペクト比とは、画像の横縦比(例: 16:9は横長のワイド画面)を指します。

  • セットアップ:Cdreamノードを3つ作成。入力画像を接続し、プロンプトをString Get Lineから供給。アスペクト比を16:9に設定(入力画像に合わせる)。ウォーターマークを無効化して「AI generated」の表示を避けます。

  • 実行:Gemini同様、並列で3つのノードを同時実行。ローカルモデルより高速で、キャラクターの同一性保持が優れています。

  • デモ結果:スパゲッティの画像を入力し、次シーンを生成。キャラクターの表情や行動が一貫しつつ、背景や照明が変わる例(例: 爆発の青い光が後ろから差し込む)。Persさんは、出力のクオリティを称賛しつつ、指の描写などの細部で時折エラーが起きる点を指摘します。

Persさんは、APIノードの価格表示をオンにする方法を示します(ComfyUIメニューから「Show API Pricing Badge」を有効化)。これにより、各ノードのコストが確認可能で、Gemini Flashが特に安価であることを強調します。また、API使用がComfyUIの開発をサポートする点も触れています。

Cdreamの代替として、複数画像生成を直接リクエストする方法もありますが、Persさんは並列ノードの方が速いと経験から述べています。ワークフローを共有し、ユーザーが好みのモデルを選択できるように提案します。

追加のTipsと応用例

動画では、視聴者の質問に答えながらTipsを追加しています。以下に箇点でまとめます:

  • サブグラフのプロモート詳細:サブグラフ内でLoad ImageをScale Imageに接続し、入力ポートを外部に露出させる方法をデモ。EscapeキーでメインWorkflowに戻るショートカットも紹介。例えば、Escapeキーは「迷子になったワークフローを素早く脱出する魔法の鍵」のようなものです。

  • バッチ処理とループ:ComfyUIの強みとして、画像配列を連続処理可能。出力画像を次の入力に使用して無限ループを作成(ただし、画像が劣化する可能性あり)。これで数百枚のバリエーションを自動生成。

  • マルチGPU対応:複数GPUでLLMと画像生成を分担可能。Discordで議論を推奨。

  • ローカル代替:LLMとしてFlorenceやQuen VL Localを提案。プロンプト生成をComfyUI外(ChatGPTなど)で行い、Multi-Line Stringノードに貼り付ける方法でAPIを避けられる。

  • カスタムノードの信頼性:GitHubのスター数、作者の履歴、ダウンロード数を確認。未知のものは他人がテストしてから使用。

  • ステップ数の調整:QuenでLightning LoRAを使用し4ステップで高速化。ただし、品質向上のため20-25ステップに増やせば可能(時間が増す)。

Persさんは、ストリーミング中のVRAM問題やモデルロードの遅さを指摘し、APIの利便性を再確認します。また、プロンプトに「no spaces between」を追加すると、モデルによっては文字間スペースが消える面白いエラーが起きる例を共有。

以下は、主要モデルの比較テーブルです(動画のポイントを基にまとめ):

| モデルタイプ | 例 | 利点 | 欠点 | 推奨用途 |
|--------------|----|------|------|----------|
| ローカル(オープンソース) | Quen Image Edit 2509 | 無料、検閲なし、自由度高 | 処理遅い、VRAM消費大 | 検閲回避、LoRAトレーニング |
| API | Google Gemini Flash | 高速、並列可能、安価 | 有料、検閲あり | 速いバリエーション生成、Macユーザー |
| API | Cdream | 高解像度、安価 | アスペクト比指定必要 | 高品質画像、ストーリーボード |

まとめ:ComfyUIでキャラクターの世界を構築しよう

動画の締めくくりで、Persさんはこのワークフローの創造的な可能性を強調します。生成したバリエーションを使って、キャラクターの世界を構築したり、ストーリーを展開したりできます。例として、フェルト製のPersさんバージョンのビデオを共有(同じワークフローで作成)。新しい衣装、場所、表情をLLMに指示して多様なシーンを生成。

オープンソースは無料・検閲なしの利点があり、APIは速度・利便性が高い。用途に応じて組み合わせを勧め、MacBookユーザーでもAPIで実行可能と励まします。最後に、「Get Comfy with Comfy」動画を参考にし、週末に創作を楽しむよう呼びかけます。

このテクニックは、AIアート作成の効率を大幅に向上させます。ComfyUIのモジュール性のおかげで、誰でもカスタマイズ可能。興味のある方は、今すぐComfyUIをインストールして試してみてください! まずは公式サイトからダウンロードし、簡単なワークフローを組んでみましょう。動画の詳細はXのComfyUIアカウントで確認を。さあ、あなたもComfyUIで独自のキャラクター世界を構築しよう!

※この記事は動画の文字起こしを元に、
 AIを利用して要約・修正されています。
 実践前に最新情報を確認を。

いいなと思ったら応援しよう!

コメント

コメントするには、 ログイン または 会員登録 をお願いします。
ComfyUIでキャラクターの一貫性を維持する方法:オープンソースモデルとAPIの活用ガイド|てくあ☕AITECCAFE✨
word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word word

mmMwWLliI0fiflO&1
mmMwWLliI0fiflO&1
mmMwWLliI0fiflO&1
mmMwWLliI0fiflO&1
mmMwWLliI0fiflO&1
mmMwWLliI0fiflO&1
mmMwWLliI0fiflO&1