Google Gemini が得意なこと
- 会話とテキスト生成:ComfyUI ワークフロー内で直接 Google のマルチモーダル AI とチャットできます
- マルチモーダル推論:Gemini の推論機能を使用して画像を解釈できます
- 画像からプロンプトへの変換:公式テンプレートには、画像を対応する描画プロンプトに変換するプロンプトが付属しています
- 複数画像の入力:
画像をバッチ処理を使用すると、1回の実行で複数の画像を AI に送信して解釈させることができます
使い方
コードから呼び出す
Comfy Router経由でHTTPから呼び出せます。コピー&ペーストで使えるPython、TypeScript、cURLのスニペットを用意しています
Google Gemini
Gemini の推論機能を備えた Google のマルチモーダル AI を体験できます。
Comfy Cloud で実行
Comfy Cloud で開く
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで “Google Gemini” を検索してください
LoadImage ノードにアップロードしてください:
example.png
LoadImage ノード 2 · example.png
ワークフローの実行をステップごとに完了する

対応するテンプレートでは、役割プロンプトを分析・生成するためのプロンプトを構築しており、あなたの画像を対応する描画プロンプトとして解釈するために使用します
Load Imageノードで、AIに解釈させたい画像を読み込みます- (任意)必要に応じて、
Google Gemini内のプロンプトを変更し、AIに特定のタスクを実行させることができます Runボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用して会話を実行します。- APIが結果を返すのを待つと、
Preview Anyノードで対応するAIの返答内容を確認できます。
補足事項
- 現在、ファイル入力ノード
Gemini Input Filesでは、事前にファイルをComfyUI/input/ディレクトリへアップロードしておく必要があります。このノードは改善中のため、アップデート後にテンプレートを修正する予定です - このワークフローでは、入力に
Batch Imagesを使用した例を用意しています。AIによる解釈が必要な画像が複数ある場合は、手順図を参照し、右クリックで該当ノードのモードをAlwaysに設定して有効化してください