Skip to main content
Google Geminiは、Googleが開発した強力なAIモデルで、会話機能とテキスト生成機能をサポートしています。現在、ComfyUIはGoogle Gemini APIを統合しており、ComfyUI内の関連ノードを直接使用して会話機能を実現できます。

Google Gemini が得意なこと

  • 会話とテキスト生成:ComfyUI ワークフロー内で直接 Google のマルチモーダル AI とチャットできます
  • マルチモーダル推論:Gemini の推論機能を使用して画像を解釈できます
  • 画像からプロンプトへの変換:公式テンプレートには、画像を対応する描画プロンプトに変換するプロンプトが付属しています
  • 複数画像の入力画像をバッチ処理 を使用すると、1回の実行で複数の画像を AI に送信して解釈させることができます

使い方

コードから呼び出す

Comfy Router経由でHTTPから呼び出せます。コピー&ペーストで使えるPython、TypeScript、cURLのスニペットを用意しています
これは下記のComfyUIで実行する場合と同じComfyアカウント上で動作し、同じクレジットで課金されます。モデルごとの料金についてはパートナーノードの料金、同時に実行できるリクエスト数については同時実行の制限をご覧ください。
APIノードを使用するには、正しくログインしていることと、許可されたネットワーク環境で使用していることを確認する必要があります。APIノードの使用に必要な具体的な要件については、ドキュメントの「APIノードの概要」セクションをご参照ください。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

Google Gemini

Gemini の推論機能を備えた Google のマルチモーダル AI を体験できます。 Google Gemini ワークフローのプレビュー

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロードするか、テンプレートライブラリで “Google Gemini” を検索してください
入力素材 このファイルを対応する LoadImage ノードにアップロードしてください:

example.png

LoadImage ノード 2 · example.png
example.png

ワークフローの実行をステップごとに完了する

OpenAIチャットステップガイド
対応するテンプレートでは、役割プロンプトを分析・生成するためのプロンプトを構築しており、あなたの画像を対応する描画プロンプトとして解釈するために使用します
画像内の番号を参考に、基本的なテキストから画像へのワークフロー実行を完了できます:
  1. Load Imageノードで、AIに解釈させたい画像を読み込みます
  2. (任意)必要に応じて、Google Gemini内のプロンプトを変更し、AIに特定のタスクを実行させることができます
  3. Runボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用して会話を実行します。
  4. APIが結果を返すのを待つと、Preview Anyノードで対応するAIの返答内容を確認できます。

補足事項

  • 現在、ファイル入力ノードGemini Input Filesでは、事前にファイルをComfyUI/input/ディレクトリへアップロードしておく必要があります。このノードは改善中のため、アップデート後にテンプレートを修正する予定です
  • このワークフローでは、入力にBatch Imagesを使用した例を用意しています。AIによる解釈が必要な画像が複数ある場合は、手順図を参照し、右クリックで該当ノードのモードをAlwaysに設定して有効化してください