GeminiDesktop
ガイド

Nano Banana とは?Google の AI 画像生成モデルを解説

公開日 · 著者: GeminiDesktop Team
GeminiDesktop を Google の優先ソースに追加 トップニュースと AI による回答に GeminiDesktop がもっと表示されます。

Nano Banana 2 は、Gemini に統合された Google の一般ユーザー向け AI 画像生成モデルです。Imagen アーキテクチャをベースに、文章での説明を画像へ変換し、アスペクト比の指定と最大 4K の解像度出力に対応しています。

TL;DR 要点まとめ

  • 位置づけ:Google の一般向け旗艦画像生成モデル。Imagen シリーズを継承し、Gemini の対話画面に組み込まれています。
  • モデルの素性:土台は Imagen 第 4 世代の拡散アーキテクチャ。「Nano」は対話用途向けに最適化されたことを示し、1 枚あたり 2〜5 秒で生成されます。
  • 解像度の上限:最大 4K のネイティブ出力。無料枠は 1K/2K から、Advanced 枠で 4K が解放されます。
  • 会話による編集:生成後に「空を夕暮れにして」「左上のウォーターマークを消して」と言うだけで、意味を保ったまま修正できます(描き直しではありません)。
  • 統合の強み:Canvas、Deep Research、Personal Intelligence と文脈を共有し、インフォグラフィックの部品や調査資料の挿絵として使えます。
  • 競合の目安:DALL-E 3/GPT-4o の画像生成、Midjourney v7、Stable Diffusion 4/Flux が比較対象。画質単体で最強ではありませんが、作業の流れが最もなめらかです。

Nano Banana 2 とは何ですか?

Nano Banana 2 は、Gemini アプリに内蔵された画像生成エンジンです。「夕暮れの山の風景を生成して」と入力したとき、裏側で動いているのがこれにあたります。名前の由来は、Google 社内でモデルのバージョンに食べ物の名前を付ける慣習で、第 2 世代は Imagen 第 4 世代のモデルに対応します。

中心となる機能は 4 つです。テキストからの画像生成はスタイル指定(「水彩」「サイバーパンク」「3D レンダリング」)、構図指定(「ローアングル」「俯瞰」「マクロ」)、光の指定(「ゴールデンアワー」「映画的なライティング」)に対応。アスペクト比は正方形 1:1、縦長 9:16(Instagram ストーリーズの表紙)、横長 16:9(動画のサムネイル、スライド)、超ワイド 21:9(バナー)をカバー。解像度は 1K/2K/4K の 3 段階。会話による反復では、生成後に「空をもっとドラマチックに」「左の人物を消して」「水彩に変えて」と追加でき、毎回ゼロから作り直すのではなく前の画像の状態を引き継いで修正するため、Midjourney の vary/remix よりも狙いどおりに動きます。

どのような仕組みで動いていますか?

基礎となるのは拡散トランスフォーマー(DiT)で、ランダムなノイズから出発し、文章の指示に導かれながら 20〜50 ステップかけて少しずつノイズを取り除いていきます。Imagen 3/4 の系譜を継ぎつつ、Gemini での利用に合わせて 3 点が調整されています。

1 つめは Gemini の言語モデルとの深い融合です。Gemini 3 のテキスト理解層をそのまま活用しているため、「会議に遅れそうで焦っている人が電車内で腕時計を見ている」といった感情を含む長い指示も解釈できます。2 つめはマルチモーダル入力で、写真を貼って「このキャラクターの髪型を保ったままスーツに変えて」と頼めます。入力画像は生成の条件として扱われ、ノイズ除去の過程に反映されます。3 つめは対話向けの高速化で、蒸留と推論の効率化によって 1 枚を秒単位まで縮め、何度も細かく直せるようにしています。

規模の面では、Imagen 4 級の完全なモデルはおよそ 200 億パラメータ規模とみられますが、Nano Banana 2 は蒸留によってより小さな推論版(推定 40〜80 億パラメータ級)を取り出し、先読み実行や注意計算の最適化と組み合わせることで、会話の中で秒単位の応答を実現しています。学習データについて Google は、LAION の上位集合に加えて自社で整備した高品質な商用画像ライブラリを使い、指示追従と複数被写体のシーンに重点的にラベル付けしたと説明しています。「2 人の人物 + 特定の場所 + 指定の動作」といった複雑な組み合わせで Imagen 3 より明確に良くなっているのはこのためです。

代償もあります。美しさの最高到達点を求めるなら今も Midjourney v7 に軍配が上がります。ただし指示追従、編集のしやすさ、文章作成の流れとの一体感の 3 点では Nano Banana 2 が明確に上です。もう 1 つの代償は「スタイルのぶれ」で、対話が 8 往復を超えると最初のスタイルの基準を忘れがちになります。そのときは最初の 1 枚をもう一度アップロードして参照させてください。

主要な画像生成モデルとどう違いますか?

モデルベンダー最大解像度指示追従会話編集オープンソース価格
Nano Banana 2Google4K強い(Gemini 3 のテキスト層)ネイティブ対応いいえGemini Advanced 月額 $19.99
DALL-E 3 / GPT-4o ImageOpenAI2K強いChatGPT の対話内いいえPlus 月額 $20
Midjourney v7Midjourney2K + アップスケール中程度限定的(/remix /vary)いいえ月額 $10〜120
Stable Diffusion 4 / Flux ProStability / BFL上限なし中程度ControlNet/Img2Imgはいローカルは無料/API は枚数課金
Firefly 3Adobe2K中程度Photoshop の生成塗りつぶしいいえCreative Cloud に付属

Nano Banana 2 の立ち位置は明確です。美の極致を求めるアーティスト向け(それは Midjourney)でも、パラメータを完全に制御したいエンジニア向け(それは Stable Diffusion)でもなく、「文章があって、使える挿絵が 1 枚欲しい」という大多数のための道具です。記事執筆、スライドの図版、SNS 素材、プロダクトのモック——こうした場面で最もなめらかに使えます。

「単位時間あたりに使える画像が何枚できるか」という実務的な指標で見ると、平均効率は Nano Banana 2 が最も高くなります。文章での説明に 3〜4 往復の対話を重ねれば、たいてい 5 分以内に決定稿にたどり着きます。Midjourney は指示の作り込みとアップスケールを経て 10〜15 分、Stable Diffusion で ControlNet を調整するならさらに時間がかかります。もちろん唯一の選択肢ではありません。実際のビジュアルデザイナーは複数を組み合わせます。Nano Banana 2 で素早く方向性を決め、Midjourney で画質を引き上げ、最後に Photoshop や Figma でレイアウトを整える、という流れです。

どんな場面で使えますか?

ブランドデザイナー:スペシャルティコーヒー店のロゴ案、紙袋のパターン、SNS 用のキービジュアルを短時間で用意できます。同じキーワード(「ミニマルな和のテイスト、ベージュとダークブラウン、手描き感」)で 20 枚の候補を出し、3 枚を Canvas で微調整すれば 10 分で完了。さらに「ブランドの基本カラー」を Personal Intelligence の好みとして登録しておけば、以降の生成が自動で同じ配色を踏襲し、毎回「ベージュとダークブラウン」と書き直す必要がなくなります。

EC の商品画像:アパレル店主が白背景の平置き写真を撮ったあと、「このシャツを東アジア系の男性モデルに着せて、オフィスの背景、自然光で」と頼めば、すぐに着用イメージが手に入り、モデル撮影の費用を節約できます。続けて「背景をカフェに」「モデルを横向きにもたれかからせて」と指示すれば商品ページ用の素材をまとめて用意でき、Instagram や TikTok のようにビジュアル依存度の高い媒体で特に効きます。ただし Google の規約は実在の著名人の生成を禁じているため、「架空の東アジア系男性モデル」といった表現にとどめる必要があります。

プロダクトマネージャー:未実装の機能のコンセプト画像を作れます。「録音波形が表示されるスマホアプリのホーム画面、下部に 3 つのタブ」と説明し、「タブをカード型に」「色をテックブルーに」と続ければ、そのまま仕様書の図版になります。社内のエンジニアに設計意図を伝えるときは Figma のワイヤーフレームより伝わりやすく、社外の投資家に見せるときも言葉だけより直感的です。

個人メディアの発信者:ニュースレターのヘッダー、縦型 9:16 の投稿カバー、動画用 16:9 のサムネイル——同じ対話の中で 3 種類の比率をまとめて出せる(「同じテーマで 1:1/9:16/16:9 を 1 枚ずつ」)ため、複数媒体への素材コストが大きく下がります。毎日更新するブロガーにとっては Canvas の文章リライトとの相性が抜群で、Canvas が本文を書き、Nano Banana 2 がヘッダー画像を出す、という一本の流れが完結します。

教師と研修担当:授業資料の挿絵を生成できます。「シルクロードを行く隊商が砂漠を横断する」「細胞内のミトコンドリアの断面」「TCP の 3 ウェイハンドシェイクの図解」など、ストックフォトと比べて教材の文脈を正確に再現でき、著作権の心配もありません。「黒板にチョークで描いた風」「手描きの図解」を指示に加えると資料全体の見た目が統一され、拾い物の画像を混ぜたときの違和感を避けられます。

個人開発者:App Store のスクリーンショット、サイトのヒーロー画像、告知用の投稿画像を、ひとつの指示でまとめて用意できます。特にストックフォトを使いたくない架空の人物像(アイコン、チームの集合写真)が必要な場面で有効です。有料広告の素材を作るときは A/B テストと組み合わせ、同じテーマで構図違いを 10 枚出して最もコンバージョンの高い 1 枚を配信すれば、予算がストックフォトの月額に消えることもありません。

できないこと・限界はどこですか?

現時点でできないこと:動画(それは Veo 3 の領域)、音声、複雑な文字の埋め込み(誤字が残るため後処理が必要)、ピクセル単位の座標指定、5 枚を超えるキャラクターの一貫性(この点は Midjourney の Character Reference が上)。

既知の制約:無料枠は 1 日あたりおよそ 20〜50 枚(地域やアカウントの区分により変動)、Advanced 枠は大幅に緩和されますが無制限ではありません。一部の地域(EU の一部加盟国、中国本土、ロシア)では規制対応のため直接は利用できません。安全フィルタは実在の著名人、未成年者、流血・暴力、露出のある内容をブロックしますが、「スーツを着た男性 CEO」のような正当な商用シーンが巻き込まれることもあります。

もう 1 つよくある失敗は、画風をめぐる法的な線引きです。存命の作家の画風の模倣(「ジブリ風」「特定の現代作家風」)は黙って拒否されるか、明らかに崩れた結果が返ってきます。これは Google が訴訟リスクを避けるために意図的に設けたフィルタです。物故作家(ゴッホ、モネ、葛飾北斎)の画風は通常どおり使えますが、商用利用の際は国ごとの著作権保護期間の違いに注意が必要です。企業ロゴ、有名なキャラクター、ブランドのマスコットもブロック対象で、二次創作には使えません。

Windows ではどう使いますか?

Google は現在も Gemini の Windows ネイティブアプリを出していません。2026-04-14 に登場した「Google app for desktop」は Alt+Space で呼び出す検索ランチャーであり、Gemini のチャットクライアントではなく、英語のみ・20MB のアップロード制限・OneDrive 非対応です。Windows で Nano Banana 2 を使って 4K 画像を生成しローカルに保存したい場合は、Windows 向けネイティブ Gemini アプリの選択肢GeminiDesktop インストールガイドを参照してください。デスクトップ版の利点は、4K 画像をブラウザ経由のダウンロードを挟まずに直接ファイルシステムへ保存できることです。

よくある質問

Q:Nano Banana 2 と Imagen の関係は? A:Nano Banana 2 は Imagen 第 4 世代の一般ユーザー向けの派生版で、推論の最適化と対話編集への対応が加えられています。Imagen はモデルファミリーの名称として存続し、主に API 開発者と企業向けの Vertex AI で提供されています。

Q:生成した画像は商用利用できますか? A:Google の規約はユーザーに生成画像の利用権を認めており、商用利用も含まれます。追跡には SynthID の電子透かしが使われます。ただし Google が補償するわけではなく、第三者の肖像や商標に関する申し立てがあった場合の責任は利用者にあります。重要な案件では、特に人物の肖像、建築物の外観、衣服の柄など後から問題になりうる要素について、事前に法務の確認を取ることをおすすめします。

Q:指や文字が崩れるのはなぜですか? A:拡散モデル全般の弱点で、ノイズ除去の終盤で細部の整合性が崩れやすいためです。第 1 世代からは大幅に改善されましたが、完全にはなくなっていません。「指は 5 本を保って」「文字は WELCOME と綴って」と追加指示すると直ることがあり、直らない場合は Canvas に取り込んで手作業で調整できます。

Q:日本語の指示でも効果は変わりませんか? A:完全に対応しており、英語と遜色ありません。土台が Gemini 3 の多言語テキスト理解だからです。ただし「和柄」「着物のディテール」「水墨画」といった文化固有の語彙は再現精度がまだ弱いため、参考画像を併用してください。1 枚の中で、場面は日本語で書き、スタイルだけ英語で補う(「ink wash painting, dramatic lighting」)という書き方が実務では最も安定します。

Q:複数の画像でキャラクターを揃えるには? A:最初に生成した画像を参照画像としてアップロードし、「このキャラクターの見た目を保って、新しい場面は……」と指示します。10 枚を超える長期的な一貫性には、今も Stable Diffusion の LoRA か Midjourney の Character Reference が必要です。

Q:SynthID の電子透かしは画質に影響しますか? A:影響しません。SynthID はピクセル単位の不可視の透かしで、肉眼では判別できず、印刷結果や SNS の圧縮後の見え方にも影響しません。役割は、Google の追跡ツールや一部の第三者の真贋判定サービスがその画像を AI 生成と識別できるようにすることです。一般ユーザーにはほぼ無感ですが、報道や証拠資料など審査の厳しい分野では重視されます。

Q:まとめて生成するときの枚数はどう数えますか? A:無料枠も Advanced 枠も「生成に成功した枚数」で数え、反復修正の小さな手直しも通常 1 枚として計上されます。節約のコツは、スタイル・構図・色・比率といった要件を最初の指示にすべて書き切ることです。まとめて書けば 1 枚で済むところを、1 往復ごとに条件を足していくと同じ結果に 3〜4 枚かかることがあります。

関連記事

デスクトップでの体験

GeminiDesktop は、Nano Banana 2 の画像生成をクロスプラットフォームのネイティブアプリで利用できるようにします。macOS(Intel と Apple Silicon)、Windows、Linux の 3 プラットフォームに対応し、対話の中での生成、繰り返しの調整、4K 画像のローカル保存までを完結できます。Google 公式の Windows 検索クライアント(詳しくは比較記事)と比べて、20MB の上限がなく、日本語 UI に対応し、Intel Mac でも利用できます。ダウンロードはこちら:geminidesktop.app

「機能と用語」の記事 19 本をすべて見る →

これらの AI ツールを試す