Gemini 3.5 Flash・Gemini 3.6 Flash・Gemini 3.7 Flashとは、Googleが2026年5月から8月にかけて相次いで投入した「Flash」系列のAIモデルであり、応答速度と低コスト運用を主眼に置いた従来の軽量設計から、最上位フロンティア級の知能を兼ね備えた実務中核機(Workhorse)へと質的な転換を遂げた三つの世代である12

人工知能システムの実務導入において、処理速度(レイテンシ)、計算コスト、そして高度な論理的思考力(インテリジェンス)をどのように調和させるかは長年の重要課題であった1。2026年5月の「Gemini 3.5 Flash」の投入以降、7月の「Gemini 3.6 Flash」、そしてわずか3週間後の8月に発表された「Gemini 3.7 Flash」に至る系譜において、Flashシリーズはこのトレードオフを段階的に解消していった4

本稿では、これら三世代の進化プロセスを検証し、AIモデルの性能評価に用いられる専門的ベンチマーク指標の本質を整理したうえで、技術者でなくとも各モデルの性能差と実用上の差異を判断できるよう解説する。

1. ベンチマーク指標の定義と実務的意義

AIモデルの能力を評価する指標は、単に知識の有無を試すペーパーテストから、複雑な現実世界のタスクを自律的にやり遂げられるかを測る「実務遂行テスト」へと移行している。各指標が何を測定し、それが実務において何を意味するのかを理解することは、モデルの適切な選定において不可欠である。

ソフトウェア開発・コーディング指標

FrontierCodeは、実際のオープンソースソフトウェア開発で生じる不具合修正や機能追加の課題(Issue)に対し、AIが生成した修正プログラムが「そのまま実運用環境に統合できる品質を満たしているか」を測定する指標である4。従来の短いコード生成試験とは異なり、膨大な既存コードベースの依存関係を正確に把握したうえで、人間による手直しの不要な高品質なコードを初回で出力できるかが問われる4

DeepSWEは、長時間の試行錯誤と複合的な手順を要する本格的なソフトウェアエンジニアリング能力を評価する試験である4。エラーの発生時に自律的に原因を特定し、修正案を再検証し、テストを通過するまで修正ループを粘り強く回し続けられるかという「長期的な問題解決の完遂力」を測定する3

WebDev Arena(Code Arena)Eloスコアは、指示文や画像データ(スクリーンショットやデザインカンプ)をもとに、動的なWebアプリケーションやUI画面を構築する能力を対戦形式で評価したレーティングである4。チェスなどの実力評価に用いられるEloレーティングの手法を採用しており、競合モデルと比較してどれだけ視覚的・機能的に忠実なWeb画面を生成できるかを示す4

エージェント機能・業務遂行指標

AutomationBenchは、「複数アプリケーションの操作を伴う実業務ワークフロー」を、途中で停止したり判断を誤ったりすることなく自律的に完遂できる割合を測る指標である7。指示された最終目標を達成するために必要なサブタスクの分解、外部ツールの適切な呼び出し、想定外のエラーへの臨機応変な対処といった、自律型AIエージェントとしての総合力が反映される7

OSWorld / OSWorld-Verifiedは、人間がパソコン画面を見ながらマウスやキーボードを使って操作するのと同様に、AIがOSのグラフィカル画面を視覚的に認識し、各種ソフトウェアを自律的に操作できるかを検証する指標である3。PC画面上のボタン配置や入力フォームを誤認せず、目的の操作を完遂する能力を評価する3

高度文書理解・専門知識ワーク指標

GDP.pdfは、金融の有価証券報告書、法務契約書、医学・生命科学の論文など、専門用語や複雑な図表、脚注が密集した高密度PDFを正確に解析・推論する能力を評価する指標である7。単純な文字起こしにとどまらず、グラフの推移や表中の細かな数値関係を正しく統合して結論を導き出せるかを測定する7

GDPval-AA / Harvey LAB-AAは、M&A(企業の合併・買収)や契約書レビュー、証券分析など、高度な専門職レベルの知識ワークにおけるアウトプットの論理性、根拠の確かさ、精緻さを評価する指標である3

GDM-MRCR(長文脈検索精度)は、100万トークン(書籍数百冊分に匹敵する情報量)の長大な文脈の中から、分散して隠された複数の特定情報を一切の見落としなく正確に抽出できるかを測定する指標である7

指標名 測定対象 平易な解説(何を測る試験か) 実務における重要性
FrontierCode 1.1 実務コードの初回完成度4 複雑なシステムを壊さずに一発で修正できるか 人間によるコード修正・手直しの工数削減
DeepSWE v1.1 長期自律開発力4 エラーが出ても自ら原因究明して完成まで粘れるか 開発者不在下での不具合自動修正の実現
WebDev Arena Elo Webアプリ・画面生成力4 デザイン画像どおりに動くWeb画面を作れるか 画面デザインからのフロントエンド開発の高速化
AutomationBench 業務ワークフロー完遂率7 複数ツールの操作を伴う複雑な仕事をやり切れるか バックオフィスや定型業務の完全自動化
OSWorld-Verified パソコン画面の操作代行力3 人間の代わりにマウスやキーボードでPC操作できるか APIが存在しない社内レガシーシステムの自動操作
GDP.pdf 難解な図表入りPDFの読解力7 決算書や契約書の表・グラフの文脈を完璧に読めるか 金融・法務・研究分野における資料分析の自動化
GDM-MRCR (128k) 長文からの情報探索精度7 膨大な社内資料の山から目的の記述を見つけ出せるか 企業内データ検索(RAG)の検索漏れ防止

2. 三世代の技術的特性と進化の系譜

Flashシリーズの急速な進化は、単なるモデルサイズの拡大によるものではなく、推論アルゴリズムの抜本的見直しとエージェント向け実行環境への最適化によってもたらされた4

Gemini 3.5 Flash:高速性とフロンティア級知能の統合

2026年5月のGoogle I/Oで発表されたGemini 3.5 Flashは、従来の「軽量モデルは応答が速いが複雑な推論は苦手である」というトレードオフを覆したモデルである1。100万トークンの広大な入力コンテキストウィンドウを備え、テキスト、画像、音声、動画、PDFを同一基盤で処理するネイティブ・マルチモーダル構造を確立した1

当時の上位機であるGemini 3.1 Proに匹敵する知能スコアを記録しながら、出力速度においては他社フロンティアモデルの約4倍(毎秒約280トークン以上)に達する高速性を実現した1。この性能特性により、Google Antigravityなどの開発プラットフォームと連動し、複数の専門サブエージェントが協調して長期タスクを実行する「マルチエージェント型ワークフロー」の実用的な基盤が築かれた2。チャットボットの体感応答性向上や、数百ページに及ぶ業務マニュアルの一括要約、リアルタイムの音声・映像対話処理などにおいて高い経済合理性を発揮した1

Gemini 3.6 Flash:トークン消費効率とエージェント実効性の洗練

2026年7月にリリースされたGemini 3.6 Flashは、3.5 Flashで確立された知能水準を基礎に、自律動作時の「無駄な推論ステップや冗長なツール呼び出し」を削ぎ落とす効率化が施された3。AIが業務を自動遂行する際、出力する文字数や思考量(出力トークン)の多さは、そのまま利用コストと実行時間の増大に直結する3

3.6 Flashでは、複合タスクの実行に必要な出力トークン数が前世代比で平均17%削減され、特定のソフトウェア修正環境(Datacurve DeepSWE)では最大65%のトークン削減を達成した3。無駄な再試行ループを抑制した結果、長期ソフトウェアエンジニアリング(DeepSWE)の精度は3.5 Flashの37.0%から49.0%へと向上し、機械学習研究タスク(MLE Bench)でも49.7%から63.9%へ、PC操作(OSWorld-Verified)でも78.4%から83.0%へと能力向上が確認された3。Figmaにおけるデザイン生成や、HarveyおよびHebbiaにおける法務・金融デューデリジェンスなど、大規模なエンタープライズ本番環境において費用対効果と処理速度を両立する主力機としての立ち位置を固めた3

Gemini 3.7 Flash:推論アルゴリズム刷新と自律開発エンジンの確立

Gemini 3.6 Flashの登場からわずか3週間後の2026年8月に公開されたGemini 3.7 Flashは、ゼロからの大規模事前学習を行わず、推論基盤のアルゴリズム改良のみで大幅な性能向上を達成したモデルである4。Googleはこのモデルを「コーディングおよびエージェント向けに最も高性能な主力モデル」と位置付けている4

最大の技術的革新は、開発者がタスクの要件に応じて推論の深さを調整できる「思考レベル制御(Tunable Reasoning Levels)」の実装である8。即答性が求められる対話には low、通常の複雑な開発には medium(標準)、極めて難解な論理推論や自律エージェントタスクには high を指定することで、同一API内で速度・精度・費用の最適バランスを柔軟に制御できるようになった8

この結果、FrontierCode 1.1で43.6%(3.6 Flash比で+9.2pt)、DeepSWE v1.1で65.3%(同+16.3pt)、AutomationBenchで30.4%(同+13.4pt)と、主要な実務ベンチマークで大幅な向上を遂げた4。特にソフトウェア開発やWebアプリケーション構築(Code Arena Elo 1588)においては、競合の最上位モデルであるClaude Sonnet 5やGPT-5.6を一部項目で凌駕する水準に達している4。さらに、静的な年次報告書PDFからリアルタイム集計グラフを備えた対話型Webページを瞬時に再構築する高度なマルチモーダル変換能力を備え、2026年末までは100万トークンあたり入力$0.75・出力$3.75という、3.6 Flashの半額にあたる導入価格が設定された48

3. 性能データ比較マトリクス

以下の表は、Gemini 3.5 Flash、3.6 Flash、3.7 Flashの公開時期、基本仕様、主要ベンチマーク評価、およびコスト構造を体系的に比較したものである。

評価カテゴリ / 項目 Gemini 3.5 Flash Gemini 3.6 Flash Gemini 3.7 Flash 備考・比較対象基準
リリース時期 2026年5月13 2026年7月3 2026年8月8 3.6から3.7はわずか3週間4
入力 / 出力コンテキスト上限 100万 / 64Kトークン1 100万 / 64Kトークン15 100万 / 64Kトークン8 100万トークンは書籍数百冊分に相当1
総合知能指数(Artificial Analysis) 528 5678 Claude Sonnet 5は55、GPT-5.6は577
実務コード生成(FrontierCode 1.1) 20%台後半(推定) 34.4%4 43.6%47 Claude Sonnet 5(42.7%)を上回る4
自律ソフトウェア開発(DeepSWE v1.1) 37.0%3 49.0%4 65.3%47 3.5 Flashから28.3ptの改善3
Web開発(WebDev Arena Elo) 15384 158847 GPT-5.6(1523)を上回る7
業務自動化(AutomationBench) 17.0%7 30.4%78 Claude Sonnet 5(10.7%)を大きく上回る7
高密度PDF理解(GDP.pdf) 22.0%7 34.0%78 専門的な図表入り文書の解析精度7
知識ワーク評価(GDPval-AA v2) 13493 14213 15258 高度な専門業務の遂行品質3
法務ワークフロー(Harvey LAB-AA) 85.1%8 90.7%78 専門的な契約書・法務レビュー精度7
長文脈検索(GDM-MRCR 128k) 91.8%8 97.0%78 膨大なデータからの特定情報抽出率7
PC画面操作代行(OSWorld-Verified) 78.4%3 83.0%3 85.0%超(OSWorld 2.0: 47.9%)3 クライアント側の内蔵ツールに対応3
思考レベル制御(Tunable Thinking) 非対応(固定推論)13 非対応(固定推論) 対応(low / medium / high)820 速度優先から熟考まで動的に制御8
入力API料金(100万トークン) $1.501 $1.503 $0.75(導入特価)/ 通常$1.508 2026年末まで半額プロモーション8
出力API料金(100万トークン) $9.001 $7.503 $3.75(導入特価)/ 通常$7.508 競合モデル($10〜$12)の1/3以下8

4. 日常業務で体感する三世代の違い

ベンチマーク数値を離れ、実際のビジネス現場や日常の作業においてどのような体験の違いが生じるかを、代表的な三つの場面に沿って整理する。

財務資料・専門文書の解析と利活用

数百ページに及ぶ企業の決算報告書や複雑な契約書を読み込ませた場合、Gemini 3.5 Flashはドキュメント全体を数秒で読み通し、大まかな要約や指定した条項の場所を素早く提示する1。しかし、複雑に入り組んだ財務諸表の注記やグラフの微細な関連性について質問すると、数値を取り違えるケースが見られた。

Gemini 3.6 Flashでは、要点を無駄のない簡潔な言葉でまとめる能力が向上し、不要な長文出力が抑制されたことで、確認作業にかかる人間の時間を削減できるようになった3

最新のGemini 3.7 Flashになると、入り組んだ図表や注記を含む高密度なPDFであっても誤解なく数値を把握し(GDP.pdf 34.0%)、単に内容を文章で説明するだけでなく、「この財務推移を直感的に把握できる、マウスで動かせるインタラクティブなグラフ付きWebダッシュボード」を即座に作成して提示するような、高度な情報変換が可能になっている7

複数ステップを伴う業務の自動化(AIエージェントへの依頼)

「毎朝届く問い合わせメールを確認し、内容を分類して社内データベースに登録し、緊急度が高いものは関係者にチャットで通知する」といった複数段階の業務を任せた場合、Gemini 3.5 Flashは基本的な指示どおりに作業を進めるものの、途中で予期せぬエラーや未対応のWeb画面に直面すると、作業を停止したり同じ操作を繰り返す無限ループに陥りやすかった2

Gemini 3.6 Flashではツールの呼び出し効率が改善され、無駄な操作回数が減少したことで、作業の途中で失敗する確率が大きく低下した3

Gemini 3.7 Flashでは、実務自動化の成功率が大幅に向上し(AutomationBench 30.4%)、途中で障害が発生しても「何が起きているかを自ら分析して別のアプローチを試す」「判断に必要な情報が足りない場合はユーザーに的確な確認質問を投げる」といった柔軟さを発揮し、最後まで仕事をやり遂げる自律性を獲得している7

Webサイトや業務システムの新規構築

手描きのレイアウトスケッチや既存システムの画面キャプチャを渡し、新しいWebページやプログラムの作成を依頼した場合、Gemini 3.5 Flashは即座にプログラムコードを生成するものの、実際に動かすとボタンの位置がずれていたり一部の機能が動かなかったりと、人間による手作業の修正が不可欠であった1

Gemini 3.6 Flashでは冗長なコード記述が減り、修正作業に必要な通信量と時間が圧縮された3

Gemini 3.7 Flashでは、提示されたデザイン画像の余白、配色、ボタンの質感を高い精度で再現し(WebDev Arena Elo 1588)、裏側の処理まで破綻なく組み上げた「そのまま本番環境で動く完成度の高いWebアプリケーション」を、わずか1回の指示から少ない手戻りで作り上げることが可能である4

5. 結論とモデル選定の指針

Gemini 3.5 Flash、3.6 Flash、3.7 Flashの進化プロセスは、AIモデルの開発競争が「単一回答の生成速度」から「自律型エージェントとしての完遂力と総合的な経済性」へと移行したことを明確に示している5

Gemini 3.5 Flashは、Flashシリーズにフロンティア級の知能を初めて注入した記念碑的モデルであり、即答性が求められるカスタマーサポートの対話窓口や、大量テキストの一次スクリーニングにおいて基礎を築いた1。続くGemini 3.6 Flashは、推論トークンの無駄を削ぎ落として企業の本番ワークフローにおけるコスト効率と安定性を確立した3

そして現行の最新モデルであるGemini 3.7 Flashは、推論の深さを自由に切り替えられる柔軟性を獲得したうえで、実務コーディングや複雑な業務自動化において競合各社の最上位フラッグシップ機に匹敵、あるいはそれを凌駕する知能水準に到達した4。さらに、2026年末までの半額プロモーション料金により、フロンティア級の能力を従来の軽量モデル以下のコストで活用できる環境が整っている4

したがって、今後の新規システム開発、既存アプリケーションの高度化、あるいは社内業務の自律自動化を検討する場合には、API互換性を維持しながら高いタスク成功率と経済的優位性を享受できるGemini 3.7 Flashの採用が最も合理的な選択肢となる5。ただし導入特価は2026年末までの期間限定であり、2027年以降は通常料金(入力$1.50 / 出力$7.50)へ戻る点は、年間の運用予算を組む段階で織り込んでおく必要がある78

引用文献 — References

  1. Gemini 3.5 Flashとは?性能・料金・使い方を徹底解説 - チャエンのAI研究所 https://digirise.ai/chaen-ai-lab/gemini-3-5-flash/
  2. Gemini 3.5 Flash の概要 - npaka / note https://note.com/npaka/n/n0c77f0c311ba
  3. Gemini 3.6 Flash、3.5 Flash-Lite、および3.5 Flash Cyberを発表 - Google Blog https://blog.google/intl/ja-jp/company-news/technology/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
  4. Google「Gemini 3.7 Flash」公開 わずか3週間で更新、コーディング・AIエージェント強化 初回価格は従来比半額 - Ledge.ai https://ledge.ai/articles/gemini_3_7_flash_coding_agent_update
  5. Gemini 3.7 Flash 評価レポート解説:DeepMind - zenk / note https://note.com/zenkok/n/n75a892894cd1
  6. Gemini 3.7 Flash: our most intelligent workhorse model - Google Blog https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
  7. Gemini 3.7 Flashとは?3.6 Flashとの違い・料金0.75ドル/M・2027年の値上げと使いどころ【2026年8月最新】 - AI革命株式会社 https://ai-revolution.co.jp/media/what-is-gemini-3-7-flash/
  8. Gemini 3.7 Flash を発表 - Google Blog https://blog.google/intl/ja-jp/company-news/technology/gemini-37-flash/
  9. Gemini 3.7 Flashとは?Gemini 3.6 Flashとの違い・Gemini Sparkでの使い方と料金 - ChatSense https://chatsense.jp/blog/gemini-3-7-flash
  10. 【Gemini 3.5 Flash-Lite & Gemini 3.6 Flash】自治体AI zevoにて2026年7月22日より提供開始 - PR TIMES https://prtimes.jp/main/html/rd/p/000000210.000056138.html
  11. エクサベース AI、Google最新モデル「Gemini 3.7 Flash」を提供開始 - ExaWizards https://exawizards.com/archives/32556/
  12. エクサベース AI、Google最新モデル「Gemini 3.7 Flash」を提供開始 - PR TIMES https://prtimes.jp/main/html/rd/p/000000482.000030192.html
  13. Gemini 3.5 Flash - Gemini Enterprise Agent Platform / Google Cloud Documentation https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/gemini/3-5-flash?hl=ja
  14. 最新モデルGemini 3.7 Flashリリース、利用価格はGemini 3.6 Flashの実に半額 - AI Watch https://ai.watch.impress.co.jp/docs/news/2133057.html
  15. 【Gemini 3.7 Flash】3週間で進化したGoogleの最強ワークホースモデルの性能・料金・使い方を徹底解説 - WEEL https://weel.co.jp/media/tech/gemini-3-7-flash/
  16. Gemini 3.5 Flash - Gemini API / Google AI for Developers https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash?hl=ja
  17. 【2026年最新】Geminiとは?最新モデル「Gemini 3.5 Flash」の特徴・使い方をわかりやすく解説 - NTT docomo Business Watch https://www.ntt.com/bizon/gemini.html
  18. Gemini 3.5徹底解説|性能・料金・Claude/GPTとの比較・個人開発での使い方【2026年5月最新】 - ShiftB https://shiftb.dev/articles/gemini-3-5-guide
  19. Gemini 3.5 Flash の新機能 - Interactions API / Google AI for Developers https://ai.google.dev/gemini-api/docs/whats-new-gemini-3.5?hl=ja
  20. Gemini 3.7 Flash - Gemini API / Google AI for Developers https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash
  21. 【アップデート】Gemini 3.7 Flashがリリースされました - DevelopersIO / クラスメソッド https://dev.classmethod.jp/articles/gemini-3-7-flash-released/