12 min read

Gemini 3.5 Flash / 3.6 Flash / 3.7 Flash 徹底比較:3か月で三世代、性能・料金・ベンチマークの全変化

Googleの「Flash」系列は、2026年5月の3.5 Flash、7月の3.6 Flash、そのわずか3週間後の3.7 Flashへと、3か月で三世代を駆け抜けた。速くて安い軽量モデルという位置づけは、この間に最上位フロンティア級の知能を備えた実務中核機(Workhorse)へと完全に置き換わっている。FrontierCode・DeepSWE・AutomationBench・GDP.pdfといった専門ベンチマークが何を測る試験なのかを平易に解きほぐしたうえで、三世代の数値を一枚の比較表に整理。3.7 Flashの目玉である思考レベル制御(low/medium/high)、2026年末までの半額プロモーション(入力$0.75/出力$3.75)と2027年の通常価格復帰、そして財務資料の解析・業務自動化・Web構築という3場面での体感差まで、21の引用文献に基づいて解説する。

12 min read

Claude Fable 5とClaude Opus 5の徹底比較:性能・料金・安全性と用途別の使い分け指針

Anthropicの第5世代モデル、Claude Fable 5(Mythosクラスの推論力+安全分類器)とClaude Opus 5(半額で迫る実務主力)はどう使い分けるべきか。100万トークンコンテキスト・128k出力という共通仕様の裏にある料金($10/$50 vs $5/$25)、Fast Mode、5段階の可変努力値、誤拒否率85%減のアライメント改善、自動フォールバック機構までを16の引用文献に基づき比較。CursorBench・OSWorld 2.0などのベンチマーク結果と、Stripeの5,000万行移行からGUI自動化・脆弱性監査まで具体的事例で選定基準を示し、Opus 5標準配備+Fable 5昇格の「動的ハイブリッドルーティング」戦略を提言する。

32 min read

Gemma 4 26B vs Qwen 3.6 27B:日本語・推論・エージェント性能を徹底比較

300億パラメータ未満のミドルクラスモデルで覇権を争う Google Gemma 4 26B A4B と Alibaba Qwen 3.6 27B。極限の MoE か、ハイブリッド Dense か。計算効率、数学的推論、自律エージェントとしてのコーディング能力、そして日本語環境でのローカライゼーション能力(Ricohによるファインチューニング事例など)まで、37本の文献に基づき徹底比較します。

18 min read

Google I/O 2026 全発表まとめ:初心者にもわかる100の新発表ガイド

2026年5月のGoogle I/Oで発表された100件すべてを初心者向けに解説。Gemini 3.5 Flash、動画生成AIのGemini Omni、自律エージェントGemini Spark、開発基盤Antigravity 2.0、科学研究を加速するGemini for Science、Android XRスマートグラス、AI製コンテンツを見分けるSynthIDまで。専門用語をかみ砕き、たとえ話を交えながら7分野の全体像をやさしく整理する。