Model Explainer / 2026-07-28

Kimi K3 とは何か

中国 Moonshot AI が 2026 年 7 月に公開した、総パラメータ 2.8 兆・アクティブ 104B の MoE モデル。「世界初のオープン 3T 級モデル」を名乗り、重みが実際にダウンロード可能になった最大級のモデルである。

一次情報:Kimi 技術ブログ / Hugging Face モデルカード + 第三者検証を突き合わせて作成

まず 3 行

  1. 正体:総 2.8T / アクティブ 104B の MoE、コンテキスト 1M トークン、ネイティブ画像理解つき。「長時間まわし続けるコーディング・エージェント」に全振りした設計。
  2. 立ち位置:Claude Fable 5 と GPT-5.6 Sol には総合で届かないと Moonshot 自身が明言。ただし Claude Opus 4.8 は多くの項目で上回り、フロントエンド生成の人間評価(LMArena)では 1 位。
  3. 使えるか:API と Kimi アプリ経由なら今日から使える。重みは 7/27 に公開されたが、ローカルで動かすのは実質不可能(重みだけで約 1.5TB)。

1. 基本スペック

Total Params
2.8 T
オープンウェイト最大
Active / Token
104 B
896 エキスパート中 16 個
Context
1,048,576
1M トークン
Modality
文字 + 画像
MoonViT-V2 (401M)
項目意味・注記
アーキテクチャMixture-of-Experts93 層 / うち dense 層は 1 層のみ
Attention 構成KDA 69 層 + Gated MLA 24 層線形系と全結合系のハイブリッド
エキスパート896 個中 16 個を選択 + 共有 2 個K2 世代から大幅に高スパース化
Attention Hidden / Heads7168 / 96
Latent MoE 次元3584(エキスパート内 3072)Stable LatentMoE
語彙160K
活性化関数SiTU-GLUSigmoid Tanh Unit
量子化MXFP4 重み / MXFP8 活性化SFT 段階から量子化前提で学習(QAT)
思考モード常時 ONreasoning_effort = low / high / max(既定 max)
ライセンスKimi K3 LicenseMIT 派生の独自ライセンス(後述)

2. 何が新しいのか(アーキテクチャ)

Moonshot の主張の中心は「大きくした」ではなく「同じ計算量からより多くの知能を取り出せるようにした」という点にある。K2 比でスケーリング効率 約 2.5 倍を掲げている。

KDA(Kimi Delta Attention)

93 層のうち 69 層で使われる線形系アテンション。長いコンテキストでも計算コストが二乗で膨らまないようにしつつ、残り 24 層の Gated MLA で選択性・表現力を確保する。1M コンテキストを「価格的に成立させる」ための土台。

AttnRes(Attention Residuals)

深さ方向の情報伝達の作り替え。従来のように各層の表現を一律に積み上げるのではなく、必要な表現を層をまたいで選択的に取り出す。

Stable LatentMoE + 学習安定化

896 中 16 という高スパース性では、ルーティングと最適化そのものが最大の難所になる。ここに次の 2 つを投入している。

推論インフラ側

エキスパート並列を大規模化しても詰まらないよう、静的シェイプ・クリティカルパス上のホスト同期なしの「完全バランス型エキスパート並列学習」を導入。運用面では 64 基以上のアクセラレータを載せたスーパーノード構成を推奨している。また KDA は従来のプレフィックスキャッシュと相性が悪いため、対応実装を vLLM コミュニティに提供している。

📍解釈:ここが一番の実務的インパクト。「1M コンテキスト + キャッシュヒット時 $0.30/MTok」という価格は、KDA とキャッシュ実装が噛み合って初めて成立している。アーキテクチャの新規性が、そのまま料金表に出ている珍しいケース。

3. 何ができるのか

長時間まわすコーディング

K3 の売りは「人の監視をほぼ外して長いエンジニアリング作業を続けられること」。Moonshot が挙げた自社検証は以下。

加えて「vision in the loop」— コードとライブスクリーンショットを往復しながら自己修正する挙動を推している。ゲーム開発、フロントエンド、CAD が想定用途。

ナレッジワーク

Kimi Work 側の事例として、42 年分の AI ASIC 産業を扱うインタラクティブ調査サイト(120 回超の再帰的自己改善、Web 検索/取得 2,800 回超、ターミナル経由のデータ取得 1,100 回超、四半期報告 87 件と原典 PDF 99 件を含む 11,000 ページ超)、核融合産業レポート、重力波イベント 391 件を 20 以上の並列サブエージェントで解析した GWTC-5 分析などを公開。

新機能として Widgets(チャット内で生成する対話コンポーネント、ローカルデータや外部プラグインと接続して更新)と Dashboard(気に入った Widget をテーマ別に常設ビューへ集約)を導入。動画編集では、56 本のソースクリップから自身のティザー動画を、クリップ選定・モーションマッチカット・ビート同期・音声処理まで含めて編集したとしている。

4. ベンチマーク(公式表からの抜粋)

Moonshot 公表値。すべて reasoning_effort=max、temperature 1.0。緑は行内最高。

ベンチマークKimi K3 Fable 5GPT-5.6 Sol Opus 4.8GLM-5.2
推論・知識
GPQA Diamond93.592.694.191.091.2
HLE-Full(ツール無/有)43.5 / 56.053.3 / 63.044.5 / 58.049.8 / 57.9
CritPt(物理)23.428.632.320.920.9
AA-LCR(長文推論)74.770.073.767.771.3
コーディング
DeepSWE67.570.073.059.046.2
ProgramBench77.876.877.671.963.7
Terminal-Bench 2.188.388.088.884.682.7
FrontierSWE81.286.671.366.767.3
SWE-Marathon42.035.039.040.013.0
SciCode58.760.256.153.550.5
Kimi Code Bench 2.0(自社)72.976.964.871.764.2
エージェント
BrowseComp91.288.090.484.3
MCPMark-Verified94.587.492.976.4
GDPval-AA v2(Elo)16861747173615931510
AA-Briefcase(Elo)15481583149513541260
Harvey Lab-AA(法務)94.693.687.291.191.0
OfficeQA Pro63.369.963.263.941.4
τ³-Banking33.426.833.027.626.8
ビジョン
OmniDocBench91.189.885.887.9
Video-MME(字幕付)90.089.586.0
MMMU-Pro81.6 / 83.481.2 / 86.583.0 / 84.678.9 / 82.7
CharXiv (RQ)84.8 / 91.388.9 / 93.584.6 / 89.180.5 / 89.9

第三者評価

ベンチマークを読むときの必読注記

公式表はモデルごとに異なるハーネスで走っている(K3 = Kimi Code、Claude 系 = Claude Code / Terminus 2、GPT 系 = Codex)。同一条件比較ではない。

📍解釈:「Kimi K3 のスコア」は常に「K3 + 特定のハーネス + 特定の設定」を意味する。単一ベンチの数字を根拠に採否を決めるべきではない。

5. 入手方法と料金

経路内容
Kimi アプリ / WebiOS・Android・HarmonyOS、kimi.com
Kimi Workデスクトップアプリ 3.1.0 以降。Windows と Apple Silicon Mac 対応
Kimi Code(CLI)ターミナルで /model から K3 を選択。Moonshot 推奨のハーネス
APIplatform.kimi.ai でモデル ID kimi-k3。OpenAI / Anthropic 互換
重みHugging Face moonshotai/Kimi-K3(2026-07-27 公開)+ 技術レポート PDF
推論エンジンvLLM / SGLang / TokenSpeed(各公式レシピあり)。Together AI・Modal などが day-0 ホスティング
企業向けKimi Enterprise(個人アカウントと組織アカウントを完全分離)

API 料金(USD / 1M トークン)

入力(キャッシュヒット)
$0.30
コーディング用途で 90% 超のヒット率と主張
入力(ミス)
$3.00
出力
$15.00
思考トークンを含む

K2.6 は $0.95 / $4.00 だった。約 3〜4 倍の値上げである。入力 100 万 + 出力 20 万トークンの仕事で試算すると:

上記は公表単価からの単純計算(Python で検算済み)。📍解釈:Moonshot は「安さで勝つ」路線を降り、能力で勝負する価格帯に移動した。既定が max effort なので、短いプロンプトでも思考トークンが膨らみコストが読みにくい点に注意。

6. セルフホストの現実

重みが公開されたことと、手元で動くことは別問題。総パラメータ 2.8T をネイティブ MXFP4(4bit + 32 要素ごとのスケール)で保持した場合の重み容量を計算すると:

重みのみ(MXFP4)
約 1.49 TB
= 1.35 TiB
BF16 換算
約 5.6 TB
現実的でない
H200 141GB 換算
11 基
重みを載せるだけの最低本数
Moonshot 推奨
64 基以上
スーパーノード構成

ここに KV キャッシュ(1M コンテキスト)、活性化、並列化のオーバーヘッドが乗る。Mac も Windows も本番デプロイ先にはならない。実質 Linux + NVIDIA(または同等)クラスタ専用である。

📍数値の食い違いに注意:一部の解説記事は「BF16 で約 594GB」と書いているが、2.8T パラメータ × 2 バイト = 5.6TB なので算術的に成立しない(おそらく別モデルの数字の転記)。1.4〜1.5TB(4bit 系)を出発点にするのが妥当。上記は当方で検算した値。

Moonshot 自身が launch 後 48 時間で GPU 容量の限界に達し、7 月 19 日に新規サブスクリプションを一時停止している(既存契約者は影響なし)。以後、会員プランを Kimi Membership(Web/App/Work)と Kimi Code Membership(コーディング)に分割すると発表。運営元でさえ計算資源の壁に当たった、という事実がセルフホストの難易度をよく表している。

7. ライセンス:Kimi K3 License

Apache 2.0 や MIT ではなく、独自の「Kimi K3 License」。文面の大部分は MIT に近く、使用・複製・改変・配布・サブライセンス・販売、および重みの実行・デプロイ・ファインチューン・派生物作成を無償で認める。ただし大規模事業者向けに 2 つの条件がある。

社内利用、および Moonshot 公式製品や認定推論パートナー経由の利用はこれらの対象外。Artificial Analysis はこのライセンスを「Commercial Use Restricted(商用利用制限あり)」に分類している。

📍実務的には:中小企業・個人事業レベルなら閾値に触れないので、事実上「商用可のオープンウェイト」として扱える。ただし「MIT だから安心」と説明するのは誤り。ライセンス名を正確に伝えること。

8. 公式に明記された弱点

  1. 思考履歴への敏感さ — K3 は「思考履歴を保持するモード」で学習されている。ハーネスが履歴の thinking 内容を全部返さない場合、あるいは他モデルとのセッション途中で K3 に切り替えた場合、生成品質が著しく不安定になる。API では reasoning_contenttool_calls を含むアシスタントメッセージをそのまま返送する必要がある。検証済みハーネス(Kimi Code)推奨、セッション中のモデル切替は避けること。
  2. 過剰な能動性 — 長時間・高難度タスクに寄せて訓練された結果、些細な問題や意図の曖昧さに遭遇するとユーザーの代わりに勝手に判断する。境界を守らせたい用途では、システムプロンプトや AGENTS.md で明示的な行動制約を書く必要がある。
  3. UX の差 — Moonshot 自身が「Fable 5 や GPT-5.6 Sol と比べて体験面で顕著な差がある」と認めている。
  4. ハルシネーション率の上昇(第三者測定)— 正答率と引き換えに 51% 程度まで上昇。事実確認が必要な用途では要注意。

9. 反論と再反論

反論①「オープンウェイトなのだから、いずれ手元で動く。待てばいい」

再反論:スパース性は計算量を減らすが保持すべき重み量は減らさない。4bit でも 1.4TB 超で、コンシューマ GPU の 24GB とは 60 倍のギャップがある。加えて KDA という新規アーキテクチャは llama.cpp / Ollama 系の対応に時間がかかり、量子化の品質確保はさらに後になる。「重み公開 = ローカル実行可能」ではない。セミナー等で説明する際にここを混同させないことが重要。

反論②「ベンチマークで Opus 4.8 を上回っているのだから、乗り換えるべきだ」

再反論:3 点で保留が必要。(a) 比較がハーネス混在で同一条件ではない。(b) Artificial Analysis は同時に「出力速度が中位値未満」「出力トークン消費が中位値の約 2 倍」を測定しており、能力と運用効率が逆方向を向いている。(c) 公式が認める「過剰な能動性」と「思考履歴の扱いの脆さ」は、既存ワークフローへの組み込みコストとして現れる。自分の実タスクで A/B することなく採否を決められる材料は揃っていない。

反論③「中国製モデルなのでデータ的に使えない」

再反論:これは二分法で切るべきではない。公式 API を使えばデータは中国のサーバへ渡るため、規制業種や機密案件では確かに選べない。しかし選択肢はそこで終わらない — 重みが公開されたので、Together AI・Modal などの第三者ホスティング(データ所在地を選べる)や、自社/リージョン内でのセルフホストという経路が開いた。むしろ「オープンウェイトである」ことが、データ所在地の問題に対する回答になっている。逆に、ライセンスの MaaS 条項や表示義務は、ホスティング事業を営む場合に実際に効いてくる。

10. 経緯

周辺の報道として、Bloomberg は Moonshot が 6 か月内の香港 IPO 準備と新規資金調達を進めていると伝えている。また The Information に帰属する報道として、Microsoft が Copilot ワークロード向けに K3 を評価し Azure での提供を準備しているとされるが、導入もコスト削減額も公式には確認されていない

11. 実務者向けのまとめ

試す価値がある場合

見送るべき場合

試すときの手順

  1. まず Kimi Code CLI で試す(Moonshot が品質を保証しているハーネスはこれのみ)
  2. API を直に叩く場合は reasoning_content の返送を必ず実装。省略すると品質が崩れる
  3. reasoning_effort を low / high に落として、コストと品質のバランスを実測する(既定は max)
  4. 行動制約を AGENTS.md かシステムプロンプトに明文化してから本番タスクに投入
  5. セッション途中で他モデルへ/から切り替えない

確認できなかった点・食い違い

少数だけ点灯する疎な専門家格子でKimi K3のMoE構造を表した表紙画像
FUJIKAWA LAB SPECIMEN 27 / 27