Kimi K3 徹底リサーチ — 2.8兆パラメータ、「史上最大のオープンウェイト」は実現するか
こんにちは!
2026年7月16日、中国・北京の Moonshot AI が新しいフラッグシップモデル Kimi K3 を発表し、APIやWebサービスでの提供を開始しました。
総パラメータ2.8兆という規模、100万トークンのコンテキスト、そして
「史上最大のオープンウェイトモデルになる」
という宣言がAI界隈をにぎわせています。
当ブログでは今年5月の記事「Mythos(ミュトス)レベルのオープンモデルはいつ出るのか」で、オープンモデルがクローズドのフロンティアにいつ追いつくのかを予測しました。
Kimi K3 は、まさにその問いに対する現時点での最新の「回答」のひとつです。
一方で、この記事を書いている7月20日時点では、モデルのウェイトも技術レポートもまだ公開されていません。
ただし、XなどSNSかいわいでは、
「ガードレールが弱めで、Fable5では拒否されるようなプロンプトでも対応してくれる」
「すぐにOpus4.8にフォールバックする Fable5より使い勝手がいい」
といった声が散見されており、
米国産のガードレール強め方針にたいして、ガードレール弱め中国産モデルが最終的にユーザーの心をつかむ可能性を秘めているかもしれません。
さて、そうはいっても本記事では、SNS等のネタではなく、一次情報(Moonshot 公式ブログ・公式APIドキュメント・GitHub)と英語圏の報道・独立評価機関の分析を突き合わせ、「公式発表」「独立評価」「未確認」を区別しながら、Kimi K3 の全体像を整理していきたいとおもいます。
第1部: Kimi K3 とは何か
リリースの経緯
Kimi K3 は2026年7月16日に発表され、同日から以下のチャネルで利用可能になりました。
- Kimi.com(チャットUI)
- Kimi Work(ワークスペース製品)
- Kimi Code(コーディングエージェント)
- Kimi API(OpenAI SDK 互換)
サードパーティの API アグリゲータである OpenRouter にも同日追加されており、「まず API とWebで使えるようにして、ウェイトは後から」という API 先行型のローンチです。
公式ブログは「フルモデルウェイトは 2026年7月27日までに 公開する」と明言しており、遅延の理由を「推論パートナーとの円滑な展開のため」と説明しています。
基本スペック早見表
| 項目 | 内容 | 情報の確度 |
|---|---|---|
| 総パラメータ | 2.8兆(MoE) | 公式発表(ウェイト未公開のため内部構成の独立確認は不可) |
| MoE構成 | 896エキスパート中16を活性化(約1.8%) | 公式発表 |
| アクティブパラメータ | 約50B(A50B)とする分析あり | 未確認(公式未公表) |
| コンテキスト長 | 100万トークン | 公式発表・APIドキュメント |
| マルチモーダル | ネイティブビジョン(画像・動画理解) | 公式発表+第三者ハンズオン確認 |
| 思考モード | 常時オン。公式 Kimi API では現在 'max' のみ、Kimi Code では low/high/max を選択可 | 公式ドキュメント |
| 新機構 | Kimi Delta Attention (KDA) / Attention Residuals (AttnRes) | 公式発表(効率数値はベンダー主張) |
| 量子化構成 | MXFP4 ウェイト / MXFP8 アクティベーション | 公式発表 |
| API価格 | 入力$3.00 / 出力$15.00(100万トークンあたり) | 公式価格ページ |
| ウェイト公開 | 2026年7月27日までに公開予定。配布ファイル形式は未確認(モデルカード公開待ち) | 公式コミットメント(7/20時点で未公開) |
| ライセンス | 「Modified MIT」との報道 | 未確認(一次ソースなし) |
第2部: アーキテクチャ — 極端に「疎」な2.8兆パラメータ
896分の16しか使わない MoE
Kimi K3 は Moonshot が「Stable LatentMoE」と呼ぶフレームワークで構築されたスパース MoE(Mixture of Experts)モデルです。特徴的なのはその活性化率の低さで、896のエキスパートのうち、トークンごとに活性化されるのはわずか16基(約1.8%)です。

総パラメータ2.8兆という数字はマーケティング上「世界初のオープン3Tクラス」と丸められて訴求されていますが、推論時に実際に動くのはそのごく一部です。
この
「巨大な知識の倉庫から、必要な棚だけを開ける」
設計により、規模と推論コストの両立を狙っています。
なお、トークンあたりのアクティブパラメータ数は Latent.Space が「A50B」(約500億)と表記していますが、Moonshot 公式は明示しておらず、この数字は未確認です。ウェイト公開後、設定ファイルやモデルカードなどから確認できる可能性があります。
2つの内製新機構: KDA と AttnRes
アーキテクチャ面での見どころは、Moonshot が内製した2つの新機構です。
- Kimi Delta Attention (KDA)
ハイブリッド線形アテンション機構。100万トークン級のコンテキストで最大6.3倍の高速デコードを実現すると主張されています - Attention Residuals (AttnRes)
従来の残差接続を置き換える機構。追加コスト2%未満で約25%の学習効率向上と主張されています
いずれも興味深い数字ですが、現時点では公式Xアナウンス由来のベンダー主張であり、技術レポート未公開のため第三者による再現はされていません。
ネイティブビジョンと常時オンの思考モード
K3 はテキスト・画像・動画を扱うネイティブマルチモーダルモデルです。
ビジョン機能については、著名なAI技術ブロガーの Simon Willison 氏が実際にテストして「Vision works well」と確認しており、これは数少ない独立した実測のひとつです。同氏の単一テストでは、思考モードが13,241推論トークンを消費する様子も観察されています(モデル一般の典型値ではなく一例です)。
思考モードは常時オンで、公式 Kimi API で指定できる reasoning_effort は現在 'max' のみです。一方 Kimi Code では low/high/max を選択できると公式に案内されており、利用チャネルによって選択肢が異なる点は押さえておきましょう。
第3部: ベンチマーク — 「自己申告」と「独立評価」を分けて読む
Kimi K3 のベンチマーク数値を読むときに最も重要なのは、どれが Moonshot の自己申告で、どれが独立評価かという区別です。
独立した比較評価としては Arena.AI(ブラインド投票)と Artificial Analysis(評価機関)があり、これとは別に Simon Willison 氏によるAPIハンズオンも公開されています。
独立評価①: Frontend Code Arena で1位
最も驚きがあったのはこちらでしょうか。
ユーザーのブラインド投票で決まる Arena.AI の Frontend Code Arena で、公表(7月16日)時点で Kimi K3 が1,679点の1位を獲得しました。
Claude Fable 5 をも上回るスコアで、前世代 Kimi K2.6 の18位から一気に17ランク上昇しています。ブラインド投票のため自己申告バイアスは入りにくいものの、初期の投票数やプロンプトの偏りといった揺らぎは残ります。それでも、フロントエンド生成能力の高さを示す、現時点で最も強い外部シグナルのひとつです。
独立評価②: Artificial Analysis — 「Opus 4.8 / GPT-5.5 級」
評価機関 Artificial Analysis の Intelligence Index では 57 で、同機関の表現を借りれば「Claude Opus 4.8・GPT-5.5 相当。
ただし Claude Fable 5・GPT-5.6 Sol には及ばない」という位置づけです。
同機関の GDPval-AA v2(実務タスクのElo評価)でも、フロンティア2強に次ぐ3位につけています。

ここで注目したいのが、右パネルのエージェントElo です。
GDPval-AA v2 のエージェントElo では K3(1,668)が Claude Opus 4.8(1,600)と GPT-5.5(1,494)を上回るという報道(The Decoder 等)があり、Moonshot 自身の「総合では Fable 5 / GPT-5.6 Sol に劣るが、コーディング・エージェント系なら Opus 4.8 / GPT-5.5 を上回る」という主張とも整合します。
一方、独立評価がすべて肯定的というわけではありません。
Artificial Analysis の AA-Omniscience では、正答率が K2.6 の33%から46%へ改善した一方、ハルシネーション率は39%から51%へ上昇したと報告されています。
知識量や推論力の向上が、そのまま回答の慎重さや事実性の向上を意味するわけではない——企業導入の判断材料として、この点は覚えておきたいところです。
なお、Artificial Analysis が7月17日に公開した分析では、同機関の非公開エージェント評価 AA-Briefcase でも Kimi K3 は Fable 5 に次ぐ2位(Elo 1,547)でした。
VentureBeat 報道の1,527ではなく、評価主体自身が分析記事で公表した1,547を採用しています(Elo は動的に再計算されるため、時点により多少変動します)。
総合ランキングでの位置づけ(参考値)
ベンチマークアグリゲータ BenchLM.ai では、7月19日調査時点で総合80.96点・4位に位置しています。

ただし BenchLM は、全モデルを自前の同一条件で実行する評価機関ではなく、複数の公開値を集約するサービスです。
モデルごとに利用できるベンチマークや評価条件が異なるため、「総合4位」は方向感を見るための参考値として扱うのが適切でしょう。
Moonshot による公式評価の注目値
Moonshot 公式の数値では、エージェント的Web閲覧ベンチマークの BrowseComp が91.2 です。
これは30万トークン到達時にコンテキスト圧縮を行う同社の評価条件での値で、圧縮なしでは90.4と明記されています。
なお外部集計では GPT-5.6 Sol(92.2)に次ぐ水準であり、無条件の「SOTA」とはいえません。
一方で、API 経由ではすでに Arena.AI や Artificial Analysis による独立評価が始まっています。現段階では「外部から観測できる性能には一定の裏付けがあるが、モデル内部の仕様や公式ベンチマークの再現条件はまだ確認できない」と整理するのが正確でしょう。
第4部: API価格 — クローズド最上位より安いが、Kimi世代では大幅値上げ
API価格は公式価格ページで確認できた一次情報です。

- Kimi K3: 入力 $3.00 / 出力 $15.00(100万トークンあたり)、キャッシュヒット時の入力は $0.30
- K2.7 Code(コーディング特化)/ K2.6(汎用): 各 入力 $0.95 / 出力 $4.00
- 長コンテキストの追加課金なし。OpenAI SDK を利用でき、
base_url・APIキー・モデル名の差し替えで呼び出せます
こちら、英語圏の報道では「Claude Sonnet 級の価格」と評されています。
実際、K3 の $3/$15 は Claude Sonnet 5 の2026年9月1日以降の標準価格と同額です(ただし Sonnet 5 は8月31日まで $2/$10 の導入価格で提供されているため、7月20日時点では K3 の方が入出力とも50%高い計算になります)。
また Kimi 系列内で見ると、K2.6 の $0.95/$4 からは大幅な値上げであり、Simon Willison 氏も「中国系AIラボとしては高めの価格帯に踏み込んだ」と指摘しています。
また Moonshot は、Mooncake と呼ばれる分散推論アーキテクチャにより「コーディングワークロードで90%超のキャッシュヒット率」を達成していると主張しており、これが実態に近ければエージェント用途での実効コストはかなり下がることになります(この数値もベンダー主張)。
第5部: 「オープンウェイト」はまだ約束の段階
ここが本記事で最も重要なポイントです。
2026年7月20日時点で、Kimi K3 は「オープンウェイトモデル」ではなく「オープンウェイトになる予定のモデル」です。
実際に Moonshot の公式 GitHub organization を確認すると、Kimi K3 のモデルリポジトリはまだ存在せず、ピン留めされたモデル系リポジトリは Kimi-K2.5 のままです。Hugging Face にもモデルカードはありません。
量子化については、公式技術ブログが MXFP4 ウェイト / MXFP8 アクティベーションという構成を明記しており、これは一次情報となる一方で、Hugging Face での配布ファイル形式がそのまま MXFP4 になるかは、モデルカードが未公開のため未確認です。
技術レポートも「今後公開する」とされています。
もうひとつ、実務上とても重要な注意があります。
「ウェイトが公開されること」と「手元で動かせること」は別問題です。
Moonshot は K3 の展開先として、64基以上のアクセラレータを備えたスーパーノード構成を推奨しています。
量子化済みとはいえ2.8兆パラメータ級であり、フルモデルの自己ホスティングはご自宅はおろか、オフィス環境でもおそらく無理で当面は、専門データセンターや大規模推論事業者向けと考えるべきでしょう。
ライセンスは複数の報道で「Modified MIT」とされていますが、モデルカードが存在しない以上、一次ソースでの確認はできません(未確認)。
予定どおり公開されれば、DeepSeek v4 Pro(1.6兆パラメータ)を抜いて史上最大のオープンウェイトモデルとなります。
第6部: エージェント機能 — K3 の主戦場
Moonshot が K3 で最も訴求しているのはエージェント用途です。
- BrowseComp(エージェント的Web閲覧)91.2(Moonshot の評価条件。外部集計では GPT-5.6 Sol に次ぐ水準)
- AA-Briefcase(Artificial Analysis のエージェント評価)で2位
- GDPval-AA v2 エージェントElo で Opus 4.8・GPT-5.5 超え
- Kimi Code というコーディングエージェント製品ラインで提供
- API はツール呼び出しに対応し、OpenAI SDK からの移行が容易
Kimi Code では、7月20日に Starter / Explorer / Expert / Master の新プラン体系が導入されました。K3 自体は全プランで利用でき、1Mコンテキストは Explorer 以上で利用できます(従来の Moderato / Allegretto 契約者には旧プランの条件が引き続き適用されます)。
実務導入時の注意
公式ドキュメント・公式ブログ自身が認めている制約もあります。
- 思考履歴の完全再送が必要
過去ターンの思考を含む assistant メッセージをそのまま返さないと品質が不安定になり得ます - 過剰な自律判断
曖昧な指示に対して、ユーザーに代わって予期しない判断をすることがあると公式が明記しています - サンプリング設定は固定で、Web検索機能は当面本番利用を推奨しないとされています
第7部: K2世代からの進化点
前世代からの変化をまとめると次のとおりです。
- 規模の飛躍
GitHub 上の従来フラッグシップ K2/K2.5 から総パラメータ2.8兆へ大幅拡大 - 内製新機構
KDA と AttnRes を導入、活性化率約1.8%の極端に疎な Stable LatentMoE 設計 - 実力の躍進
Frontend Code Arena で K2.6 の18位 → K3 で1位へ - ネイティブビジョン
画像・動画理解を標準搭載 - 常時オンの思考モード
- 製品ライン再編
K3(フラッグシップ)/ K2.7 Code(コーディング特化)/ K2.6(汎用低価格帯)の3層構成に
K2.6 との比較は、Arena.AI や Artificial Analysis の評価で一部確認できます(Frontend Code Arena の18位→1位、AA-Omniscience の正答率33%→46%など)。一方、K2 や K2.5 を含めて全世代を同一条件で横断した比較は限定的であり、アーキテクチャや学習方法を含む詳細は技術レポート待ちです。
第8部: まだわかっていないこと
現時点で未公表・未確認の事項も整理しておきます。
- 学習データ規模・学習トークン数・学習手法(事前学習コーパス、RL/ポストトレーニング構成)→一次・二次いずれのソースでも未公表
- アクティブパラメータ数→ 「約50B(A50B)」は分析者の表記で、公式未公表
- 技術レポート/論文→ 未公開(今後公開するとの公式表明のみ)
- Hugging Face モデルカード・配布ファイル形式→ 存在しない(ウェイト未公開のため)
- ライセンスの正確な条項: 「Modified MIT」は報道レベルの言及のみ
7月27日のウェイト公開期限を過ぎたら、(1) 本当に公開されたか、(2) 公式スコアの評価条件が技術レポートで十分に開示され、同等条件で追試できるか、(3) ライセンス条項、の3点をチェックしましょう。当ブログでも続報があれば、また、くわしく取り上げる予定です。
まとめ
Kimi K3 を一言でまとめると、
「フロンティア最上位(Claude Fable 5 / GPT-5.6 Sol)には総合で一歩及ばないものの、コーディング・エージェント領域では Opus 4.8 / GPT-5.5 級以上を狙える位置につけた、"オープンウェイト予定"の超大規模MoE」
です。
ブラインド投票の Frontend Code Arena 1位という独立評価は実力の裏付けとして重く、一方でモデル内部の仕様や公式ベンチマークの再現条件については、7月27日までに予定されるウェイト公開と、今後公開される技術レポートを待つ必要があります。「史上最大のオープンウェイト」という看板が本物になるかどうか、あと1週間ほどで答え合わせが始まります。
5月の記事「Mythos(ミュトス)レベルのオープンモデルはいつ出るのか」では、オープンモデルがフロンティアに追いつく時期をベンチマークの傾きから予測しました。
K3 が予定どおりウェイトを公開すれば、「Artificial Analysis の総合指数で Opus 4.8 と同等圏に入るモデルのウェイト」が2026年夏に手に入ることになり、同記事で描いたトレンドは想定ラインの上限を走っていることになります。
ただし、同記事の主軸だったサイバーセキュリティ能力(CyberGym や AISI 実環境テスト)については K3 の評価データがまだ存在しません。「能力到達と公開判断は別問題」と書いたあの答え合わせは、ウェイト公開後の独立評価を待って、あらためて行いたいと思います。
次回予告
次回は、Qwen が公式に発表した次期フラッグシップ Qwen3.8 を取り上げる予定です。総パラメータ2.4兆・オープンウェイト公開予定と、こちらも Kimi K3 と並ぶ超大規模のオープン系モデルです。Kimi K3 と同じく、一次情報ベースの徹底リサーチで掘り下げますので、どうぞお楽しみに。
それでは、また次回、お会いしましょう!
参考資料(一次情報・主要ソース)
- Moonshot AI 公式ブログ: Kimi K3 Tech Blog
- Kimi API 公式ドキュメント: K3 Quickstart
- Kimi API 公式価格ページ
- Kimi Code What's New(新プラン体系)
- Moonshot AI 公式 GitHub
- Moonshot AI 公式X(KDA / AttnRes の効率数値の発表元)
- Artificial Analysis: Kimi K3 分析(Intelligence Index / GDPval-AA v2 / AA-Briefcase / AA-Omniscience)
- Simon Willison: Kimi K3 ハンズオン
- Tom's Hardware: Moonshot releases 2.8-trillion-parameter Kimi K3
- VentureBeat: China's Moonshot AI releases Kimi K3
- Arena.AI 公式X: Frontend Code Arena 結果
- OpenRouter: moonshotai/kimi-k3
- Latent.Space: Kimi K3 分析
- BenchLM.ai: Kimi K3
- Alibaba Qwen 公式X: Qwen3.8 発表(次回予告の出典)
- Bloomberg: Alibaba's Qwen unveils preview of flagship AI model
※本記事の内容は2026年7月20日時点の調査に基づきます。図表はすべて公表値をもとに Qualiteg が作図したものであり、公式チャートの転載ではありません。