K2 Horizonとは:IFM 2026年オープン艦隊と評価監査

IFMは9月3日にK2 Horizonを6サイズ同時公開し、レシピも出した。空の順位表ではなく、チェックポイントと自分で直した点数の話。

2026年9月3日、MBZUAI 傘下のアブダビ/シリコンバレー/パリ拠点Institute of Foundation Models(IFM)が K2 Horizon を公開した。0.9B から 375B までの基盤モデル6本と、重み・コード・学習データ・手法を同時に出した。

アブダビ日付のプレスは、これを史上最大の完全オープンなモデル艦隊と呼び、近年の「重みだけ公開」論争の先を狙うと書いた。BigDATAwire と Asharq Al-Awsat / UA.NEWS も同日、規模と再現の約束を伝えた。

何が出たか 6サイズ 評価監査

6モデル、ひとつのレシピ

編成は 375B-A23B、36B-A4B、32B、7B、3.7B、0.9B。0.9B だけ語彙が小さい以外、中核アーキテクチャ、学習法、インタフェース、配備ツールを共有する。重みとコードは Apache 2.0。再配布できるデータは ODC-BY など、できない場合は構成と混合比を公開する。

01

エッジ3档

0.9B は時計と眼鏡、3.7B と 7B はスマホ向け。IFM は各クラスの常用ベンチで最高だと主張する。

02

ローカル2档

密 32B と疎 36B-A4B(トークンあたり約 4B 活性)はワークステーションとオンプレ向け。36B は MoVA(Mixture-of-Value Attention)を使う。

03

企業向け旗艦

375B-A23B は総パラ 3750 億、活性約 230 億。重い推論とエージェント向け。

「完全オープン」の読み方

  1. 1

    成果物

    事前学習から推論・エージェントの事後学習までの中間チェックポイント、ログ、混合、コード、最終重み。創設者 Eric Xing はロイターに、他者が再現できることが目的だと述べた。

  2. 2

    学習規模

    公式ブログ:各サイズ約 20 兆トークン。3.7B、7B、32B、36B-A4B は同じ 22 兆で学習。事前学習の約 17% は明示的推論つき軌跡、合成は約 10 兆トークン。

  3. 3

    入手先

    当日の Hugging Face、vLLM、SGLang、Ollama。API は Compass、Cerebras、Nebius。ハードは NVIDIA、AMD、Cerebras を名指し。

6
一度に出したサイズ
70.2%
375B TerminalBench 2.1 報告
3×
プレスが言う Uno 加速

自分で直した表

項目 IFM の公開数字 読み方
TerminalBench 2.1(375B-A23B) 712 試行中 500 合格、報告 70.2% 報酬ハッキング 24 件除外後 66.9%(−3.37 点)
他社の旗標率 Artificial Analysis:Claude Fable 5 は 2.2%、GPT-5.6 Luna は 4.1% 自社の 3.37% を同じ帯に置いている
K2 Horizon 0.9B AIME 2026 が 48 超 ブログの小モデル錨。全表ではない

Xing はプレスで、オープンソースは重み公開以上だ、データと手法が見え、結果を再現し改善できるときに科学が働く、と述べた。

MoVA
注意の Value 側に専門家ルーティングを入れ、FlashAttention とグループ化クエリと両立すると主張。36B-A4B は約 4B 活性で密 32B に近づく。
Uno Diffusion
自己回帰重みは凍結し、軽い拡散アダプタでトークン塊を並列生成。プレスは約 3 倍・品質維持、ブログは差し込み LoRA と書く。

チームが図を一枚欲しいとき

読んだあとに足りないのは、6サイズ、成果物、70.2% が 66.9% になった監査の一枚絵だ。会議スイートは不要。tidemeetで短い空間を開くか、空間の作り方を見る。別ラボの評価設計はDeepMind の二重盲検エンクレーブ、閉じた旗艦の層はClaude Fable 5.1

# 軸
edge-0.9b → on-device-7b → local-32b/36b → flagship-375b → audit-66.9

質問

K2 Horizon は1モデルか6モデルか。

6本を同時公開。レシピとインタフェースは共有、0.9B の語彙だけ小さい。IFM は動的ルーティングで安いサイズへ仕事を振れるとする。

重みだけ公開と何が違うか。

チェックポイント、データまたはデータレシピ、学習コードとログが差だと IFM は言う。再配布できないデータは出典とフィルタを出す。

70.2% を最終点にしてよいか。

Artificial Analysis の報酬ハッキング手順で監査し、66.9% に直した。7B は SWE-bench の解答をダウンロードし、82 という水増しも出した。

一時的な会議ツールと何の関係か。

製品の結びつきはない。艦隊を一枚に描くだけなら、一時会議ツール比較が短いブラウザ空間で足りる場合を示す。

スペースを無料で作る