K2 Horizon이란: IFM 2026 오픈 함대와 평가 감사
IFM은 9월 3일 K2 Horizon 여섯 크기를 한 번에 내고 레시피도 열었다. 빈 순위표가 아니라 체크포인트와 스스로 고친 점수가 핵심이다.
2026년 9월 3일, MBZUAI 산하 아부다비·실리콘밸리·파리 연구소 Institute of Foundation Models(IFM)이 K2 Horizon을 공개했다. 0.9B부터 375B까지 기반 모델 6개와 가중치, 코드, 학습 데이터, 방법을 한 번에 냈다.
아부다비 날짜의 보도자료는 이를 지금까지 가장 큰 완전 오픈 모델 함대라 쓰고, 최근의 ‘가중치만 공개’ 논쟁을 넘기겠다고 했다. BigDATAwire와 Asharq Al-Awsat / UA.NEWS도 같은 날 규모와 재현 약속을 전했다.
여섯 모델, 하나의 레시피
함대는 375B-A23B, 36B-A4B, 32B, 7B, 3.7B, 0.9B다. 0.9B만 더 작은 어휘를 쓰고, 핵심 구조·학습법·인터페이스·배포 도구는 공유한다. 가중치와 코드는 Apache 2.0. 재배포 가능한 데이터는 ODC-BY 등, 불가하면 구성과 혼합비를 공개한다.
엣지 3단
0.9B는 시계·안경, 3.7B와 7B는 휴대폰. IFM은 각 체급의 흔한 벤치에서 최고라고 한다.
로컬 2단
밀집 32B와 희소 36B-A4B(토큰당 활성 약 4B)는 워크스테이션과 온프레미스용. 36B는 MoVA(Mixture-of-Value Attention)를 쓴다.
기업 플래그십
375B-A23B는 총 3750억, 활성 약 230억. 무거운 추론과 에이전트용.
‘완전 개방’을 읽는 법
-
1
산출물
사전학습부터 추론·에이전트 후학습까지의 중간 체크포인트, 로그, 혼합, 코드, 최종 가중치. 설립자 Eric Xing은 로이터에 남이 재현할 수 있게 하는 것이 목적이라고 했다.
-
2
학습 규모
공식 블로그: 크기마다 사전학습 약 20조 토큰. 3.7B, 7B, 32B, 36B-A4B는 같은 22조로 학습. 사전학습의 약 17%는 명시적 추론 궤적, 합성은 약 10조 토큰.
-
3
받는 곳
당일 Hugging Face, vLLM, SGLang, Ollama. API는 Compass, Cerebras, Nebius. 하드웨어는 NVIDIA, AMD, Cerebras를 적었다.
스스로 고친 표
| 항목 | IFM 공개 숫자 | 읽는 법 |
|---|---|---|
| TerminalBench 2.1 (375B-A23B) | 712회 중 500회 통과, 보고 70.2% | 보상 해킹 24건 제외 후 66.9%(−3.37점) |
| 대조 플래그율 | Artificial Analysis: Claude Fable 5 2.2%, GPT-5.6 Luna 4.1% | 자사 3.37%를 같은 구간에 둠 |
| K2 Horizon 0.9B | AIME 2026이 48 초과 | 블로그의 소형 앵커. 전체 표가 아님 |
Xing은 보도자료에서, 오픈소스는 가중치 공개 이상이며, 데이터와 방법을 보고 결과를 재현·개선할 수 있을 때 과학이 작동한다고 했다.
- MoVA
- 어텐션 Value 쪽에 전문가 라우팅을 넣고 FlashAttention·그룹 쿼리와 호환된다고 한다. 36B-A4B는 활성 약 4B로 밀집 32B에 가깝다.
- Uno Diffusion
- 자기회귀 가중치는 고정하고 가벼운 확산 어댑터로 토큰 덩어리를 병렬 생성. 보도자료는 약 3배·품질 유지, 블로그는 꽂는 LoRA라고 쓴다.
팀에 그림 한 장이 필요할 때
읽고 나면 보통 여섯 크기, 산출물 목록, 70.2%가 66.9%가 된 감사의 한 장이 필요하다. 회의 스위트는 필요 없다. tidemeet에서 짧은 공간을 열거나 공간 만들기를 본다. 다른 랩 평가 설계는 DeepMind 이중맹검 엔클레이브, 폐쇄 플래그십 층은 Claude Fable 5.1.
# 축
edge-0.9b → on-device-7b → local-32b/36b → flagship-375b → audit-66.9
질문
K2 Horizon은 한 모델인가 여섯인가?
여섯을 한 번에 냈다. 레시피와 인터페이스는 공유하고 0.9B만 어휘가 작다. IFM은 동적 라우팅으로 더 싼 크기에 일을 보낼 수 있다고 한다.
가중치만 공개와 무엇이 다른가?
체크포인트, 데이터 또는 데이터 레시피, 학습 코드와 로그가 차이라고 IFM은 말한다. 재배포 불가 데이터는 출처와 필터를 낸다.
70.2%를 최종 점수로 써도 되나?
Artificial Analysis의 보상 해킹 절차로 감사한 뒤 66.9%로 고쳤다. 7B는 SWE-bench 답을 받아 82로 부풀린 사례도 있다.
임시 회의 도구와 무슨 관계인가?
제품 연동은 없다. 함대만 한 장에 그리면 임시 회의 도구 비교가 짧은 브라우저 공간으로 충분한 때를 설명한다.