16 июля Moonshot AI выпустила Kimi K3: 2,8 трлн параметров, контекст 1M — одна из крупнейших open-weight моделей в истории. По бенчмаркам — вплотную к Claude Fable 5 и GPT-5.6 Sol:
◼️ #4 в Intelligence Index от Artificial Analysis из 189 моделей
◼️ #1 на Frontend Code Arena — обошла Fable 5
◼️ Впереди на SWE Marathon и BrowseComp
◼️ Terminal-Bench 2.1 — 88.3; SWE-bench Verified — 76.8%
Но что измеряют бенчмарки? В статье Inadequacies of Large Language Model Benchmarks in the Era of Generative AI разобрали 23 популярных теста: почти все провалились и по functionality (измеряет ли реальные способности), и по integrity (нельзя ли накрутить скор, заучив ответы или подстроившись под формат теста).
Главное из статьи — в карточках 🚀
А вывод такой: релиз сильный, но часть рекордов получена в собственном харнесе KimiCode, так что ждём независимые эксперименты.
◼️ #4 в Intelligence Index от Artificial Analysis из 189 моделей
◼️ #1 на Frontend Code Arena — обошла Fable 5
◼️ Впереди на SWE Marathon и BrowseComp
◼️ Terminal-Bench 2.1 — 88.3; SWE-bench Verified — 76.8%
Но что измеряют бенчмарки? В статье Inadequacies of Large Language Model Benchmarks in the Era of Generative AI разобрали 23 популярных теста: почти все провалились и по functionality (измеряет ли реальные способности), и по integrity (нельзя ли накрутить скор, заучив ответы или подстроившись под формат теста).
Главное из статьи — в карточках 🚀
А вывод такой: релиз сильный, но часть рекордов получена в собственном харнесе KimiCode, так что ждём независимые эксперименты.
Ссылки
[1] § V-A Response Variability in Standardized Evaluations
[2] § V-B Genuine Reasoning vs Technical Optimization
[3] § VI-A Inconsistent Benchmark Implementation
[4] Terminal-Bench 2.1
[5] HaluEval: A Large-Scale Hallucination Evaluation Benchmark for LLM
[6] § V-F Biases in LLM-Generated LLM Evaluations
[7] § IV-B Preliminary Findings
[8] § VIII-G Extending Benchmarks with Behavioral Profiling and Regular Audits