🔥 Сразу три релиза за день: Qwen 3.8, DeepSeek V4 Pro и Grok 4.6
• Qwen3.8-2.4T-A95B - Qwen открыла веса своего самого большого монстра.
2,4 трлн параметров, 95B активных, 512 экспертов и контекст до 1 млн токенов. По eval команды, Qwen3.8-Max получает 86,6 на TerminalBench 2.1 и 93,0 на PaperBench, уже вплотную заходя на территорию закрытых frontier-моделей.
• DeepSeek V4 Pro 0813 - финальная Pro-версия появилась в официальном API.
Контекст 1 млн токенов, до 384K output, Responses API и tool calling. Цена особенно агрессивная: $0,435 за 1 млн входных токенов при cache miss и $0,87 за выход, а при cache hit вход падает до $0,003625. По опубликованным DeepSeek цифрам, Terminal-Bench 2.1 вырос с 72,1% до 87,9%, CyberGym с 52,7% до 83,3%, DeepSWE с 12,8% до 62,7%.
• Релиз Grok 4.6
Модель набрала 61 на Artificial Analysis Intelligence Index, столько же, сколько GPT-5.6 Sol, и обошла его на CursorBench, FrontierCode и AA-Briefcase. При этом GPT-5.6 Sol остаётся впереди на DeepSWE и Terminal-Bench. xAI отдельно прокачивала модель через agentic RL для coding, web development, CAD и kernel optimization, а на длинных задачах стала чаще появляться самостоятельная проверка результата.
@ai_machinelearning_big_data
#AI #Qwen #DeepSeek #Grok #LLM #Agents
• Qwen3.8-2.4T-A95B - Qwen открыла веса своего самого большого монстра.
2,4 трлн параметров, 95B активных, 512 экспертов и контекст до 1 млн токенов. По eval команды, Qwen3.8-Max получает 86,6 на TerminalBench 2.1 и 93,0 на PaperBench, уже вплотную заходя на территорию закрытых frontier-моделей.
• DeepSeek V4 Pro 0813 - финальная Pro-версия появилась в официальном API.
Контекст 1 млн токенов, до 384K output, Responses API и tool calling. Цена особенно агрессивная: $0,435 за 1 млн входных токенов при cache miss и $0,87 за выход, а при cache hit вход падает до $0,003625. По опубликованным DeepSeek цифрам, Terminal-Bench 2.1 вырос с 72,1% до 87,9%, CyberGym с 52,7% до 83,3%, DeepSWE с 12,8% до 62,7%.
• Релиз Grok 4.6
Модель набрала 61 на Artificial Analysis Intelligence Index, столько же, сколько GPT-5.6 Sol, и обошла его на CursorBench, FrontierCode и AA-Briefcase. При этом GPT-5.6 Sol остаётся впереди на DeepSWE и Terminal-Bench. xAI отдельно прокачивала модель через agentic RL для coding, web development, CAD и kernel optimization, а на длинных задачах стала чаще появляться самостоятельная проверка результата.
@ai_machinelearning_big_data
#AI #Qwen #DeepSeek #Grok #LLM #Agents