Дешёвая модель, которая обошлась дороже всех
Знакомая ловушка: провайдеры режут цену за токен, ты радостно переезжаешь на облегчённую версию — экономия же! А потом ловишь реальную задачу и понимаешь: агент на дешёвой модели делает втрое больше вызовов инструментов. Планировать разучился, галлюцинирует, ходит по кругу, чинит баги новыми багами. Токены капают, время течёт, нервы на исходе.
Простой пример: агенту надо найти файл на Google Диске, вытащить данные и кинуть отчёт в CRM. Дорогая модель пишет скрипт и закрывает задачу. Дешёвая — пишет скрипт, перечитывает, лезет гуглить, пишет ещё один скрипт, дебажит. Вместо тысяч токенов — сотни тысяч. Зато дёшево! Или нет?
Почему так вышло? Бум вычислений: Китай вложил 140 млрд в видеокарты, США строят дата-центры и проектируют АЭС. Мощности не резиновые, поэтому провайдерам проще выкатить маленькие модельки — едят мало, стоят дёшево, а по тестам почти не уступают старшим. Почти.
Вот это «почти» и есть подвох: MMLU и GSM8K проверяют изолированные вопросы, а не планирование в длинной цепочке. В бою всё иначе.
Весь разбор тут: Хабр
🔥 — узнал свой пайплайн
🤡 — а я всё на мини сижу
@ai_for_dev
Знакомая ловушка: провайдеры режут цену за токен, ты радостно переезжаешь на облегчённую версию — экономия же! А потом ловишь реальную задачу и понимаешь: агент на дешёвой модели делает втрое больше вызовов инструментов. Планировать разучился, галлюцинирует, ходит по кругу, чинит баги новыми багами. Токены капают, время течёт, нервы на исходе.
Простой пример: агенту надо найти файл на Google Диске, вытащить данные и кинуть отчёт в CRM. Дорогая модель пишет скрипт и закрывает задачу. Дешёвая — пишет скрипт, перечитывает, лезет гуглить, пишет ещё один скрипт, дебажит. Вместо тысяч токенов — сотни тысяч. Зато дёшево! Или нет?
Почему так вышло? Бум вычислений: Китай вложил 140 млрд в видеокарты, США строят дата-центры и проектируют АЭС. Мощности не резиновые, поэтому провайдерам проще выкатить маленькие модельки — едят мало, стоят дёшево, а по тестам почти не уступают старшим. Почти.
Вот это «почти» и есть подвох: MMLU и GSM8K проверяют изолированные вопросы, а не планирование в длинной цепочке. В бою всё иначе.
Весь разбор тут: Хабр
🔥 — узнал свой пайплайн
🤡 — а я всё на мини сижу
@ai_for_dev