Вау! Смотрите, если к дешёвым open-source моделям добавить самопроверку, то они обгонят Claude
Исследователи из Stanford, Berkeley (запрещены в РФ) и NVIDIA показали, как это работает на практике с помощью фреймворка LLM-as-a-Verifier.
Так DeepSeek V4 Flash + самопроверка
на Terminal-Bench 2.1 смогла:
1. Сгенерировать всего 5 вариантов решения
2. Та же модель их оценила и выбрала лучший
3. Точность выросла с 79 % до 88 %
В итоге обогнали Claude Fable 5 и сделали это в 11 раз дешевле.
Исследователи из Stanford, Berkeley (запрещены в РФ) и NVIDIA показали, как это работает на практике с помощью фреймворка LLM-as-a-Verifier.
Так DeepSeek V4 Flash + самопроверка
на Terminal-Bench 2.1 смогла:
1. Сгенерировать всего 5 вариантов решения
2. Та же модель их оценила и выбрала лучший
3. Точность выросла с 79 % до 88 %
В итоге обогнали Claude Fable 5 и сделали это в 11 раз дешевле.