Тест 14 нейросетей: стоит ли дешёвая модель своих денег?
Мой сервис по каждому судебному делу составляет «паспорт» — выжимку из акта в виде таблицы на 28 полей: кто с кем судился, что просил истец, что взыскал суд, какие статьи применил и т.д. Ранее писал, что эти выжимки позволяют снизить количество галлюцинаций при ответе сервиса.
Составляет такие паспорта DeepSeek v4-flash, это одна из самых дешёвых, но эффективных моделей на рынке. И у неё встречаются пробелы в работе: то обстоятельство перепутает, то оставит поле пустым, хотя ответ есть в тексте судебного акта.
Хочется больше точности, и логичное решение — взять модель посильнее и подороже. Но прежде чем менять модель, я решил проверить, можно ли ещё что-то выжать из DeepSeek v4-flash, и провёл тест.
Взял выборку из 100 судебных дел и 14 нейросетей — от топовых GPT-5.5, Opus 4.8 и Sonnet 5 до бюджетных (все модели можно увидеть на графике).
Каждая модель читала судебный акт и составляла по нему паспорт (выжимку). Для каждого дела заранее готовился эталон: его совместно составляли Opus 4.8 и GPT-5.5, а спорные поля дополнительно сверялись с текстом акта. Дальше всё просто: чем больше полей в паспорте модели совпало с эталоном, тем выше ее точность. Проверка шла вслепую — оценщик не знал, паспорт какой модели перед ним.
Результат: топы набрали 96–98%, а DeepSeek v4-flash — 90,4% и десятое место (рейтинг на картинке).
Не стал спешить с заменой модели и разобрал, на чем именно DeepSeek v4-flash теряет точность. Ошибки оказались двух типов — и лечатся они по-разному.
➡Первый тип — путаница в обстоятельствах дела. Подсказка нашлась ещё при подготовке эталонов паспортов: даже Opus 4.8 и GPT-5.5 иногда трактовали одно и то же поле по-разному. Оказалось, дело не в том, что одна модель сильнее другой, а в самой инструкции\промте — некоторые формулировки в инструкции можно было понять двояко. Переписал спорные места, и путаница в ответах DeepSeek v4-flash почти полностью ушла.
➡Второй тип — пустые поля паспорта. Здесь DeepSeek v4-flash не выдумывает, а ленится: суд расписал, как считал компенсацию, а в поле «способ расчета» все равно пусто. Правки в инструкцию больше не помогали: заставляешь модель заполнять все пустые поля и она начинает галлюцинировать.
Но пустое поле, в отличие от выдумки, легко обнаружить автоматически. Поэтому я дописал скрипт (доработал код в инструменте, который собирает паспорта) — после составления паспорта он проверяет, какие поля остались пустыми, и просит DeepSeek v4-flash дозаполнить только их. Уже заполненные поля трогать ему запрещено.
Итог: паспорт подорожал примерно на 37%, а точность выросла с 90,4% до 96,2%. Для сравнения: у Sonnet 5 — 98,7%, но он дороже DeepSeek v4-flash в 15 с лишним раз.
Этот тест ещё раз показал, как сильно на результат влияет окружение (обвязка) модели. И что даже топовые нейросети ошибаются в простой на первый взгляд задаче: пересказать судебное дело в таблицу.
Так что ответ на вопрос из заголовка — да, дешёвая модель стоит своих денег, если немного постараться.
Мой сервис по каждому судебному делу составляет «паспорт» — выжимку из акта в виде таблицы на 28 полей: кто с кем судился, что просил истец, что взыскал суд, какие статьи применил и т.д. Ранее писал, что эти выжимки позволяют снизить количество галлюцинаций при ответе сервиса.
Составляет такие паспорта DeepSeek v4-flash, это одна из самых дешёвых, но эффективных моделей на рынке. И у неё встречаются пробелы в работе: то обстоятельство перепутает, то оставит поле пустым, хотя ответ есть в тексте судебного акта.
Хочется больше точности, и логичное решение — взять модель посильнее и подороже. Но прежде чем менять модель, я решил проверить, можно ли ещё что-то выжать из DeepSeek v4-flash, и провёл тест.
Взял выборку из 100 судебных дел и 14 нейросетей — от топовых GPT-5.5, Opus 4.8 и Sonnet 5 до бюджетных (все модели можно увидеть на графике).
Каждая модель читала судебный акт и составляла по нему паспорт (выжимку). Для каждого дела заранее готовился эталон: его совместно составляли Opus 4.8 и GPT-5.5, а спорные поля дополнительно сверялись с текстом акта. Дальше всё просто: чем больше полей в паспорте модели совпало с эталоном, тем выше ее точность. Проверка шла вслепую — оценщик не знал, паспорт какой модели перед ним.
Результат: топы набрали 96–98%, а DeepSeek v4-flash — 90,4% и десятое место (рейтинг на картинке).
Не стал спешить с заменой модели и разобрал, на чем именно DeepSeek v4-flash теряет точность. Ошибки оказались двух типов — и лечатся они по-разному.
➡Первый тип — путаница в обстоятельствах дела. Подсказка нашлась ещё при подготовке эталонов паспортов: даже Opus 4.8 и GPT-5.5 иногда трактовали одно и то же поле по-разному. Оказалось, дело не в том, что одна модель сильнее другой, а в самой инструкции\промте — некоторые формулировки в инструкции можно было понять двояко. Переписал спорные места, и путаница в ответах DeepSeek v4-flash почти полностью ушла.
➡Второй тип — пустые поля паспорта. Здесь DeepSeek v4-flash не выдумывает, а ленится: суд расписал, как считал компенсацию, а в поле «способ расчета» все равно пусто. Правки в инструкцию больше не помогали: заставляешь модель заполнять все пустые поля и она начинает галлюцинировать.
Но пустое поле, в отличие от выдумки, легко обнаружить автоматически. Поэтому я дописал скрипт (доработал код в инструменте, который собирает паспорта) — после составления паспорта он проверяет, какие поля остались пустыми, и просит DeepSeek v4-flash дозаполнить только их. Уже заполненные поля трогать ему запрещено.
Итог: паспорт подорожал примерно на 37%, а точность выросла с 90,4% до 96,2%. Для сравнения: у Sonnet 5 — 98,7%, но он дороже DeepSeek v4-flash в 15 с лишним раз.
Этот тест ещё раз показал, как сильно на результат влияет окружение (обвязка) модели. И что даже топовые нейросети ошибаются в простой на первый взгляд задаче: пересказать судебное дело в таблицу.
Так что ответ на вопрос из заголовка — да, дешёвая модель стоит своих денег, если немного постараться.