TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
from:adam

21 Sep, 19:28

Open in Telegram Share Report

Пока пишу тут серию постов про экономику ии лаб, прокоменчу мыслями своими адский твиттерский хайп по JEV.

Если пропустили, стартап TypeSafe выкатил модель, которая вообще не умеет писать текст. На вход ей дают контекст и набор вопросов, на выходе получают да/нет, выбор из вариантов или оценку по шкале с вероятностями. Обещают всё это на два порядка быстрее и дешевле LLM. По сути, фундаментальный классификатор.

Смотреть на JEV имеет смысл через триаду cost/latency/quality. С ценой и задержкой всё понятно, разница с фронтирными моделями примерно два порядка, с мелкими вроде Haiku около порядка. С качеством сложнее. Сами TypeSafe заявляют паритет с LLM среднего класса, но независимые замеры скачут от очень хороших результатов до провалов, в одном бенче на фишинговых письмах JEV заметно проиграл даже Haiku. Но у качества есть вторая половина, про которую в сравнении с мелкими LLM забывают. LLM плохо скорят и принимают решения, промпт "ты гениальный классификатор, оцени свой слоп от 1 до 10" даёт число, которое гуляет от прогона к прогону и от порядка вариантов, потому что рождается той же генерацией токенов, что и сам слоп. JEV учили именно принимать решения и отдавать вероятность напрямую, и у LangChain при повторных прогонах одних и тех же кейсов разброс оценок оказался на порядки ниже, чем у LLM-джаджей, что крайне важно для eval'ов и автоматической разметки.

И даже там, где аплифт в точности найдётся, он не настолько большой, чтобы пережить месяц, за который лаба завалит данными условный Opus. Лаба тратит миллиарды на одну большую модель, та становится лучше сразу на куче задач на сдачу, а потом это улучшение расползается вниз по всей линейке и почти бесплатно доезжает до мелких моделей. А вот стабильность масштабом не лечится, это свойство самого подхода. Так что устойчивое преимущество JEV в цене, задержке и стабильности решений, и если они тебе не важны, через 2-3 месяца он будет сосать лапу.

А вот если cost и latency жёсткое ограничение, становится интереснее. Особенно в массовых сценариях в горячем пути, где LLM просто не сходилась по экономике и задачу либо не делали вообще, либо закрывали условными регулярками и прочим хардкодом. Там, где ошибка стоит дорого или решение ещё надо объяснять, JEV подходит плохо, платишь ты там за качество, а он возвращает ответ и вероятность без рассуждения.

Эндрю Чен хорошо подметил ещё одно следствие. AI-приложение с несколькими LLM-вызовами на каждом экране не окупалось рекламой, поэтому либо инференс субсидирует гигант, либо пользователь платит подписку. Если такие решения дешевеют на два порядка, начинает сходиться экономика бесплатных приложений с рекламой. Универсального ассистента там не будет, будет куча маленьких фич вроде фильтра важных писем.

При этом самим классификаторам сто лет в обед, и на своих данных они выигрывают у JEV по всем параметрам. На том же фишинговом наборе маленькая модель, дообученная всего на тысяче примеров, обошла его с большим запасом. Да и zero-shot придумали не вчера, вероятности вариантов ответа можно за один проход снять с любой небольшой открытой модели. Новое в том, что JEV работает zero-shot из коробки, без датасета и обучения под задачу, и что его вытащили по апишке, как полноценный продукт с чарджем. Дешёвый и быстрый классификатор теперь можно купить как сервис, а не делать ради него проект на квартал с датасетом и ML-командой.

Улучшать его по мере накопления данных при этом нечем, файнтюна нет, а в контекст много примеров не засунешь. А когда датасет накопился, проще обучить условный BERT, поэтому, кажется, JEV это инструмент холодного старта или солидного бейслайна/бенча.

Отсюда мысль, что, кажется, применение для JEV стоит искать в первую очередь не среди текущих LLM-вызовов, которые хочется удешевить, ибо там решит эффект масштаба лаб. Исключение составляют джаджи и разметка, где LLM плоха по устройству. А интереснее всего посмотреть на список того, что вы вообще не стали делать, потому что LLM там была слишком дорогой или медленной, а своих данных и ML-ресурса на отдельный классификатор не было.

4.3k 1 53 17 53
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot