2Brains Крингли спорит с идеей, что галлюцинации LLM лечатся только масштабированием
Роберт X. Крингли, давний тех-обозреватель и бывший сотрудник Stanford AI Lab, вернулся после паузы с заявлением о 2Brains Inc: стартапе, который он основал с двумя партнерами для борьбы с галлюцинациями LLM. Значение новости не в очередном «антигаллюцинационном» слое, а в прямом споре с доминирующей ставкой индустрии: больше GPU, больше обучения, меньше выдуманных ответов.
Заявленная архитектура 2Brains разделяет генерацию текста и работу с фактами. Одна часть формулирует ответ, другая ищет и проверяет данные, затем результат сверяется до выдачи пользователю. По словам Крингли, система работает на обычных CPU, патенты поданы, архитектура описана, а на бенчмарке faithfulness она более чем вдвое превышает опубликованный baseline и в проверенном режиме не фабрикует факты.
Слабое место истории — пока это в основном утверждения сооснователя, а не независимая техническая публикация с воспроизводимыми тестами. Но сам конфликт важен: если значительная доля enterprise-запросов на деле является lookup, то прогонять их через дорогой генеративный inference не только расточительно, но и рискованно в банках, страховании, медицине и праве.
Командам, внедряющим GenAI в критичные процессы, теперь сложнее оправдывать подход «ждем модель побольше»: придется выбирать между масштабированием GPU-инференса и архитектурой, которая умеет отказаться от ответа, когда факт не найден.
Источник | Перевод
Роберт X. Крингли, давний тех-обозреватель и бывший сотрудник Stanford AI Lab, вернулся после паузы с заявлением о 2Brains Inc: стартапе, который он основал с двумя партнерами для борьбы с галлюцинациями LLM. Значение новости не в очередном «антигаллюцинационном» слое, а в прямом споре с доминирующей ставкой индустрии: больше GPU, больше обучения, меньше выдуманных ответов.
Заявленная архитектура 2Brains разделяет генерацию текста и работу с фактами. Одна часть формулирует ответ, другая ищет и проверяет данные, затем результат сверяется до выдачи пользователю. По словам Крингли, система работает на обычных CPU, патенты поданы, архитектура описана, а на бенчмарке faithfulness она более чем вдвое превышает опубликованный baseline и в проверенном режиме не фабрикует факты.
Слабое место истории — пока это в основном утверждения сооснователя, а не независимая техническая публикация с воспроизводимыми тестами. Но сам конфликт важен: если значительная доля enterprise-запросов на деле является lookup, то прогонять их через дорогой генеративный inference не только расточительно, но и рискованно в банках, страховании, медицине и праве.
Командам, внедряющим GenAI в критичные процессы, теперь сложнее оправдывать подход «ждем модель побольше»: придется выбирать между масштабированием GPU-инференса и архитектурой, которая умеет отказаться от ответа, когда факт не найден.
Источник | Перевод