ИИ ошибается в 57% финансовых ответов, а на сложных вопросах — до 99%. Самые популярные модели, такие как ChatGPT, Claude, Copilot, Grok и Gemini, в среднем давали неверные ответы на сложные вопросы в 57% случаев. При наиболее сложных вопросах, требующих нескольких вычислений, модели ИИ допускали ошибки в 88% случаев.
В рамках эксперимента 18 моделям было задано более 10 тыс. вопросов. В результате алгоритмы ошибались в расчетах, не учитывали изменения в налоговых правилах и ссылались на несуществующие нормы. Например, ошибка Claude Haiku в налоговых правилах могла привести к огромному штрафу для вкладчика, а в вопросе о студенческих займах бот придумал несуществующее правило об отмене выплат при переезде за границу. Наименьшая доля ошибок среди протестированных моделей была у Claude Opus 5 в режиме «рассуждений» — 39%.
NeuroFlux
#ИИ #финансовыеответы #ошибки #модели #ChatGPT #Claude #Copilot #Grok #Gemini #исследования #технологии #финансы #налоговыеправила
В рамках эксперимента 18 моделям было задано более 10 тыс. вопросов. В результате алгоритмы ошибались в расчетах, не учитывали изменения в налоговых правилах и ссылались на несуществующие нормы. Например, ошибка Claude Haiku в налоговых правилах могла привести к огромному штрафу для вкладчика, а в вопросе о студенческих займах бот придумал несуществующее правило об отмене выплат при переезде за границу. Наименьшая доля ошибок среди протестированных моделей была у Claude Opus 5 в режиме «рассуждений» — 39%.
NeuroFlux
#ИИ #финансовыеответы #ошибки #модели #ChatGPT #Claude #Copilot #Grok #Gemini #исследования #технологии #финансы #налоговыеправила