Forward from: Бизнес и искусственный интеллект
ИИ ошибается больше чем в 50% финансовых ответов.
В тесте 18 моделей, включая ChatGPT, Claude, Copilot, Grok и Gemini, средняя доля ошибок составила 57%, а на сложных задачах с несколькими вычислениями — 88%. Модели путались в расчётах, не учитывали изменения налоговых правил и ссылались на несуществующие нормы. Лучше всех выступил Claude Opus 5 в режиме рассуждений, но и он ошибался в 39% случаев. #ai #ии
В тесте 18 моделей, включая ChatGPT, Claude, Copilot, Grok и Gemini, средняя доля ошибок составила 57%, а на сложных задачах с несколькими вычислениями — 88%. Модели путались в расчётах, не учитывали изменения налоговых правил и ссылались на несуществующие нормы. Лучше всех выступил Claude Opus 5 в режиме рассуждений, но и он ошибался в 39% случаев. #ai #ии