Исследование EsoLang‑Bench от Lossfunk показало, что даже топовые модели (GPT‑5.2, O4‑mini, Gemini 3 Pro, Qwen3‑235B, Kimi K2) почти не умеют программировать на эзотерических языках вроде Brainfuck, Whitespace и Befunge‑98 — их точность там 0–11%, против высоких результатов на обычных бенчмарках.
Ни одна модель не решила ни одной задачи выше уровня «Easy», а GPT‑5.2 не смогла сложить 5+7 на Brainfuck, а на Whitespace все модели дали 0% по синтаксической корректности.
Полезнее всего оказался цикл «код → ошибка → исправление», а few‑shot, LLM‑критик и ReAct дали лишь +~0,8 п.п.
EsoLang‑Bench наглядно показывает: современные LLM всё ещё запоминают паттерны, а не умеют переносить вычислительные навыки на незнакомый синтаксис.
Сам бенч
https://github.com/Lossfunk/EsolangBench
Ни одна модель не решила ни одной задачи выше уровня «Easy», а GPT‑5.2 не смогла сложить 5+7 на Brainfuck, а на Whitespace все модели дали 0% по синтаксической корректности.
Полезнее всего оказался цикл «код → ошибка → исправление», а few‑shot, LLM‑критик и ReAct дали лишь +~0,8 п.п.
EsoLang‑Bench наглядно показывает: современные LLM всё ещё запоминают паттерны, а не умеют переносить вычислительные навыки на незнакомый синтаксис.
Сам бенч
https://github.com/Lossfunk/EsolangBench