Китайский ИИ «спроектировал чип»Alibaba выкатила Qwen3.8-Max (2,4T параметров) и главным аттракционом сделала не SWE-бенч, а
автономный chip-design. Таргет - GCD/RSA-ускоритель с модульным умножением и возведением в степень: компактный, логически плотный блок. На входе - минимум: описание задачи, stub-воркспейс с пустыми модулями и eval-скрипт. Песочница с настоящим тулчейном (Iverilog → Yosys → OpenROAD), корректность - bit-exact через рандомизированный cocotb на WIDTH 4/6/8/16. Ни golden reference, ни человека в контуре. Пока всё выглядит как нормальный closed-loop, а не как демо на синтетике.
Метрики для пресс-релиза: ~500 turns, 71 eval, улучшайзинг gate count с 8298 до 678, die 106×106 → 46×46 мкм, wirelength 33 369 → 4187 мкм, WNS из −4,46 нс вытянут в +0,66 нс, timing closure на 500 МГц. Минус 81% площади. Красиво - ровно до момента, когда начинаешь читать, от чего считали проценты...
..а считали от 8298 вентилей «первой функционально рабочей версии». Переведём на инженерный: baseline был раздутым черновиком, и добрая половина хвалёного улучшения - это модель, героически побеждающая собственную криворукость на старте. 6288 из 6288 сэкономленных на 22-м turn'е вентилей - это замена аппаратного restoring-делителя по модулю на итеративный shift-subtract. Отличное решение! Которое любой RTL-джун держит в голове как дефолт, а не как откровение на 22-й итерации. То есть «прорыв» - это когда агент наконец перестал синтезировать делитель там, где нужен сдвиговый цикл.
Дальше - про масштаб, о котором маркетинг тактично молчит. WIDTH=16. Настоящий RSA - это 2048/4096 бит; шестнадцатибитный «RSA-ускоритель» - это лабораторка второго курса, а не то, что кто-то тейпаутит. Разводили в Nangate45 - академическом PDK, а не на реальном foundry-ноде, где начинается веселье с DRC, antenna rules, EM/IR-дропом и corner'ами. 46×46 мкм с 4187 мкм трассировки роутится без единого congestion-хотспота - тут и OpenROAD не вспотел. Timing closure на 500 МГц в такой конфигурации - это не достижение, это отсутствие проблемы.
И всё же кидаться помидорами целиком - глупо. Реально ценное здесь - не итоговые 678 вентилей, а то, что агент держал когерентную стратегию сотни turn'ов и продолжал вытаскивать структурные улучшения (module fusion, resource sharing одного субтрактора глобально, FSM-прунинг) на 400-м шаге, а не залипал на косметике после ранних лёгких вентилей. Вот это - сигнал. Петля «edit ➡️ simulate ➡️ synthesize ➡️ P&R ➡️ читаю числа ➡️ рефакторю» с жёсткой верификацией на каждом шаге масштабируется туда, куда single-shot-генерация RTL не масштабируется никогда.
Резюме для тех, кто дочитал: «ИИ проектирует чипы» - маркетинговый буллшит; до полноценного SoC-флоу тут как до Луны. А вот «агент способен держать инженерную стратегию на сотнях итераций закрытого цикла и находить architecture-level, а не syntax-level улучшения» - правда, и это важнее любого заголовка.
PS: Контекст: прошлый 3.7-Max уже крутил 35-часовую автономную оптимизацию Triton-ядра под кастомный чип с 1158 tool-call'ами. Alibaba методично докручивает один и тот же сюжет - long-horizon под железо - от релиза к релизу. Это не случайный выброс, это дорожная карта. Только напомню в скобках: все числа - из собственного launch-репорта, third-party репликации нет, а «лучше всех протестированных моделей» - это их эвал на их постановке. Верить на слово в EDA - примерно как верить в тайминги по datasheet без своего STA.
PPS: о том, о чём в отчёте - ни строчки: это RSA/крипто-блок. Оптимизировали его исключительно под area × correctness. Никто, судя по описанию, не проверял constant-time. А в трейсе прямым текстом: «early-exit для чётных», «MSB субтрактора как компаратор», data-dependent число итераций. Поздравляю - вы получили компактный крипто-датапас с шикарным timing side-channel'ом. На реальном RSA такое «оптимизированное» железо утекает секрет по задержке ещё до того, как доедет до fab. Метрика PPA сошлась, threat model - нет.
@vlsihub