J-Space, который завирусился в Twitter, сообщество разоблачило как фейк.
За последние два дня он очень быстро привлёк огромное внимание благодаря набору крайне завышенных результатов тестирования DeepSeek V4, а посты о нём распространили многочисленные аккаунты, занимающиеся продвижением ИИ, как в Китае, так и за его пределами.
В проекте автор утверждает:
V4 Flash + J-Space может сравняться с GLM-5.3.
V4 Pro + J-Space напрямую превосходит Fable 5 в нескольких агентных бенчмарках.
Одновременно утверждается, что скорость выросла в 2,53 раза, а эффективность использования токенов — в 2,21 раза.
Если эти данные верны, это означает, что существует способ повысить результаты DeepSeek сразу в нескольких сложных агентных бенчмарках почти до уровня смены поколения модели, при этом вообще не изменяя её веса.
Проблема в том, что сообщество обнаружило, что эти результаты невозможно воспроизвести.
Пользователь GitHub GoForceX провёл тесты с высокой параллельностью на выборке из 87 задач Terminal Bench 2.1 и подтвердил, что загружал
skill.md J-Space и другие его модули.
Результаты оказались полностью противоположны официальному отчёту.
После добавления J-Space результаты в бенчмарке немного снизились, а расход токенов и стоимость, наоборот, выросли.
Это не просто ошибка в десятичной запятой.
Результаты напрямую противоречат главным рекламным заявлениям проекта — «рост производительности, рост скорости и рост эффективности использования токенов».
После этого всё больше разработчиков начали требовать от автора опубликовать исходные материалы экспериментов, включая полные настройки оценки, ответы модели, логи запусков DSH, результаты по каждой задаче, исходные замеры времени и расход токенов.
И вот здесь возникает основная проблема.
Так называемый «полный отчёт об оценке» проекта в основном раскрывает только итоговые агрегированные результаты.
Исходных результатов, подтверждающих эти точные цифры, логов запусков по каждой задаче, манифестов запусков или полного набора данных для воспроизведения эксперимента нет.
Особенно примечательно, что улучшения эффективности в проекте указаны не приблизительно, а с очень конкретными числами — 2,53× и 2,21×.
Но когда сообщество потребовало исходные данные, сам автор ответил:
«Эти данные действительно преувеличены».
И заявил, что в целом улучшение можно считать находящимся примерно в диапазоне от 1,6× до 3×.
Это вызывает очень прямой вопрос.
Если 2,53× и 2,21× действительно были рассчитаны по результатам реальных запусков бенчмарков, то где соответствующие исходные данные по времени и расходу токенов?
На данный момент автор не дал официального ответа на сомнения сообщества и вместо этого удалил несколько issues, в которых высказывался скепсис.
Буду продолжать следить за развитием ситуации.
✈️
Linux Ninja