TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Linux Ninja

21 Aug, 09:09

Открыть в Telegram Поделиться Пожаловаться

J-Space, который завирусился в Twitter, сообщество разоблачило как фейк.

За последние два дня он очень быстро привлёк огромное внимание благодаря набору крайне завышенных результатов тестирования DeepSeek V4, а посты о нём распространили многочисленные аккаунты, занимающиеся продвижением ИИ, как в Китае, так и за его пределами.

В проекте автор утверждает:

V4 Flash + J-Space может сравняться с GLM-5.3.

V4 Pro + J-Space напрямую превосходит Fable 5 в нескольких агентных бенчмарках.

Одновременно утверждается, что скорость выросла в 2,53 раза, а эффективность использования токенов — в 2,21 раза.

Если эти данные верны, это означает, что существует способ повысить результаты DeepSeek сразу в нескольких сложных агентных бенчмарках почти до уровня смены поколения модели, при этом вообще не изменяя её веса.

Проблема в том, что сообщество обнаружило, что эти результаты невозможно воспроизвести.

Пользователь GitHub GoForceX провёл тесты с высокой параллельностью на выборке из 87 задач Terminal Bench 2.1 и подтвердил, что загружал skill.md J-Space и другие его модули.

Результаты оказались полностью противоположны официальному отчёту.

После добавления J-Space результаты в бенчмарке немного снизились, а расход токенов и стоимость, наоборот, выросли.

Это не просто ошибка в десятичной запятой.

Результаты напрямую противоречат главным рекламным заявлениям проекта — «рост производительности, рост скорости и рост эффективности использования токенов».

После этого всё больше разработчиков начали требовать от автора опубликовать исходные материалы экспериментов, включая полные настройки оценки, ответы модели, логи запусков DSH, результаты по каждой задаче, исходные замеры времени и расход токенов.

И вот здесь возникает основная проблема.

Так называемый «полный отчёт об оценке» проекта в основном раскрывает только итоговые агрегированные результаты.

Исходных результатов, подтверждающих эти точные цифры, логов запусков по каждой задаче, манифестов запусков или полного набора данных для воспроизведения эксперимента нет.

Особенно примечательно, что улучшения эффективности в проекте указаны не приблизительно, а с очень конкретными числами — 2,53× и 2,21×.

Но когда сообщество потребовало исходные данные, сам автор ответил:

«Эти данные действительно преувеличены».

И заявил, что в целом улучшение можно считать находящимся примерно в диапазоне от 1,6× до 3×.

Это вызывает очень прямой вопрос.

Если 2,53× и 2,21× действительно были рассчитаны по результатам реальных запусков бенчмарков, то где соответствующие исходные данные по времени и расходу токенов?

На данный момент автор не дал официального ответа на сомнения сообщества и вместо этого удалил несколько issues, в которых высказывался скепсис.

Буду продолжать следить за развитием ситуации.

✈️ Linux Ninja

294 0 0 2
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot