TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

26 Dec 2025, 14:09

Открыть в Telegram Поделиться Пожаловаться

Ян ЛеКун показал альтернативу генеративным VLM

Meta* FAIR представила VL-JEPA — первую vision-language модель, которая не генерирует токены, а предсказывает смысл в абстрактном пространстве.

Это развитие линии JEPA, которую ЛеКун продвигает как альтернативу генеративному подходу. Сначала был V-JEPA для видео (понимание физики мира), затем LeJEPA (теоретическое обоснование).

Теперь — полноценная мультимодальная модель.

Вместо того, чтобы предсказывать следующий токен как GPT/Claude, VL-JEPA предсказывает эмбеддинг — «смысл» ответа. Декодер в текст вызывается только когда нужно показать результат человеку.

Результаты:
- 1.6млрд параметров конкурирует с 72B Qwen-VL на задаче понимания действий
- На 50% меньше обучаемых параметров при лучшем качестве в контролируемом сравнении
- Декодирование в ~3 раза эффективнее за счёт selective decoding
- Одна модель решает classification, retrieval и VQA без изменения архитектуры.

Почему это важно?Генеративные VLM тратят ресурсы на моделирование поверхностных вариаций текста. VL-JEPA работает на уровне семантики, что даёт выигрыш в эффективности и скорости. Особенно важно для real-time приложений: робототехника, AR-очки, стриминг видео.

Авторы говорят, что это не замена VLM для задач рассуждения, использования инструментов и агентного поведения — там генеративные модели пока лидируют.

*запрещенная организация в России.
All about AI, Web 3.0, BCI
LeCun's JEPA has evolved into a vision-language model, with 1.6B parameters rivaling the 72B Qwen-VL. Instead of predicting words directly, the proposed VL-JEPA learns to predict the core "meaning" of a text in an abstract space, ignoring surface-level wording variations. This method outperforms s...

4.6k 5 91 24
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot