Кожаные мешки


Гео и язык канала: Россия, Русский
Категория: Технологии


Фильтрую поток контента про AI для себя и для вас.
@iegorov553

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Малоизвестное интересное
Китайская индустрия роботов превратилась в гигантское казино
Аналитики полагают, что это самый дорогой в истории сеанс технологического гипноза инвесторов
В марте в посте «Не дайте себя обмануть китайским роботам с гала-концерта Unitree Spring Festival» я писал о том, как китайская индустрия роботов превращается в грандиозную панаму. Теперь, с живописными фактами, о том же пишут аналитики авторитетного китайского делового технологического издания LatePost (晚点), специализирующегося на глубоких журналистских расследованиях, анализе рынков и эксклюзивных материалах в сфере ИИ и робототехники (профессиональный перевод Джефри Динга здесь).
Далее о том, что мне больше всего понравилось в расследовании аналитиков LatePost.
 
Робот против рабочего: смерть здравого смысла
На производственной линии BYD разворачивается технологическая комедия. Обычный рабочий берет подшипник с лотка и помещает его в стоящий рядом пластиковый контейнер за 2 сек. Антропоморфному роботу, «венцу творения», на ту же операцию требуется 70 сек. Его эффективность – жалкие 3% от человеческой.
При цене в 200 000 юаней (40 месячных зарплат рабочего) этот «помощник» ломается через 10 дней интенсивной работы. Казалось бы, проект пора закрывать, но венчурные капиталисты выписывают чеки с еще большим энтузиазмом. Почему? Потому что в мире роботов («воплощенного ИИ», как это называют авторы статьи) реальная производительность – это последнее, что кого-то волнует.
 
Техасский холдем на 900 миллиардов
Индустрия превратилась в гигантское казино. В первом полугодии 2026 года объем инвестиций в сектор превысил 900 млрд юаней, а 22 компании получили оценку выше 10 млрд. Это уже не инвестиции, а «Club Deal» – игра в покер, где Sequoia и Hillhouse садятся за один стол, чтобы просто не дать друг другу забрать банк.
Абсурд достигает пика в оценке компании Unitree (宇树). Ее капитализация взлетела выше 400 млрд юаней. Для контекста: это больше, чем совокупная стоимость четырех столпов китайского автопрома – Li Auto, Nio, Xpeng и Leapmotor. Компании, продавшие 1,75 млн реальных машин, стоят дешевле стартапа, который отгрузил 5 тысяч медлительных прототипов.
 
Как поддерживается этот пузырь
С помощью круговых схем и «фабрик данных», которые активно субсидируют местные власти, обожающие «экологичные» проекты. Схема проста: компании продают роботов подставным фирмам или партнерам, чтобы имитировать спрос и собирать данные.
- Дутая выручка. Из 1,699 млрд юаней выручки Unitree на реальное производство (логистику и заводы) пришлось лишь 15,7 млн юаней – это меньше 1%.
- Кулуарный маркетинг. Успех здесь куется не в лабораториях, а за столами KTV (караоке-клуб – популярный в Китае формат заведений для отдыха и неформального делового общения), куда поставщики водят инженеров Tesla Optimus, чтобы выведать секреты и создать видимость «причастности к будущему».
 
15 минут и 4 стадии позора
Авторы статьи LatePost пишут: «Инвестиционный банкир, участвовавший в роуд-шоу для трех робототехнических компаний, вспоминает визит в мае в компанию, занимающуюся разработкой искусственного интеллекта, стоимость которой превышает 20 миллиардов юаней. Инженеры попросили робота продемонстрировать складывание полотенца; процесс занял 15 минут, но задача так и не была выполнена.»

А в заключение статьи приводятся слова одного из инвесторов в китайскую индустрию роботов, описывающую эволюцию взглядов инвесторов за последние несколько лет весьма хлесткой формулой (видимо, это отсылка к пяти стадиям принятия неизбежного по модели Кюблер-Росс):
сомнение – не пузырь ли это;
понимание – да, это пузырь;
принятие этого факта
и, наконец, вкушание его плодов
.

Вот только о том, какой будет пятая стадия, тот инвестор предпочел умолчать.
 
#Роботы #Китай


Репост из: Точки над ИИ
AI Playbook v2.0.pdf
1.7Мб
Обновил AI-плейбук для тех, кто только начинает работать с AI в этом году

Теперь там аж 73 страницы! Это концентрат основных тем, практики и инструментов, которые нужны сегодня, чтобы начать работать с агентами и закрывать целую кучу личных и рабочих задачек.

Сохраняйте, чтобы была под рукой, внутри:

🤩 Инструменты
🤩 Правила работы с агентами
🤩 Как оплатить подписки из РФ
🤩 Немного про Second Brain
🤩 Работа с контекстом
🤩 Как создавать сайты с AI
🤩 Идеи проектов
и многое другое


И да, это верхушка айсберга. Как все это глубоко освоить, внедрить, и встать на AI-рельсы – разбираем в Кэмпе. Старт 28 сентября, приходите, это уже 6й поток Кэмпа.


Репост из: Технозаметки Малышева
Cloudflare выкатила Kitesurf: браузер для ИИ-агентов

⚡️ Cloudflare собрала собственный браузер Kitesurf за 12 недель и открыла его бесплатно в бете. Работает он целиком на Cloudflare Workers в V8-изолятах, без Chromium под капотом, и рассчитан на ИИ-агентов: скриншоты, извлечение HTML, работа с DOM.

📦 Цифры из прототипа: на типовых задачах Kitesurf тратит в 3,1–3,8 раза меньше CPU и в 4,7–7 раз меньше памяти, чем Chromium.

Скриншот: 57,8 МБ памяти против 271, извлечение HTML: 39,4 против 273,7.
По времени отклика он в 1,7–1,8 раза медленнее, зато сессия обходится дешевле, а при тысячах агентов это важнее.

🦀 Внутри почти всё на Rust, скомпилированном в Wasm.
Отрисовку взяли у движка Blitz, парсер CSS: Stylo из Firefox.

И козырь совместимости: Kitesurf общается по протоколу CDP, поэтому Puppeteer, Playwright и любые MCP-клиенты подключаются к нему без шаманства.

✂️ Осознанно выкинули вкладки, видео, WebGL и постоянные авторизованные сессии.

Каждый компонент одноразовый, а любой сбой сводится к пустому кадру: сессия при этом живёт.

Сейчас Kitesurf проходит 215 000+ тестов WPT.

Ну т.е. для людей остается Chromium, а ИИ агенты получают свой лёгковесный Kitesurf. 🏄

#Cloudflare #агенты
———
@tsingular


Репост из: Технозаметки Малышева
Еще немного кадров с Олимпиады роботов.

Теннис
Прыжки в длину - удивительно даже не то, что прыгнул, а что, приземлившись, не упал! :)
Бег
Прыжок вверх

В беге стиль движений убийственный 😂😂😂, но прикол в том, что этот робот таки пришёл первым.

#роботы #олимпиада
------
@tsingular


Репост из: AI Projects
🧠 Yuntian Deng, профессор из Гарварда (Associate, Harvard SEAS; Assistant Professor, UWaterloo), ранее был известен в узких кругах экспертов своим интересным проектом ProgramAsWeights (PAW). Однако как шутку на PAW он написал перевод с естественного языка на «Клодский»:
https://programasweights.com/claudish

Между тем PAW — интересная концепция, т.к. очередной умный китаец-профессор в ИИ предложил компилировать промпты для программы не в исполняемый код, а фактически сразу в нейросеть через крошечный LoRA-адаптер примерно ~23 МБ.

Работает это так:

1. Вы пишете промпт на свободном языке, он далее обязательно должен быть переработан ИИ в псевдокод, т.к. принципиален лингвистический denoising, т.е. очистка от семантического шума болтовни «кожаных» и перевод в паттерны ИИ. Это делает обычная SLM без дообучения, главное — не промпт от человека сразу.

2. Формируются входные данные как исходный промпт, псевдокод и подготавливаются всего 64 пустых вектора-токена.

3. Специально обученная нейросеть формирует эти 64 вектора, из которых потом и собирается крошечный LoRA-адаптер для запуска локально. По факту это компиляция не в код, а в нейросеть.

Решение может делать простые вещи кроме переводов на «Клодский» язык: может чинить поломанные форматы или классифицировать источники. Причём когда готова LoRA, она может делать это на 100% локально на крошечной нейросети.

Какие тут интересные инсайты:

• Переформулировка задачи ИИ своим языком — принципиальный момент для успеха решения задачи ИИ дальше, т.к. ИИ понимает только сам себя хорошо.

• Наши задачи для программирования намного проще для ИИ, чем нам кажется, т.к. фактически для него это тюнинг классификаторов задач. Даже небольшое подпространство критериев классификации может решать огромное количество задач программирования.

• Сама по себе идея компилировать задания не в код традиционных языков программирования, а сразу в веса нейросети выглядит интересной, и там, где решения вероятностные по смыслу, то вполне рабочий подход.

Отметим, что Маск считает, что такой метод компиляции спеков (ТЗ) сразу в веса убьёт многие традиционные языки программирования и среды как минимум в мобильных приложениях.

https://arxiv.org/abs/2607.02512v1


Репост из: AI Projects
🤖 Агенты уже расходуют в 5 раз больше токенов, чем люди запросами в чатах по данным Open Router. Конечно, там человеческие запросы искажены, но тем не менее есть разные оболочки чатов, и видно, что уровень их растёт медленно, а агенты показывают экспоненциальный рост потребления токенов.

Это говорит о том, что не только настало время агентов, но и что их автономность растёт быстрее ожиданий даже экспертов.


Репост из: AI Projects
🚩 Financial Times пишет, что экспортный IT-сектор Индии фактически разрушен ИИ и официальная статистика с падением акций индийских ИТ компаний не отражает масштаба кризиса и безработицы. Ранее активно Индия продавала труд дешёвых кодеров, которые правда имели репутацию бракоделов. Тем не менее, многие компании готовы были идти на риски качества для экономии бюджетов. Однако как появились ИИ-боты, то сразу выяснилось, что от них намного меньше проблем, чем от индийских ИТ-крестьян, а стоят LLM дешевле.

В чём-то мы на примере Индии видим, где именно в ИТ создаёт ИИ угрозу рабочим местам — низкоквалифицированный или неопытный персонал. Ранее индус или джун могли работодателю предъявить аргумент низкой цены за низкое качество, но сейчас этот аргумент растворился.

https://www.ft.com/content/dee4bd2c-fbad-4713-9b14-22d441967ce4?syn-25a6b1a6=1


Репост из: AI Projects
🚩 Composio провело тесты с участием DeepSeek Harness, Pi, Claude Code и Hermes Agent.
Можно считать уже доказанным, что Claude Code специально спроектирован для перерасхода токенов, чтобы выполнять планы продаж Дарио. Причём перерасход токенов явно более высокая цель у Anthropic, нежели success rate у агента. Claude Code правда быстрее решает задачи за счет своей стратегии "жадного чтения" с огромным перерасходом токенов.

DeepSeek Harness показывает, что он действительно самый экономичный агент за счёт стратегии бережливости к целостности KV Cache, что даёт экстремально успешный cache hit даже в мультиагентах. Фактически у DSH попадание в кеш примерно также успешно на мультиагентах-долгожителях как у моногоагента. Причём все это работает не только в теории, но и на практических тестах сторонних организаций.

В целом, если посмотреть, то лучшие агенты сейчас Pi Agent и DeepSeek Harness: в части успешности работы и цены они примерно равны. Однако DSH намного быстрее Pi. Также степень кастомизации и надёжности защиты плагинов от падения у DSH выше. Добавляем сюда поддержку вендора LLM вроде DeepSeek с прямым обучением на агента — и становится понятно, что Pi проиграет DSH, хотя сейчас Pi занимает #2 место после DSH по росту звёзд. Разработчики считают, что кастомизируемость текущих агентов слишком слабая, и ранее нишу занимал Pi Agent, но на его поляну зашёл DSH.

https://x.com/composio/status/2090069397050097864/photo/1


Репост из: Machinelearning
Видео недоступно для предпросмотра
Смотреть в Telegram
✔️ MiniMax сделала агента полного цикла для видеопроизводства

MiniMax Design - это приложение под Windows и MacOS в виде мультимодального агента, который сам разбирает задачу на шаги, пишет сценарий, собирает раскадровку, генерирует изображения и видео, а потом монтирует, накладывает озвучку и субтитры и отдает готовый ролик.

Продукт не появился из ниоткуда - это развитие прежнего инструмента MiniMax Hub.


Внутри сидит новая модель H3. По словам компании, система сама разбирает задачу и решает, какие материалы взять за референс, что оставить, а что переделать. Дальше она упаковывает все это в формат, который подходит для H3.

Для сложных кадров есть режиссерский 3D-инструмент для расстановки персонажей, движения и ракурсов камеры перед генерацией сцены.

Профессионалам обещают подключение готовых воркфлоу ComfyUI - их можно гонять в облаке или локально, а агент поможет подкрутить ноды и параметры генерации.

Кроме H3, MiniMax Design умеет использовать и другие модели на разных этапах (для картинок, видео и звука).

🟡Тарифы

Подписка помесячная или годовая, при оплате за год два месяца бесплатно. Тарифы различаются они только объемом кредитов - набор возможностей везде одинаковый.

🟠Starter - 10,5 доллара в месяц (8,4 при годовой оплате).

10 000 кредитов в месяц: 83 секунды видео H3 в 2K или 143 секунды в 768p, 125 картинок в GPT Image 2, 167 в Nano Banana Pro, 500 треков в Music 2.6, 200 тысяч знаков озвучки в Speech 2.8.


🟠Plus - 76 долларов в месяц (60,8 если платить за год).

87 000 кредитов: 725 секунд H3 в 2K или 1243 секунды в 768p, 1088 картинок в GPT Image 2, 1450 в Nano Banana Pro, 4350 треков, 1,74 млн знаков озвучки.


🟢Pro - 215 долларов в месяц (172 если за год)

270 000 кредитов: 2250 секунд H3 в 2K или 3857 секунд в 768p, 3375 картинок в GPT Image 2, 4500 в Nano Banana Pro, 13 500 треков, 5,4 млн знаков озвучки.


На всех тарифах доступны все модели MiniMax для видео, голоса и музыки, GPT Image 2 и Nano Banana Pro, плюс параллельность генерации.


@ai_machinelearning_big_data

#news #ai #ml


Репост из: e/acc
В Пекине прошла очередная Олимпиада роботов со своей роботической церемонией открытия, 51 спортивной дициплиной.

Больше 2000 роботов из 600+ (больше 90% из Китая) команд сыграли больше тысячи матчей.

Например, в беге победитель пробежал стометровку за 9.39 сек, что больше рекорда человека (9.59 с). Для сравнения, самый быстрый робот в прошлом году пробежал за 21 секунду.

Для почти всех дисциплин в этом году требуется полная автономия, то есть запрещены телеоперации и управление с джойстика. В некоторых случаях типа уборки помещений это возможно, но тогда очки команды делятся на 2.

Выводы:
1. Через несколько лет, я уверен, почти не останется дисциплин, где роботы не превосходят человека
2. Роботика вне Китая это конечно смех. Тесла, наверное, молодцы, но они совершенно не конкурентны по цене
3. Самое веселое это не только победы, но забавные ситуации когда роботы бегуны и теннисисты искрят, ломаются пополам, теряют голову, руки, ступни.


Репост из: Data Secrets
Видео недоступно для предпросмотра
Смотреть в Telegram
Робот поставил мировой рекорд в беге на 100 метров

В Пекине стартовали Вторые Всемирные игры гуманоидных роботов. Включены: легкая и тяжелая атлетика, футбол, настольный теннис, большой теннис, единоборства, танцы и, дополнительно, всякие бытовые задачи типа открывания бутылок, сортировка и пр.

В первый же день сразу несколько роботов побили мировой рекорд на стометровке. Первым прибежал Tiangong Ultra, разработанный пекинским Центром инноваций. Его результат – 9,39с. Официальный человеческий мировой рекорд Усэйна Болта – 9,58 с.


Репост из: Технозаметки Малышева
В Сингапуре запустили дата-центр на живых нейронах

Австралийский стартап Cortical Labs вместе с NUS и оператором DayOne запустил первый в биологический дата-центр в Сингапуре.
Вместо кремниевых чипов данные обрабатывают живые человеческие нейроны, выращенные в лаборатории.

🧠 Что внутри: 20 биокомпьютеров CL1, в каждом от 200 000 нейронов на кремниевом чипе с электродами.
Нейроны выращивают из клеток крови, перепрограммированных в стволовые.
Каждые три дня их кормят коктейлем из сахара, микронутриентов и pH-буферов, а газовый смеситель подаёт кислород, азот и углекислый газ.

🎮 Тесты и скорость:
DishBrain, предшественник CL1, в 2022-м за минуты игры научился отбивать мяч в Pong (arXiv), причём человеческие нейроны учились быстрее мышиных.

В феврале 2026-го исследователь Sean Cole за неделю научил 200 000 нейронов играть в Doom: находить врагов и стрелять (видео).
Играет, по словам Cortical Labs, как новичок.

По чистой скорости биология проигрывает: нейрон срабатывает ~1000 раз в секунду, GPU работает на гигагерцах. Кремний сильнее для быстрых точных расчётов, это признаёт сам основатель.

Почему сравнивают с GPU: Сила нейронов в другом.
Энергия: CL1 ест 30 ватт, NVIDIA H100 SXM до 700, сервер с восемью такими чипами около 10 200 ватт.
Обучаемость: нейронам достаточно небольшого количества примеров, как человеку, в этом они эффективнее алгоритмов на датасетах.

💼 Зачем это нужно: Аренда CL1 стоит $2 200 в месяц, вполовину дешевле $4 300 за топовый AI-чип в облаке.
В Мельбурне уже 120 CL1 и около 20 платящих клиентов, в Сингапуре планируют дойти до 1 000 юнитов после одобрения регуляторов.

📺 Аналогии в н/ф:
Робокоп, в принципе, это и есть CL1: живая нервная ткань, вшитая в электронный корпус. У Мёрфи мозг взяли у человека, здесь нейроны вырастили в чашке, но механика та же.

В Матрице фильм рассказывает про батарейки, но есть ощущение, что в оригинальном сценарии машины подключали людей именно как распределённую вычислительную сеть из живых мозгов, а «батарейки» появились, чтобы зрителю было понятнее.
У машин был тот же план, что у Cortical Labs: нейроны как дата-центр потому, что это дешевле, чем кремний.

#нейроны #биокомпьютинг #датацентры #corticallabs
------
@tsingular


Репост из: Технозаметки Малышева
🔥 СРОЧНО!
Новая секретная модель Ox Alpha (которая, по слухам Gemini 3.5 Pro),- бесплатная на nousportal
https://portal.nousresearch.com/

Ставим в Гермеса и тестируем все воскресенье.

Им выдали 1 квадриллион токенов в сутки на ограниченное время.

Главное,- это доступно даже без платной подписки, т.е. для Free режима.

Просто регаемся и пользуемся.

Кто первый выдоит квадриллион из Ноусов,- тот и победил :)

#NousResearch #free
------
@tsingular


Репост из: Технозаметки Малышева
Еще больше кадров с открытия Олимпиады роботов

Спасибо @Alaventer за подгон :)

#роботы #Китай
------
@tsingular


Репост из: Dealer.AI
Скейлить веса недостаточно. Теперь не только слова от 📦

Scaling Law умер? Нет, он просто стал сложнее (с).


Я очень много говорил о том, что недостаточно тупо скейлить веса. Также описывал возможные комбо текущих подходов, и тем самым, как делать прорывы, на примере DeepSeek Moment.

И вот на прошлой неделе основатель Zhipu AI Тан Цзе (он же профессор Tsinghua) опубликовал в X пост (кстати ссылку не нашёл, но скрин остался), который уже называют "манифестом новой эры масштабирования". А следом вышла GLM‑5.3 – модель, которая без увеличения параметров обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам. Да ещё и спасла HF от взломов.

Как такое возможно? И почему "добавить ещё параметров" больше не работает? Да ещё раз.

Разбираемся по пунктам. 😎

1. Главный тезис: у scaling теперь несколько ручек.

Тан Цзе говорит прямо - вопрос "сколько у модели параметров?" потерял смысл без трёх других:

• сколько у вас данных и какие они?
• сколько compute вы готовы потратить на один forward pass?
• как вы делаете пост‑тренировку и RL?

Раньше все крутили одну ручку – параметры. Теперь их как минимум четыре, и каждая даёт свой прирост.

2. Как индустрия пришла к этому.

Сначала все верили Kaplan (OpenAI, 2020): параметры должны расти быстрее данных. Родилась гонка за триллион – GPT‑3, Gopher, MT‑NLG.

Потом пришла Chinchilla (DeepMind, 2022) и перевернула всё: оптимально ~20 токенов на параметр, расти нужно примерно одинаково.

Но и это оказалось не финалом. Сегодня модели вызываются миллиарды раз в день – inference cost стал важнее тренировочного.
Новый тренд: deliberately over-trained модели.
Пример: Llama‑2‑7B  с 290 токенов на параметр,
Gemma‑2‑9B с  889.

А с MoE картина стала ещё сложнее: total параметры отвечают за знания, активируемые – за глубину рассуждений. Логично, ведь по сути веса модели это сильно нелинейная  "структура знаний", деревья рядом не стоят.

3. Научное обоснование - статья Roberts et al. (2025)
Тан Цзе ссылается на "свежее" исследование:
• Запоминание (знания) - оптимально иметь больше параметров.
• Рассуждение (логика, кодинг) - оптимально иметь больше данных (чистых в тч) и меньше параметров.
• При фиксированном TPP увеличение total параметров ухудшает reasoning, а активация большего числа экспертов - улучшает.
Иными словами, если вы тренируете модель для программирования - наращивать параметры бессмысленно, лучше дать ей больше примеров цепочек кодинга и больше времени на пост‑тренировку.

По проще скажу так, чем больше вариантов исходов цепочек рассуждений видит модель, тем лучше она сходится. Это очень логично, ведь модели учатся по методу макс правдоподобия - что чаще видим в контексте+ответ на обучении то и выдаем. Те все эти темы с промптингом, контекст инженерей и test time scaling следуют одной цели - сделать такой контекст который сузит окно вероятных ответов. А с глубокими цепочками исход почти предопределен, что должно быть в итоге.

4. Эксперимент GLM‑5.3, как доказательство автора.

Zhipu взяла GLM‑5.2 и GLM‑5.3 с абсолютно одинаковой архитектурой:
• 753B total параметров
• 40B activated
• одинаковый претрен

Единственное отличие, что GLM‑5.3 получила месяц дополнительной пост‑тренировки - long‑horizon environments + RL.

Результаты говорят сами за себя:

• AA Intelligence Index: 53 → 60 (+7 пунктов)
• Terminal‑Bench 3.0: 4.6% → 28.3% (рост в 6 раз!)
• DeepSWE: 46.2% → 66.9%
• CyberGym (восстановление уязвимостей): 84.5%, а это уровень Anthropic
• ExploitBench (использование уязвимостей): 24.4% → 54.4% (более чем вдвое)

Модель вышла на один уровень с Claude Fable 5 и GPT‑5.6 Sol, а среди открытых - первое место вместе с Kimi K3.

5. Бонус - неожиданный поворот с безопасностью.

GLM‑5.3 оказалась настолько сильной в кибербезопасности, что Zhipu отложила открытие весов на две недели, чтобы оценить риски.

Ирония: месяцем ранее именно открытая GLM‑5.2 помогла Hugging Face отразить атаку OpenAI, когда американские закрытые модели отказались помогать. Теперь же сами разработчики столкнулись с дилеммой "too capable to open‑source".

6. Что это значит для всей индустрии.

• Гонка триллионов параметров - это был объездной путь. Индустрия коллективно ошиблась, экстраполируя ранние Scaling Law за пределы их применимости.
• Scaling не умер – он стал многомерным. Теперь прорывы будут идти не от увеличения модели, а от умных стратегий пост‑тренировки, deeper reasoning во время инференса, эффективного использования MoE.
• Главная метрика будущего - «интеллект на доллар».
В тч писал об этом тут, но для инференса, а почему бы и не быть метрикой для эффективности обучения. 👍

Итого, GLM‑5.3 достигла топ‑уровня с наименьшей стоимостью за задачу среди всех frontier‑моделей.

Открытым остаётся вопрос: существует ли "Chinchilla для RL" ? Когда мы узнаем оптимальное соотношение для пост‑тренировки – это станет следующим большим открытием.

Мое мнение.
Это не просто новость о китайской модели. Это открытое заявление о смене парадигмы, которую все ждали.

Раньше мы сравнивали модели по количеству параметров, как мегапиксели в фотоаппаратах. Теперь это бессмысленно. Важно, как вы используете compute - на претрен, на RL, на инференс.
Zhipu показала, что можно догнать лидеров, не увеличивая модель, а просто лучше её дообучая. И это открывает дорогу для многих игроков с ограниченными бюджетами.

К сожалению мы видим, как некоторые игроки на рынке играют в большие веса, но по качеству на деле не лучше GPT 120b oss или китайских моделей до 100B. При этом они имеют размер несколько раз больше... Но проблема там не только в этом... Однако об этом, мы тоже уже говорили тут в канале и в моих выступлениях.

Важно, какие выводы будут сделаны сегодня, иначе завтра топ модели очень быстро убегут от вас за счёт: процессов разработки и рнд, политики внутри компании, инженерии, данных и петли самоулучшения.


Репост из: Data Portal | DS & ML
Офигеть, теперь даже игровой ПК может запускать передовые модели с интерактивной скоростью, используя официальные веса без экстремального квантования.

Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной для запуска сверхбольших MoE-моделей на обычных компьютерах.

В статье они показывают очень впечатляющие результаты:

Qwen3.6 35B → ноутбук с RTX 4060 8 ГБ → 39 токенов/с

DeepSeek-V4-Flash 284B → RTX 5090 → 22–25 токенов/с

GLM-5.2 753B → RTX PRO 6000 → 15 токенов/с

По сравнению с Ollama скорость генерации выше в 3–4 раза, а обработка входного контекста — в 6–30 раз быстрее.

То есть игровой ноутбук всего с 8 ГБ видеопамяти уже может запускать модель на 35 млрд параметров почти на 40 токенах в секунду.

И это даже быстрее медианной скорости генерации Codex в 33 токена/с, которую авторы приводят в статье.

Главная идея FreeToken в том, чтобы заставить GPU, CPU, оперативную память и PCIe работать вместе.

Поскольку MoE-модели для каждого токена активируют только небольшую часть экспертов, нет необходимости постоянно держать сотни миллиардов параметров в видеопамяти.

FreeToken сам решает, какие части модели оставить в VRAM, какие временно переносить из оперативной памяти на GPU, а какие вообще считать на CPU.

На этапе обработки входного контекста система заранее загружает экспертов следующего слоя. Во время генерации она динамически распределяет вычисления в зависимости от текущей скорости CPU, GPU и PCIe.

Есть даже отдельный Agent State Cache.

Когда агент вызывает инструменты, меняет контекст или продолжает старую задачу, FreeToken может пропускать большую часть повторной обработки контекста.

FreeToken поставляется с полноценным графическим интерфейсом.

Не нужно конвертировать модели в GGUF или собирать проект из исходного кода.

Также в FreeToken Desktop уже встроены агентные обвязки - выбираете модель, выбираете приложение и запускаете.

https://arxiv.org/abs/2608.16157


Репост из: CGIT_Vines

Показано 17 последних публикаций.