Якушев Герман


Гео и язык канала: Россия, Русский
Категория: Технологии


Меня и так все знают. y7.hk
Пишу о технологиях, бизнесе, путешествиях, искусстве, дизайне. Занимаюсь AI и SaaS сервисами в свободное время.
✉️ @yakushevhk если нужен

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Мой сетап для работы с агентами ⚡

Мне часто пишут в личку с вопросами про harness: что я использую и как всё устроено на практике.

Удивился, что многие до сих пор знают только Codex и вообще не представляют, как сейчас выглядит нормальная разработка с агентами. Делюсь своим сетапом, на котором сижу каждый день.

Главная проблема в разработке сегодня — это не скорость печати кода, а когнитивная нагрузка. Когда ты один пытаешься одновременно держать в голове архитектуру, писать логику, гонять тесты и анализировать данные — внимание быстро размывается. Правильный сетап позволяет разгрузить голову и вести несколько параллельных процессов: пока один агент пишет код, второй крутит тесты, а третий собирает аналитику.

Вот из чего собран стек:

— Терминалы: Использую Warp и cmux. Второй — вообще лучшее, что сейчас есть: прямо внутри терминала работает полноценный встроенный браузер, что для автономных агентов и отладки дико удобно.

— GPUI-редакторы: Легковесные Waku и Zed. За счет рендеринга на GPU они моментально открываются, не жрут память как монстры на Electron и отлично подходят для работы в связке с консольными агентами вроде Claude Code или Opencode.

— Рабочая лошадка — OMP (Oh My Pi): При нормальной настройке ничего удобнее пока нет. Движок написан на Rust, поэтому спокойно тянет параллельный запуск саб-агентов. Из коробки: автоматический поиск по прошлым сессиям, глобальная память, хорошо реализованный Vision и связка «агент для агента» (когда легкая быстрая модель на лету мониторит контекст и подсказывает основной, если та начинает ошибаться).

— Верхнеуровневый harness: Чтобы не переключаться между окнами руками, я использую Hermes Agent (но подойдет любой мета-харнесс, который вам ближе). Он связывает сессии воедино и управляет задачами в потоке.

Как это работает на практике: прилетает большой отчет по SEO или продуктовый таск. Система сама разбирает его на части и на лету раскидывает работу: что-то уходит в OMP, что-то в Devin.

В итоге параллельно закрываются тесты, код и анализ, а мне остается только смотреть в чек-лист и отмечать галочками, куда двигаться дальше.

Когда рутина и постоянное переключение контекста уходят на машины, голова остается свежей для решений по самому продукту. И именно это в конечном счете приводит к нормальному результату без каши в голове. 🧠


Закат индийской фабрики кода 🇮🇳

Двадцать пять лет мировая экономика держалась на предельно простой и выгодной сделке. Западный банк, страховщик или телеком звонил в Бангалор и говорил: «Нам нужно еще пятьсот программистов на поддержку легаси». Через месяц на проект выкатывали толпу дешевых джунов, а клиенту выставляли пухлый счет за отработанные часы.

Модель называлась Time & Materials (T&M), в народе — бодишоп. Человека ставили на биллинг ровно так же, как станок на заводе.

Чем медленнее писался код, чем больше людей сидело на статус-созвонах и чем больше строк спагетти-кода выкатывалось в прод — тем счастливее были акционеры аутсорсера. На этой модели выросли гиганты с миллиардными выручками (TCS, Infosys, Wipro, HCL, Cognizant) и армией в 6 миллионов сотрудников.

Но в 2026 году западный заказчик открыл Cursor, Copilot и Claude. А совет директоров внезапно задал индийским галерам смертельный вопрос: зачем нам оплачивать счета за тысячу медленных рук, если ту же работу закрывают двести человек в связке с нейросетями?

Индийский IT-сектор накрыл тектонический сдвиг, ломающий саму суть аутсорса:

— Смерть почасовой оплаты: Модель T&M внезапно стала токсичной для самих подрядчиков. Если ИИ ускоряет закрытие задач в два раза, то по старой почасовой ставке вендор зарабатывает вдвое меньше. Клиенты больше не покупают «человеко-часы» — на продлениях контрактов они срезают бюджеты на 25–40% и требуют платить строго за измеримый результат (outcome-based).

— Зачистка скамейки запасных: Раньше индийские компании держали на «бенче» (на окладе без проекта) до 20–30% сотрудников, чтобы мгновенно закрывать входящие заявки. Сегодня скамейку вынесли на мороз, урезав резерв до рекордных 8–12%. Не вышел на проект за 60 дней — на выход с вещами.

— Удар по дорогой середине: Под нож попали даже не выпускники, а мидлы с опытом 4–12 лет. Те самые «координаторы», которые годами перекладывали тикеты в Jira и правили чужие баги. Аналитики оценивают число специалистов под угрозой увольнения в 400–500 тысяч человек по всей стране.

— Бунт заказчиков (GCC): Корпорации больше не хотят платить наценку посредникам. Зачем нанимать Wipro, если можно открыть собственный хаб в том же Хайдарабаде? В Индии уже работает свыше 2 100 таких центров, и они нанимают в два раза активнее, чем классические аутсорс-галеры.

Масштаб проблемы колоссальный. Индийские вузы по инерции продолжают штамповать по 1,5 миллиона инженеров в год, но в 2026 году 85% выпускников остаются без единого предложения о работе.

Председатель совета директоров крупнейшего работодателя страны TCS прямым текстом заявил акционерам: через три года у компании будет полмиллиона ИИ-агентов наравне с полумиллионом людей, а эра массового кампусного найма завершена навсегда.

Индийский техсектор с выручкой в четверть триллиона долларов, конечно, не исчезнет завтра. Но легендарный социальный лифт, который четверть века превращал любого студента с базовым знанием Java в зажиточного среднего класса с квартирой в ипотеку, намертво встал.

Фабрика дешевого человеческого кода закрывается. На ее месте пытаются построить бутик для редких архитекторов. А остальным миллионам вчерашних программистов предлагают срочно освоить профессию оператора нейросетей. 💻


Токены, жадность и правила парето 🤔

Последнее время моим роутером моделей пользовалось довольно много людей — миллион запросов, 80 миллиардов токенов и 100 тысяч долларов в эквиваленте API


85% созданных ключей — были бесплатные для людей из раздач, помощи и прочее (для использования Fair use). Но в основном 20-25% от этой бесплатной массы — использовали тысячи запросов суточно, иногда десятки тысяч на человека, и забирали 95% трафика и моих оплаченных квот. То есть если бесплатно — то всегда потребление крайне абсурдное.

Треть бесплатных подписок — которые не приносят абсолютно ничего, кроме блокировки мне аккаунтов — забирали до 95% трафика. Все те, кто покупал, в основном использовали на несколько сессий по 200-500 запросов суточно. И у них началась просадка по качеству из-за ротаций корпоративных аккаунтов


С сегодняшнего дня все free-ключи будут отозваны. И я запускаю единую код/бизнес подписку на все Tier-1 китайские модели + несколько быстрых от Google, с полным безлимитом и высокой скоростью TPS, часть мне выдают на новых мощностях от Huawei

P.S. все квоты забрали, больше не продаю


SEO + GEO автоматизация

Работает очень быстро (вывод в топы) и хорошо по нужным гео. В связке с любым Harness + китайскими сервисами 😔 Автоматически подбор конкурентов, добавление беклинков и прочего, эксперимент получился довольно удачный, запускаю тогда на сотню доменов, несколько в день на автомате

Очень эффективно это работает именно с нейронками на поиск, потому что алгоритм внутри заставляет их петлять внутри вашего сайта и добавлять в глобальную память. Bing + ChatGPT очень хорошо работает и на СНГ на удивление


Казино без вывески 🎰

В 2025 году мобильные игры принесли больше $113 млрд — это больше, чем ПК и все домашние консоли вместе взятые. При этом число скачиваний во всем мире падает. Индустрия растет не потому, что в игры пришли новые люди, а потому что со старых игроков стали выжимать в разы больше.

В геймдеве обожают пугать цифрами про «китов»: мол, доли процента пользователей приносят всю выручку. В реальности математика еще циничнее.

В типичной условно-бесплатной игре реальные деньги платит крошечная доля — всего 1,5–3% аудитории. Но внутри этой горстки работает закон гипер-Парето: верхние несколько процентов платящих генерируют до 80% всей кассы. Это люди, способные влить в один проект десятки и сотни тысяч долларов за сезон.

Но главный вопрос: зачем разработчики делают эти миры бесплатными? Зачем в условный Genshin Impact вливают сотни миллионов долларов на открытый мир, оркестровую музыку и сюжет, если платит жалкая горстка?

Ответ простой: бесплатные игроки — это бесплатные декорации казино.

Человек с золотой картой никогда не станет спускать тысячи долларов в пустой комнате. Ему нужны зрители. Бесплатная массовка создает онлайн, генерирует мемы, спорит о тир-листах и формирует социальный статус. Вы играете годами без доната не из-за щедрости шанхайских разработчиков, а потому что вы — часть интерьера, в котором кит выгуливает своего редкого персонажа за две тысячи долларов.

Никаких тайных психиатров в штате студий нет — есть банальная инженерия азарта:

— Скиннеровский ящик: Мозг устроен так, что максимальный выброс дофамина происходит не от гарантированного приза, а от непредсказуемого ожидания. Это классический игровой автомат из Вегаса, только вместо трех семерок на барабане крутится аниме-девушка с катаной.

— Многослойный бутерброд валют: Вы никогда не покупаете героя напрямую за рубли или доллары. Вы покупаете кристаллы, кристаллы меняете на примогемы, примогемы — на крутки, а крутки крутите с базовым шансом 0,6%. Мозг физически не способен трезво оценить стоимость покупки через четыре прокладки. Человек не думает: «Я только что спустил $250 на картинку на экране». Он думает: «Мне не хватает всего десяти круток до гаранта».

— Искусственная боль (Fun Pain): Игра сначала дает порцию чистого кайфа, а затем плавно пережимает кислород — кончается смола, упирается лимит инвентаря, а таймер на баннере показывает, что через 48 часов персонаж исчезнет на полгода. Разработчик продает вам не победу, он продает мгновенное снятие дискомфорта.

В итоге воронка безупречна. Бесплатный игрок радуется халяве, игрок с подпиской за $5 в месяц чувствует себя гением экономии, а кит на верхушке пищевой цепочки оплачивает банкет за всех троих.

Так что если вы годами играете в подобные игры и гордитесь тем, что не потратили ни рубля — не обольщайтесь. Вы просто отлично работаете аниматором в чужом игровом клубе. И помогаете удерживать за столом парня, который оплачивает всю эту вечеринку. 🎲

511 0 12 2 96

Новая моделька Jev работает крайне быстро, способы применения могут быть довольно неожиданными


Микросон на эшелоне ✈️

Пассажир в самолете живет в красивой сказке.

В кабине сидят двое суперменов с белоснежными зубами. Оба предельно бодры. Автопилот — это так, приятная опция, чтобы руки не затекали. А если кто-то вдруг закроет глаза хотя бы на секунду — кабина взревет сиренами, диспетчер закричит в наушники, а автоматика даст пощечину.

В реальности небо устроено циничнее.

На высоте 10 000 метров современный лайнер летит сам. Диспетчер легко подождет минуту до ответа. Второй пилот решит «еще пару секунд не трогать напарника». А человеческий мозг умеет вырубаться на 5–15 секунд так виртуозно, что сам человек потом искренне уверен: «я просто моргнул».

Это называется микросон. Не «поспать в кресле по расписанию». А мгновенная дыра в сознании. Глаза могут быть открыты. Руки лежат на штурвале. Но картинка мира на секунду просто выключилась.

Причина простая — биология. В гипоталамусе сидят циркадные часы, которым абсолютно плевать на стоимость вашего билета. В районе 03:00–05:00 утра температура тела падает, и наступает WOCL (Window of Circadian Low) — биологическая яма, когда способность соображать стремится к нулю. И чашка кофе здесь работает как подорожник на открытом переломе.

В Европе регуляторы сдались еще в 90-х и легализовали Controlled Rest: один пилот официально спит до 45 минут по таймеру, второй бдит, а бортпроводники каждые 15 минут заглядывают в кабину. В США FAA до сих пор считает такой сон ересью и запрещает его на уровне правил. Физиология у всех одна, но правила зависят от паспорта.

И всё бы ничего, но эта система держится на одной хрупкой аксиоме: «второй пилот не уснет».

А он тоже человек. В 2024 году новенький Airbus A320 индонезийской Batik Air летел с 153 пассажирами. Командир уснул законно, а второй пилот, который ночью нянчил детей, уснул случайно. Самолет летел без управления 28 минут, уклонился от курса, а диспетчеры безуспешно кричали в пустоту. Обошлось: командир проснулся, растолкал напарника и соврал про «проблемы со связью».

В опросе европейского профсоюза ECA 76% пилотов признались, что проваливались в микросон за штурвалом. А в Австралии 15% пилотов честно заявили: однажды они открыли глаза и увидели, что второй пилот тоже спит.

Почему авиация не падает каждый день? Потому что на крейсерском эшелоне автопилот справляется лучше сонного человека. Опасность микросна не в том, что лайнер камнем пойдет вниз. Опасность в том, что пилот просыпается в состоянии Sleep Inertia — когда мозг еще минут десять тупит и принимает Венеру за встречный бомбардировщик (как было на рейсе Air Canada).

Так что когда вы ночью смотрите в иллюминатор на высоте 11 тысяч метров, помните: за бронированной дверью сидят не биороботы. Там сидят два уставших млекопитающих, которые отчаянно борются со своим гипоталамусом. И надеются, что автопилот сегодня в хорошем настроении. 😴


Раздача (дизайн) 😊

Так как Qwen 3.8 Max номер один в дизайне, одна из задач у меня была на будущее — сделать каталог анимаций, структур популярных сайтов и многое другое


Больше миллиона строчек стилей и примеров. 155 сайтов скопированы (использовать как референсы, только в законных целях), чтобы делать лендинги или дашборды в хорошем виде. Также все примеры в HTML + CSS/JS + Astro (для SEO) готовыми шаблонами. То есть это для того, чтобы брать лучшее от лучших.

Бесплатно, писать сюда @yakushevhk


Alibaba Qwen 3.8 Max 👌

Написал только после больших тестов, они продолжались больше двух недель. Теперь рейтинг от меня:

— лучший фронтенд
— разработка на Go и Rust тоже на первом месте
— знания чуть уступают ChatGPT, но, это решается выходом в веб

Спасибо тем, кто использует мой безлимитный роутер Helium, потратили хорошо. Модель спокойно работает автономно по 10-16 часов без вмешательства человека, результат действительно очень хороший. Вот оставлю себе как основную модель


Спасибо, Телеграм. Только давайте быстрее, пока вас не запретили


Я нашел довольно интересное поведение Телеграм-клиентов на iOS и на Mac при сломанном запросе

Почините, а то я хочу пользоваться новой разметкой и функцией markdown для постов даже со сломанными формулами. Знаю, что некоторые ребята меня читают из разрабов


Открывать аккуратно, я предупреждал, достаточно кликнуть на @mdtestbug, и вас вообще выкинет. Ничего страшного там внутри нет. Но главное не пересылайте в чат друзьям, они его не откроют пока там есть эти сообщения


Kimi K3 🌀

2.8 триллиона параметров. Миллион токенов контекста. Самая крупная open-source модель в истории Китая.

BrowseComp — бенчмарк, где нужно найти в интернете то, что сам интернет не может найти. Первое место. K3 обошла GPT 5.6 Sol Max и Fable 5.

GDPval-AA v2 — реальная продуктивность в knowledge-work. Третье место, сразу за двумя закрытыми флагманами.

AA-Briefcase — агентные бизнес-задачи. Второе. GPT 5.6 Sol Max позади.


Модель уже доступна по API.

P.S. Я уже ее активно использую весь день, хочу сказать — что для фронтенда она очень крутая, особенно для анимации или сложных лендингов, а также в агентском режиме.


Ваш браслет — ваш новый терапевт (и он не берёт деньги за сеанс, ну почти)🕐

Google Research сделали SensorFM. Они скормили одной нейросети триллион минут данных с фитнес-браслетов пяти миллионов человек. Теперь эта штука понимает, что у вас депрессия, просто по тому, как вы двигаете запястьем.

Дальше — интереснее. Модель учили без диагнозов. Ей не сказали: «Ваня — тревожный, Настя — в группе риска по диабету». Ей просто вывалили гору сырых сигналов: пульс, температура, движение, потливость ладошек. И сказали: «Ну, давай, разбирайся».

Она разобралась. SensorFM обошла традиционные медицинские модели на 34 задачах из 35. То есть ваш браслет теперь предсказывает здоровье точнее, чем методики, которые врачи использовали десятилетиями.

Без единого анализа крови. Без МРТ. Просто по тому, как вы ворочаетесь ночью и насколько потеете в пробке. Но вишенка на торте — это Personal Health Agent. Они подключили SensorFM к AI-ассистенту и дали ему задачу: «Напиши сводку по здоровью вот этого человека». Часть сводок была основана на реальных медицинских тестах. Часть — на чистом угадывании модели. Потом позвали живых врачей. «Оцените качество». Врачи не знали, где — анализы, а где — нейронка.

Разницы они не нашли.
Нейросеть нагадала медицинские показатели с точностью, которую практикующие врачи не смогли отличить от лабораторных результатов. Ваш Fitbit — это теперь диагностический прибор, просто никто вам об этом не сказал. И самое тревожное: модель не упирается в потолок. Больше данных — лучше прогнозы.

Через пару лет ваш браслет, скорее всего, сообщит вам о проблемах с сердцем раньше, чем вы сами почувствуете одышку.

Или диагноз «депрессия» поставит не психиатр после часовой беседы, а уведомление на запястье в 9:42 утра вторника: «Вы как-то мало двигаетесь, и пульс странный. Давайте поговорим».

Будущее медицины — это когда железка на руке знает, что с вами не так, а вы ещё даже не завтракали.

https://research.google/blog/sensorfm-towards-a-general-intelligence-and-interface-for-wearable-health-data/

977 0 31 6 33

А ещё GLM 5.2 на первых местах в нескольких рейтингах по веб-разработке (UX/UI, стилям и прочему). Тут тоже могу согласиться с этим. Делают очень круто


За сутки тестирования. Китайцы не поставили счетчик квоты, он не работает попросту, поэтому можно делать с ними что угодно.

GLM 5.2 пока лучшая модель, которой я пользовался за последний год


Совет джедаев — теперь и у моего роутера 😀

OpenRouter запустил Fusion — штука, где несколько нейросетей голосуют за лучший ответ, а потом один синтезатор собирает итог. Идея не новая, но они первые нормально упаковали. https://openrouter.ai/fusion

Я сделал то же самое. Называется Helium Wave.

Суть: ваш запрос летит сразу в несколько моделей параллельно. Каждая работает изолированно, не видит ответы соседей. Потом быстрая модель получает все варианты, находит противоречия, правит галлюцинации и выдает один чистый результат. Если результат не устраивает — может отправить на "доработки" до трёх итераций.


Что под капотом: MiniMax M2.5/3, MiMo V2.5 Pro, GLM-5.2, Qwen 3.7 Plus и другие. Но они по разным маршрутам используются.

Четыре форклоу:
— wave/fast — один эксперт + синтез. Дешево и сердито.
— wave/medium — две лёгкие модели + синтез
— wave/max — три лучшие модели + синтез. Максимум проверок, лучший результат на выходе.
— wave/ghost — две стадии. Сначала анализ, потом ревью другими моделями с историей первого этапа. Это специальный режим для "хакеров", как Claude Mythos, все ограничения сняты максимально, она умеет ломать и тестировать, конечно для проверки своих проектов на уязвимости.

📡 router.y7.hk/wave

Прирост качества ответа до 15%, на медицинских вопросах до 20% (точность). Доступы есть у всех, кто пользуется роутером. Полностью бесплатно, ценники выставлены сколько была бы стоимость по API в оригинале


Китайцы снова в деле 🤗

Zhipu тихо выкатил ZCode 3.0.0 — свой ответ на Claude Code и Codex. И на фоне всех этих релизов это выглядит как попытка продать вам Ferrari, но с кнопкой «бензин бесплатно».

Суть апдейта: полный переход на собственное ядро ZCode Agent. Раньше это был просто красивый UI поверх чужих моделей. Теперь — автономная система, которая сама разбирается в кодовой базе, управляет Git-коммитами и даже генерирует changelog без вашего участия.


GLM-5.2 под капотом. Контекст — 1 миллион токенов. Это примерно 300 страниц кода, которые модель держит в оперативной памяти одновременно.

Новые пользователи получают сразу два подарка: GLM Start Plan (неделя бесплатного доступа к флагманским моделям) и 150% бонус к квоте. Плюс 20 миллионов токенов при регистрации.

GLM-5.2 работает, но жрет квоту в 3 раза интенсивнее, чем GLM-4.7. В час пик — еще дороже. Фактически, вас заманивают бесплатной IDE, чтобы потом продать вам токены по подписке.

Это как раздать бесплатные бритвы, а потом продавать лезвия. Gillette бы позавидовали.


Скачать можно прямо сейчас: zcode.z.ai/cn. Только не забудьте купить токены, когда бесплатные закончатся. А они закончатся.

691 0 26 4 11

Бомба сработала 😮

Anthropic рассказывал всем, что их модель Mythos — это оружие. Слишком опасное для публичного доступа. Слишком мощное. Сами придумали класс «Mythos», сами назвали его бомбой.

В пятницу правительство США им поверило.

Commerce Secretary Говард Латник прислал гендиректору Дарио Амодеи письмо: Fable 5 и Mythos 5 теперь под экспортным контролем. Ни один иностранец не имеет права к ним прикоснуться. Вообще ни один. Даже британцы. Даже канадцы. Даже собственные сотрудники Anthropic с грин-картами.

Причина — некий «джейлбрейк». Некто под ником Pliny the Liberator выложил метод обхода защитных классификаторов Fable 5 — через multi-agent атаку, Unicode-трюки и многое другое, я проверял — работает. Заодно слил системный промпт модели на 120 000 символов.

Что делает этот «джейлбрейк»? Просит модель прочитать кодовую базу и исправить баги. Всё. Именно то, для чего модель и создавали.

Но это ещё не всё. Администрация Трампа пыталась уговорить Anthropic добровольно придержать релиз. Компания отказалась. Тогда включили экспортный контроль. Пятница, 17:21 — классика.

Теперь самое смешное. Та же администрация, которая запрещает иностранцам смотреть на Fable 5, параллельно ослабляет экспортный контроль на чипы в Китай. Марк Андриссен резюмировал лучше всех: «Снаряд лежит в здании, а люди, которые его построили, не имеют права на него смотреть».


Контекст для полной картины: в прошлом году Anthropic подписал контракт с Пентагоном — Claude должен был стать первым AI на секретных сетях. Сделка развалилась в феврале. Пентагон в ответ внёс Anthropic в список «угроз цепочке поставок» — в одну категорию с Huawei. Компания подала в суд.

А в прошлом месяце Anthropic конфиденциально подал заявку на IPO.

Гэри Маркус уже предсказывает: китайские исследователи, работающие в Anthropic и OpenAI, теперь массово вернутся в Китай. Прямо вместе с пониманием архитектуры. Гениальный способ предотвратить утечку технологий.

P.S. Сэм Альтман как-то сказал про Anthropic: «Это невероятный маркетинг — говорить, что ты построил бомбу». Теперь Министерство торговли официально подтвердило: да, это бомба. И бомба теперь лежит на складе, а ключ — только у американцев. Которые тоже не могут её запустить, потому что модель отключили вообще для всех.


Цифровой арбитраж ✨

Я зашёл на сервисы поднебесной, чтобы проверить, сколько стоят ИИ-подписки на Таобао и в китайских магазинах. Результаты выглядят привлекательно 💸

Начнём с абсурда. Xiaomi MiMo V2.5 Pro — модель уровня Claude Opus, 82 миллиарда кредитов — продаётся за ¥39. Это 400 рублей. Официально такой объём стоит $88+. Скидка в 15 раз. Довольно выгодно.

Gemini 3.1 Pro на 12 месяцев — ¥53. Официально $200. Минус 94%. За цену одного официального дня ты получаешь год доступа.

Китайские API работают по схеме «почти бесплатно». DeepSeek и Kimi K2.6 продают токены со скидкой 93-99%. Мелкие пакеты — за копейки. Крупные — стабильно в десять раз дешевле оригинала.

Западные подписки дешевле, но не настолько. Claude Pro и Sonnet — минус 85-90%. Max — минус 71%. Codex — минус 79%. GLM-5.1 — минус 65-73%.

Самая маленькая скидка у 火山引擎 Pro (даже не пробуйте, там не очень) — всего 25%. Видимо, ByteDance жёстко контролирует перепродажу.

Пользуйся, пока не закрыли. Или нет, решать вам.

Жду какой-нибудь Kimi 3 в ближайшей перспективе, который будет работать как Claude Fable 5, но без ограничений. Если кто не знал, то на китайских подписках почти нет их, ни технической, не этичной.


Видео недоступно для предпросмотра
Смотреть в Telegram
Скорость, которая опережает мысль 🐼

1000 токенов в секунду. Впервые на модели с триллионом параметров.

Xiaomi только что сломали барьер, который еще вчера считали физическим пределом. Обычные видеокарты. Просто инженерия, доведённая до абсурда.

Раньше, когда вы спрашивали нейросеть о чём-то сложном, вы ждали. Секунды, иногда минуты. Модель думала, вы нервно смотрели на thinking...

Теперь представьте: вы задаёте вопрос, а ответ появляется быстрее, чем вы успеваете моргнуть. Не один ответ — десятки вариантов, перебранных и отобранных за то же время.


Парадокс в том, что это работает только на обычных картах. Не на суперкомпьютерах, не на кастомных чипах за миллиоды долларов. На том, что стоит в дата-центрах по всему миру.

Доступ ограничен. С 9 по 23 июня, только для одобренных заявок. Бесплатный чат, но не более 10 входов в день и 30 минут за сессию. Ресурсов не хватает даже на всех желающих.

https://mimo.xiaomi.com/blog/mimo-tilert-1000tps

994 1 27 11 19
Показано 20 последних публикаций.