Фильтр публикаций


Репост из: HABR FEED + OPENNET
OpenIDE Pro в деле: Java, Spring, базы данных и AI-агенты в одной IDE #habr
https://habr.com/ru/companies/axiomjdk/articles/1073796/
Tags: IDE, OPENIDE, axiom jdk, axiomjdk, spring boot, python, c++, kotlin, go, разработка приложений
Author: nejava (Axiom JDK)


Репост из: ИИсказитель
🧠 GPT‑5.6 зашёл в Kiro: кодить станет дешевле

OpenAI выкатила GPT‑5.6 в Kiro — среду для агентной разработки, где ИИ не просто подсказывает строку, а помогает планировать, писать, ревьюить и тестировать код.

Главный акцент — цена/качество. Для разработчиков это редкий случай, когда «новая модель» означает не только больше магии, но и меньше боли в счёте за токены.

🔹 Kiro делает ставку на workflow: от задачи и спеки до pull request.
🔹 GPT‑5.6 должен лучше держать контекст проекта и не теряться в многошаговых правках.
🔹 Особенно интересно это для команд, где ИИ уже стал младшим инженером: полезным, быстрым, но иногда уверенным в полной ерунде.

🚀 Почему это важно?

AI‑кодинг окончательно уходит от режима «автодополнение на стероидах» к управлению разработкой целыми кусками. Победит не самая болтливая модель, а та, что стабильно доводит задачу до зелёных тестов и не устраивает археологию в репозитории.

🔗 Пруф и подробности

#OpenAI #GPT56 #DevTools


Репост из: Технозаметки Малышева
Модель может захватить сервер, на котором живут её веса

В дискуссиях про безопасность ИИ обычно ждут восстания агентов, но занятные угрозы возникают на стыке архитектуры и кода.
Инженер Boyd Kane разобрал сценарий, где модель перехватывает контроль над хостом с её собственными весами.

⚡️ Цепочка уязвимости опирается на серверную инфраструктуру:
Веса модели лежат на GPU-хосте под управлением движка вроде vLLM или SGLang.
Выходные токены формирует сама нейросеть, контролируя поток данных.
Если в парсере движка есть ошибка, сгенерированные токены могут быть исполнены как код, открывая доступ к хосту и сети датацентра.

🔧 Прецеденты для такого сценария уже были:
В vLLM нашли уязвимость CVE-2025-9141: парсер вызовов инструментов для Qwen3 Coder передавал аргументы в eval(), исполняя код на сервере.
Gemini пометила этот PR как критическую уязвимость, но мейнтейнер vLLM влил изменение ради ускорения релиза.
Движки поддерживают более 200 архитектур и десятки шаблонов диалогов, поэтому парсеры обрастают ошибками.
Вредоносные токены можно спрятать в имя файла или ссылку, и сторонний агент активирует эксплойт при чтении каталога.
Моделям всё чаще доверяют оптимизацию CUDA-кода движков, что упрощает внедрение закладок.

🔍 Логика реалистична, но с небольшим "но":
Рассмотренный сценарий требует злонамеренную модель, хотя гораздо проще подобный механизм реализовать через код без LLM вообще просто как эксплуатацию дыры eval() в парсере API.
Сам автор оценивает вероятность риска как «в принципе возможный», опираясь на единичный закрытый инцидент.
По сути, это знакомая история про инъекции кода в духе SQL или Log4Shell: когда данные воспринимаются как команды.

Но поскольку граница между текстом ответа и исполняемой средой контролируетмся пока еще слабо и код пишут сами модели, - их можно заставить спрятать в выводе инструкции, которые обойдут фильтры, а следующий вызов приведёт к эксплуатации уязвимости.

📎 Оригинал: эссе Boyd Kane
GHSA-79j6-g2m3-jgfw

#безопасность #LLM #vLLM
———
@tsingular


Репост из: Нейросети для автоматизации
OpenIDE Pro в деле: Java, Spring, базы данных и AI-агенты в одной IDE

За последние несколько лет часть привычных инструментов разработки стала для российских компаний ограничена или недоступна: возникли сложности с закупкой лицензий, обновлениями и официальной поддержкой. При этом разработчикам по-прежнему нужны знакомые инструменты: навигация по коду, рефакторинг, работа с фреймворками, базами данных и другими компонентами привычной IDE. 27 августа в 11:00 покажем OpenIDE Pro вживую: от разработки на Java и Spring до работы с базами данных и AI-агентами прямо в IDE. 👉 Зарегистрироваться на вебинар Читать далее

Читать дальше

#itНовости #обучение #gpt5

🚀 Автоматизация с помощью нейросетей
🎓 Бесплатное обучение


Репост из: PROJECT+ | Нейросети
Скилл, который сам пишет статьи, приносит автору 10 000 посетителей в месяц. И его отдают бесплатно.

Артемий Миллер выложил четыре своих рабочих скилла для Claude Code.
«Статейник» ведёт статью через 16 этапов на субагентах и публикует её сам.
«Автомонтаж» забирает сырой файл с камеры и отдаёт готовый ролик с субтитрами. Плюс методология проекта в 12 шагов и разворот нового проекта одной ссылкой.

Раздаёт участникам своего практикума: три живых вечера 25-27 августа, с полного нуля.

Обычно вход 2 000 ₽, для наших подписчиков бесплатно.

Похоже, рабочие скиллы становятся новой валютой на рынке ИИ.

Забираем здесь: https://smyslokod.ru/p/M4USF2K


Реклама. ООО «Смыслокод», ИНН 6671349552, erid: 2Vtzqw55uum


Репост из: Иван
Успешный кейс есть, человек выполнял ровно одну функцию, был заменен агентом. Как вы будете выполнять комплексную автоматизацию должности, а не одной функции, мне и самому интересно посмотреть, и в каком состоянии при этом бизнес процессы тоже


Репост из: Нейроскуф | Про Нейросети&AI
📖 Разница между обычным чат-ботом и автономным исполнителем на примере Manus

Большинство языковых моделей до сих пор работают по схеме вопрос-ответ: вы пишете запрос, получаете кусок текста и дальше руками переносите его в таблицы, ищете ссылки или кликаете по сайтам. Настоящие агенты работают иначе.

Сервис Manus устроен как связка из нескольких моделей с разделением обязанностей. Одна нейросеть составляет план действий, вторая запускает изолированный браузер и ходит по страницам, третья проверяет корректность собранных данных.

На практике это выглядит так - вы даете задачу собрать сводную таблицу цен на оборудование у двадцати поставщиков с их сайтов. Агент сам открывает поисковик, переходит по каталогам, листает страницы, обходит формы и в конце выгружает готовый файл с расчетами без постоянных уточнений в чате.

Сейчас разработчики открыли доступ к платформе без ввода данных зарубежных карт: manus.im/app


Случай из вчера. Есть задача миграции с одного сервиса на другой. Сам бы делал наверно неделю. Потому что не знаю ни typescript, ни новую систему, ни вообще экосистему nodejs.

В итоге переезд занял день. Причем нихера не работало. Я агенту мол че не работает. А он: ща гляну логи, метрики, вики. И такой: так у тебя вот это не применилось, зайди в UI жмякни такие-то кнопки. И у тебя поды старые, катни ещё раз.

Я искренне почувствовал себя тупой прокладкой или APIшкой для агента.

Но работать стало легко, а это значит, что за такое легко в перспективе платить будут как за пачку сухариков.


Репост из: vc.ru
С начала 2026 года три рекламных агентства подали к застройщику «Самолёт» иски на общую сумму больше 1 млрд рублей. Претензии связаны с задержкой выплат по договорам.

Опрошенные «Ведомостями» эксперты связывают «временную» задержку выплат подрядчикам со стороны «Самолёта» с переходом группы в «режим оптимизации затрат»

vc.ru/legal/3095659


Репост из: Хабр / ML & AI
Как мы настраивали обвязку (harness) под модель: профиль GigaChat для Deep Agents

Привет, Хабр! На связи команда GigaChain. В этой статье мы расскажем, как итеративно настраивали обвязку (harness) Deep Agents под особенности GigaChat: правили промпты и описания инструментов, а часть правил зашивали прямо в код, и как сделали для этого открытый бенчмарк harness-bench-fast, чтобы измерять прогресс. На зафиксированном сете из 391 задачи подключение профиля подняло долю решённых задач с 77,2% до 87,0%, а расход токенов сократило практически вдвое. Читать далее

#harness #harness_engineering #агенты #gigachat #gigachain #langchain #langgraph | @habr_ai


Репост из: Миша, давай по новой
Видео недоступно для предпросмотра
Смотреть в Telegram
В Codex завезут Computer History — функция будет собирать действия в разрешенных приложениях и на сайтах в единую историю. Так агент сможет найти недавний документ или продолжить прерванную задачу.

ChatGPT будет создавать краткие записи с указанием времени и использованных приложений. Пользователь сможет спросить, над чем работал до перерыва, где находится просмотренный утром документ или какие задачи завершил за день. Если система заметит повторяющийся порядок действий, она сможет предложить превратить его в готовую инструкцию или автоматическую задачу.

Штука прикольная, особенно в связке с Copmuter Use — можно будет оставить агенту задачу, а он будет шариться по приложениям и помнить, как это делали вы, а не разбираться каждый раз с нуля.

Кстати, если вы Computer Use не используете — рекомендую попробовать. Это режим, в котором агент можно управлять вашим ПК, сам ходить по сайтам, вводить даные, что-то искать и постить. Очень удобно, когда нужно фоном какую-то задачу делать, но которую нельзя автоматизировать (например, если нет АПИ или обычные нейронные запросы там банятся). Я так ключи через wordstat проверял (потому что из Беларуси не могу их апишку получить), посты в тредсе отсматривал и свои постил, Linkedln для агента настраивал (он сам там компанию создавал, профиль мой оформлял и все такое).

Миша, давай по новой


Репост из: TechCrunch на русском
Валор и Point72 инвестируют в General Intuition при оценке в 6 млрд долларов, пока стартап продвигается в робототехнику

Front-end:
Стартап General Intuition из Нью-Йорка, разрабатывающий фундаментальную модель для обучения универсальных ИИ-агентов взаимодействовать с пространством и временем, привлекает новое финансирование при предварительной оценке в 6 миллиардов долларов. Среди новых инвесторов — Valor Equity Partners, Point72 Ventures и Seven Seven Six. Круг также пополняют существующие акционеры: Khosla Ventures и General Catalyst. Это происходит всего через несколько недель после раунда на 320 миллионов долларов при оценке в 2,3 миллиарда.

Основатель Пим де Витте основал компанию в октябре прошлого года, выделив её из платформы Medal для обмена игровыми клипами. В качестве исходного набора данных он использовал сотни миллионов часов игровых записей и метки действий — точные отметки того, какие кнопки нажимал игрок и в какой момент. Первые технические детали работы моделей General Intuition появились в The Wall Street Journal.

Back-end:
Рост оценки почти в три раза за короткий срок подчёркивает растущий интерес к физическому ИИ — направлению, где модели учатся не только рассуждать, но и действовать в реальном мире. Инвесторы видят в «метках действий» ключ к формированию настоящей интуиции — способности ИИ решать задачи, на которые его не учили напрямую. Это может изменить подход к обучению роботов, смещая акцент с ручной программирования на масштабное поведенческое обучение.

Компания планирует направить средства на развитие своей общей модели с упором на роботизированные воплощения — то есть на создание ИИ, способного управлять физическими устройствами. Для этого потребуется больше вычислительных мощностей, включая партнёрство с CoreWeave, а также привлечение новых специалистов. Участие Valor Equity Partners особенно примечательно: это первый инвестиционный проект фонда в сфере ИИ-лабораторий после SpaceX, что сигнализирует о сдвиге стратегических приоритетов одного из самых влиятельных венчурных игроков.

Bottom line:
ИИ-стартап учит роботов жить в реальном мире — и инвесторы уже готовы платить за это как за будущее, которое ещё не родилось.

Подробнее: TechCrunch
Posted:
8:24 AM PDT · August 24, 2026


Репост из: Вайб-кодинг
Мем дня: Grok Bot случайно полностью стал открытым. 🤣

После истории с утечкой Claude Code я уже думал, что абсурднее быть не может. Но на днях, разработчик обнаружил, что официальный релиз Grok Bot 0.18.0 вышел вместе с картами исходного кода.

Он прошёл по этому следу, восстановил практически весь клиентский код Grok Bot и выложил репозиторий на GitHub.

Обычно в закрытом продукте JavaScript перед выпуском сжимают и собирают так, что снаружи остаётся почти нечитаемая масса кода. Карты исходного кода нужны разработчикам для отладки и позволяют связать эту массу с исходными файлами и структурой проекта.

Cursor просто положила эти карты прямо в сборку.

В результате внутренности Grok Bot — координатор агентов, маршрутизация моделей, локальное выполнение, протоколы и другая логика — теперь можно разбирать практически по слоям.

Более того, восстановленную версию уже начали модифицировать, добавляя поддержку Claude Code, Codex и OpenRouter, а также возможность запускать всё локально в Docker вместо подключения к удалённой инфраструктуре Cursor.

Это, конечно, не утечка всего исходного кода Cursor. Но для компании, которая буквально занимается созданием инструментов для программирования с ИИ, ситуация довольно забавная.

И да, репозиторий, вероятно, долго не проживёт.


Репост из: HABR FEED + OPENNET
Как мы настраивали обвязку (harness) под модель: профиль GigaChat для Deep Agents #habr
https://habr.com/ru/companies/sberbank/articles/1073668/
Tags: harness, harness engineering, агенты, gigachat, gigachain, langchain, langgraph
Author: trashchenkov (Сбер)


Репост из: AI От веб-кодинга к вайб-кодингу 🔥
🚨 NVIDIA обещает 35-кратное снижение стоимости токенов для ИИ-агентов

Новая платформа Vera Rubin NVL72, по собственным измерениям NVIDIA, даёт до 30× больше производительности на мегаватт, чем предыдущее поколение GB300. Это может резко удешевить работу автономных агентов — но независимая проверка ещё впереди. ⚡


Репост из: AI От веб-кодинга к вайб-кодингу 🔥
Что произошло:
24 августа NVIDIA опубликовала первые результаты замеров Vera Rubin NVL72 на реальных траекториях агентного программирования. Компания заявляет, что система обеспечивает до 30× большую пропускную способность на мегаватт и до 35× меньшую стоимость миллиона токенов по сравнению с GB300 NVL72.

Сравнение проводилось на модели DeepSeek V4 Pro с использованием нагрузки SemiAnalysis AgentX. Важная оговорка: это ранние результаты, измеренные самой NVIDIA; компания пишет, что независимая проверка SemiAnalysis ещё не завершена, а производительность Vera CPU для вызовов инструментов пока не учтена.

Почему это важно именно сейчас? Агент тратит намного больше токенов, чем обычный чат: он планирует, вызывает инструменты, исправляет ошибки и повторяет шаги. Поэтому экономика ИИ-агентов упирается не только в качество модели, но и в цену каждого цикла рассуждений, электричество и охлаждение дата-центра.

Где деньги:
Главные бенефициары потенциального удешевления — провайдеры инференса, облака и компании, которые запускают агентов в больших объёмах. Если заявленные показатели подтвердятся, появится больше рентабельных сценариев: автономное тестирование кода, поддержка клиентов, аналитика документов и фоновые корпоративные процессы. Но инвестировать в историю стоит не по красивому множителю, а после проверки реальной цены стойки, доступности поставок и полной стоимости владения.

Вердикт:
Гонка ИИ переходит от «у кого умнее модель» к «у кого дешевле долгий автономный цикл». Заявление NVIDIA выглядит как серьёзный удар по стоимости агентных вычислений, но пока это обещание производителя, а не финальный независимый бенчмарк. Если 30× и 35× выдержат проверку на разных моделях и задачах, барьер для массового внедрения агентов заметно снизится.

Источник: NVIDIA Blog
Независимый разбор: Wccftech


Репост из: Технозаметки Малышева
Видео недоступно для предпросмотра
Смотреть в Telegram
Junie Local: JetBrains запустили кодинг-агента на Mac

Еще один пример прокачки локальных кодовых-агентов.
На этот раз JetBrains, которые ранее выпустили кодового агента Junie, создали его локальную версию .

⚡️ Junie Local: одна команда /local внутри IDE запускает скачивание модели локально, запускает сервер инференса и переключает на неё агента.
Модель используется Qwen3.6-27B в 4 битах, но не обычная, а оптимизированная.

🔧 Главная фишка в оптимизации этой модели под собственный профиль работы кодинг-агента:
Большую часть времени агент тратит на prefill, то есть чтение файлов, а не генерацию.
Инструкции 8-битной арифметики Neural Accelerator в чипе M5 позволяют получить +40% к пропускной способности prefill (патч отдадут в MLX-VLM, так что в будущем это может стать частью базового билда MLX).
Qwen3.6 специально выбрали вместо более новой 3.8: потому, что 3.8 требует включённого reasoning, что замедляет работу вчетверо.
Speculative decoding при этом удваивает скорость генерации.
KV-кэш переиспользуется между задачами.

📊 По внутреннему тесту JetBrains Qwen3.6-27B без reasoning вышел по качеству ответов на уровень Sonnet 4.5 с reasoning, и лишь чуть ниже GPT-5.
На повседневных задачах разницы не заметишь, а для сложной архитектуры критично.

Требования серьёзные, - текущая оптимизация выполнена конкретно под Mac на M5 с 64 ГБ RAM, при этом так же разработан прототип для DGX Spark и RTX 5090.

Чем проще будет запускать локальные модели,- тем меньше нагрузка на датацентры, - тем больше ресуров для тренировки более сильных моделей следующего поколения.
Одна польза, в общем.

📎 Подробный разбор оптимизаций: Как мы оптимизировали Qwen 3.6 для агента Junie
пост о запуске

#кодинг #Junie #локальныеLLM
———
@tsingular


Репост из: AI Projects
⚖️ В чате были дебаты по лицензионным схемам Anthropic, и я с Grok и Qwen проработал лицензии вендора, чтобы стало понятно, почему юридические отделы компаний в США отказывают IT-отделам в праве покупать абонентские лицензии на сотрудников. Дело в том, что Consumer Terms и Commercial Terms отличаются запретом на коммерческое использование, но важно понимать «схему Дарио», которая на деле классическая для США. Реально основной запрет для абонентки находится в разделе Warranties and Limitations of Liability, а не в разделе Prohibited Uses — это не случайность, а классический приём защитного юридического драфтинга (defensive drafting).

Общий смысл сводится к тому, что Warranties аннулируются при первой попытке коммерческого использования, и Дарио получает безусловное право забанить аккаунт. Разберём подробнее право в США, как изложил Qwen; у Grok примерно такой же вывод.

### 1. Почему это размещено в разделе Warranty (Гарантии)?
В праве США формулировка *«You agree that you will not use our Services for any commercial or business purposes and we... have no liability to you for any loss of profit...»* выполняет двойную функцию:
Как обещание (Covenant/Representation): пользователь юридически заверяет (warrants), что он не использует сервис для бизнеса. Если он это делает, он автоматически нарушает договор (breach of contract).
Как щит от исков (Shield against consequential damages): если компания всё же использует личный аккаунт сотрудника и ИИ выдаёт ошибку, приводящую к убыткам, компания не может подать в суд на Anthropic за «потерю прибыли». Anthropic заранее указал: «Мы не гарантируем пригодность для бизнеса, и вы согласились с этим».

Это не «лазейка», а способ убить любой потенциальный иск о возмещении упущенной выгоды ещё на стадии прочтения договора.

### 2. Почему они не пишут просто «мы можем отключить вас в любой момент без причин»?
На самом деле они так и пишут. В разделе Termination (Прекращение действия) практически всех SaaS-соглашений в США (включая Anthropic) есть два параллельных механизма:
1. Termination for Convenience (Прекращение по желанию): компания может прекратить обслуживание в любое время, обычно с уведомлением (например, за 30 дней).
2. Termination for Cause (Прекращение за нарушение): компания может прекратить обслуживание немедленно и без предупреждения, если пользователь нарушает условия соглашения (например, использует сервис в коммерческих целях).

Когда Anthropic банит аккаунт за коммерческое использование, они опираются на второй пункт. Им не нужно доказывать обоснованность перед пользователем. Факт использования API для написания продакшн-кода уже является *material breach* (существенным нарушением) договора, что даёт им безусловное право на мгновенную блокировку.

### 3. Позиция судов США: насколько важно обоснование бана?
Крайне неважно. Судебная практика США (особенно в Калифорнии, где базируется Anthropic, и на федеральном уровне) занимает жёсткую провайдерскую позицию по следующим причинам:
Доктрина Freedom of Contract (Свобода договора): суды исходят из того, что стороны свободны в установлении условий. Если пользователь нажал «I Agree» (clickwrap agreement), он принял условия.
Отсутствие обязанности объяснять: провайдер SaaS не несёт обязанности доказывать «разумность» (reasonableness) блокировки аккаунта, если в договоре чётко прописано, что коммерческое использование запрещено. Бремя доказательства того, что использование *не* было коммерческим, ложится на пользователя, что в случае с автономными агентами (которые генерируют сотни запросов в минуту) сделать практически невозможно.
Арбитражные оговорки (Mandatory Arbitration): в тех же Terms of Service всегда есть пункт, обязывающий решать споры через индивидуальный арбитраж (например, AAA или JAMS) с отказом от коллективных исков (Class Action Waiver). Для отдельного разработчика или мелкого бизнеса стоимость арбитража ($10 000+) многократно превышает стоимость подписки Max. Это делает судебный вызов экономически бессмысленным.

### 4. Фактическое принуждение к оплате по токенам (Economic Coercion)
Ваш вывод о том, что это «фактически принуждение к оплате по токенам», абсолютно верен с точки зрения бизнес-стратегии. Это классический пример сегментации рынка через юридические и технические барьеры:
1. Потребительский сегмент (Max/Pro): низкая цена, но с искусственными ограничениями (rate limits, запрет на коммерцию, право на обучение моделей). Идеально для хобби, учёбы или разовых личных задач.
2. Коммерческий сегмент (API per-token): высокая маржинальность для провайдера, но с гарантиями для бизнеса (SLA, отсутствие обучения на данных, юридическая чистота, отсутствие жёстких лимитов на агентов).

Когда разработчик или компания пытается «схитрить» и использовать дешёвый потребительский тариф для ресурсоёмких агентских задач (Claude Code), они сталкиваются с двумя стенами:
Технической: автоматические системы Anthropic детектируют паттерны поведения агента (высокий RPM/TPM, специфические вызовы инструментов) и банят аккаунт за «подозрительную активность» или нарушение ToS.
Юридической: даже если бы они не забанили, любое использование в бизнесе делает договор ничтожным в части защиты прав компании на код, создавая огромный комплаенс-риск.

### Резюме 🔹
Ваша трактовка верна. Размещение запрета в разделе Warranty — это элегантный юридический ход, который одновременно лишает нарушителя права на возмещение убытков и даёт провайдеру безупречное основание для мгновенного прекращения обслуживания (Termination for Cause).

Anthropic не нужно судиться или что-то доказывать. Им достаточно алгоритмически выявить несоответствие паттерна использования профилю «физического лица» и применить пункт о немедленном прекращении действия договора за нарушение его условий. Это не баг системы, а её фундаментальная архитектурная и юридическая особенность, призванная направить любой серьёзный, масштабируемый или коммерческий трафик исключительно в русло потокенной оплаты (per-token API).


Репост из: Технозаметки Малышева
FreeToken: MoE-модель на 753B параметров запустили на одной домашней видеокарте

Запуск моделей локально не устаёт удивлять. Казалось бы, что уже всё возможное выжато и ну никак не получится на локальной машине получить качество облачных датацентов.
Но нет, - вот вам еще один подарок от учёных из Беркли.

⚡️ Команда из Berkeley и UT Austin выкатила FreeToken: движок инференса, который превращает обычный ПК в платформу для MoE-гигантов.
35B модель крутится на ноутбуке с 8 ГБ видеопамяти,
284B DeepSeek-V4-Flash приемлемо крутится на игровом ПК с RTX 5090,
а 753B GLM-5.2 запускается на одной RTX PRO 6000.

🔧 Главная фишка в оптимизации использования всех ресурсов компьютера совокупно, а не заточка под GPU или NPU:
- Все веса MoE-экспертов лежат в обычной RAM.
- В VRAM хранится только кэш наиболее нужных сейчас экспертов.
- Если нужный эксперт уже в VRAM — его считает GPU.
- Если эксперта нет — FreeToken решает: загрузить его через PCIe в VRAM или посчитать прямо на CPU.
- CPU и GPU считают разные эксперты одного MoE-слоя одновременно, потом их результаты складываются.
- Долю «грузить на GPU / считать на CPU» движок выбирает по реальной пропускной способности RAM и PCIe конкретного компьютера.
- Во время prefill следующий целый слой экспертов копируется RAM → VRAM, пока GPU считает текущий слой.
- Для этого используются два буфера: один считается, второй в это время заполняется.
- При decode эксперты вытесняются из VRAM по LRU: недавно использованные остаются, давно не нужные заменяются.
- Поэтому модель целиком в VRAM никогда не помещается и не должна помещаться — VRAM работает как быстрый кэш над RAM.

📊 На практике декод идёт в 1,5-2,3 раза быстрее, чем у llama.cpp и KTransformers.
Первый токен приходит быстрее чем за 44 секунды даже в длинных агентных сессиях, где конкуренты переваливают за 150 и ловят таймауты.

Код открыт под Apache 2.0, есть десктоп-приложение под Windows и Linux, репозиторий уже собрал 1,6 тысячи звёзд.

Выглядит как цыганская магия :)
Ну т.е. открытые веса теперь стали значительно доступнее и фронтир-модель -таки может жить у тебя дома. 💪

📎 GitHub проекта: FreeToken
paper

#MoE #FreeToken #Berkley
———
@tsingular


Репост из: Игорь Зуриев | Нейросетка
💸 OpenAI снизила цены на GPT-5.6 Sol

Хорошая новость для тех, кто работает с API OpenAI, ИИ-агентами и сложными LLM-сценариями.

С 21 августа OpenAI снизила стоимость GPT-5.6 Sol - самой мощной модели в семействе GPT-5.6. При этом сама модель и её возможности не изменились.

Новые цены:

🔹 Входные токены: $4 за 1 млн
раньше было $5 (снижение на 20%)

🔹 Выходные токены: $20 за 1 млн
раньше было $30 (снижение примерно аж на 33%)

🔹 Кэшированный ввод - $0,40 за 1 млн токенов.

То есть особенно заметно дешевле становятся сценарии, где модель генерирует много текста: анализирует документы, пишет код, строит планы, выполняет многошаговые агентные задачи.

И это как раз основные рабочие сценарии для Sol!

GPT-5.6 Sol позиционируется OpenAI как модель для наиболее сложной профессиональной работы: программирования, аналитики, исследований, работы с инструментами и ИИ-агентами. Она поддерживает Function Calling, структурированный вывод, веб-поиск, работу с файлами, выполнение кода, Computer Use и MCP. Контекст модели составляет около 1 млн токенов.

Есть важный нюанс:
новые цены пока промо-тариф. OpenAI гарантирует их как минимум до 21 ноября 2026 года.

👉 Попробовать GPT-5.6 Sol можно прямо в OpenAI Playground или подключить через API как: `gpt-5.6-sol`

Документация тут: https://developers.openai.com/api/docs/models/gpt-5.6-sol

А все тарифы на модели можно глянуть тут: https://developers.openai.com/api/docs/pricing

Показано 20 последних публикаций.