Postlar filtri


Deepseek выкатил мультимодальную модель!

deepseek-v4-flash-vision-exp – принимает картинки вместе с текстом: описание изображений, чтение скриншотов, анализ графиков.
По тексту (агенты, reasoning, знания) – на уровне обычного V4-Flash, а на мультимодальных агентских бенчмарках – большой скачок, близко к Opus 4.8
Картинка стоит максимум 384 токена – всё, что больше ~800×800, сжимается до этого размера. 2000×2000 и 5000×5000 съедят одинаково
– тарификация – по ценам V4-Flash: при $0.14/1M input это ~18 тысяч изображений на доллар (в off-peak часы – вдвое дешевле)
– до 600 изображений в одном запросе, форматы JPEG/PNG/GIF/WebP, есть Files API для переиспользования
– работает через три интерфейса сразу: OpenAI Chat Completions, Responses API и Anthropic-совместимый /messages

Короче, надо пробовать. Стоит как обычно копейки вообще. Должна быть сильна и в обработке документов, и в обработке графики (кроме совсем уж плотных текстов)

https://api-docs.deepseek.com/news/news260821/


Воруем рассуждения модели

Вот еще интересное от подписчика: свежая исследовательская работа про довольно сильную проблему безопасности моделей. Сайт, кстати, довольно красиво сделанный.

Суть: когда Claude, GPT или Gemini думают, API возвращает вам зашифрованный блок рассуждений, который вы отправляете обратно в следующем запросе. Так вот, этот блок переносимый. Берём трейс от сильной модели (Opus), подсовываем его слабой модели того же провайдера (Haiku), просим «перепиши, что приложено к этому ходу» – и получаем сырое рассуждение Opus текстом. При этом анти-дистилляционные защиты не срабатывают.

Что они с этим сделали:
– проверили на 120 задачах Codeforces – длина декодированного текста почти один в один совпадает с числом скрытых thinking-токенов, то есть достают практически всё, а не огрызки
– собрали 6 708 публичных агентских трейсов с GitHub и Hugging Face, где остались зашифрованные блоки – и декодировали 315 320 рассуждений
– в реальных пользовательских сессиях нашли 704 утечки: 62 API-ключа, 33 пароля, 24 токена доступа, 30 личных email, имена, адреса, внутренние URL. Пу-пу-пу...
– 64 из них были только внутри рассуждений и нигде в видимой части сессии.

Короче, если вы логируете или выкладываете энкриптед трейсы куда-нибудь – вы выкладываете всё, что хоть как-нибудь попадало в разговор. Проверьте свои репозитории и датасеты прямо сейчас.

И прикол еще, что сами провайдеры годами продавали «мы прячем reasoning ради безопасности и защиты от дистилляции». Оказалось, что все это вскрывается просто на раз... Интересно, сколько времени займёт патч и не будут ли вообще убирать все.

https://stolen-thoughts.com/

UPD: уже пофиксили


Как сейлзы Anthropic используют AI

Очень показательные кейсы про область, про которую мало пишут. AI в продажах (как обработке входящих заявок, так и всяких там холодных звонков/писем-линкединов). Выложил Джон Альберт – как их команда business development живёт внутри Claude Cowork. Типа год назад тратил ~5 часов в день на разбор входящих в sales-inbox и отвечал на одни и те же вопросы. Теперь почти всё это – скиллы и расписанные по таймеру задачи.

Что у них крутится:
– База знаний. Документ с типовыми вопросами клиентов и лучшими ответами. Клод сам его собрал из продуктовых доков и каналов, сам же периодически помечает, что устарело. Без этого документа ничего дальше не работает.
– Inbox-скилл. Раз в час сканирует почту, находит треды, где нужен ответ, и оставляет черновики. Внутри – тонкий системный промпт, база знаний как контекст и профиль стиля конкретного сейлза (его отдельный voice-скилл собирает из писем и документов человека).
– Ночной прогон по всей книге аккаунтов (их у него 100+). Клод ходит в Salesforce, Apollo, Common Room, Gong и их data warehouse, проверяет сигналы против ICP и утром выдаёт по каждому аккаунту бриф, скор и outbound-план, чего кому написать. Ведёт небольшой memory-файл, чтобы не делать одно и то же дважды.
– Pipeline-скиллы: сверяет стадии сделок в Salesforce с тем, что реально происходит в Gmail и Gong, и предлагает апдейт с доказательствами – но только предлагает, человек апрувит. Если отклонил – записывает причину, чтобы не повторять.
– Мелочь, но приятная: скилл ловит no-show на встречи и «ушедших в тень» клиентов; другой раз в несколько часов берёт новые лиды из CRM и пишет первое касание.
– Call-coach: разбирает транскрипты Gong против плейбука discovery-звонков – три плюса, три минуса, pass/fail и одна вещь, которую тренировать дальше. Прикольно, что они используют дорогущий гонг вместо своих агентов :)

И ещё набор разовых запросов без скиллов: дашборд по usage аккаунта «в один промпт», поиск "скрытого использования" (уже пользуются продуктом, а сделки в CRM нет), подбор аккаунтов под вебинар по ICP.

Основные советы для компаний, что только начинают: сначала база знаний, потом воркфлоу; давать Клоду примеры того, как работает команда, а не абстрактные инструкции; человек на проверке каждой отправке; фидбек записывать обратно в скилл.

Ну и да, показательна нормальная архитектура: хороший адаптированный промпт + курируемый контекст, регулярно обновляемый, + память об ошибках + человек на кнопке «отправить», а не "фабрика агентов". Короче, нормальный контекст и самоусиливающая обратная связь. Супер-полезно конечно такие вещи читать не от всяких блогеров.

https://claude.com/blog/how-anthropics-business-development-team-uses-claude-to-run-inbound-and-outbound-at-scale




OpenAI выпустила ChatGPT для подростков

Прикольно, OpenAI запустила отдельный режим для пользователей 13–17 лет. Попадают туда автоматически: либо человек сам указал возраст, либо система по поведению решила, что перед ней несовершеннолетний. Это, получается, такой отдельный продукт со своим онбордингом.

В целом молодцы, пофиксили все основные проблемы с читерингом домашки :)
– Study Mode по умолчанию + «responsible homework reminders» – модель распознаёт попытку просто списать домашку и разворачивает диалог в пошаговый разбор;
– Study Hours – расписание, когда учебный режим включается сам; ставит подросток или родитель;
– квизы и визуализации для математики и естественных наук;
– родительский контроль: Quiet Hours, часть настроек аккаунта, уведомления в высокорисковых ситуациях;
– напоминания о перерывах и предупреждение при загрузке личных фото;
– партнёрство с CodeAI – про то, как учить подростков понимать и проверять AI, а не просто им пользоваться.

Плюс там отдельный харнес (under-18 model spec). Там теперь запрещена не только романтика: модель не должна использовать романтический язык, поощрять эмоциональную зависимость и намекать, что у неё есть чувства или сознание.

Переключаем подростков? )
https://openai.com/index/chatgpt-for-teens/

2k 3 61 5 17

Speko – OpenRouter для голосового AI

Вчера попался интересный проект, который как-то хотел сделать сам :)
Ребята из стартапа YCombinator сделали один API, за которым 60+ голосовых моделей, и роутер, который сам выбирает лучшую под язык и задачу.

Что внутри:
– 61 модель и 10 языков в бенчмарке; на платформе 16 STT, 16 LLM и 17 TTS. Русского в бенчмарках нет, есть европейские и индийские (сразу видно, откуда фаундеры), но можно самому потестить все модели (в списках есть все сотня языков)
– говорите «оптимизируй под точность / задержку / цену», указываете язык и регион – роутер сам подбирает модель и в ответе честно пишет, кого позвал
– 1 ключ, API совместим с OpenAI, из коробки заводится в LiveKit и Pipecat, есть TS, Python и MCP
– тарифы: +5% к прайсу провайдера за роутинг либо $0.09/мин all-in за весь стек STT+LLM+TTS. На старте дают $100 кредитов, то есть можно обпробоваться по полной и потом если что уйти к исходным провайдерам
– сам шлюз выложен в опенсорс под MIT – можно поднять у себя

Но самое конечно интересное - поковыряться в бенчмарках :)
https://benchmarks.speko.ai/

Пишут, что на 9 языках чтобы быть в топе надо использовать 4 разные модели (согласен с этим, аналогично было для перевода текстов у intento).

Надергал вам скриншотов оттуда, куча данных для сравнения. Практически везде лучшие результаты не у популярных моделей, а у например qwen ASR или inworld, так что сравнивайте обязательно.

Ещё пара фактов оттуда же: 95% продовых голосовых систем до сих пор каскадные (STT → LLM → TTS), а не end-to-end. Ну собственно поэтому они и делают сравнение 3 разных подсистем, а не end2end (за что им прилетело кстати на hackernews).

Еще из прикольного - сравнение в реальном времени или на файлах. Вот например можете проверить всех провайдеров, которые заявляют русский - https://benchmarks.speko.ai/compare/stt?lang=ru&scenario=ru-support
Советую! Будут крайне неожиданные результаты чаще всего :)

Короче, очень понравился сайт. Прям кладезь инфы и тестов про голосовые модели.

https://speko.ai


Сколько на самом деле стоит сессия в Claude Code – разбор от Anthropic

Интересный пост от Anthropic с полезными советами, как экономить токены в Claude Code.

Как устроена цена токена
Запрос проходит через GPU в две фазы. Prefill – модель читает весь контекст (системный промпт, CLAUDE.md, ваше сообщение, все файлы и выводы команд). Decode – модель пишет ответ, по одному токену за раз: ответ на 200 токенов – это 200 прогонов модели подряд. Поэтому output стоит примерно 5x от input.
Дальше кэш. Если запрос начинается с тех же токенов, что и предыдущий, сервер не пересчитывает состояние, а достаёт из кэша – это 0.1x от цены input. Запись в кэш дороже (до 2x), но пишется один раз, а читается на каждом ходу. Claude Code управляет кэшем сам, но его легко сломать:
– /model посреди разговора – у каждой модели свой кэш, весь разговор перечитывается по полной цене (opusplan, кстати, переключает модель при каждом входе-выходе из plan mode)
– /effort – уровень усилий тоже часть ключа кэша, та же история
– Fast mode – включайте в начале сессии, ре-префилл идёт по ценам fast mode; выключение обратно бесплатно
– время – кэш живёт час на подписке и 5 минут на API-ключе (ENABLE_PROMPT_CACHING_1H=1 растягивает до часа); вернулись после обеда – платите за перечитывание всего разговора

Почему длинные сессии дорогие
Ничего не отправляется один раз. Каждый прочитанный файл и вывод каждой команды переотправляются на каждом последующем ходу до конца сессии. Ход №40 тащит с собой все 39 предыдущих. Кэш делает это дешёвым, но дешёвое – не бесплатное, плюс модель вынуждена думать поверх мусора.

Отсюда практика:
– начинайте новую задачу со свежим контекстом, с /clear

– старайтесь всякие команды использовать с минимальным выводом (не просто чтение каждой строчки файла выдавать)

– будьте конкретными. «Тесты падают» вместо «почини тест в @utils.test.ts» – это grep, несколько открытых файлов, и всё это висит в контексте до конца сессии. @упоминание вообще убирает Read-вызов: файл прикрепляется к сообщению до отправки

– вывод больше 30 000 символов Claude Code сам уносит в файл и оставляет превью. Проблема – всё, что меньше: тест-раннер с 400 строками passing tests влезает под лимит и остаётся навсегда.

– /context в свежей сессии показывает, что загружено до того, как вы напечатали хоть слово – CLAUDE.md, определения MCP-инструментов. Можно проверить заранее. Ненужный MCP-сервер отключается через /mcp

– /rewind вместо /compact, если надо отрезать последние неудачные ходы – бесплатно, кэш до них цел. /compact переписывает весь разговор и всегда что-то стоит, причём до перерыва сильно дешевле, чем после (пока старый разговор ещё в кэше), поэтому прежде чем пойдете попить чайку - сделайте /compact.

Сабагенты - отдельный контекст со своим системным промптом, но без вашего разговора. Обратно возвращается только ответ, всё остальное выбрасывается. Для мелких задач – лишние траты (сабагент перечитывает то, что основная сессия уже знала). Окупается на задачах с большим выхлопом – разбор логов, например. Можно дать шумной задаче своё определение сабагента с model: haiku, иначе она крутится на модели основной сессии.

https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Google превратил таблицы в мини-приложения

Очень прикольная штука. Новая фича в Google Sheets, которая по текстовому промпту превращает строки и столбцы в интерактивные «мини-аппы». Пишешь «сделай визуальный трекер учёбы» – Gemini собирает интерфейс поверх твоих данных.

Прикольно, что оно синхронное, правишь в canvas – обновляется sheet, и наоборот.
Все правишь промптами. Живет как отдельная вкладка, но шарится со всеми людьми без ограничений каких-нибудь "опасных скриптов".
Пока доступна только если выбран английский в Google AI Pro и Ultra и раскатывается на Workspace Business/Enterprise Standard и Plus

Примеры от Google: трекер дедлайнов для студентов, дашборд для fantasy football, рассадка гостей на свадьбе с drag-and-drop. Смотрите видос, выглядит прям здорово.

Я думаю это прям большой подарок для любителей экселек. Теперь они (или их коллеги) могут из всего этого сделать целые приложения.

https://blog.google/products-and-platforms/products/workspace/sheets-canvas-for-google-sheets-spreadsheets/


Как корпорации на самом деле используют ChatGPT – большое исследование OpenAI

Большое хорошее исследование OpenAI вместе с Columbia и Wharton. Про реальное использование ИИ-шек в компания. Связали внутренние данные ChatGPT Enterprise с должностями сотрудников, автоматической классификацией задач и финансами публичных компаний из Compustat. Это первый настолько детальный взгляд на реальное использование, а не презентации красивые и блоги: 1 764 организации, 17,4 млн сообщений, плюс подвыборка из 973 компаний с 8,7 млн классифицированных сообщений по 60 категориям задач.

Затраты:
– Закупка токенов у Enterprise-клиентов выросла в 7 раз с июня 2025 по март 2026
– Внутри когорты компаний, подключившихся до июня 2025, рост в 4 раза – то есть примерно половина всего роста происходит внутри уже существующих клиентов, а не за счёт новых
– В начале 2026 ускорение случилось одновременно во всех когортах – похоже, дело в самом продукте и рынке, а не в естественном созревании клиентов. Ну я согласен, в начале января модели вообще нереально прокачались.

Кто внедряет:
– Адоптеры радикально крупнее: медианная выручка $2,3 млрд против $210 млн, персонал 2 934 против 424 человек, R&D $113 млн против $10 млн
– Компании из топ-25% по выручке внедряют на 6,9 п.п. чаще, из топ-5% – на 9,8 п.п. Внутри своей отрасли эффект ещё сильнее: до 11,3 п.п.
– Выручка на сотрудника – значимый предиктор внедрения, то есть там где инновации и вклад людей именно двигает выручку. А вот капиталоёмкость (PP&E на сотрудника) работает в минус: заводы с большими основными фондами внедряют реже
– Кто годами вкладывался в процессы, инновации и софт, тот и внедряет AI первым. Классическая история про general purpose technology: сама по себе технология мало что даёт без доп.перестройки
– Крупные внедряют чаще, но использование на сотрудника у них ниже. Купить на всех проще, чем заставить всех пользоваться. Согласен на 100%. Все эти "мы купили Клод на 200 сотрудников, мы AI-first" - это полная чушь )

Кто пользуется внутри компаний
– Использование размазано по всем функциям: инженеры – 11% недельной активной аудитории в средней компании, топы и партнёры – 9%, финансы и маркетинг – по 5%
– По интенсивности картина другая: больше всех сообщений пишут аналитики и маркетинг, меньше всех – руководители и финансисты
– Джуны и стажёры отправляют на 8–9 сообщений в неделю больше среднего пользователя своей же компании. Чем выше должность, тем меньше сообщений. Ну тут 2 момента: во-первых, джуны пытаются переложить свое незнание на ИИ (и это так себе тренд), а во-вторых, быстрее адаптируют технологии (и я это тоже замечают, когда синьоры до сих пор иногда фыркают или пытаются читать строки каждого коммита ИИ)

Что делают:
– 56% активных пользователей за неделю хотя бы раз делают документацию и техтексты, 50% – техническую/цифровую работу, 41% – переписку, 39% – обзоры тем
– По объёму сообщений концентрация выше: документация 18,3%, техработа 12,7%, переписка 11,9%. При этом 27,3% сообщений – длинный хвост из десятков мелких категорий, не влезающих в топ-12
– Отраслевая специфика есть, но на удивление скромная: финансисты чаще делают налогово-финансовые задачи, ритейл и медиа – продажи и маркетинг. Но ядро (тексты, техработа, коммуникация) одинаковое везде, и по объёму сообщений отрасли почти не отличаются
– У руководителей свой профиль: относительно больше обзоров тем, юридических и финансовых вопросов – меньше «производственных» задач

Короче, мы в самом начале. Все пока барахтаются. Доступ к одной и той же модели не даёт одинакового результата – ценность возникает там, где компания перестраивает процессы, обучает людей и находит свои use cases. Это ровно та работа, которую покупка лицензий не заменяет.

Но при этом если лидеры с накопленными процессами и экспертизой внедряют раньше и глубже, AI может не сократить, а увеличить разрыв в производительности между лидерами и остальными – при формально равном доступе к технологии. Короче, всякие гиганты не дремлют, мелким надо бежать в 2 раза быстрее...

https://cdn.openai.com/pdf/how-organizations-use-chatgpt.pdf


И Zhipu туда же с GLM-5.3

Модель та же, что у 5.2 (~743B MoE), весь прирост из улучшения и масштабирования post-training. Она и раньше была рабочей лошадкой (особенно учитывая, что ее могли хостить все подряд, в том числе Мистраль вот стал делать для "суверенных ИИ Европы" вместо того, чтобы пытаться дообучать че-то там), а теперь стало еще более выгодно. Короче, кодинг, обработка, аналитика, математика - гораздо лучше.

Весов пока нет, только в API и в GLM Coding Plan. Короче, Яндекс и Сбер скоро станут умнее.

https://z.ai/blog/glm-5.3


Claude в Chrome теперь – это Cowork

Прикольно, сделали полноценную рабочую сессию. То есть разговор, начатый в браузере, продолжается в десктопе и на мобильном, работают skills и коннекторы. Claude видит страницу, кликает, заполняет формы под вашими логинами. Кстати в Codex немного кривые чаты, но они синхронизировались уже, Клод догоняет.

Главный сценарий – системы без API: внутренние дашборды, legacy, порталы вендоров. Честно говоря все больше этим пользуюсь. Буквально сегодня получал сертификат из реестра компаний с помощью ИИ-шек. А уж настройка всяких гуглоклаудов и Ажуров (чего терпеть не могу) - милое дело. Главное - проверить план перед запуском.

Теперь вообще можно так: собрал инвойсы из кабинетов поставщиков в таблицу в браузере – докрутил её в десктопе с локальными файлами. Эт тоже прям мой юзкейс :)

Видос: https://youtu.be/C-5wF6tkQ2Q?is=7K-bw55ZAu62Zrxf

Про prompt injection пишут честно: риск снижен, но не убран. Добавили проверку действий – перед отправкой формы или скачиванием файла система сверяет действие с исходной задачей.

Доступно на Max и Team, Pro – в ближайшие недели.

Для компаний с зоопарком старых систем это дешевле, чем писать коннекторы.

https://claude.com/blog/cowork-chrome-side-panel


Google выкатил Gemini 3.7 Flash

Их прорвало что ли? Или летние нагрузки меньшие освободили GPU для тренинга?

– Цена не изменилась: $0.75 / $3.75 за 1M токенов. Для сравнения: Claude Sonnet 5 – $2 / $10, GPT-5.6 Terra – $2 / $12 (он типа круче Луны) То есть Flash в 2.5–3 раза дешевле конкурентов. Но это промо-цена до конца 2026. С января – $1.50 / $7.50. Хах, тут каждые 2 недели выходят новые модели, а они рассказывают, что будет через 5 месяцев :)
– FrontierCode 43.6% – лучший результат среди всех, включая Sonnet 5 и GPT-5.6. Огоняет флагманы конкурентов в production-коде
– AutomationBench (автоматизация enterprise-процессов): 30.4% против 10.7% у Sonnet 5
– Длинный контекст: 97% на MRCR при 128k.
– Понимание PDF (GDP.pdf): 34% – тоже лучший результат, хотя абсолютные цифры показывают, что до "решённой задачи" всем ещё далеко

Слабые места тоже есть: агентские задачи (Terminal-bench 3.0, OSWorld) – GPT-5.6 заметно впереди, а в знаниевой работе (GDPVal) лидирует Muse Spark.

Короче, перейти с 3.5/3.6 наверное стоит после тестов, для больших доков, обработок и кодовых баз должно быть норм.

https://deepmind.google/models/model-cards/gemini-3-7-flash/


DeepSeek V4 Pro 0813 вышел.

Ждал бенчмарков и цен новых. Выглядит довольно неплохо, но с новыми ценами уже чуууть уступает GPT-5.6 Luna, а если не видно разницы и модель от OpenAI доступа из каждого утюга, то смысла как будто нет.

В целом увеличение не такое страшное. Примерно в 1,5-2,5 раза. Кэш - больше подорожал, но он и стоил вообще копейки. В пиковое время все еще в 2 раза выше. Пик - это китайский пик, то есть по Кипру/Москве - 4-7 утра и 9-13 утра. Короче, до обеда не работать с deepseek :)

https://artificialanalysis.ai/models/deepseek-v4-pro


Хах, новый компактный Qwen завтра:
https://huggingface.co/Qwen/Qwen3.8-27B

С Qwen связан один прикол. Тестировал разные модели для извлечения данных в закрытой системе (никакими облачными провайдерами без DPA не за тыщщу миллионов пользоваться нельзя, нужны "суверенные модели" со всякими zero data retention или хостинг на своих серверах). Компания европейская и соответственно я попробовал все, что хвалится своей безопасностью и "умом" от европейских провайдеров и лабораторий на английском, французском и немецком языках.
Так вот Qwen3.6-35B-A3B за копейки порвал всех просто в клочья... То есть китайские модели лучше работают на европейских языках, чем европейские :)


ChatGPT снова сбросил лимиты :) Было в субботу, во вторник и вот сегодня. Ощущение, что лучшая тактика - за пару дней вычистить все, перейти на Claude, подождать сброса, снова потратить все

2k 2 23 11 14

Grok 4.6 вышел

Главный фокус – долгоживущие агенты и интерактивная/визуальная работа: модель должна держать задачу на много шагов, а не выдавать один хороший ответ.

– AA Intelligence Index: 61 против 56 у Grok 4.5. Это ровно уровень GPT-5.6 Sol Max (61) и почти Fable 5 Max (62). Скачок за месяц серьёзный. Прикольно, что в табличке в скриншоте не боятся показывать бенчмарки, на которых не занимают 1 места. Сейчас все в тройке, но при этом цена вообще мизерная - $2 / $6 за 1M токенов, есть fast-вариант вдвое дороже. Первую неделю – 2x включённого лимита в Grok Build и Cursor.
– Доступ сразу везде: Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare.
– Тренировали интересно: Grok 4.5 использовали, чтобы перегенерировать SFT-траектории для 4.6, а мусорные трейсы отфильтровали модельными проверками. Модель учит модель.

В кодинге пока чуть отстает, а вот в работе белых воротничков - лидер: GDPval-AA v2 — 1753 (у Fable 1741, у GPT 1728), AA-Briefcase – 1577, и особенно Harvey LAB на юридических задачах: 15.8% против 11.3% у Fable и 2.5% у GPT-5.6. Разрыв в шесть раз.

Кажется это сейчас лучший вариант для длинных агентов над документами и офисной работой: разбор договоров, заявок, отчётности.

x.ai/news/grok-4-6

16 ta oxirgi post ko‘rsatilgan.