AI Projects


Kanal geosi va tili: Rossiya, Ruscha


Искусственный интеллект. Управление проектами. Промптинг. Vibe coding

Связанные каналы  |  Похожие каналы

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri


📊 Financial Times сделал обзор исследования Enterprise-заказчиков Anthropic на базе отчета Ramp, и он довольно любопытный.

Прежде всего видна победа CFO над девелоперами. Времена, когда можно было тратить токены на фронтирные модели Anthropic без оглядки на цену, ушли в далекое прошлое. CFO вводят жесткие финансовые лимиты по расходу на Claude для разработчиков, и это изменило их спектр потребления токенов моделей Anthropic драматическим образом.

Только 11% от корпоративных расходов по Ramp идет на Fable 5. Большинство девелоперов вынуждены использовать Opus 4.8 из-за лимитов по деньгам от CFO. Sonnet почти потерял конкурентоспособность как LLM, и его применяют примерно 10% разработчиков.

Исследование Ramp показывает, что хотя агрессивное повышение цен на Claude путем запрета фикс-тарифов даже компаний размером с булочную и дало скачок прибыли и доходов Anthropic, но они замедлились в росте значительно ниже рынка ИИ. Если брать в расходах по токенам, то Дарио сознательно пошел на потерю рыночной доли в пользу денег.

Основной инсайт тут в том, что я довольно часто на обучении еще вижу команды стартапов или банков, которые живут в реальности «США 1–2 года назад», когда владельцам компании было наплевать, сколько Claude стоит, и главное — хоть как-то втянуть девелоперов в тему ИИ-разработки. В Россию традиционно современные тенденции приходят с лагом в 1–2 года, т.е. нужно быть готовым также к тому, что финансовые директора возьмут топор и начнут рубить бюджеты на дорогие LLM самым жестким образом. Поэтому уже важно создавать экономически эффективные пайплайны с сочетанием бюджетных LLM, чтобы не оказаться у «разбитого корыта», когда придет CFO и скажет: «Я больше за эти счета на Claude платить столько не буду, вот вам лимит $XXX и крутитесь в нем как знаете».

https://www.ft.com/content/5ee49718-c258-4f01-aa32-7e5b76ae5245?syn-25a6b1a6=1


Microsoft выступил Капитаном Очевидностью против откровенного мошенничества вендоров LLM, когда они обучают ИИ на специальных агентах, чтобы выбить много «попугаев» в табличках бенчмарков, а реально выдают разработчикам совсем других агентов, которые не приближаются к показателям из бенчей.

В чём-то эту тенденцию сломал DeepSeek, который впервые стал и обучать, и тестировать LLM на своём DeepSeek Harness. Вы можете быть уверены, что в DSH эта LLM выбивает бенчи, что показывают маркетологи.

Самая большая разница тут у Anthropic с SWE-тестами типа SWE Bench. Просто там манипуляции с бенчами были такие, что Дарио решил даже раскрыть, как это делает, т.к. если бы он скрыл и его поймали, то его бы объявили мошенником. Конечно, никакого Claude Code нет там и близко. Если брать SWE Bench, то стандартное тестирование требует Zero Agent, т.е. у которого есть только Bash и средство редактирования текстового файла и ВСЁ. До DSH именно на Zero Agent и показывал бенчи DeepSeek. На деле такой сверхлёгкий агент обычно и применяется для обучения LLM, т.к. там очень критична скорость работы обвязки, чтобы суперкластер не ждал агента даже миллисекунды.

В чём разница SWE-агентов Anthropic для бенчей от Claude Code? Если почитать «статьи под звёздочкой», то там видны такие приёмы в основном:

1. Brute Force по дереву вариантов решений. Идея на деле классическая: строится Decision Tree, далее сканируются его ветки субагентами. Это работает уже 2 года для получения лидерских бенчей, но создаёт чудовищный перерасход токенов, несовместимый с нормальной эксплуатацией.

2. «Временные и изоляционные тесты». Это интересный приём, и странно, почему вендоры LLM его как-то в конечные агенты не перекладывают. Для LLM для фикса бага очень важно обрубить лишние семантические связи, т.е. изолировать его. Для этого тот же Claude обучен писать специальные «тесты на изоляцию» и другие «динамические тесты». После фикса он их удаляет. Эти тесты полностью не совпадают по логике с TDD и классикой автотестов, ну и что? Значит, надо меньше молиться на TDD и автотесты и применять передовое ИИ-тестирование, раз оно как раз работает. Что это «выглядит необычно для разработчиков» — то проблемы разработчиков: надо обучить новой технологии, а не скрывать её от них.

Но основной инсайт тут в том, что никакой оптимизации Claude на Claude Code на Reinforcement Learning нет, есть загрузки сессий на SFT, но это не то же самое, что RL-обучение, а скорее нейросеть запоминает типовые фиксы и типовое поведение. Именно запоминает, генерализует, но не понимает с той глубиной, как это на RL получается. Поэтому в новом виде бага или доработки такое обучение не сработает.

https://arxiv.org/abs/2608.17528


🤖 Несмотря на мою критику HR как отставших в массе от прогресса, следует отметить, что «в массе» не означает все. Реальные эксперты есть, конечно. Сегодня беседовал с HR от клиента, который верно заметил интуитивно, а потом и практически, что техлиды занимаются на тестировании кандидатов идиотизмом «тестовыми задачками», т.к. сам HR, который «не бум-бум» в программировании, легко их решил в DeepSeek V4 Flash. Поскольку CEO ставит задачу внедрять ИИ-разработку и для HR искать таких кандидатов тоже, коллега резонно недоумевает, в чём смысл старых схем проверки компетенций через тестовые задания, если подразумевается, что у персонала есть LLM даже мощнее DeepSeek V4 Flash.

Это действительно важный момент. Если у вас для приёма кандидатов есть тестовые задания и LLM среднего уровня их решает, то вы занимаетесь полной ахинеей, а не тестированием кандидатов. Актуальны сейчас только те задачи для тестирования, которые сложны для самих LLM. Это такие:

• Выбор между разными архитектурными решениями и паттернами как оптимальными для ИИ, а не человека (!) для конкретных задач

• Проверка, что код соответствует скрытым ожиданиям заказчика, а не только формальной спецификации

Могут быть и другие. Вопрос, как проверять кандидатов сейчас, сложный, но определённо старым тестовым задачам место в мусорке. Новые тестовые задачи должны быть с учётом того, что у инженера уже есть ИИ и насколько он умеет управлять ИИ в ходе их решения.


В Сингапуре запущен первый в мире коммерческий ЦОД на биокомпьютере на нейронах человека. Стоимость подписки — $2,200 в месяц, и клиенты на это имеются: в основном разработчики гуманоидов. Давайте разберёмся.

Сейчас в ЦОД всего 20 биокомпьютеров CL1; в каждом — 200 тыс. живых нейронов человека на чипе с электродами, которые считывают и стимулируют электрическую активность клеток. Для задач типа расчёта инференса LLM человеческие нейроны неэффективны, т.к. не имеют точности вычислений GPU.

Однако живая нейросеть умеет решать лучше GPU задачи, очень важные для гуманоидов, а именно поведение в условиях острого дефицита исходной информации: это навигация, ориентация и адаптация к новым условиям.

Для гуманоидов и автономных роботов живая нейросеть имеет преимущество экстремально низкого энергопотребления. CL1 с системами поддержки потребляет около 30 Вт, тогда как Nvidia H100 SXM при интенсивных аналогичных задачах ориентации — до 700 Вт; для сложных задач адаптации к новым условиям аналогом CL1 будет сервер с восемью H100, который потребляет 10,2 кВт.

Пока о перестановке биокомпьютеров в гуманоидов с практической точки зрения речь не идёт, но это возможная перспектива, если питание их GPU станет критическим местом. В данный момент создатели гуманоидов скорее стараются извлечь из живых нейросетей оптимальные паттерны для обработки поведения роботов и дистиллировать их в обычные нейросети. Наиболее важны тут паттерны ориентации и поведения в незнакомой обстановке.

https://www.straitstimes.com/tech/forget-silicon-chip-servers-singapores-newest-data-centre-needs-to-be-fed

2.9k 1 107 19 57

🧠 Yuntian Deng, профессор из Гарварда (Associate, Harvard SEAS; Assistant Professor, UWaterloo), ранее был известен в узких кругах экспертов своим интересным проектом ProgramAsWeights (PAW). Однако как шутку на PAW он написал перевод с естественного языка на «Клодский»:
https://programasweights.com/claudish

Между тем PAW — интересная концепция, т.к. очередной умный китаец-профессор в ИИ предложил компилировать промпты для программы не в исполняемый код, а фактически сразу в нейросеть через крошечный LoRA-адаптер примерно ~23 МБ.

Работает это так:

1. Вы пишете промпт на свободном языке, он далее обязательно должен быть переработан ИИ в псевдокод, т.к. принципиален лингвистический denoising, т.е. очистка от семантического шума болтовни «кожаных» и перевод в паттерны ИИ. Это делает обычная SLM без дообучения, главное — не промпт от человека сразу.

2. Формируются входные данные как исходный промпт, псевдокод и подготавливаются всего 64 пустых вектора-токена.

3. Специально обученная нейросеть формирует эти 64 вектора, из которых потом и собирается крошечный LoRA-адаптер для запуска локально. По факту это компиляция не в код, а в нейросеть.

Решение может делать простые вещи кроме переводов на «Клодский» язык: может чинить поломанные форматы или классифицировать источники. Причём когда готова LoRA, она может делать это на 100% локально на крошечной нейросети.

Какие тут интересные инсайты:

• Переформулировка задачи ИИ своим языком — принципиальный момент для успеха решения задачи ИИ дальше, т.к. ИИ понимает только сам себя хорошо.

• Наши задачи для программирования намного проще для ИИ, чем нам кажется, т.к. фактически для него это тюнинг классификаторов задач. Даже небольшое подпространство критериев классификации может решать огромное количество задач программирования.

• Сама по себе идея компилировать задания не в код традиционных языков программирования, а сразу в веса нейросети выглядит интересной, и там, где решения вероятностные по смыслу, то вполне рабочий подход.

Отметим, что Маск считает, что такой метод компиляции спеков (ТЗ) сразу в веса убьёт многие традиционные языки программирования и среды как минимум в мобильных приложениях.

https://arxiv.org/abs/2607.02512v1


🤖 Агенты уже расходуют в 5 раз больше токенов, чем люди запросами в чатах по данным Open Router. Конечно, там человеческие запросы искажены, но тем не менее есть разные оболочки чатов, и видно, что уровень их растёт медленно, а агенты показывают экспоненциальный рост потребления токенов.

Это говорит о том, что не только настало время агентов, но и что их автономность растёт быстрее ожиданий даже экспертов.


🤖 Дебаты вокруг ИИ и Linux, а также тот факт, что сам Линус перешёл на ИИ, уже поставили прямой вопрос о переводе ядра Linux на ИИ-разработку.
Мейнтейнеры пишут, что от «1/3 до 1/2» новых патчей сетевого кода для ядра Linux уже, вероятно, генерируются ИИ, а не людьми. «Мы полностью перегружены», — говорит мейнтейнер Linux, и считает, что с ИИ-патчами можно совладать только ИИ-ревьюеру, люди не могут обрабатывать такой пайплайн. Цукерберг уже предоставил проекту Linux ресурсы Meta, последняя его Muse довольно сильна, хотя и не самый топ, но по факту её предлагают использовать ревьюером.
 
Цель лидеров проекта Linux — «начать смещать фокус на то, чтобы позволить LLM заниматься рутинной работой — управлением patchwork, автоматизацией типичных жалоб на процессы, редактированием сообщений коммитов и, возможно, применением патчей».
 
Закат эпохи ручного программирования всё ближе, даже бастионы Linux близки к капитуляции перед натиском ИИ.


💡 Киаран Ричи (Kiaran Ritchie) — известный канадский геймдизайнер, программист, аниматор и специалист по техническому дирекшену персонажей.

Киаран Ричи — автор трёхтомного учебного пособия «The Art of Rigging». Эта серия книг и обучающих видеокурсов считается фундаментальной классикой для технических художников. Последней его известной игрой была «Rogue Islands».

Киаран делится интересным инсайтом о десакрализации кодирования. Он считает, что самое важное — архитектурный замысел и сама идея приложения, а копание в коде у него всегда вызывало отвращение как грязная, но необходимая работа для реализации его идей. Как легко догадаться, он продвигает идею, что ИИ забрал себе рутину кодирования и тестирования, а он наконец в позиции «творца».

https://x.com/kiaran_ritchie/status/2090845497624060162


В сообществе Linux вызвала большие дебаты правка Линуса Торвальдса в ядре Linux с помощью ИИ. Дело не только в его авторитете, а в том, что Линус, как и многие архитекторы, уже сравнительно давно не занимается разработкой ядра, а скорее управляет ей.
Он сейчас ревьюит код и мержит пул-реквесты от контрибьюторов. Тут Линус заметил, что ИИ снимает с него 90% чёрной работы тестирования, и действительно он сам сделал патч для ядра впервые за долгое время.
 
Однако в этом «I'll be back» есть серьёзный тренд, который обсуждают в X эксперты. Сейчас уже заметно возвращение в разработку старых именитых экспертов, которые уже много лет считают, что «кодить — это не барское дело». Однако эксперты заметили, что ИИ-боты меняют контекст и резко снижают трудоёмкость разработки и главное — тестирования, поэтому становится целесообразным переход из позиции фактически технологического менеджера в практикующего разработчика-ботовода.
 
Этот эффект может оказать заметное влияние на рынок труда сеньоров, т.к. против экспертов типа Линуса они все джуны в части понимания архитектур и критичности изменений. Поэтому часть коллег в X опасается даже «нашествия старейшин», которые, как Эмануэль Зорг из «Пятого элемента», вылезут из кресел менеджеров и решат, что «если хочешь сделать хорошо, то сделай сам [с помощью ИИ]».
 
https://github.com/torvalds/linux/commit/818bebeb63dd6bf5f4e07e145f6cdbace520a34c

3.3k 5 54 14 45

🐧 Обычно Линус Торвальдс заявляет, что использует ИИ для пет-проектов, а не для ядра Linux, но постепенно и последний из могикан сдался. Однако как он использует ИИ — достаточно любопытная практика. Линус не отказывается читать код ИИ, хотя сейчас это популярно, но он идёт дальше. Когда LLM не может найти проблему, он ищет её вместе с агентом, причём часто не соглашается с его выводами. Это довольно интересная практика, которая показывает, что даже критический код, где требуется ручной анализ, всегда можно делать с ИИ как с партнёром, но это не копилот как раньше, это скорее напоминает «парное программирование». Вероятно, для написания ядер систем и блоков кода, отвечающих за безопасность, потребуется знание программирования от разработчика, но это и не ручное программирование, и не копилот, и не автоматический агент. Это агент-партнёр как в методичках XP.

https://x.com/mark_k/status/2090842540870074806


🔒 Про «мелкий шрифт» в лицензионных соглашениях Дарио. Сам Anthropic заявлял, что не обучает прямо на ваших данных Claude, как это делает DeepSeek или Gemini на Free Tier. Однако корпоративные заказчики стали требовать прекратить хранить их данные и переложить хранение на их сервера, даже если Дарио это нужно технически.

Дарио заявил, что хранить нужно «в целях безопасности», но как раз корпоративы себя в безопасности не чувствуют и указывают Амодеи, что он нарушает обычай zero-retention, который обычен для Enterprise-заказчиков.

Фокус тут просто в том, что если вендор хранит данные, то ФБР, налоговики или другие федеральные службы могут через ордер в секретном суде к ним получить доступ и довольно быстро. Однако если вендор удаляет данные, то как в меме «нет ножек — нет мультиков», т.е. «нет данных — отдавать нечего».

В любом случае вы должны помнить: если работаете с чем-то чувствительным для Родины и отправляете это в Claude, то это не самое умное решение. Для серьёзных тем ставят ИИ локально, даже если это в 10 раз дороже.

https://www.bloomberg.com/news/articles/2026-08-20/anthropic-plans-to-change-data-retention-policy-for-advanced-ai


На OpenRouter появилась бесплатная Stealth-модель Ox Alpha, которая по бенчмаркам кодирования бьёт Fable и GPT-5.6 Sol. Вероятно, это новая версия GLM.

Известный эксперт Бен Дэвис прогнал скрытую модель через DeepSWE (сейчас считается самым реалистичным и сложным для разработки). Она набрала более 80%, против 65% у Fable и 52% у GPT-5.6 Sol. Дэвис говорит, что довольно уверен — это модель GLM-5.x, ссылаясь на совпадающий видеоэнкодер, токенизатор, стиль ответов и поведение при попытках джейлбрейка.

Хотя скорость бесплатной модели 20–30 токенов/сек, но дареному коню в зубы не смотрят. Как минимум для code review и проверки спеков запускать её можно.


🚩 Financial Times пишет, что экспортный IT-сектор Индии фактически разрушен ИИ и официальная статистика с падением акций индийских ИТ компаний не отражает масштаба кризиса и безработицы. Ранее активно Индия продавала труд дешёвых кодеров, которые правда имели репутацию бракоделов. Тем не менее, многие компании готовы были идти на риски качества для экономии бюджетов. Однако как появились ИИ-боты, то сразу выяснилось, что от них намного меньше проблем, чем от индийских ИТ-крестьян, а стоят LLM дешевле.

В чём-то мы на примере Индии видим, где именно в ИТ создаёт ИИ угрозу рабочим местам — низкоквалифицированный или неопытный персонал. Ранее индус или джун могли работодателю предъявить аргумент низкой цены за низкое качество, но сейчас этот аргумент растворился.

https://www.ft.com/content/dee4bd2c-fbad-4713-9b14-22d441967ce4?syn-25a6b1a6=1

4.3k 4 137 11 47

📊 Arena довольно корректно Pareto-диаграммой показывает факт, что сформировались фактически 2 лиги по цене/качеству. Первая около 1680 баллов Эло — это фронтиры или «модели-думатели». Из них самый дешёвый Qwen 3.8 Max. Конечно, зависит от области применения, но если брать научные исследования, то эта модель уехала в какой-то космос от остальных.

Второй эшелон — это worker-модели или «модели-делатели» с рейтингом около 1590 баллов Эло. Несмотря на повышение цен, DeepSeek V4 Flash тут господствует дешевизной, при этом выдерживает планку качества для своей ниши.


Tencent выпустил интересные локальные модели для перевода Hy-MT2-1.8B и Hy-MT2-30B-A3B. Они поддерживают перевод на 33 языка, но что важно — там нативная поддержка русского и казахского языков. Наши «православные модели» обычно слабые и как раз делают акцент, что у них специальное обучение на русский, но тут братья-китайцы зашли на эту поляну, и что-то мне подсказывает, что русский у китайцев будет работать лучше, т.к. обычно всё лучше работает нашей кулибинщины. Для Казахстана нативная поддержка национального языка также довольно важный момент, т.к. местных проектов почти нет.
https://huggingface.co/tencent/Hy-MT2-30B-A3B/blob/950da628cfc4f1ecaf24f86475425c3a858db5d8/README.md


🚀 DeepSeek наконец официально разродился мультимодальной моделью.
DeepSeek-V4-Flash-Vision-Exp теперь доступен через API. Также DeepSeek обновил DeepSeek Harness до 0.1.1 для поддержки модели «из коробки».

По бенчам мультимодальных агентов DeepSeek V4 Flash Vision близок к Opus-4.8. Однако скорее всего модель должна заметно прирасти и на разработке фронтов, т.к. китайцы сейчас учат мультимодальные модели «нативно», т.е. сразу на смеси визуальных данных типа скриншотов и эскизов UI с кодом. Тут нужно подождать Arena для оценки.

Подключается так:
model='deepseek-v4-flash-vision-exp'


Чтобы понять, насколько выше скорость развития ИИ по сравнению с традиционными IT-технологиями, стоит вспомнить Закон Мура для старого IT: он гласит, что мощность старых IT-систем удваивается примерно за 2 года. Скорость потребления физлицами и компаниями токенов на OpenRouter удваивается каждые 11 недель.

🚀 Пристегнитесь, это только начало входа в ИИ-прогресс. Впереди ещё полная «ИИ-сингулярность», когда на 100% автоматически ИИ будет делать своё следующее поколение. Хотя Альтман считает, что мы уже в ИИ-сингулярность как минимум частично вошли.


🤖 IPO производителя роботов-гуманоидов Unitree Robotics прошло сенсационно. Инвесторы полностью верят, что гуманоиды в ближайшем будущем начнут заменять рабочих. Цена акций в ходе торгов прыгала на 600% и стабилизировалась на 460%, что дает капитализацию Unitree более $50 миллиардов долларов, т.к. компания по гуманоидам стала дороже Газпрома за 1 день. Надо еще отметить, что это торги на Шанхайской бирже, где традиционно регуляторы сбивают ажиотаж инвесторов, подобный раздуванию NASDAQ. Правительство КНР считает, что это опасно «пузырем», и блокирует многих инвесторов. Поэтому $50 миллиардов — крайне сдержанная оценка, на NASDAQ она была бы кратно выше, если бы китайцы разрешали продавать «национальное достояние».

Основатель компании Ван Синсин за один день разбогател до $16 миллиардов долларов.

Довольно очевидно, что вера инвесторов в то, что гуманоиды — не игрушка, а начнут заменять рабочих, крепка. Впрочем, для Китая это новость разве что для стройки, где ждут гуманоидов. «Темные фабрики» КНР, где свет выключен, т.к. там на 100% работают роботы, существуют уже давно. Гуманоиды скорее важны там, где нужны мобильные рабочие на сложной площадке, как строительная, или где много ремонтов и других нетиповых операций.

https://www.theguardian.com/technology/2026/aug/19/unitree-shares-surge-humanoid-robot-firm-chinese-stock-market-debut


🤖 Просили в комментариях, как промптить наши слабые «Православные ИИ». На самом деле с ними работают универсальные техники просто для прокачивания слабых GPT, хотя есть особенности.

Ещё год назад я мог заставить GigaChat или YandexGPT решать задачи resource leveling, которые штатно для них были «космические».

Особенность GigaChat — слабый dataset на pretraining для «планов». Обычно топовые вендоры LLM генерируют миллионы планов агентов и пихают в base-модель и на SFT. Технически модель легко обучается им и это решает массу проблем «отсутствия мозгов», в том числе у SLM. Проблема GigaChat, что он обучен планированию как агент ещё хуже современных SLM около 27B параметров. Однако это можно исправить и не очень сложно во многих случаях.

Вам нужно просто сгенерировать в нормальной фронтирной LLM целый Knowledge Base по планам разных типов и просто загружать их по задаче. Это почти «внешний CoT». Правда лучше брать не Claude и не Grok как на скрине, хотя это работает, а китайцев, из которых GigaChat дистиллируют, т.е. Qwen и DeepSeek. Поскольку они более родственные через дистилляцию, то их промпты в GigaChat зайдут лучше.

Интересный аспект, что с GigaChat часто срабатывает просто нормальный step-by-step промпт от фронтирной модели даже без few shots. Иными словами, модель не такая уж тупая, как кажется, но просто плохо обученная планированию действий как агент, поэтому план надо «подкладывать».

Если GigaChat сбивается на выполнении многошагового плана по KB, тогда нужно применять средство воспитания слабых моделей как Structured Output. Просите шаги плана и наполнение инструментов оформить через JSON. Сам по себе Structured Output насильно загоняет LLM в прокрустово ложе схемы просто фильтрацией логитов. Полученный JSON уже алгоритмически разбираете и выполняете. Код просто можно в том же DeepSeek написать для этого.


Маск заявил, что в MedAgentBench Стэнфорда Grok занял первое место. Правда, онлайн-сайта для теста нет, чтобы покрутить результаты. Есть другой тест MAST — там в лидерах GPT-5.6 Sol и следом Kimi K3. Основная проблема с медицинскими бенчмарками в том, что они тестируют не все LLM и относительно открыты.

Даже если и заниматься медицинскими консультациями с ИИ, то нельзя тут доверять ни одному Grok 4.6 или GPT-5.6 Sol. Кроме проблемы галлюцинаций, модели в медицине в реале строят гипотезы, которые по смыслу имеют вероятность ошибочности. Поэтому в медицинской диагностике точно нужно собирать «ансамбль» из разных LLM и консолидировать ответы, чтобы понять, где консенсус всех ИИ и это довольно надёжно, а где дискуссионные вещи. Это хорошая практика в любом анализе, но там, где life-critical, это обязательно, поэтому вопрос об одной «лучшей медицинской LLM» сам по себе ошибочен как сценарий эксплуатации.

https://www.arise-ai.org/mast

20 ta oxirgi post ko‘rsatilgan.