AI Projects


Гео и язык канала: Россия, Русский
Категория: Другое


Искусственный интеллект. Управление проектами. Промптинг. Vibe coding

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Другое
Статистика
Фильтр публикаций


Любопытный ещё конструкт Дарио в лицензии Anthropic. Если заметили, то "non-commercial" упоминается там дважды. В Warranties покупатель "заверяет Anthropic", что использование абонентки не будет в коммерческих целях.

Но в преамбуле это ещё раз.

Evaluation and Additional Services. In some cases, we may permit you to evaluate our Services for a limited time or with limited functionality. Use of our Services for evaluation purposes are for your personal, non-commercial use only.

Это не тавтология, конечно, а дело в том, что Дарио запрещает на абонентке даже тестировать корпоративные решения (!). Это и есть основной смысл Evaluate и главная целевая аудитория этого запрета, а не какие-то триалы, которые выдаёт Anthropic. Фактически Дарио требует от корпоратов связаться с его сейлами и заплатить за тестирование его продуктов, правда он может дать скидку на этап тестирования, но на абонентках запрещается и коммерческое использование, и даже тестирование корпоративных систем, которые ещё не эксплуатируются.


⚖️ В чате были дебаты по лицензионным схемам Anthropic, и я с Grok и Qwen проработал лицензии вендора, чтобы стало понятно, почему юридические отделы компаний в США отказывают IT-отделам в праве покупать абонентские лицензии на сотрудников. Дело в том, что Consumer Terms и Commercial Terms отличаются запретом на коммерческое использование, но важно понимать «схему Дарио», которая на деле классическая для США. Реально основной запрет для абонентки находится в разделе Warranties and Limitations of Liability, а не в разделе Prohibited Uses — это не случайность, а классический приём защитного юридического драфтинга (defensive drafting).

Общий смысл сводится к тому, что Warranties аннулируются при первой попытке коммерческого использования, и Дарио получает безусловное право забанить аккаунт. Разберём подробнее право в США, как изложил Qwen; у Grok примерно такой же вывод.

### 1. Почему это размещено в разделе Warranty (Гарантии)?
В праве США формулировка *«You agree that you will not use our Services for any commercial or business purposes and we... have no liability to you for any loss of profit...»* выполняет двойную функцию:
Как обещание (Covenant/Representation): пользователь юридически заверяет (warrants), что он не использует сервис для бизнеса. Если он это делает, он автоматически нарушает договор (breach of contract).
Как щит от исков (Shield against consequential damages): если компания всё же использует личный аккаунт сотрудника и ИИ выдаёт ошибку, приводящую к убыткам, компания не может подать в суд на Anthropic за «потерю прибыли». Anthropic заранее указал: «Мы не гарантируем пригодность для бизнеса, и вы согласились с этим».

Это не «лазейка», а способ убить любой потенциальный иск о возмещении упущенной выгоды ещё на стадии прочтения договора.

### 2. Почему они не пишут просто «мы можем отключить вас в любой момент без причин»?
На самом деле они так и пишут. В разделе Termination (Прекращение действия) практически всех SaaS-соглашений в США (включая Anthropic) есть два параллельных механизма:
1. Termination for Convenience (Прекращение по желанию): компания может прекратить обслуживание в любое время, обычно с уведомлением (например, за 30 дней).
2. Termination for Cause (Прекращение за нарушение): компания может прекратить обслуживание немедленно и без предупреждения, если пользователь нарушает условия соглашения (например, использует сервис в коммерческих целях).

Когда Anthropic банит аккаунт за коммерческое использование, они опираются на второй пункт. Им не нужно доказывать обоснованность перед пользователем. Факт использования API для написания продакшн-кода уже является *material breach* (существенным нарушением) договора, что даёт им безусловное право на мгновенную блокировку.

### 3. Позиция судов США: насколько важно обоснование бана?
Крайне неважно. Судебная практика США (особенно в Калифорнии, где базируется Anthropic, и на федеральном уровне) занимает жёсткую провайдерскую позицию по следующим причинам:
Доктрина Freedom of Contract (Свобода договора): суды исходят из того, что стороны свободны в установлении условий. Если пользователь нажал «I Agree» (clickwrap agreement), он принял условия.
Отсутствие обязанности объяснять: провайдер SaaS не несёт обязанности доказывать «разумность» (reasonableness) блокировки аккаунта, если в договоре чётко прописано, что коммерческое использование запрещено. Бремя доказательства того, что использование *не* было коммерческим, ложится на пользователя, что в случае с автономными агентами (которые генерируют сотни запросов в минуту) сделать практически невозможно.
Арбитражные оговорки (Mandatory Arbitration): в тех же Terms of Service всегда есть пункт, обязывающий решать споры через индивидуальный арбитраж (например, AAA или JAMS) с отказом от коллективных исков (Class Action Waiver). Для отдельного разработчика или мелкого бизнеса стоимость арбитража ($10 000+) многократно превышает стоимость подписки Max. Это делает судебный вызов экономически бессмысленным.

### 4. Фактическое принуждение к оплате по токенам (Economic Coercion)
Ваш вывод о том, что это «фактически принуждение к оплате по токенам», абсолютно верен с точки зрения бизнес-стратегии. Это классический пример сегментации рынка через юридические и технические барьеры:
1. Потребительский сегмент (Max/Pro): низкая цена, но с искусственными ограничениями (rate limits, запрет на коммерцию, право на обучение моделей). Идеально для хобби, учёбы или разовых личных задач.
2. Коммерческий сегмент (API per-token): высокая маржинальность для провайдера, но с гарантиями для бизнеса (SLA, отсутствие обучения на данных, юридическая чистота, отсутствие жёстких лимитов на агентов).

Когда разработчик или компания пытается «схитрить» и использовать дешёвый потребительский тариф для ресурсоёмких агентских задач (Claude Code), они сталкиваются с двумя стенами:
Технической: автоматические системы Anthropic детектируют паттерны поведения агента (высокий RPM/TPM, специфические вызовы инструментов) и банят аккаунт за «подозрительную активность» или нарушение ToS.
Юридической: даже если бы они не забанили, любое использование в бизнесе делает договор ничтожным в части защиты прав компании на код, создавая огромный комплаенс-риск.

### Резюме 🔹
Ваша трактовка верна. Размещение запрета в разделе Warranty — это элегантный юридический ход, который одновременно лишает нарушителя права на возмещение убытков и даёт провайдеру безупречное основание для мгновенного прекращения обслуживания (Termination for Cause).

Anthropic не нужно судиться или что-то доказывать. Им достаточно алгоритмически выявить несоответствие паттерна использования профилю «физического лица» и применить пункт о немедленном прекращении действия договора за нарушение его условий. Это не баг системы, а её фундаментальная архитектурная и юридическая особенность, призванная направить любой серьёзный, масштабируемый или коммерческий трафик исключительно в русло потокенной оплаты (per-token API).


💡 Резонный вопрос: сколько нужно VRAM для запуска Qwen3.8-27B локально.

Я уже писал, что NVFP4-квантизация при профессиональном, а не любительском исполнении почти не даёт деградации в качестве. В случае такой квантизации DeepSeek её вообще нет по тестам Nvidia практически, но это не для «NVFP4 от кухарок» — профессиональная квантизация сложная штука.

Unsloth как раз профессионалы, но их подход в том, что лучше не трогать критические слои квантизацией, поэтому они сошлись на том, что 23.4 GB на веса оптимально.

На 50к токенов вам потребуется примерно 3 ГБ ещё на KV Cache. Экономичность тут за счёт гибрида State и GPT-моделей, который мы уже часто видим в блестящем исполнении от китайцев. Также сделан и Kimi K3.

State-модель лучше помнит важные понятия в большом контексте, она нативно умеет передумывать. Если агентский сценарий подразумевает «эволюцию состояния», то такая модель нативно это поддерживает. Собственно, выдающийся результат Qwen3.8-27B в агентских тестах и связан со State-технологией, которую китайцы уже хорошо освоили и внедрили — тут они технологические лидеры.

https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4


В экспертном сообществе уже обсуждают, в каком плане Дарио говорил, что китайцы отстают от Anthropic на «6 месяцев». Вероятно, он имел в виду, что китайцы могут превзойти фронтир Claude Opus в 27B весах через 6 месяцев — что сейчас и получилось.

Однако крайне интересное наблюдение за моделью — очень мощные результаты в престижном юридическом бенчмарке Harvey's Legal Agent. Модель Qwen3.8-27B там опередила Claude Opus 4.8. Это доказывает, что Qwen3.8-27B — не просто мощная кодирующая модель, а проявление более широкого понятия: это мощная агентская модель. Это видно и по агентским тестам типа DeepSWE, где большой прирост.

Тем не менее, для тех, кто работает с корпоративными документами и облако неприемлемо по соображениям безопасности, очень хорошая новость: по работе с разными договорами и регламентами Qwen3.8-27B примерно уровня Claude Opus всего 6 месяцев назад.

Вероятно, Alibaba родила хитовую SLM для умных RAG-агентов.

https://www.orcarouter.ai/blog/qwen-3-8-27b-benchmarks#the-first-independent-result-1-open-weight-on-harvey-s-legal-agent-benchmark


Qwen3.8-27B выступил на Arena сенсационно, подтвердив ранее невероятные бенчмарки, что он сильнее Claude Opus 4.6 Max, которой всего-то полгода от роду. Важно, что модель выступила очень ровно с рейтингом примерно 1600 баллов в разных категориях, а в общем чате в Expert выступила с 1503 балла, что лучше гигантских фронтиров Google и Meta. Иными словами, для SLM модель показывает невероятный баланс и явно не заточена на бенчмарки, т.к. были бы тогда где-то просадки, а не «ровное выступление».

Теперь становится всё более очевидно, что на нейросетях около 25-30B весов китайцами будут уже стабильно поставляться кодирующие модели на уровне фронтиров Anthropic, OpenAI, Google и Meta. Это «чудо» объясняется просто. Для Reinforcement Learning не требуется американская гигантомания LLM с «энциклопедическими знаниями» в 3-5T весов. Тема RL просто структурирует веса больше, а не их число.

В объёме весов около 30B помещаются стеки JavaScript, React, HTML и Python с их классическими библиотеками. Поэтому у всех ИТ-директоров должен чётко взяться приоритет на эти AI Friendly стеки, т.к. в случае ужесточения политик к доступу к облачным LLM как вендорами, так и Правительством придётся пересаживаться на локальные китайские модели. При большем числе разработчиков запуск даже компактной DeepSeek V4 Flash может быть проблемой с учётом ограничений на закупки GPU.

Сейчас нужно сокращать стеки, которые не AI Friendly как 1С или не проходящие по тестам в такой SLM библиотеки даже под React или Python. Сейчас оптимально «Золотой ИИ стек» начать внедрять хоть как-то, чтобы быть уверенным, что «План Б» на случай отключения ИИ-облаков в рабочем состоянии. Очевидно, что обычное формотворчество и разработку/проведение тестов стоит переводить на Qwen3.8-27B, как минимум проверять совместимость пайплайна с ним.


⚠️ Я заметил, что в чате у нас многие разработчики, которые пользуются Claude по фикс-тарифам, мыслят в torrent-логике: если им удаётся нарушать лицензию вендора с запретом применения тарифов для подписки для бизнес-задач, то всё ок. Вопрос в том, что обычно средний программист просто не видит, что тут делает вендор при нарушениях, т.к. не с ним ведутся потом разговоры. Также тут есть недооценка Anthropic по техническим возможностям противодействия нарушениям его лицензий. У нас в чате есть коллеги из EPAM, которые уже 2 года создают нейросети, чтобы как раз и ловить «особо хитрых», и для них делают нейросетки «с винтом». Они просто не пишут в чате, а читают, но я поясню, что примерно они продают заказчикам из anti-fraud.

1. Лицензионный аспект и обычный «эффект иглы»

Текущая EULA для фикс-тарифов у Дарио полностью запрещает коммерческое применение: «Use of our Services for evaluation purposes are for your personal, non-commercial use only.». Все абонентские подписки — максимум для персональных пет-проектов, даже фрилансерам фактически запрещено через абонентки Anthropic делать приложения под заказ.

Далее тут есть очень серьёзная «ошибка выжившего» у разработчиков, которые предполагают, что вендор, заметив их нарушения лицензии, сразу побежит их банить или судиться. По опыту разборок Microsoft с пиратами изнутри него самого отмечу, что это глубочайшее заблуждение. Вас сначала в «книжечку запишут» и будут ждать, пока вы тем самым местом поглубже не подсядете «на иглу», т.к. вендор сначала ждёт, пока вы, нарушая его лицензию, не дойдёте до состояния, когда уже не сможете без серьёзного повреждения бизнеса от него отказаться. Также ему нужен побольше масштаб нарушений, т.к. «орёл не ловит мух». Microsoft будет ждать, пока наивный девелопер не создаст rollout решения на 100+ пользователей, вот после этого и отправляется уже банда юристов и применяются технические меры, которые ранее были в режиме «наблюдателя».

Поэтому если у вас бизнес в США или ЕС хоть филиалом, то все эти шашни с нарушением EULA закончатся на масштабировании письмом от Дарио «С ВАС N МИЛЛИОНОВ БАКСОВ, ЗАВТРА!» и он пойдёт в суд. Из России это блокировка международного бизнеса, но технический бан получить легко.

2. Нейросеть-сканнер Anthropic всё про вас знает, просто ей не сказали «ФАС!»

Если посмотреть решения EPAM по anti-fraud и добавить, что Дарио хранит ваш контекст 30 дней, то 99%, что он знает, что вы нарушаете лицензию. Просто см. п.1: вендор просто ждёт масштаба нарушений, и ИИ-боту дано указание оценивать «клиент уже на игле или нет?». Пока нейросеть говорит «они могут нас легко сменить на DeepSeek или Qwen» или «пока одиночка и мелочь», то команды ФАС нет. Однако вы точно должны понимать, что вы курица-бойлер, которую растят на убой, и далее придёт хозяин KFC.

Не играйте в казино в рулетку и не играйте в нарушение лицензий вендоров — последствия одинаковые, но в случае облачного сервиса вы заложники вендора на 100%.

https://www.anthropic.com/legal/consumer-terms

2.7k 1 93 143 57

Возвращаясь к любимой дискуссии «чему учить» [школьников/студентов] ввиду того, что им работать не с текущими LLM, а с их поколением 2030-х годов, где даже бюджетная модель DeepSeek скорее будет иметь Verbal IQ выше Эйнштейна.

Определённо сейчас бесполезно «закреплять навыки» и «закреплять знания» с точки зрения механистической точности либо вспомнить что-то или сделать что-то. Это тема как раз ИИ-агента, чтобы вспомнить все редкие факты, а также грамотно применить в механистических операциях для решения задачи.

Явно сейчас становится более важно иметь более широкие, а не глубокие знания. Поэтому в чём-то текущее наше образование с фокусом на узкие знания и навыки тут малоэффективное в ИИ-реальности. С ИИ вам важно понимать «о чём идёт речь» в разных контекстах. Если ранее тот же строитель вряд ли мог быть химиком, то в 2030-х скорее это будет обычное дело, когда с ИИ будут обсуждаться какие-то присадки бетона или там эмиссия каких-то паров стирола из пенопластов. Чтобы решать такую «боковую задачу», нужно широкое образование во многих науках, иначе боту придётся сначала вас обучать основам химии, а потом уже задачу решать.

Очень существенный аспект — сдвиг от того «как сделать» на то, «что сделать». Это совсем новый навык описания целей. Нормального классического образования тут вообще нет, такой навык можно развить просто практикуясь с агентами.

Я бы такие советы дал родителям в канале:

📌 Стимулируйте детей изучать с ИИ как можно более широкий охват разных наук и областей знаний, не требуйте запоминать мелкие факты или тренироваться механицизму исполнителя в них

📌 Детям важно получить практику постановки задач агентам, единственный тут способ — ставить задачи агентам в каких-то творческих проектах, образование школ и университетов тут совсем неадекватно текущей реальности


📊 Интересный график, который показывает, где сейчас наиболее быстрый рост внедрения ИИ-агентов. С февраля 2026, т.е. за неполный год, по данным Codex рост был такой:

Юридическая сфера: 108x
Продажи: 41x
Подбор персонала: 41x
Маркетинг: 26x
Здравоохранение: 24x

🔹 Наиболее эффективно сейчас делать разработки ИИ-агентов в этих сегментах с бешеным ростом. Такой рост показывает, что там быстро будет достигнут почти 100% охват отрасли ИИ-агентами, поэтому важно успеть заскочить в последний вагон уходящего ИИ-поезда.


📊 На тему того, насколько репрезентативна выборка OpenRouter, на которой виден разгром китайцами американских моделей по объёму потребления токенов.

Vercel является популярной платформой для разработки на Next.js.

По их данным картина почти зеркальная с OpenRouter — 62% рынка в объёме токенов принадлежит теперь китайским вендорам LLM. Причём уход клиентов к китайцам с OpenAI и Anthropic идёт ещё более стремительными темпами, чем потребление на OpenRouter. Вероятно, это связано с тем, что на Vercel больше разработчиков, и они, если не члены какой-то секты фанатиков какой-то LLM, а инженеры, то просто делают тесты и выбирают то, что лучше работает и дешевле.

Данные графика по Vercel AI Gateway


🔌 Gergely Orosz, известный по работе в Substack, Uber и Skype, довольно правильный архитектурный инсайт двигает, о котором я часто говорю на обучении:
Конечным клиентам намного важнее Tools для агента через MCP, чем ваши агенты.

Сейчас многие команды решили, что их цель — написать агента лучше Hermes или DeepSeek Harness, но это очевидная идея-фикс. Ваши клиенты будут пользоваться теми LLM и теми агентами, что уже внедрили и оплатили. Поэтому им оптимально получить MCP для подключения своего агента и своей LLM к вашим сервисам. Ваш агент, если и интересует, то в сценарии agent2agent, т.е. когда ваш агент отвечает на запросы агента клиента. Однако важно понимать, что это целесообразно только в сложных сценариях, т.к. в желании клиентов применять своих агентов и LLM есть хорошее: они сами платят за инференс и за поддержку своих агентских обвязок.

История есть в тему. У меня недавно был на обучении менеджер, который был «Фома неверующий в ИИ», пока ему в чат Telegram для его клиентов не написал ИИ-бот клиента, что хочет купить его товар. Просто клиент хотя и мелкий, но продвинутый, вероятно навайбкодил себе бота. ИИ у него куда более тщательно расспросил характеристики товара, чем обычный клиент, выбрал все опции и сделал заказ, человек только его подтвердил. Тут коллега задумался, что, вероятно, бот клиента всё это сделал бы сам без него, если бы он создал ему инфраструктуру. По опросам в ЕС сейчас уже 20% европейцев не просто осведомлены о возможности использовать ИИ-ботов для закупок товаров себе, а согласны это делать автоматически. Под исключение попадают скорее медикаменты и другие товары по безопасности.

Если мораль, то ваш MCP для ваших клиентов и партнёров важнее вашего агента. Ваш агент может быть скорее средством его тестирования. Ваши уникальные Tools важнее ваших попыток конкуренции с Hermes или OpenClaw.

https://x.com/GergelyOrosz/status/2091248280365682688


📊 Financial Times сделал обзор исследования Enterprise-заказчиков Anthropic на базе отчета Ramp, и он довольно любопытный.

Прежде всего видна победа CFO над девелоперами. Времена, когда можно было тратить токены на фронтирные модели Anthropic без оглядки на цену, ушли в далекое прошлое. CFO вводят жесткие финансовые лимиты по расходу на Claude для разработчиков, и это изменило их спектр потребления токенов моделей Anthropic драматическим образом.

Только 11% от корпоративных расходов по Ramp идет на Fable 5. Большинство девелоперов вынуждены использовать Opus 4.8 из-за лимитов по деньгам от CFO. Sonnet почти потерял конкурентоспособность как LLM, и его применяют примерно 10% разработчиков.

Исследование Ramp показывает, что хотя агрессивное повышение цен на Claude путем запрета фикс-тарифов даже компаний размером с булочную и дало скачок прибыли и доходов Anthropic, но они замедлились в росте значительно ниже рынка ИИ. Если брать в расходах по токенам, то Дарио сознательно пошел на потерю рыночной доли в пользу денег.

Основной инсайт тут в том, что я довольно часто на обучении еще вижу команды стартапов или банков, которые живут в реальности «США 1–2 года назад», когда владельцам компании было наплевать, сколько Claude стоит, и главное — хоть как-то втянуть девелоперов в тему ИИ-разработки. В Россию традиционно современные тенденции приходят с лагом в 1–2 года, т.е. нужно быть готовым также к тому, что финансовые директора возьмут топор и начнут рубить бюджеты на дорогие LLM самым жестким образом. Поэтому уже важно создавать экономически эффективные пайплайны с сочетанием бюджетных LLM, чтобы не оказаться у «разбитого корыта», когда придет CFO и скажет: «Я больше за эти счета на Claude платить столько не буду, вот вам лимит $XXX и крутитесь в нем как знаете».

https://www.ft.com/content/5ee49718-c258-4f01-aa32-7e5b76ae5245?syn-25a6b1a6=1


Microsoft выступил Капитаном Очевидностью против откровенного мошенничества вендоров LLM, когда они обучают ИИ на специальных агентах, чтобы выбить много «попугаев» в табличках бенчмарков, а реально выдают разработчикам совсем других агентов, которые не приближаются к показателям из бенчей.

В чём-то эту тенденцию сломал DeepSeek, который впервые стал и обучать, и тестировать LLM на своём DeepSeek Harness. Вы можете быть уверены, что в DSH эта LLM выбивает бенчи, что показывают маркетологи.

Самая большая разница тут у Anthropic с SWE-тестами типа SWE Bench. Просто там манипуляции с бенчами были такие, что Дарио решил даже раскрыть, как это делает, т.к. если бы он скрыл и его поймали, то его бы объявили мошенником. Конечно, никакого Claude Code нет там и близко. Если брать SWE Bench, то стандартное тестирование требует Zero Agent, т.е. у которого есть только Bash и средство редактирования текстового файла и ВСЁ. До DSH именно на Zero Agent и показывал бенчи DeepSeek. На деле такой сверхлёгкий агент обычно и применяется для обучения LLM, т.к. там очень критична скорость работы обвязки, чтобы суперкластер не ждал агента даже миллисекунды.

В чём разница SWE-агентов Anthropic для бенчей от Claude Code? Если почитать «статьи под звёздочкой», то там видны такие приёмы в основном:

1. Brute Force по дереву вариантов решений. Идея на деле классическая: строится Decision Tree, далее сканируются его ветки субагентами. Это работает уже 2 года для получения лидерских бенчей, но создаёт чудовищный перерасход токенов, несовместимый с нормальной эксплуатацией.

2. «Временные и изоляционные тесты». Это интересный приём, и странно, почему вендоры LLM его как-то в конечные агенты не перекладывают. Для LLM для фикса бага очень важно обрубить лишние семантические связи, т.е. изолировать его. Для этого тот же Claude обучен писать специальные «тесты на изоляцию» и другие «динамические тесты». После фикса он их удаляет. Эти тесты полностью не совпадают по логике с TDD и классикой автотестов, ну и что? Значит, надо меньше молиться на TDD и автотесты и применять передовое ИИ-тестирование, раз оно как раз работает. Что это «выглядит необычно для разработчиков» — то проблемы разработчиков: надо обучить новой технологии, а не скрывать её от них.

Но основной инсайт тут в том, что никакой оптимизации Claude на Claude Code на Reinforcement Learning нет, есть загрузки сессий на SFT, но это не то же самое, что RL-обучение, а скорее нейросеть запоминает типовые фиксы и типовое поведение. Именно запоминает, генерализует, но не понимает с той глубиной, как это на RL получается. Поэтому в новом виде бага или доработки такое обучение не сработает.

https://arxiv.org/abs/2608.17528


🤖 Несмотря на мою критику HR как отставших в массе от прогресса, следует отметить, что «в массе» не означает все. Реальные эксперты есть, конечно. Сегодня беседовал с HR от клиента, который верно заметил интуитивно, а потом и практически, что техлиды занимаются на тестировании кандидатов идиотизмом «тестовыми задачками», т.к. сам HR, который «не бум-бум» в программировании, легко их решил в DeepSeek V4 Flash. Поскольку CEO ставит задачу внедрять ИИ-разработку и для HR искать таких кандидатов тоже, коллега резонно недоумевает, в чём смысл старых схем проверки компетенций через тестовые задания, если подразумевается, что у персонала есть LLM даже мощнее DeepSeek V4 Flash.

Это действительно важный момент. Если у вас для приёма кандидатов есть тестовые задания и LLM среднего уровня их решает, то вы занимаетесь полной ахинеей, а не тестированием кандидатов. Актуальны сейчас только те задачи для тестирования, которые сложны для самих LLM. Это такие:

• Выбор между разными архитектурными решениями и паттернами как оптимальными для ИИ, а не человека (!) для конкретных задач

• Проверка, что код соответствует скрытым ожиданиям заказчика, а не только формальной спецификации

Могут быть и другие. Вопрос, как проверять кандидатов сейчас, сложный, но определённо старым тестовым задачам место в мусорке. Новые тестовые задачи должны быть с учётом того, что у инженера уже есть ИИ и насколько он умеет управлять ИИ в ходе их решения.


В Сингапуре запущен первый в мире коммерческий ЦОД на биокомпьютере на нейронах человека. Стоимость подписки — $2,200 в месяц, и клиенты на это имеются: в основном разработчики гуманоидов. Давайте разберёмся.

Сейчас в ЦОД всего 20 биокомпьютеров CL1; в каждом — 200 тыс. живых нейронов человека на чипе с электродами, которые считывают и стимулируют электрическую активность клеток. Для задач типа расчёта инференса LLM человеческие нейроны неэффективны, т.к. не имеют точности вычислений GPU.

Однако живая нейросеть умеет решать лучше GPU задачи, очень важные для гуманоидов, а именно поведение в условиях острого дефицита исходной информации: это навигация, ориентация и адаптация к новым условиям.

Для гуманоидов и автономных роботов живая нейросеть имеет преимущество экстремально низкого энергопотребления. CL1 с системами поддержки потребляет около 30 Вт, тогда как Nvidia H100 SXM при интенсивных аналогичных задачах ориентации — до 700 Вт; для сложных задач адаптации к новым условиям аналогом CL1 будет сервер с восемью H100, который потребляет 10,2 кВт.

Пока о перестановке биокомпьютеров в гуманоидов с практической точки зрения речь не идёт, но это возможная перспектива, если питание их GPU станет критическим местом. В данный момент создатели гуманоидов скорее стараются извлечь из живых нейросетей оптимальные паттерны для обработки поведения роботов и дистиллировать их в обычные нейросети. Наиболее важны тут паттерны ориентации и поведения в незнакомой обстановке.

https://www.straitstimes.com/tech/forget-silicon-chip-servers-singapores-newest-data-centre-needs-to-be-fed

3.2k 2 118 19 62

🧠 Yuntian Deng, профессор из Гарварда (Associate, Harvard SEAS; Assistant Professor, UWaterloo), ранее был известен в узких кругах экспертов своим интересным проектом ProgramAsWeights (PAW). Однако как шутку на PAW он написал перевод с естественного языка на «Клодский»:
https://programasweights.com/claudish

Между тем PAW — интересная концепция, т.к. очередной умный китаец-профессор в ИИ предложил компилировать промпты для программы не в исполняемый код, а фактически сразу в нейросеть через крошечный LoRA-адаптер примерно ~23 МБ.

Работает это так:

1. Вы пишете промпт на свободном языке, он далее обязательно должен быть переработан ИИ в псевдокод, т.к. принципиален лингвистический denoising, т.е. очистка от семантического шума болтовни «кожаных» и перевод в паттерны ИИ. Это делает обычная SLM без дообучения, главное — не промпт от человека сразу.

2. Формируются входные данные как исходный промпт, псевдокод и подготавливаются всего 64 пустых вектора-токена.

3. Специально обученная нейросеть формирует эти 64 вектора, из которых потом и собирается крошечный LoRA-адаптер для запуска локально. По факту это компиляция не в код, а в нейросеть.

Решение может делать простые вещи кроме переводов на «Клодский» язык: может чинить поломанные форматы или классифицировать источники. Причём когда готова LoRA, она может делать это на 100% локально на крошечной нейросети.

Какие тут интересные инсайты:

• Переформулировка задачи ИИ своим языком — принципиальный момент для успеха решения задачи ИИ дальше, т.к. ИИ понимает только сам себя хорошо.

• Наши задачи для программирования намного проще для ИИ, чем нам кажется, т.к. фактически для него это тюнинг классификаторов задач. Даже небольшое подпространство критериев классификации может решать огромное количество задач программирования.

• Сама по себе идея компилировать задания не в код традиционных языков программирования, а сразу в веса нейросети выглядит интересной, и там, где решения вероятностные по смыслу, то вполне рабочий подход.

Отметим, что Маск считает, что такой метод компиляции спеков (ТЗ) сразу в веса убьёт многие традиционные языки программирования и среды как минимум в мобильных приложениях.

https://arxiv.org/abs/2607.02512v1


🤖 Агенты уже расходуют в 5 раз больше токенов, чем люди запросами в чатах по данным Open Router. Конечно, там человеческие запросы искажены, но тем не менее есть разные оболочки чатов, и видно, что уровень их растёт медленно, а агенты показывают экспоненциальный рост потребления токенов.

Это говорит о том, что не только настало время агентов, но и что их автономность растёт быстрее ожиданий даже экспертов.


🤖 Дебаты вокруг ИИ и Linux, а также тот факт, что сам Линус перешёл на ИИ, уже поставили прямой вопрос о переводе ядра Linux на ИИ-разработку.
Мейнтейнеры пишут, что от «1/3 до 1/2» новых патчей сетевого кода для ядра Linux уже, вероятно, генерируются ИИ, а не людьми. «Мы полностью перегружены», — говорит мейнтейнер Linux, и считает, что с ИИ-патчами можно совладать только ИИ-ревьюеру, люди не могут обрабатывать такой пайплайн. Цукерберг уже предоставил проекту Linux ресурсы Meta, последняя его Muse довольно сильна, хотя и не самый топ, но по факту её предлагают использовать ревьюером.
 
Цель лидеров проекта Linux — «начать смещать фокус на то, чтобы позволить LLM заниматься рутинной работой — управлением patchwork, автоматизацией типичных жалоб на процессы, редактированием сообщений коммитов и, возможно, применением патчей».
 
Закат эпохи ручного программирования всё ближе, даже бастионы Linux близки к капитуляции перед натиском ИИ.

3k 2 54 29 48

💡 Киаран Ричи (Kiaran Ritchie) — известный канадский геймдизайнер, программист, аниматор и специалист по техническому дирекшену персонажей.

Киаран Ричи — автор трёхтомного учебного пособия «The Art of Rigging». Эта серия книг и обучающих видеокурсов считается фундаментальной классикой для технических художников. Последней его известной игрой была «Rogue Islands».

Киаран делится интересным инсайтом о десакрализации кодирования. Он считает, что самое важное — архитектурный замысел и сама идея приложения, а копание в коде у него всегда вызывало отвращение как грязная, но необходимая работа для реализации его идей. Как легко догадаться, он продвигает идею, что ИИ забрал себе рутину кодирования и тестирования, а он наконец в позиции «творца».

https://x.com/kiaran_ritchie/status/2090845497624060162


В сообществе Linux вызвала большие дебаты правка Линуса Торвальдса в ядре Linux с помощью ИИ. Дело не только в его авторитете, а в том, что Линус, как и многие архитекторы, уже сравнительно давно не занимается разработкой ядра, а скорее управляет ей.
Он сейчас ревьюит код и мержит пул-реквесты от контрибьюторов. Тут Линус заметил, что ИИ снимает с него 90% чёрной работы тестирования, и действительно он сам сделал патч для ядра впервые за долгое время.
 
Однако в этом «I'll be back» есть серьёзный тренд, который обсуждают в X эксперты. Сейчас уже заметно возвращение в разработку старых именитых экспертов, которые уже много лет считают, что «кодить — это не барское дело». Однако эксперты заметили, что ИИ-боты меняют контекст и резко снижают трудоёмкость разработки и главное — тестирования, поэтому становится целесообразным переход из позиции фактически технологического менеджера в практикующего разработчика-ботовода.
 
Этот эффект может оказать заметное влияние на рынок труда сеньоров, т.к. против экспертов типа Линуса они все джуны в части понимания архитектур и критичности изменений. Поэтому часть коллег в X опасается даже «нашествия старейшин», которые, как Эмануэль Зорг из «Пятого элемента», вылезут из кресел менеджеров и решат, что «если хочешь сделать хорошо, то сделай сам [с помощью ИИ]».
 
https://github.com/torvalds/linux/commit/818bebeb63dd6bf5f4e07e145f6cdbace520a34c

3.5k 5 55 14 48

🐧 Обычно Линус Торвальдс заявляет, что использует ИИ для пет-проектов, а не для ядра Linux, но постепенно и последний из могикан сдался. Однако как он использует ИИ — достаточно любопытная практика. Линус не отказывается читать код ИИ, хотя сейчас это популярно, но он идёт дальше. Когда LLM не может найти проблему, он ищет её вместе с агентом, причём часто не соглашается с его выводами. Это довольно интересная практика, которая показывает, что даже критический код, где требуется ручной анализ, всегда можно делать с ИИ как с партнёром, но это не копилот как раньше, это скорее напоминает «парное программирование». Вероятно, для написания ядер систем и блоков кода, отвечающих за безопасность, потребуется знание программирования от разработчика, но это и не ручное программирование, и не копилот, и не автоматический агент. Это агент-партнёр как в методичках XP.

https://x.com/mark_k/status/2090842540870074806

Показано 20 последних публикаций.