техно-свалка


Kanal geosi va tili: Rossiya, Ruscha


Склад AI и техно-экспериментов, robotics и случайных мыслей.

Bog‘liq kanallar

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri


Попробовала DeepSeek Harness

Это оболочка, которая превращает DeepSeek в агента. Модель получает доступ к инструментам и выполняет задачу в несколько шагов.
🛠 Инструменты из коробки:
Shell — агент может выполнять команды в терминале.
Web search — сам ищет информацию в интернете, когда её не хватает в контексте.
Subagent — умеет делегировать подзадачи другим агентам.
Agent loop — цикл, в котором агент сам планирует, выполняет и проверяет результат.
🧪 Экспериментальные фичи:
Agent Teams — несколько агентов работают над задачей вместе.
Automation tasks — фоновые задачи, которые можно запустить и забыть.
Voice input — голосовой ввод.
🧩 Плагины
Можно ставить готовые или собирать свои прямо в Creator mode — агент буквально помогает себе расширять возможности.
📂 Работа с данными
Файлы, код, таблицы, документы — всё это агент читает, редактирует и анализирует сам.
Сейчас Harness в public preview и открыт как open source.
В репозитории также есть обсуждения проблем с ретраями, перегрузкой длинных сессий и квотами.


Что показали OpenAI на DevDay 2026

Dots
Главный анонс — Dots. Это постоянно работающие AI-агенты с собственным облачным компьютером и браузером. Они работают на GPT-6 Astra, могут подключаться к тысячам приложений и выполнять задачи в фоне.
Dots доступны для Pro и Business Premium, Enterprise получает beta. Обычное общение с Dot не расходует стандартный ChatGPT usage, но запуск Codex или Work использует их отдельные лимиты.

GPT-6.1 Sol
Вышел всего через неделю после GPT-6 Sol.
OpenAI заявляет производительность близкую к Astra в coding, computer use и professional work, но примерно в 5 раз дешевле по стоимости токенов.
Контекст — 1,05 млн токенов, output — до 128K.

Pro 500
Новый тариф за $500 в месяц с лимитом использования около 25× относительно Plus.
В него входит Astra Ultrafast — ускоренный режим, который OpenAI заявляет до 8× быстрее в Codex.

Sign in with ChatGPT
Теперь лимиты подписки можно использовать внутри сторонних AI-сервисов.
На старте подключены 16 приложений, включая Devin, Notion, Vercel и OpenClaw.

Decisions API
Новый API на базе Luna для задач, где модель должна выбрать один вариант из заранее заданного набора.
Например: классификация запросов, маршрутизация тикетов или выбор следующего действия агента.

Agents API
Добавили computer use, multi-agent orchestration, tool search и управление контекстом.
Источники: OpenAI DevDay 2026 Recap, Introducing Dots, документация GPT-6.1 Sol.


Machine learning Interview dan repost
🔥 DeepSeek и Huawei строят китайскую альтернативу CUDA

DeepSeek выпустила open-source инструменты для ускорителей Huawei Ascend, включая поддержку TileLang для Ascend 950. Они упрощают написание вычислительных ядер, перекладывая часть низкоуровневой работы на компилятор.

Смысл шире одной библиотеки: Китай пытается снизить зависимость не только от чипов NVIDIA, но и от всей экосистемы CUDA.

Именно за этим сейчас стоит следить особенно внимательно. Сильный GPU без удобных компиляторов, библиотек и инструментов для разработчиков мало что решает.

Китай строит не просто свои AI-чипы. Он строит свой полный AI-стек.


Harness: что происходит между «ИИ, сделай» и реально выполненной задачей

Допустим, вы поручили ИИ найти квартиру: до 80 тысяч, с котом, не дальше 15 минут от метро.
Он открыл объявления. В одном цена без комиссии, в другом нельзя животных, в третьем «15 минут» — на машине. Потом сайт завис, а половина найденного перестала помещаться в контекст.
Кто хранит найденное, запускает браузер и возвращает агенту ошибку, чтобы тот мог продолжить?
Для этого нужен harness — программная обвязка вокруг модели. Модель выбирает следующий шаг, обвязка выполняет его и возвращает результат. В развитом harness есть сохранение прогресса, ограничения и проверки.
Для такого поиска можно собрать цикл:
Модель запрашивает открытие объявления.
Harness запускает браузер и передаёт содержимое.
Модель извлекает цену и условия.
Harness сохраняет данные и результаты проверок.
Цикл продолжается до выполнения задачи или достижения лимита.
Упрощённый псевдокод выглядит так:
state = load_progress()

for step in range(30): >action = model(task, state)

if action.type == "finish": >if check_result(state): >>break state.add("Результат не прошёл проверку") continue result = tools.execute(action) state.add(result) save_progress(state)

Здесь 30 шагов — ограничитель расходов, tools — доступные действия, state — накопленные результаты, а check_result — проверка условий завершения. Например, у каждой квартиры должны быть ссылка, полная цена и подтверждённые условия проживания с животными.
Где это пишется? В обычном проекте на Python, TypeScript или другом языке. Пример структуры своего harness:
agent/ loop.py — цикл работы tools.py — браузер, поиск, API state.py — сохранение прогресса checks.py — проверка результата policy.py — права и лимиты
Где посмотреть настоящий код:
• mini-swe-agent — компактный пример цикла «модель → команда Bash → результат → модель». На нём удобно разбирать сам механизм. (github.com)
• Примеры Anthropic — механизмы для длительной работы: обработчики событий и отдельный агент, который проверяет результат. (github.com)
Одна и та же модель с разной обвязкой получает разные возможности: где-то она лишь описывает, как искать квартиру, а где-то действительно открывает объявления, ведёт таблицу и отмечает непроверенные условия.


Sonnet 5.5: обогнал Opus в одном тесте, стоит вдвое дешевле

28 сентября Anthropic выпустила Claude Sonnet 5.5 — модель для кода, документов, таблиц и повседневных задач.

Что изменилось относительно Sonnet 5:

• Ответы генерируются на 30%+ быстрее.
• Задачи обходятся до 30% дешевле в тестах Anthropic. Цена токена прежняя, но модель тратит меньше токенов: чаще объединяет вызовы инструментов и выполняет работу за меньшее число шагов.
• В Terminal-Bench 4.0 — 70,6% против 66,4% у Opus 5.5. Здесь агент решает многошаговые задачи через терминал. Это победа в конкретном тесте: в сложной работе с неоднозначными требованиями Anthropic по-прежнему выделяет Opus.

Цена API — $2 за миллион входных и $10 за миллион выходных токенов, вдвое ниже Opus 5.5.

А ещё это первый Sonnet, прошедший Pokémon Red только по скриншотам. Модель получает изображение игры, выбирает действие и смотрит изменения.

[Анонс Anthropic](https://www.anthropic.com/claude-sonnet-5-5)


Alice AI Foundation: что Яндекс открыл вместе с весами модели

21 сентября Яндекс опубликовал AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля, без весов сторонней LLM.
В модели 48 слоёв.
Часть вычислений выполняют MoE-слои (*mixture of experts*). Вместо одного большого блока в них работают множество небольших «экспертов». Для каждого фрагмента текста модель выбирает 10 из 512 и добавляет один общий. Так разные фрагменты проходят через разные части сети.
Для работы с контекстом чередуются два механизма внимания. Kimi Delta Attention сворачивает историю в состояние фиксированного размера, снижая расход памяти на длинных текстах. Полное внимание позволяет напрямую обращаться к предыдущим фрагментам. Заявленный предел контекста — 262 144 токена.
Это всё ещё базовая модель: финальную настройку на диалог она не проходила.

Модель получила 86,5 балла на WikiWebFacts против 83,2 у DeepSeek-V4-Flash-Base.

Источники: [модель ] · [отчёт Яндекса]


🔥 Что реально изменилось за последние дни: GPT-6, Claude Opus 5.5, Xiaomi MiMo и грядущий Qwen 4

За последние пару дней вышло сразу несколько крупных AI-моделей. Я сравнила их не по сухим рейтингам, а по тому, что мне кажется важнее: код, агенты, контекст, скорость и сколько всё это стоит на практике.

🤖 OpenAI GPT-6 Sol / Luna
Здесь интереснее всего то, что OpenAI фактически спустила часть технологий GPT-6 Astra в более дешёвые модели. Sol и Luna обучались похожими методами и получили улучшения Astra в coding, computer use, factuality и agentic-задачах.
При этом API подешевел примерно вдвое:
Sol: $2 input /$10 output
Luna: $0.10 /$0.50 за 1M токенов
По бенчмарку DeepSWE 1.1:
Sol — 68.8%
Luna — 66.6%
То есть даже Luna уже залезает в область серьёзного coding-agent, хотя стоит копейки. Плюс OpenAI переработала prompt caching: cached input теперь может быть дешевле на 90%.

🧠 Claude Opus 5.5
Anthropic пошла немного другим путём: ставка на длинные автономные задачи и качество агента.
Цена: $4 /$20. Это на 20% ниже Opus 5, модель генерирует более чем на 30% быстрее, а типичная задача, по данным Anthropic, обходится примерно на 40% дешевле из-за меньшего количества токенов и шагов.
То есть Opus интересен не только тем, что «умнее». Он стал меньше ходить кругами и делать меньше tool calls для получения результата. Для больших codebase, рефакторинга и автономных агентов это может быть важнее цены одного токена.

🚀 Xiaomi MiMo-V2.6 Pro
Для меня это самый интересный релиз по соотношению характеристик и цены.
Что внутри:
1M context
128K max output
text + image + video + audio
tool calling
open weights
Цена: $0.435 input /$0.87 output.
На Artificial Analysis Intelligence Index Xiaomi указывает 46.32 — сейчас это один из самых сильных результатов среди open-weight моделей.
Но технически интереснее другое: Xiaomi сильно масштабировала RL на реальных agentic-задачах. Для Pro использовали около 750 тыс. trajectories, а DeepSWE v1.1 в процессе RL вырос с 58.4 до 72.6.
То есть open-weight модели начинают догонять закрытые уже не только масштабом pretraining — их серьёзно дожимают через agentic RL.

👀 И ещё важное — Qwen 4
Это уже официально: Alibaba сообщила, что Qwen 4 находится в обучении.
Причём компания уже показала направление развития: Qwen3.8-Max прогнали через месяц автоматического self-improvement — 33 итерации, после чего его Artificial Analysis score вырос с 40 до 45.
Дальше в roadmap — Qwen 4.5 и Qwen 5, где Alibaba говорит уже о масштабе 5–10 трлн параметров.
💡 Мой вывод после сравнения:
Claude Opus 5.5 — ставка на тяжёлые и длинные agentic-задачи.
GPT-6 Sol — сильный компромисс между frontier-возможностями и ценой.
GPT-6 Luna — особенно интересна для массовых агентов и большого числа вызовов.
MiMo V2.6 Pro — наиболее интересный open-weight релиз по цене/возможностям.


Какую модель вы бы протестировали? Делитесь в комментариях! 👇

196 0 3 32 56

Xiaomi выпустила MiMo-V2.6

Новая серия включает модели MiMo-V2.6 Pro и Flash. Они мультимодальные и рассчитаны на код, agentic-задачи, работу с GUI, изображениями и внешними инструментами.

Что интересно:
— контекст до 1 млн токенов;
— RL-обучение на ~750 тыс. trajectories;
— Pro вырос на DeepSWE v1.1 с 58,4 до 72,6 после RL;
— поддерживаются Computer Use, Blender/3D и управление роботом в симуляции;
— Xiaomi открыла не только веса, но и часть RL-кода, environments и agent harnesses.

Официальный релиз:
https://mimo.mi.com/docs/en-US/news/latest/v2-6

Hugging Face:
https://huggingface.co/XiaomiMiMo


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
В Шанхае прошли бои полноразмерных гуманоидов

На турнире URKL сражались гуманоиды EngineAI T800 ростом 173 см. У всех команд было одинаковое железо: до 29 степеней свободы, пиковый момент суставов до 450 Н·м, стереокамеры и LiDAR. Поэтому основная разница между бойцами — софт, настройки управления и стратегия.
Победил «Белый орёл», забрав дневную и вечернюю сессии. В финале показали и multi-robot бой: «Белый орёл» + «Золотая вспышка» против «Матадора».

Технически цикл выглядит так: perception → оценка 3D-позы и траектории противника → прогноз движения → выбор удара/уклонения → whole-body control. Внизу работает низколатентный контур, оценка внешних сил и компенсация баланса после ударов.

Движения T800 можно обучать через RL + whole-body tracking в Isaac Lab, а затем переносить policy на реального робота. В multi-agent режиме два T800 ещё и объединяют наблюдения, закрывают слепые зоны и динамически распределяют роли «сдерживать» / «атаковать». ([GitHub])
#робототехника


A1intelligence — канал об искусственном интеллекте dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
В Google Colab теперь можно бесплатно тренировать более 500 моделей — энтузиасты выпустили Unsloth Studio.

Unsloth Studio — это простой и удобный веб-интерфейс для обучения и тонкой настройки нейросетей без кода: поддерживается автоматическое создание синтетических датасетов, обучение занимает в 2 раза меньше времени и требует на 70% меньше VRAM на бесплатных GPU. Поддерживается работа как с готовыми, так и с кастомными датасетами.

Пробуем на Google Collab.

#полезныеинструменты #opensource




tldr_tany (Таня Савельева) dan repost
Вчера выступала на большой конфе в Парке Горького от Тинька по продуктам

Конфа была топ

Я спросила - сколько людей вайбкодило что-то?
Поднял руки почти весь зал

Второй вопрос - кто с этого что-то заработал
Подняло руки 2 человека - 1 из них мой гость

Это про то, почему нужен маркетинг, продажи и продукт


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Робот-рука взяла кирпичик LEGO: что под капотом
Потестила захват предметов на AdeeptTank Raspberry Pi. Рука — 4 степени свободы: плечо, локоть, кисть, захват. Для опускания и захвата работают три из них — плечо, локоть и захват; кисть отвечает за вращение. Каждый сустав — сервопривод на плате PCA9685 (I²C, адрес 0x5f).
Как управляется:
— серво понимает не «угол», а ширину импульса: 500 мкс = 0°, 2400 мкс = 180°, 50 Гц;
— в коде: servo.Servo(pca.channels[ch], min_pulse=500, max_pulse=2400).angle = 90.
Позу подбирала интерактивно — скрипт двигает сустав на 5° за команду и не пускает за безопасные пределы.
Следующий шаг — «чувство захвата» по току серво. Так работают промышленные захваты.
Степень свободы — одно движение.
Углы можно не подбирать руками, а считать. Зная длины звеньев и углы, положение клешни выводится по формуле: x = L₁cosθ₁ + L₂cos(θ₁+θ₂), аналогично y. А обратно — от точки к углам — идут через якобиан: матрицу «на сколько сдвинется клешня при малом повороте каждого сустава».
#роботетхника


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Digit 5 научили работать рядом с людьми без защитной клетки

Agility Robotics показала новое поколение своего гуманоида Digit. Главный апгрейд здесь не скорость и не грузоподъёмность, а отдельная система безопасности для работы рядом с человеком.

Робот использует:
-бортовые камеры;
-датчики глубины;
-IMU;
-собственные AI-алгоритмы Agility для обнаружения людей и оценки опасного сближения.
Если человек оказывается слишком близко, Digit 5 может изменить движение, остановиться или перейти в безопасное положение.

Ключевой момент: за это отвечает отдельный safety-контроллер, независимый от основной системы управления. Agility также использует платформу NVIDIA IGX Thor + Halos for Robotics для safety-critical функций.

Из железа:
-поднимает до 22,7 кг;
-работает около 90 минут;
-заряжается за 9 минут.

То есть идея Digit 5 уже не в том, чтобы просто «уметь ходить», а в том, чтобы реально работать на складе или производстве в одной зоне с людьми.
Agility Robotics — Digit 5


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Роботы строят роботов»: массовое производство запущено 🤖🏭

В Китае произошёл тектонический сдвиг в робототехнике. В Лючжоу официально запущен первый в мире завод по массовому производству человекоподобных роботов мощностью более 10 000 единиц в год!

Каждые 10 минут с конвейера сходит один готовый промышленный гуманоид. И да, это буквально «роботы делают роботов» — производство управляется цифровым «мозгом» и системами симуляции, а участие человека сведено к минимуму.

Это не единичный случай. Китайская XPENG тоже не отстаёт: её робот IRON (76 степеней свободы, три чипа Turing на 2250 TOPS) уже самостоятельно сошёл с конвейера 8 сентября. Массовый выпуск запланирован на конец этого года, а коммерческие поставки — на 2027-й.

Мы входим в эпоху, когда роботы перестают быть штучным товаром.
#роботехника


"Красный день" для AI-индустрии: топ-менеджеры просят тормозить, рынок паникует 📉🤯

В воскресенье, 13 сентября, произошло нечто из ряда вон выходящее. Глава Anthropic Дарио Амодеи опубликовал эссе «We Must Pace the Frontier», в котором призвал замедлить темпы развития передовых AI-моделей из-за рисков безопасности.

Самое удивительное — его поддержали Сэм Альтман (OpenAI) и Илон Маск. Это редчайший случай единства среди обычно конкурирующих лидеров отрасли.

Амодеи предупредил, что в течение 6–12 месяцев рой AI-агентов может «захватить весь интернет» и нанести ущерб в сотни миллиардов долларов.Альтман заявил, что OpenAI не будет проводить IPO в 2026 году, сосредоточившись на безопасности.

Реакция рынка была мгновенной. В понедельник, 14 сентября, акции AI-компаний по всему миру резко обвалились. SoftBank потерял более 10%, пострадали Nvidia, Intel, ASML, SK Hynix. Reuters назвал это «самой серьёзной угрозой на сегодняшний день для миллиардов долларов, вложенных в эту индустрию».

При этом китайская государственная пресса назвала призывы Anthropic к замедлению развития AI элементом технологической борьбы с Китаем.

Пока неясно, чем закончится этот «тормозной путь», но одно очевидно: эпоха безудержного роста AI-хайпа, похоже, столкнулась с суровой реальностью

#AI #безопасность #рынок #Anthropic #OpenAI


Trashchenkov dan repost
🧠 GigaChat 3.5 Reasoning
У GigaChat появилась первая модель с полноценным рассуждением — GigaChat 3.5 Reasoning.

Как её делали?
Сначала был SFT: модель обучили на готовых примерах решений, в том числе для агентных сценариев. Это сформировало стартовый набор способов решения для последующего RL.

Дальше из одного SFT-чекпоинта независимо обучили шесть специализированных моделей через online RL: математика и естественные науки, код, агент для кода, универсальный агент, диалог и следование инструкциям.

При online RL модель сама генерирует несколько решений задачи, получает награды за их качество и учится на собственных свежих попытках. Так постепенно закрепляются полезные стратегии: перепроверить результат, вернуться после ошибки, попробовать другой путь. В GigaChat для этого использовали CISPO — алгоритм из работы про MiniMax-M1.

Для каждого эксперта настроили свою схему награды: математические ответы сверяли с эталоном, код запускали, патчи проверяли тестами, в агентных сценариях смотрели на конечное состояние среды, а диалог оценивали через LLM-судью.

Агентов учили отдельно. Code Agent работал с реальными репозиториями через
mini-SWE-agent: читал файлы, запускал команды, правил код и смотрел на результат. General Agent учился вызывать инструменты, работать с памятью и поиском и проходить многошаговые диалоги.

После RL шесть специализированных моделей свели в одну через on-policy distillation: итоговая модель сама генерировала решение, а соответствующий эксперт давал ей обучающий сигнал на каждом токене.

По метрикам прирост заметный относительно GigaChat 3.5 Instant. Например:
— SWE-bench Verified: 42,6 → 64,7;
— Terminal-Bench 2: 13,48 → 30,3;
— Natural Plan: 64 → 80,19.

На задачах AIME 2025/2026, HMMT и IMOAnswerBench новая модель в среднем использовала на 37% меньше токенов рассуждения, чем DeepSeek V4 Flash Preview.

📖 Подробная статья про обучение
⚖️ Веса на Hugging Face и GitVerse — лицензия MIT
🧪 Попробовать в вебе — режим «Рассуждение»


Эксплойт dan repost
Suno ВСЁ — китайцы выкатили мощнейший опенсорсный генератор музыки.

YuE2-3B превращает текст и описание стиля в полноценную песню с вокалом и инструменталом. В свежем сравнительном тесте модель обошла Suno V5.5 и V5 по общей оценке качества, причём всё это с открытыми весами.

Особенно интересно, как она работает с текстом: модель лучше держит соответствие заданным словам, а среди примеров уже есть треки на русском. Можно генерировать музыку, редактировать мелодию и аккорды и даже управлять композицией через музыкальную партитуру.

Модель можно скачать бесплатно на Hugging Face или сразу потыкать в браузере — здесь.

@exploitex


Data Secrets dan repost
⚡️ Только что вышел DeepSeek-V4.1-Flash

Многие бенчмарки на уровне Opus 5 и Sol (обратите внимание на DeepSWE). Учитывая, что это модель Flash, самая маленькая из семейства, очень даже круто.

По поводу внутренностей:

– 552В MoE
– Новая асимметричная архитектура Causal Encoder–Decoder: 8В активных параметров на вход, 16В активных на выход
– Новые метода претрейна + более масштабный RL

Оптимизировали KV-кэш. Теперь он занимает еще меньше памяти в пересчете на токен (3 график).

Цены: $0.15/М input, $0.6/M output в непиковые часы. В пик – в два раза выше.

Веса

Статья


Data Secrets dan repost
Подробности по решению Навье-Стокса внутренней моделью OpenAI:

– Есть аналитическое доказательство и формализация Lean.

– Доказано, что гладкое течение несжимаемой жидкости в 3D может за конечное время развить сингулярность. То есть скорость в какой-то точке жидкости неограниченно растет, хотя движение начинается гладко и энергия конечна на всем пути.

– Решение – это вихрь, который закручивается вовнутрь и вытягивается типа спагетти. Центральная область сжимается и ускоряется так, что энергия остается конечной. Это доказывает варианты С и D из официальной формулировки Clay Institute.

По поводу скандала с кражей решений интерпретация компании такая:

– С 28 августа OpenAI обучали новую внутреннюю модель, заметно превосходящую GPT-6 Astra. Услышав 1 сентября слухи о том, что решены две проблемы тысячелетия, они запустили мультиагентную систему (до ~10 000 параллельных агентов) для проверки модели на всех открытых проблемах тысячелетия. Агентам давали разные варианты формулировки задачи и доступ к кэшированному интернету и коду.

– По пути агенты разрешили более простой вопрос – регулярность для уравнений Эйлера (практически та же задача, над которой работали Бакмастер и Альпеге, но без условия на forced). Это заняло около 50 часов силами почти 100 агентов.

– После этого ресурсы перебросили на Навье-Стокса; решение нашли через 88 часов после запуска 5 сентября. Еще 17 часов ушло формализацию в Lean.

В общей сложности вышло ~130 млрд токенов.

20 ta oxirgi post ko‘rsatilgan.