Tlinov


Channel's geo and language: Russia, Russian


Канал о разработке с помощью ИИ Агентов.
Agent-First Engineering

Related channels  |  Similar channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Что за модель сидит в dots OpenAI?

В Dots невозможно выбрать какую-то конкретную модель при работе.
(спасибо за прозрачность, очень ценим)
Но, OpenAI упоминали что это какая-то модель Astra.
Однако, сколько бы я с ней не работал, по результатам работы это что-то странное.
Она делает странные и временами очень глупые вещи, которые..ожидаешь скорее от локальной qwen на 20млрд параметров.




У всех так?


Qwen image 2.1 Turbo
Ссылка

Alibaba выпустили Qwen 2.1 Turbo и с неё за день успели снять ограничения o_O.
гуд, в целом, честно, чем больше ограничений и контроля - тем хуже.всё по-умолчанию должно быть разрешено, не запрещено, как сейчас тебе аккаунт банят за то что ты сгенерировал картинку кота с петлёй..это я о себе.Мне реально заблокировали аккаунт за генерацию мемного стикера с котом.


Заходишь в комментарии к OpenAI

и видишь сплошное удовольствие от использования


Чем дальше тем меньше смысла использовать передовые платные модели.

Большинство пользователей используют ии модели для достаточно простых задач, в то же время у большинства пользователей очевидно нет RTX 6000 PRO,dgx spark или прочей радости чтобы запустить очень большую модель, но эта необходимость так же постепенно отпадает. маленькая, быстрая адекватная модель лучше чем массивная умная и медленная.


Чтобы не быть голословным, попросил агента проверить по логам использование и сравнить разницу прошлой подписки pro $200 и нынешней $500 и..обнаружил для себя что оказывается купил прошую $200 подписку за $500

За дополнительные $300 я получил примерно на 6% больше токенов Astra - оценка по логам. Цена выросла на 150%. Очень щедро, спасибо.

Если использовать квоту полностью, каждый токен теперь обходится мне примерно в 2,36 раза дороже. Видимо, токены стали премиальнее. Надеюсь, хотя бы вручную отобраны.

«Выгоду» нашёл. У OpenAI она вполне ощутимая.


OpenAI PRO 500

Наверняка помните, когда начиналась продолжающаяся сегодня ИИ-волна, выход "ОЧЕНЬ ОПАСНОГО" GPT-2, claude Sonnet 3, 3.1, в тот момент платить $20 за модель казалось чудовищно дорого, 100$ чувствовались как для олигархов, про 200..можно и не говорить, не помню была ли она тогда, ведь о ней я даже не задумывался.

Сегодня оплатил PRO подписку за $500.
Какой итог?
Лимиты PRO за $500 по ощущению, не знаю точно ли это так, но ощущаются так же как лимит PRO $200.
Ты буквально сидишь-работаешь, не в 20 разных окон как это было раньше, работаешь с 1-2 агентами Astra и лимит уходит так будто лимит это сливочное масло, а твоя попытка что-то сделать - микроволновка.

Честно, это не преувеличение и не беспочвенный хейт.

Что вообще получаешь на подписке за $500?
режимы ultrafast для Astra и Sol.
Которые, можете сами посудить из этого поста где я делал замеры реальной скорости, мягко говоря удовлетворительные.
Изначально скорость 20 токенов в секунду и при включении Ultrafast ты получаешь x8 скорость = ~160-180 t/s
Это не ultrafast.Это даже не fast.Это обычная скорость инференса.
Локальная модель которую я запускаю на пк выдает ~90 токенов в секунду с контекстным окном 256k на macbook pro m5 max 128gb
Это модель qwen-3.8-flash-Next на 180 млрд параметров.

Я очень, очень надеюсь, что стоимость оперативной памяти и прочих комплектующих продолжит падать, а не начнет контролироваться OpenAI/Anthropic и пр ИИ компаниями, чтобы было невыгодно покупать устройства для локального инференса, что было бы чертовски прискорбно.




Что по скорости Codex?

Прогнал 105 замеров:
7 моделей, 5 уровней мышления, по 3 повтора.
Результат у почти всех моделей OpenAI печальный.

gpt-6.1-sol: около 23–26 токенов в секунду. На max медианное ожидание первого текста - 130 секунд. И это на просьбе написать рассказ примерно на 400 слов.
Claude отдельно не замерял - последние пару месяцев им не пользуюсь.

Если Opus 5.5 действительно выдаёт около 100 токенов в секунду, то выбор Codex для разработки вместо Claude Code становится сомнительным. Качество решений - отдельный вопрос, но столько ждать в каждом рабочем цикле тяжело.


Как работают нейросети — и как до этого додумались?

Сделал большой фильм об истории нейросетей и их математике: от первых моделей нейрона до трансформеров и ChatGPT.

Через исторические сценки, рисунки и маленькие опыты разбираем, как машина исправляет ошибки, распознаёт изображения, запоминает прошлое и создаёт текст. Проследим, зачем понадобились градиентный спуск, глубокие сети и механизм внимания.

2 часа 11 минут, 87 глав.
В описании есть таймкоды - можно смотреть постепенно или выбрать интересующую тему.

▶️ Смотреть

Какую идею стоит разобрать подробнее следующим роликом?




Такие челленджи мне нравятся


NerfBench показывает что Opus 5.5 чуть деградировал


GPT-6.1-Astra во вторник?


Справедливости ради

GPT-6.1-Sol звёзд с неба не хватает, но действительно модель очень экономичная.
Качество её работы достаточно велико и при этом стоимость чудовищно низкая.
И её вполне возможно на ежедневной основе использовать на Ultra режиме в подписке на $200.

Честно говоря модели Opus 5.5 и Sonnet 5.5 я не испытывал, но наверняка у них результаты в фронтенд и подобных "визуальных" вещах будут лучше с первого раза, но модели Claude как будто чуть плевать хотели на ваши просьбы, часть намерений игнорируют и не стараются исполнить их точно.С GPT такой проблемы меньше.
Я не фанат ни того, ни другого.Мы в ситуации, когда приходится выбирать из двух зол


Неуверен, но может сработать


Безумно тошнит от такого рода вещей

Ограничивать выпуск моделей предоставляя их "доверенным лицам" - это и есть угроза безопасности. Так ИИ лаборатории создают дисбаланс.
Люди которым действительно необходим доступ к Mythos 5.1 и прочим моделям о которых мы можем и не знать - почти наверняка получат доступ к этим моделям через третьих лиц. А люди которые действительно могли бы улучшить безопасность своих сервисов и продуктов остаются с моделями отстающими на несколько месяцев от передовых.

Это и создает угрозу безопасности.Не доступ к лопате создает угрозу окружающим, а её отсутсвие перед человеком с лопатой, который пытается использовать её чтобы вам навредить.


OpenAI раскинули отложенный сброс

Можно проверить в использовании вашего аккаунта.


Твитты которые я заслужил

20 last posts shown.