Tlinov


Гео и язык канала: Россия, Русский
Категория: Криптовалюты


Канал о разработке с помощью ИИ Агентов.
Agent-First Engineering

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Криптовалюты
Статистика
Фильтр публикаций




Такие челленджи мне нравятся


NerfBench показывает что Opus 5.5 чуть деградировал


GPT-6.1-Astra во вторник?


Справедливости ради

GPT-6.1-Sol звёзд с неба не хватает, но действительно модель очень экономичная.
Качество её работы достаточно велико и при этом стоимость чудовищно низкая.
И её вполне возможно на ежедневной основе использовать на Ultra режиме в подписке на $200.

Честно говоря модели Opus 5.5 и Sonnet 5.5 я не испытывал, но наверняка у них результаты в фронтенд и подобных "визуальных" вещах будут лучше с первого раза, но модели Claude как будто чуть плевать хотели на ваши просьбы, часть намерений игнорируют и не стараются исполнить их точно.С GPT такой проблемы меньше.
Я не фанат ни того, ни другого.Мы в ситуации, когда приходится выбирать из двух зол


Неуверен, но может сработать


Безумно тошнит от такого рода вещей

Ограничивать выпуск моделей предоставляя их "доверенным лицам" - это и есть угроза безопасности. Так ИИ лаборатории создают дисбаланс.
Люди которым действительно необходим доступ к Mythos 5.1 и прочим моделям о которых мы можем и не знать - почти наверняка получат доступ к этим моделям через третьих лиц. А люди которые действительно могли бы улучшить безопасность своих сервисов и продуктов остаются с моделями отстающими на несколько месяцев от передовых.

Это и создает угрозу безопасности.Не доступ к лопате создает угрозу окружающим, а её отсутсвие перед человеком с лопатой, который пытается использовать её чтобы вам навредить.


OpenAI раскинули отложенный сброс

Можно проверить в использовании вашего аккаунта.


Твитты которые я заслужил


Можно свободно использовать подписку OpenAI в приложениях партнеров.Кажется в будущем они планируют расширить это без ограничений, чтобы любой мог в своём приложении использовать авторизацию OpenAI на равне с API.


Вот еще шедевр.




GPT-6.1-Sol

Попросил создать модель дерущегося человека с анимацией.
Результат не вау, но это было сделано с 1 прохода, без каких-либо дополнительных запросов.В общем, если работаете с 3д, очевидно с модели OpenAI Astra и с Opus 5.5 модели начали понимать пространство лучше.И не знаю заметили ли, они стали лучше писать. Раньше 60% текста который я получал от агента был на русском языке, кажется GPT-5.4 и 5.5 приходилось жестко промптить чтобы агент не разговаривал с тобой на Английском с редким вкраплением русских слов. Сейчас отчеты агентов более менее удобно читать. Пропала дробь текста, когда агент пишет текст в колонку и подобными последовательностями:
описание
->шаг 1
->шаг 2
->шаг 3

Множество проблем действительно исчезает, но очевидно, работоспособность ии всё еще оставляет желать лучшего. Агенты всё еще не имеют собственного опыта и как следствие способности к оценке и всё еще не умеют ставить долгосрочные цели выше краткосрочных что приводит к потере скорости работы на 99 тестов чтобы понять что ничего непонятно.


Это пожалуй самое интересное.

Плагины теперь постепенно становятся настоящими расширениями внутри codex.

+ Пользователи могут создавать собственные плагины и распространять свои плагины среди других пользователей. Наконец появляется какая-то экосистема. Ваши созданные плагины будут предлагаться релевантно тому чем занимается какой-либо пользователь.


Пока что я недоволен OpenAI

Ощущение сегрегации пользтователей не исчезает.


НО.При том что кол-во лимита в подписке сократилось вдвое.То есть не 1/5, а скорее 1/2.5




Nerf Bench
https://www.bridgebench.ai/nerf-bench

Bridgebench начали проверять нерфятся ли модели после релиза и насколько.
Теперь можно наглядно глянуть и понять так ли это, или просто "кажется"


Репост из: Rickler Treasury
🚨 Farcaster внутренний кошелек дрейнят!!! Пишу пост подробнее, если вдруг там завалялись деньги, то выводите срочно



Показано 20 последних публикаций.