Вебмастер Букреев (Reader)


Гео и язык канала: Россия, Русский
Категория: Технологии


Ридер для вебмастеров. Публикую самое интересное и полезное для вебмастеров. Подписывайся, чтобы не пропустить важные новости индустрии. Ну и все фишки палим тоже тут. Обсудить можно в чате: https://t.me/marafonbukreev

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Мне тут один знакомый программист на днях сказал «Да ладно, Грок новый - прямо почти как Опус, но в 10 раз дешевле».

Ну, я ж любопытный. Кто ж мешает подключить Грок и глянуть как он там, на нашем бенче?

Результат в табличке. Тут никакого открытия не случилось.

Законное 15 место в рейтинге и затраты на уровне топовых моделей.

Ждем следующего «убийцу Опуса» :-)


Ой, а молодцы!!! Могут же!

А где бы программу/учебник глянуть… А то нашим могут и туда традиционные ценности и нравственность засунуть :-)


Прекрасное. В панели регру не работает продление доменов. Не грузятся скрипты - домен недоступен. Реакции на тикет нет уже больше суток :-)))

ЗЫ. А так хотелось заплатить им денег…


Клод продлил повышенные лимиты до 31 августа.

Раньше окончанием акции значилось 19 августа (сегодня собственно).


‼️ Рунету сегодня нехорошо. И, похоже, причина довольно железная. В буквальном смысле.

Вечером посыпались жалобы сразу на десятки совершенно не связанных между собой сервисов: банки, маркетплейсы, операторов связи, VK, Steam, Discord, онлайн-кинотеатры и прочее. Жалобы идут из разных регионов России.

Почти одновременно в Москве погас свет в нескольких районах. Сообщалось о проблемах в Гагаринском, Даниловском районе, Замоскворечье и районе Октябрьской. Были проблемы с мобильной связью, магазинами, транспортом. На Калужско-Рижской линии метро некоторое время увеличивали интервалы движения.

А теперь самое интересное.

Мне тут злые языки подсказали: смотрите в сторону Бутлерова, 7.

Для тех, кому адрес ничего не говорит: это ММТС-9, она же M9.

И вот это уже не просто "где-то дата-центр моргнул".

M9 - одна из ключевых телекоммуникационных площадок российского интернета. Там сконцентрировано огромное количество операторского оборудования и межоператорских соединений. Там же находится площадка MSK-IX. Сам MSK-IX в свое время называл Бутлерова, 7 самой востребованной в России локацией для межоператорского взаимодействия - на ней присутствовали сотни операторов.

И сообщения об аварии с электропитанием на M9 действительно есть. Некоторые хостеры уже сообщили клиентам о проблемах с питанием и деградации связности на площадке.

По одной из появившихся технических версий, сначала произошёл сбой в московской энергосистеме, после чего проблемы зацепили в том числе инфраструктуру в районе M9. Именно это могло дать такой красивый каскад: электричество → операторские узлы → маршрутизация/связность → одновременно "падают" десятки вообще не связанных между собой сервисов.

Но тут аккуратно: окончательно эту причинно-следственную цепочку пока никто официально не подтвердил. Так что пока это наиболее логичная рабочая версия, а не установленная причина.

И маленький технический нюанс.

Фраза "упала точка обмена трафиком и поэтому упал Рунет" - слишком примитивное объяснение. Интернет так не устроен, MSK-IX вообще географически распределён, маршруты резервируются, питание резервируется и все взрослые люди заранее готовятся к отказам.

Но когда проблемы возникают на площадке такой концентрации инфраструктуры, как M9, эффект получается очень заметным.

Что мы сегодня, собственно, и наблюдаем.

Судя по сообщениям, электричество и часть сервисов уже возвращаются. Теперь будет интересно дождаться нормального технического разбора аварии.

Потому что если версия про M9 подтвердится, главный вопрос будет уже не "почему упало", а почему резервирование не спасло от настолько массового эффекта. 🙂

Причем резервирование питания именно на этой точке - МНОГОКРАТНОЕ.
Интересно, какое количество полыхающих поп будет завтра на совещаниях и разборах…


Вышла GLM 5.3

Первый кейс под который вообще бенмарк делался..

Погнали. :-)

Полную табличку итоговую почищу чуть-чуть и в комментах закину.


Гугл в строку поиска воткнул кнопку «Режим ИИ». Я так понимаю скоро вполне себе этот режим станет режимом по умолчанию, вместо «Поиск в Google».

Ну или не станет. Я ж эксперт - должен все возможные варианты озвучивать :-)))

50/50 короче.

Из интересного: если задать запрос, то в режиме «Поиск в Google» будет блок с ИИ-ответом и там указаны источники откуда взята информация.

Если тот же запрос пульнуть в «Режим ИИ» - там будет более полная/подробная информация БЕЗ ссылок на источники. те из этого режима даже при цитируемости вебмастера трафика не получат совсем..

Круто, счастье, ЗБС :-)


Стек нарочно простой: Python-бот на Telegram Bot API (polling, без вебхуков), SQLite для всего состояния, Docker Compose для развёртывания на домашнем сервере.

Главный принцип архитектуры - разделение вероятностного и детерминированного. LLM (OpenAI Responses API, structured output) отвечает только за то, что действительно требует понимания языка: разобрать свободный русский текст в строгую схему (Pydantic), сформулировать похвалу, добавить недельному отчёту немного «человечности», иногда придумать новую тему раунда. Модель никогда не считает баллы, не хранит состояние и не имеет права отрицать то, что уже сохранено в базе - при обычном разговоре ей передаётся точный контекст из SQLite, и по нему она обязана сверяться.

Вся арифметика баллов живёт в одном модуле без единого обращения к LLM. Она детерминирована и покрыта тестами, а документация формул синхронизирована с кодом как источник истины.

Из инженерных деталей: обработка Telegram update идемпотентна по update_id, чтобы повторная доставка не начисляла баллы дважды; частичные отчёты - это upsert, неназванные поля не затираются; запись в уже закрытую неделю блокируется на уровне сервиса; плановые рассылки (утро/вечер/бэкап) идемпотентны через таблицу отправленных сообщений, что переживает рестарт контейнера.

Ежедневный бэкап SQLite с ретеншеном настроен отдельной джобой.

Ну, типа все 🙂


Как это выглядит на практике.

Утром в 11:00 приходит план на день: шаги, рабочие/домашние задачи, ведение дневника, что осталось из недельных целей вроде бассейна. Если не ответить - придёт мягкое напоминание ещё пару раз, максимум три сообщения.

Вечером - один опрос, без повторов. Отвечаю обычным текстом, свободной формулировкой, в любом порядке фактов. Бот разбирает сообщение сам и досчитывает необходимое но не выдумывает цифры, только уточняющий вопрос, если данных мало.

Каждый четверг стартует новый недельный раунд ровно на 7 дней, с отдельным отчётом за прошлую неделю: сумма баллов, разбивка по дням и активностям, средние шаги, посещения бассейна, прогресс. Раунд каждую неделю получает новую игровую обёртку: не сами правила, а подача и формулировки, чтобы не приедалось.

Баллы начисляются по чётким таблицам: сон, питание, шаги, рабочие и домашние задачи, дневник, плавание - у каждого свой диапазон и свой «вес». Плановый максимум недели фиксированный, а дополнительные заплывы сверх плана дают бонусные баллы, которые могут компенсировать слабый день - это разрешённое «читерство» в игре с самим собой.

Продожение в следующей серии (Технические подробности)… 🙂


Репост из: Alexander Bukreev
Лимиты Кодекса кончились. Лимиты Клода кончились. Выпускаем Кракена (GLM) :-)


Псилохог подсказал одну интересную особенность мозга… Послушал несколько лекций по этой теме. Появилась идея.

Я давно заметил закономерность: у меня не проблема с силой воли вообще, а с тем, чтобы просто начать - выйти на прогулку, дойти до бассейна, сесть за домашние дела. Одно и то же напоминание в календаре я могу игнорировать неделями… 🙂

Решил сделать личного Telegram-бота, который превращает рутину в игру. Не трекер для галочек, а что-то, что напоминает по-разному, принимает отчёт обычным текстом («5 рабочих задач закрыл, 2 домашних, 4300 шагов, дневник заполнил») и сразу считает баллы.

Ключевая мысль: не требовать идеального дня. Каждый день - это просто «сколько баллов получилось набрать». Частичный результат лучше нулевого, и один плохой день не рушит всю неделю.

В основе - принцип PINCH (Passion, Interest, Novelty, Challenge, Hurry): игра, личный контекст, еженедельная новизна оформления, вызов самому себе прошлому, и мягкая срочность вместо давления. Никакого стыда и чувства вины - только похвала, подколы и очередной раунд.

Те по сути - это обычный игровой процесс. Где нужно набрать максимальное количество балов за неделю.

Продолжение в следующей серии… :-))

291 1 6 11 16

Codex, ять…

Так и живем :-)


Мне тут добрый человечек @Sprytru подкинул ключик для опенроутера и попросил протестить еще несколько моделек.

ОБновленный рейтинг на экране.

Если что - я думал какая-то ошибка. Сначала перепроверил, потом еще раз запустил GPT SOL. Неа, ровно тот же результат получился…

Мимо.Про удивила. Как и Соннет 5 в начале тестов.


Есть знакомый сильный CTO - Александр Букреев. Более 20 лет работает с
web-системами и инженерными командами. Управлял до четырёх одновременных
кросс-функциональных команд и 22 прямыми техническими подчинёнными; отвечал за
найм, архитектуру совместно с командой, delivery, production, безопасность
и технический бюджет.

Умеет выстраивать технологическую функцию в действующем digital-бизнесе:
масштабировал инженерную организацию с 3 до 15 человек, сокращал деплой
с максимум 90 до примерно 10 минут, руководил системами с нагрузкой до
700 тыс. авторизаций в сутки и около 3 млн транзакций в месяц.

Сейчас рассматривает CTO-позиции и проектную работу. Работает удалённо из
Москвы, возможны встречи и редкие командировки. Если вам или кому-то из ваших
знакомых нужен опытный CTO для уже работающего продукта и команды, можно
написать Александру напрямую:

Резюме: https://bukreev.pro/resume
Telegram: https://t.me/abukreev


Друзья, у меня для вас внезапное предложение: помочь знакомому проекту получить хорошего CTO. Знакомый - это я 🙂

Многие из вас знают меня давно и именно как технического директора: я больше 20 лет работаю с web-системами, строю команды разработки и навожу порядок между «бизнесу нужно» и «разработка делает».

Сейчас ищу новый проект или постоянную работу в роли CTO. Лучше всего подойду действующему digital/web-бизнесу после MVP, где уже есть продукт, деньги на разработку и команда, но нужен человек, который возьмёт на себя технологическую функцию целиком.

Что умею:

- управлять несколькими командами разработки, QA и DevOps одновременно;
- нанимать, увольнять и развивать людей;
- вместе с командой отвечать за архитектуру, инфраструктуру, production,
безопасность и инциденты;
- выстраивать понятный delivery - от проработки задач до релиза и отката;
- готовить и обосновывать технический бюджет;
- разговаривать с собственниками и продуктовой командой на языке целей,
приоритетов и рисков.

Немного масштаба: до четырёх одновременных кросс-функциональных команд, 22 прямых технических подчинённых, рост инженерной организации с 3 до 15 человек. В одном из проектов сократили деплой с максимум 90 до примерно 10 минут. В более ранних системах были нагрузки до 700 тыс. авторизаций в сутки и около 3 млн транзакций в месяц.

Работаю из Москвы, преимущественно удалённо. Возможны встречи и редкие командировки, релокация - нет. Ищу именно CTO-функцию, а не работу программистом с красивым названием должности.

Теперь самое интересное. Если вы лично порекомендуете меня человеку со стороны компании и эта рекомендация приведёт к подписанному договору, я выплачу вам 20% от своей первой полной выплаты.

Правило действует для любого договора: штат, ИП или проектная работа. Даже если до вашей рекомендации я уже самостоятельно откликнулся в эту компанию.

Чтобы зафиксировать рекомендацию, просто напишите мне название компании и кому вы меня представили. Если рекомендаций в одну компанию будет несколько, учитывается первая зафиксированная.

Резюме: https://bukreev.pro/resume
Правила и готовый текст для пересылки: https://bukreev.pro/recommend-cto
Telegram: https://t.me/abukreev

А ниже оставляю короткий текст, который можно просто переслать нужному человеку.


Мне тут подсказали, что в гугл-консоль можно теперь добавить соцеточки для аналитики.

Правда поговаривают так же, что еще не всем раскатали. Жалко мне тестить не на чем :-)


Опять эти загадочные "сайты, работающие в России".

Дебилы, блин. Практически любой сайт в мире открывается и "работает" в России - как и в любой другой стране с доступом в интернет. Сайт - это не магазин, который открыл филиал в Химках.

По такой формулировке российский номер телефона скоро потребуется для входа на сайт музея в Перу, форум японских аквариумистов и домашнюю страницу профессора из Огайо.

Осталось только объяснить всему интернету, что он теперь работает по российским законам.


Ну и пожалуста. Вообще в шоке сижу…

Получается Луна и Терра на этом типе задач уделывают Сол и GPT 5.5

8-0

ЗЫ. Ушел еще раз много думать…


Сегодня не было настроения работать. Жарковато.

В общем решил продолжить развлечение. С очень неожиданной развязкой.

Sonnet 5 обошел всех в рейтинге. И terra от ГПТ оказалась лучше остальных ГПТ-моделей.

Для меня прямо открытие. Сижу, перевариваю.
Я «просто глянуть» эти две модели запустил…

И что теперь, Луну и Хайку тестить? :-)


Почему xhigh effort - это не режим "максимальной эффективности"

Закончил тесты GPT на десяти реальных задачах. Сравнивал обычные значения effort с переключением на xhigh.

Результат довольно однозначный: xhigh не улучшил качество ни у одной из моделей, зато существенно увеличил время работы и расход токенов.

У GPT-5.6 результат снизился с 70,18% до 69,21%, а количество полностью решенных задач - с 6 из 10 до 5 из 10. Время выросло с 21:39 до 55:40, объем входных токенов - с 3,32 до 7,08 млн, выходных - с 44,96 до 122,28 тыс.

У GPT-5.5 результат снизился с 61,38% до 59,05%, решенных задач стало 4 из 10 вместо 5 из 10. Время выросло с 38:12 до часа, выходных токенов стало больше примерно вдвое.

То есть в данном случае "не улучшил" фактически означает "ухудшил". Модель дольше работала, потратила больше токенов и в итоге решила меньше задач.

Высокий effort действительно может быть полезен, но не как настройка по умолчанию. Он нужен для задач, где требуется именно размышление:

аналитика рынка или ниши
формирование продуктовой карты
поиск неочевидных решениq
творческие задачи
работа с неявными критериями приемки
ситуации, где нужно не выполнить инструкцию, а сначала придумать, что именно следует делать

Но если агент просто выполняет понятные операции, пишет обычный код или оркестратор только управляет другими агентами, высокий effort ему не нужен.

Для кодинга он зачастую скорее вреден. Модель начинает дольше обдумывать простые действия, генерирует больше промежуточных рассуждений и медленнее приходит к тому же или даже худшему результату.

Отсюда, видимо, и рассказы о том, как люди постоянно сжигают лимиты своих тарифов, которых им вечно не хватает. Включают "максимальное мышление" для всех задач подряд и получают расход в два-три раза больше времени и токенов.

Но "больше думать" - вообще не синоним эффективности.

Иногда это буквально означает, что прежде чем выполнить ls или dir, модель долго размышляет, как эта команда повлияет на архитектуру всего проекта. 🙂

Короче, переключаться на xhigh для тестов было плохой идеей. Возвращаю модели на medium и дальнейшие сравнения буду проводить именно на нем.

Высокий effort оставлю для тех задач, где дополнительное размышление действительно является частью работы

Показано 20 последних публикаций.