Sinекура


Kanal geosi va tili: Rossiya, Ruscha
Toifa: Bloglar


Канал Сергея Николенко обо всём, но в основном об AI.
Сайт с выступлениями, лекциями и публикациями: https://sergeynikolenko.ru/

Связанные каналы

Kanal geosi va tili
Rossiya, Ruscha
Toifa
Bloglar
Statistika
Postlar filtri


В деньрожденческом посте я анонсировал, что выложу невероятный подарок от Иры. Но пока собирался это сделать, понял, что я так и не выложил её предыдущий невероятный подарок, ещё новогодний.

Это... глянцевый журнал про меня. Буквально, целый журнал, в том числе физически напечатанный. Со статьями, которые действительно интересно читать, с участием многих моих близких друзей, с кучей отличных фотографий и стильных псевдореклам. (И да, он реально глянцевый, так что фотографии не очень задались.)

Совершенно потрясающая штука, и хотя мне сложно реально оценить, сколько это было работы, даже скромные нижние оценки выглядят ужасающе.

В декабре Ира даже взяла у меня полноценное интервью для этого журнала так, что я совершенно не понял суть замысла. А потом на Новый год как понял...

К журналу ещё и сайт прилагается, но, как и положено сайту глянцевого журнала, там не все статьи выложены. Так что есть и отдельный полный pdf. Встречайте:

Сайт singularityzine.press
(кстати, почта hello@singularityzine.press работает, можете Ире туда написать)

Прямая ссылка на полный pdf журнала
(и google drive на всякий случай)

Мне даже как-то немного волнительно это выкладывать. Но, думаю, пора. ;)

Разве что с утверждением на последней странице я теперь, после своего дня рождения, не могу согласиться.) Но это уже другая история...

#lifestyle #fun #web


Сегодня симулятор ходьбы, очень атмосферная игра про смотрителя маяка где-то на севере: холодное море, туман, северное сияние, брошенные посёлки и одинокий человек, который едет искать пропавшего сына. Сделано красиво и с большим вниманием к деталям, особенно к лодке. Как всегда, лучше читать по ссылке:

WILL: Follow The Light
(и вот выложил на DTF)

Игра вышла этой весной, в мае 2026 года. Сделано на Unreal Engine 5, и выглядит это, надо сказать, отлично: свет, вода, туман и погода здесь на уровне заметно более дорогих проектов.

Главного героя зовут Уилл Нильсен, и он смотритель маяка. Место действия прямо не называется, но на стене в его комнате висит карта Исландии, местный бар называется Hekla’s Hideaway, а фамилии у людей вроде Олофсдоттир,так что тут всё ясно.

Начало игры мне очень понравилось. Первые полчаса — это просто рабочая смена [...] И по ходу этой рутины игра рассказывает про героя. [...] Атмосфера сразу затягивает. [...]

Отдельно надо сказать про лодку, потому что это один из лучших компонентов игры. У Уилла есть яхта по имени Molly, и она сделана роскошно: обшитая деревом каюта с диванами, керосиновыми лампами и иллюминаторами; рация на столе, по которой надо ловить нужную частоту; карта, на которой перед выходом надо самому проложить маршрут. И собственно ходьба под парусом... [...]

Дальше игра выпускает героя на сушу, и здесь тоже всё хорошо. Городок Хафсберг сделан душевно и узнаваемо: деревянные крашеные дома, церквушка на холме, бар, доска объявлений с записками про пропавшую собаку и туман. Часть города разрушена, среди руин стоят палатки спасателей, и по ним ходят люди, с которыми можно поговорить.

Персонажи, кстати, тоже удались. Их немного, но каждый живой: диспетчер Кэсс, бармен, который «просто подменяет», врач в палатке, каюр с собаками, отец. Диалоги написаны сдержанно и без пафоса, озвучены прилично.

А во второй половине игра уходит на север, и вот тут начинается уже совсем красота: горы, снега, собачья упряжка, ледяные торосы, полярная ночь и северное сияние во весь экран. Есть даже белый медведь. Пейзажи здесь такие, что хочется останавливаться и просто смотреть, и игра это прекрасно понимает и регулярно ставит героя на удачную точку. [...]

Есть и недостатки. История в WILL, к сожалению, очень предсказуемая [...] Зато на этом фоне вдруг появляется какая-то ничем не объяснённая мистика. Герою является покойная жена и вручает волшебную лампу, свет которой как-то связан со светом маяков [...]

Я вообще заметил, что в атмосферных играх такого типа мистику добавляют почти всегда и почти всегда зря — как будто авторы не доверяют собственному материалу.

Но детали и построение мира в целом всё искупают. Здесь куча “настоящих” фотографий, вырезок, записок, жизнь городка на краю света показана очень выпукло. [...]

Так что если вы любите жанр — берите, тут есть за что любить. А если симуляторы ходьбы вас обычно усыпляют, WILL вряд ли переубедит: ходить, смотреть по сторонам и слушать чужие воспоминания здесь и есть основное занятие. Но мне понравилось.

#tgif #games


Обзор игры обязательно будет, но вне очереди поделюсь радостью, потому что очень уж хорошо совпало.

Только что написал
вам про статью "AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation"... и вот сегодня её приняли на EMNLP!

Вадим, Андрей и все-все-все, поздравляю!!

#research #publications #ai


Давным-давно, больше месяца назад, прошёл митап CS Space про LLM, на котором я не только делал доклад про вайб-математику, но и проводил квиз про LLM-искусство. Тогда же и обещал его выложить.

Вот, выполняю обещание в виде интерактивной игры на сайте:

Квиз по LLM-искусству

Там можно войти по Google-аккаунту, как в игре "Что было раньше" (о которой я вам писал месяц назад), но в целом особого смысла в этом нет, потому что лидерборд здесь точно низачем не нужен.

В квизе три раунда:

1. "Стихи о любви": нужно выбрать настоящий отрывок авторства известного поэта из четырёх вариантов, три из которых в стиле этого поэта написал Claude Fable 5.

2. "Автопортреты LLM": нужно выбрать из нескольких вариантов, какая именно модель написала подробные промпты для автопортретов, которые вы видите (в каждом задании четыре автопортрета одной и той же модели).

3. "AI-музыка": нужно ответить, о какой модели или архитектуре поётся в песне, текст которой сочинил Claude Fable, а на музыку положила Suno.

Второй тур во многом угадайка (я так и задумывал, чтобы немного уравнять шансы участников), а вот первый и третий, как по мне, прямо очень крутыми вышли.

Честно говоря, я за AI-музыкой не слежу и не ожидал, что песни так хорошо получатся. Да и стихи меня поразили. Вспомните, что ещё пару поколений назад LLM было очень трудно писать по-русски, соблюдая размер и рифму. А сейчас уже Бродский вообще как родной.)

Enjoy!

#web #chgk #fun


Сегодня продолжу рассказывать про свои недавние статьи. Вот, например, порекламирую работу моего аспиранта Вадима Ломшакова и ещё одного моего аспиранта (правда, больше формального) Андрея Подивилова:

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

Почти все бенчмарки для LLM-агентов сводят прогон к одному биту: решил задачу или нет. Для лидерборда это, может, и неизбежно, но человек, который работает с агентом целый день, видит всю траекторию: как агент следует инструкциям, как пользуется инструментами, проверяет ли за собой, как исправляет ошибки и что вообще пишет пользователю.

Агент может пройти формальную проверку, но быть невыносимым в "рабочей коммуникации"; а может в итоге так и не написать проходящую тесты программу, но по дороге сделать кучу полезного. А для задач вроде "напиши документацию" бинарного критерия успеха и вовсе не существует.

AgentLens — это попытка сделать систему, которая оценивает именно траектории. Каждый прогон получает формальную верификацию там, где она возможна (тесты, проверки состояния репозитория и т.д.), плюс отзывы LLM-судей по пяти измерениям: итоговый результат, следование инструкциям, разные ловушки (pitfalls), в которые можно попасться, качество работы с инструментами и просто насколько приятно человеку с агентом взаимодействовать.

Одна из главных идей в том, что LLM-судья не только ставит оценку, но и пишет связный текстовый отзыв со ссылками на конкретные места в траектории, так что любой балл хорошо мотивирован, и эту мотивацию можно реально прочитать. Пользователя в нашей статье, кстати, тоже симулирует LLM — с разными персонами, включая пользователя слегка токсичного.

В полученном лидерборде на первом месте Opus 4.7, но это довольно скучный результат. Самое интересное — что по отзывам часто видны важные подробности. Например, Kimi K2.6 оказался на последнем месте, и по цифрам это выглядит как "слабая модель"; но отзыв судьи по tool calls показывает, что почти все ошибки — это один и тот же баг парсинга аргументов на стороне OpenRouter, а когда аргументы доходили нормально, агент работал вполне прилично;

Ещё один любопытный результат — self-preference судей: если сравнивать GPT-5.5 и Sonnet 4.6 их же собственными судьями, каждый судья заметно чаще предпочитает свою модель. Это ожидаемо, но забавно, что половина этого эффекта — в той самой крайне субъективной метрике Pleasantness.) Впрочем, победителя в среднем это не меняет.

Весь код выложен в соответствующем репозитории, и есть даже отдельная страничка про AgentLens и пост от авторов из Explyt.

Спасибо Вадиму Ломшакову, Андрею Подивилову и другим соавторам! Надеюсь, ещё поработаем вместе.

#research #publications #ai



6 ta oxirgi post ko‘rsatilgan.