Postlar filtri


нужность бенчмарков и эвалов
- миру нужно больше писькомерок для моделей
- репост выше пытается сказать, что китайский кими к3 практически догнал опус 5
- cursor bench для меня выглядит как один из самых полезных эвалов на рынке на сегодня
- нет такой большой нужной популярной задачи как программирование для ллм
- создание супер-кодера это самая важная задача сегодня в мире
- важнее этой задачи не существует
- американские компании по слухам сажают всех своих сотрудников и программистов-разметчиков делать разметку кодинговых данных
- десятки тысяч людей по всей планете учат ллмки программировать
- мы точно дойдем до стадии, где ллм будут как калькулятор для программирования (в целом по ощущениям мы почти там уже)
- я глубоко убежден, что бОльшая часть бенчмарков хакается китайскими лабораториями
- они накручивают показатели именно этих бенчей и их модели тупые как пробки за пределами задач этих бенчей
- китайцы мастерски дистилят опус и гпт и находят всё новые и новые пути для дистила западных моделей
- в конечном счете китайцы точно постепенно догоняют американские модели
- но я не готов верить что сегодня китайские модели где-то близко к американским
- пожалуйста переубедите меня и скажите мне чего я не знаю


Data Secrets dan repost
Очень показательный график из свежей статьи Bloomberg

Оранжевые точки – китайские модели, синие – США. По оси Y – взвешенное среднее по бенчмаркам GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, Humanity’s Last Exam, GPQA Diamond, CritPt, SciCode, AA-Omniscience и AA-LCR.

Ломаной соединены фронтирные модели. Видно, насколько за пару лет сократился разрыв в способностях (и это еще на графике нет GLM-5.3). Многие американские лидеры до сих пор утверждают, что китайские модели отстают на 6-9 месяцев, но, очевидно, эта информация устарела. И это уже не говоря про цены.




pered-transformerom.pdf
3.7Mb
Для тупых (для меня) всё что нужно знать перед тем как изучать трансформеры




жалкие попытки понять трансформер (надо учить как работают нейросети)


Grokking
- среди всех ИИ лабораторий в мире мне особо симпатизирует XAI (grok)
- они выбрали отличный от всех подход к выравниванию моделей (alignment)
- как делают другие: делают такой пост-трейнинг моделей (SFT, DPO, PPO, тестовые сеты) чтобы модели соответствовали полит-корректности
- к примеру OpenAI и Anthropic выравнивают под калифорнийские ценности
- китайские модели выравнивают под китайские ценности и политику
- при этом XAI выравнивают модели под миссию truthseeking, поиск истины
- это самый охуенный подход к алайменту
- мне как человеку который занят в пост-трейне моделей это очень импонирует
- надеюсь у меня в будущем будет возможность делать проекты с такими ценностями и подходами

Забавное про название Grok
- словечко grokking обозначает стадию пре-трейринга модели, когда её обучают на большом количестве данных и она неожиданно выучивает правила и взаимосвязи, которых на меньшем масштабе не понимала
- название grok образовано в том числе и от этого


kak-rabotayut-llm.html
17.5Kb
- нашел скилл от команды антропик
- делает разбор любых тем
- уровень разбора всегда для тех кто ниче не знает по теме
- и можно так разобрать любую учебную тему или кусок кода


автономные боты как сотрудники
- по запускам и логике становится понятно, что это некст биг финг
- антропики сделали клауд бота: в слаке можно подключить в любой тред и дать задачу или в личку в слаке
- xai сделали grok bot, тоже типа сотрудников заменяет (вот разбор)
- чтобы такое делать нужно иметь достаточно крутой уровень ллм и выбить на агентных бенчах хорошие показатели
- я думаю ллм будут двигаться к всё более автономному варианту работы над всё бОльшим размером задач
- может шутка перестанет быть шуткой: "make me a billion bucks. make no mistakes."
- если агенты начнут зарабатывать деньги... появятся первые ребята которые на этом зарабатывают больше чем тратят
- и если ты на 1 доллар зарабатываешь 1.01, то дальше оптимизация и масштабирование
- надо пойти поизучать что там в последних батчах YC


Claude управляет реальной войной
- сел значит поесть в промежутке между закрытием рабочих тикетов
- тут вышло видео с фактами, о которых я давно говорю друзьям и коллегам https://youtu.be/cfZ5pYYPvlk
- Palantir + все то ИИ лаборатории управляют каждой войной, которую ведут вооруженные силы США
- сегодня не для каждого очевидно, что LLM это важная часть в цепочке принятия решений в военных действиях
- и этот факт один из ключевых почему LLM сегодня это такая же важная технология как ядерное оружие
- но я надеюсь, что технология будет мирной и такой же важной и полезной как мирный атом


ship maxxing
- сейчас по ощущениям у меня смещается больше фокус в рабочие задачи
- на прохождение курса cs336 меньше времени
- но этот подход полезнее для моей прокачки
- я точно хочу пройти полностью курс
- но кажется я неправильно понял, что является важным
- всё же не уверен что скорость обучения это самое важное
- я могу учиться по 1-2 часа в неделю и это достаточный темп
- если конечно учиться так каждую неделю
- но что важнее максимизировать: доставку результата до юзеров
- не важно будут это рабочие задачи или опен-сорс проекты
- думаю главное на чем стоит держать фокус это "ship maxxing"
- тогда в рабочих задачах я быстрее научусь
- и если будут крохи времени и сил, то буду делать опен-сорс




Stepa dan repost
Мысли про вычисления на базе GPU
- думаю и спрос и предложение будут расти
- верю, что и Китай, и США нарастят производство
- кажется человечество готово употребить любое количество интеллектуальных вычислений, которое будет доступно
- не могу представить ситуацию, что самые умные вычисления не нужны (см антропик)
- могу представить ограничения спроса на не самые умные (китайский опен сорс)
- тяжело наверное быть фронтир лабораторией: нужно удерживать лидерство чтобы покупали у тебя (ситуация winner take it all)
- вопрос: что если мы достигнем предела точности/качества/сложности в задачах программирования?
- тогда начнут быть важными другие параметры: цена, скорость
- может цензура будет важна? Хочется верить что XAI с фокусом на truth seeking выиграет


ну пацаны, всё же очень просто




(ниче не понятно, но оч интересно)


cs336: Lecture 3: Architectures
- архитектуры моделей это оч просто
- вы же все знаете как работает типичный трасформер, да?
- (нет, не знаю)
- иду читать как устроен трансформер (приключение на 15 минут)


мативэйшен!



19 ta oxirgi post ko‘rsatilgan.