TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
OK ML

20 May, 14:57

Открыть в Telegram Поделиться Пожаловаться

Может ли ИИ самостоятельно взломать программу, имея только её исполняемый файл?

Статья посвящена учебным задачам — CrackMe-программам, не вредоносному взлому, но прочитать полезно и задумка на уровне AGI. Авторы построили автоматизированный полигон для реверс-инжиниринга. Туда помещают ИИ-агента и дают ему бинарник, набор инструментов, терминал Linux и ограничение по времени (можно и еще бы ограничений накрутить, чтоб не улететь по токенам в космос 😭).

ИИ должен ✅ исследовать программу, понять её логику, получить пароль/ключ и отправить результат. А система автоматически проверяет правильный ли ответ. Так как ИИ умеет красиво объяснять, прекрасно газлайтит 😈 и феерично галлюцинирует 🍄, успех  авторами статьи определяется только исполняемой проверкой. То есть важно только принимает ли бинарник найденный пароль 🌐. 

Фреймворк можно разделить на 5 частей (контейнер с Linux, набор инструментов реверса (дизассемблеры, компиляторы, библиотеки, отладчиик, символьный анализ и т.д.), интерфейс общения с ИИ, сама система проверки и система логирования) и записывает ВСЁ:
🙂 какие команды выполнял ИИ;
🙂сколько времени потратил;
🙂сколько токенов использовал;
🙂какие инструменты запускал;
🙂сколько раз ошибался;
🙂где именно провалился.

Почему фреймворк интересен, вопреки спорным результатам? 
Даже на образовательных, относительно простых задачах бинарного реверс-инжиниринга модели показывают сильный разброс. GPT-5.5 значительно опережает конкурентов (а вот моя любимая кими к2 сильно отстает), особенно на сложных задачах. Все модели хуже справляются с реальными публичными CrackMe, чем со сгенерированными шаблонами. 💐Это показывает, что шаблонные задачи ещё не полностью отражают сложность реального мира и, конечно, полностью опираться на такие результаты не стоит.

Главная ценность работы, кмк, в попытке превратить реверс-инжиниринг в формальную, воспроизводимую и автоматически проверяемую задачу для ИИ-агентов.  😑Особенно интересно, что бенчмарк измеряет не просто знания модели о реверс-инжиниринге, а её способность автономно действовать: строить гипотезы, выбирать инструменты, проверять результаты, менять стратегию и вовремя останавливаться. Многие модели, судя по логам, находили правильное направление анализа, но не успевали превратить его в рабочий ответ.

Читаем!
Тырим идею себе в ресеч, улучшаем, разрываем индустрию!
Все!
🔨

348 2 8 11 35
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot