Сизиф нанимает рой LLM агентов работать вместо себя 🪨
🔺Сизифов труд — тяжёлая, бесконечная, безрезультатная работа и муки. Именно так зачастую ощущается настройка всяких парсеров, в которых нужно учесть 100500 случаев и исключений, которые встречаются в реальных данных.
🔺Мы недавно экспериментировали с парсерами документов и там получились неплохие результаты. Идея в том, что для типовых документов необязательно обучать ML или использовать LLM. Можно попросить LLM написать обычный парсер на питоне. Эдакий олд скул + хайп AI LLM Agent))) ну а че, стоим на плечах гигантов!
🔺Из плюсов:
✅суперская скорость выполнения в продакшене, так как мы не тащим туда LLM или ML
✅интерпретируемость и легкость изменения
✅на этапе создания парсера нам не нужен дорогой Сизиф-программист, все автоматически сделает LLM
🔺Главная проблема тут в том, как написать парсер под большой датасет. Зачастую в локальную модель не запихаешь много примеров. Тут нужно двигаться в сторону агентного роя. Много небольших агентов могут писать парсеры для разных примеров из датасета, а затем объединять это все в один мега парсер, например. Или же можно воспользоваться эволюционными алгоритмами (как делают google). По нашим тестам такие парсеры вполне себе пригодны для работы.
🔺Естественно, подход можно раскатать на любую задачу, которую можно решить через код. Планируем продолжать эксперименты…
🔺Сизифов труд — тяжёлая, бесконечная, безрезультатная работа и муки. Именно так зачастую ощущается настройка всяких парсеров, в которых нужно учесть 100500 случаев и исключений, которые встречаются в реальных данных.
🔺Мы недавно экспериментировали с парсерами документов и там получились неплохие результаты. Идея в том, что для типовых документов необязательно обучать ML или использовать LLM. Можно попросить LLM написать обычный парсер на питоне. Эдакий олд скул + хайп AI LLM Agent))) ну а че, стоим на плечах гигантов!
🔺Из плюсов:
✅суперская скорость выполнения в продакшене, так как мы не тащим туда LLM или ML
✅интерпретируемость и легкость изменения
✅на этапе создания парсера нам не нужен дорогой Сизиф-программист, все автоматически сделает LLM
🔺Главная проблема тут в том, как написать парсер под большой датасет. Зачастую в локальную модель не запихаешь много примеров. Тут нужно двигаться в сторону агентного роя. Много небольших агентов могут писать парсеры для разных примеров из датасета, а затем объединять это все в один мега парсер, например. Или же можно воспользоваться эволюционными алгоритмами (как делают google). По нашим тестам такие парсеры вполне себе пригодны для работы.
🔺Естественно, подход можно раскатать на любую задачу, которую можно решить через код. Планируем продолжать эксперименты…