CAMEL-AI запустили систему,где ИИ сам создает данные для обучения в физике, математике и других сложных областях
Project Loong автоматически создает, верифицирует и использует синтетические данные для обучения LLM в узкоспециализированных доменах (физика, математика, биология).
Система использует комбинацию кода и цепочек рассуждений для проверки корректности и обучает модели через RL на верифицированных примерах.
Ключевые преимущества:
1. Нулевая зависимость от размеченных данных
2. Автоматическая верификация ответов
3. Специализация в 8 сложных доменах
Полностью открытый исходный код
Как это работает?
Небольшой seed-датасет →
Генерация синтетических примеров →
Двойная верификация через код и рассуждения →
RL-обучение на проверенных данных →
Улучшение генерации
HuggingFace
GitHub
Project Loong автоматически создает, верифицирует и использует синтетические данные для обучения LLM в узкоспециализированных доменах (физика, математика, биология).
Система использует комбинацию кода и цепочек рассуждений для проверки корректности и обучает модели через RL на верифицированных примерах.
Ключевые преимущества:
1. Нулевая зависимость от размеченных данных
2. Автоматическая верификация ответов
3. Специализация в 8 сложных доменах
Полностью открытый исходный код
Как это работает?
Небольшой seed-датасет →
Генерация синтетических примеров →
Двойная верификация через код и рассуждения →
RL-обучение на проверенных данных →
Улучшение генерации
HuggingFace
GitHub