Продолжаем неторопливо разбирать статьи с #ICLR 2026 🇧🇷 в этот раз LiteCoST — двухэтапный фреймворк для QA на длинном контексте (от 10K токенов).
Stage 1️⃣: Генерация CoST-трейсов с GPT-4o
Сначала GPT-4o генерирует Chain-of-Structured-Thought (CoST) трейсы: анализирует запрос, выбирает структуру (таблица/граф), строит схему, извлекает данные, проверяет качество и уточняет итеративно, если ответ не совпадает с референсом. Таким образом мы получаем и трейс, и структурированный контекст как вывод (SSO) — таблицу или граф.
Stage 2️⃣: Адаптация SLM через SFT + GRPO
Трейсы используются для обучения SLM: LLaMA-3.2-3B-Instruct (3B) и Qwen2-7B-Instruct. Для обучения использовались данные из FinQA (8k), TAT-QA (16k), SQuAD (100k+), LegalBench (6.8k) — всего
Stage 1️⃣: Генерация CoST-трейсов с GPT-4o
Сначала GPT-4o генерирует Chain-of-Structured-Thought (CoST) трейсы: анализирует запрос, выбирает структуру (таблица/граф), строит схему, извлекает данные, проверяет качество и уточняет итеративно, если ответ не совпадает с референсом. Таким образом мы получаем и трейс, и структурированный контекст как вывод (SSO) — таблицу или граф.
Stage 2️⃣: Адаптация SLM через SFT + GRPO
Трейсы используются для обучения SLM: LLaMA-3.2-3B-Instruct (3B) и Qwen2-7B-Instruct. Для обучения использовались данные из FinQA (8k), TAT-QA (16k), SQuAD (100k+), LegalBench (6.8k) — всего