за последние годы инференс моделей очень подешевел: в конце 2022 модели уровня GPT-3.5 стоили $20 за миллион токенов, а к концу 2024 уже $0.07 (по данным Stanford's AI Index), то есть за два года разница 280x!
так что сейчас поставить пять моделей на один запрос стоит примерно как одна модель совсем недавно, что сильно повышает привлекательность ансамблей для решения сложных задач
поэтому я думаю что следующий bottleneck, который нужно решать — это то, что эти пять моделей могут говорить друг с другом только текстом: сейчас каждый handoff между моделями в ансамбле выглядит как одна модель, которая пишет предложения, и следующая, которая их читает и снова запускает на этом инференс
как минимум это медленно, но еще важнее то, что почти всё, что посчитала первая модель, не переживает этот перенос, вторая модель получает только результат и вся остальная посчитанная инфа теряется
так что сейчас поставить пять моделей на один запрос стоит примерно как одна модель совсем недавно, что сильно повышает привлекательность ансамблей для решения сложных задач
поэтому я думаю что следующий bottleneck, который нужно решать — это то, что эти пять моделей могут говорить друг с другом только текстом: сейчас каждый handoff между моделями в ансамбле выглядит как одна модель, которая пишет предложения, и следующая, которая их читает и снова запускает на этом инференс
как минимум это медленно, но еще важнее то, что почти всё, что посчитала первая модель, не переживает этот перенос, вторая модель получает только результат и вся остальная посчитанная инфа теряется