TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Павлин Шарит

7 Jun, 17:07

Открыть в Telegram Поделиться Пожаловаться

LLM gateway

Поймал себя на том, что в третьем по счету проекте копирую один и тот же кусок прокси для OpenAI - и понял, что пора это выносить

Сейчас сложно найти продукт, в котором нет хотя бы одного обращения к LLM (или БЯМ - большая языковая модель, как же мне нравится эта аббревитура), и вместе с этим остро встает вопрос работы с ключами

Понятно, что секреты мы держим в переменных среды или в централизованном хранилище, но когда проектов становится много, этого уже мало - нет единого подсчета токенов, нет централизованного управления, и в каждом сервисе болтается свой кусок логики для общения с провайдером

Решается это через AI gateway - по сути как nginx, только стоит не перед бекендом, а перед LLM-провайдером и проксирует все запросы через себя

Litellm - open source решение, которое умеет говорить со 100+ провайдерами (OpenAI, Anthropic, Gemini, Bedrock и тд) в едином OpenAI-формате, так что менять провайдера можно прямо в конфиге, не переписывая интеграцию в коде

Через конфиги настраиваешь, какие есть провайдеры и их fallback-и на случай, если какой-то ляжет, а заодно получаешь:
- retry с настраиваемым числом попыток
- load balancing между несколькими ключами или деплойментами одной модели
- virtual keys - выдаешь команде или проекту отдельный ключ, не светя реальные ключи провайдеров
- лимиты по бюджету и токенам в разрезе проекта или пользователя
- кеширование ответов и rate limiting
- callbacks для логирования и observability - Langfuse, MLflow и прочие

Но что зашло больше всего - можно настроить пред и постобработку запроса, то есть написать кастомные middleware сразу на все запросы - например, вырезать персональные данные перед отправкой в модель и это заработает для всех сервисов разом, а не копипастой в каждом
GitHub - BerriAI/litellm: Python SDK, Proxy Server (AI Gateway) to call 100+ LLM APIs in OpenAI (or native) format, with cost tracking, guardrails, loadbalancing and logging. [Bedrock, Azure, OpenAI, VertexAI, Cohere, Anthropic, Sagemaker, HuggingFace, VLLM, NVIDIA NIM]
Python SDK, Proxy Server (AI Gateway) to call 100+ LLM APIs in OpenAI (or native) format, with cost tracking, guardrails, loadbalancing and logging. [Bedrock, Azure, OpenAI, VertexAI, Cohere, Anthr...

1.1k 0 19 6 25
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot