Плато ИИ реальна, но надежда есть - следующий скачок произойдет, когда стартапы помогут компаниям использовать свои бизнес - данные
Современные большие языковые модели ИИ обучаются на общедоступных данных из Интернета.
Но общедоступные текстовые обучающие данные в Интернете уже давно собраны (например, Github, Reddit, Wordpress и другие общедоступные веб-страницы).
Это заставляет компаниям, занимающимся ИИ, отказаться от других источников. Например, с помощью Whisper OpenAI расшифровала миллион часов видео на YouTube для GPT-4. Еще одна тактика заключается в использовании недорогих, человеческих ресурсов через такие сервисы, как ScaleAI.
Поставщики моделей могут продолжать следовать этому пути (в конце концов, есть примерно 150 миллионов часов видео на YouTube).
Улучшения, скорее всего, будут незначительными; доходность снизится. Синтетические данные - это еще один путь, но есть свои ограничения и слабые места.
Emergence Capital считает, что настоящий прорыв, который позволит человечеству перейти к следующему уровню - это бизнес - данные, созданные на работе.
Искусственный интеллект, построенный на собственных бизнес-данных, станет огромной волной в ближайшее время.
Посмотрите на эти цифры:
- В 2020 году Zoom зафиксировал 3,3 триллиона минут совещаний - 55 миллиардов часов - динамического участия человека. Это затмевает примерно 150 миллионов часов общего контента YouTube.
- Ironclad обрабатывает более 1 миллиарда документов в год.
- Slack передает более миллиарда сообщений в неделю.
Почему это так ценно: Сравните ARPU лучших потребительских приложений с ценой за рабочее место в некоторых B2B-приложениях.
Даже самые популярные бизнес-приложения, такие как Notion, по-прежнему зарабатывают гораздо больше.
Современные большие языковые модели ИИ обучаются на общедоступных данных из Интернета.
Но общедоступные текстовые обучающие данные в Интернете уже давно собраны (например, Github, Reddit, Wordpress и другие общедоступные веб-страницы).
Это заставляет компаниям, занимающимся ИИ, отказаться от других источников. Например, с помощью Whisper OpenAI расшифровала миллион часов видео на YouTube для GPT-4. Еще одна тактика заключается в использовании недорогих, человеческих ресурсов через такие сервисы, как ScaleAI.
Поставщики моделей могут продолжать следовать этому пути (в конце концов, есть примерно 150 миллионов часов видео на YouTube).
Улучшения, скорее всего, будут незначительными; доходность снизится. Синтетические данные - это еще один путь, но есть свои ограничения и слабые места.
Emergence Capital считает, что настоящий прорыв, который позволит человечеству перейти к следующему уровню - это бизнес - данные, созданные на работе.
Искусственный интеллект, построенный на собственных бизнес-данных, станет огромной волной в ближайшее время.
Посмотрите на эти цифры:
- В 2020 году Zoom зафиксировал 3,3 триллиона минут совещаний - 55 миллиардов часов - динамического участия человека. Это затмевает примерно 150 миллионов часов общего контента YouTube.
- Ironclad обрабатывает более 1 миллиарда документов в год.
- Slack передает более миллиарда сообщений в неделю.
Почему это так ценно: Сравните ARPU лучших потребительских приложений с ценой за рабочее место в некоторых B2B-приложениях.
Даже самые популярные бизнес-приложения, такие как Notion, по-прежнему зарабатывают гораздо больше.