Власть данных в эпоху ИИ
Информация в цифровую эпоху давно стала новой нефтью (извините за штамп). Однако в последнее время в связи с бурным развитием ИИ, ценность данных стала особенно ощутимой. Масштабирование LLM, появление все большего числа параметров - наглядный показатель как роста эффективности моделей, так и объема уникальных (или не очень) данных, на базе которых эти модели учатся.
Власть постепенно переходит не столько к тем, кто способен создать лучший алгоритм, сколько к тем, кто контролирует доступ к данным. Неслучайно в недавно принятом законе о поддержке развития ИИ в России значительное внимание уделяется именно данным. Саму технологию со временем можно воспроизвести. Вычислительные мощности можно купить или арендовать. Даже специалисты, несмотря на сохраняющийся дефицит, перемещаются между компаниями и странами (правда, только пока, Китай уже вводит ограничения). Но качественный массив данных, особенно уникальных данных, не купить уже сейчас.
Возникает новая форма дефицита. Интернет долгое время создавал иллюзию практически неограниченного доступа к информации. Казалось, что преимущество получает тот, кто умеет быстрее находить, обрабатывать и интерпретировать открытые данные. ИИ постепенно меняет эту модель. Публичная информация доступна всем игрокам и поэтому сама по себе дает все меньше конкурентных преимуществ.
По данным Epoch AI, весь эффективный запас качественного публичного текста, созданного человечеством, составляет порядка 300 трлн. токенов. При сохранении текущих темпов масштабирования языковые модели полностью выберут его между 2026 и 2032 годом. Ценность смещается в сторону закрытых массивов: корпоративных баз, пользовательских историй, медицинских данных и финансовой информации.
Отсюда возникает и новый реструмент (а может и форма) власти - право решать, кто именно получит доступ к информации и на каких условиях. У любого бизнеса есть некие наборы данных. Это информация о клиентах, маркетинговые, финансовые данные. Если речь идет о крупном бизнесе и некоем уникальном продукте, например, фитнес-трекере, то у компании есть ценная информация о физической активности пользователей.
За три года сформировался рынок, которого прежде не существовало. По данным WSJ, пятилетнее соглашение OpenAI с News Corp оценивается более чем в $250 млн. Google платит Reddit около $60 млн в год за доступ к веткам на форуме, на основе которых обучается Gemini. Amazon приобрел доступ к архивам The New York Times за $20–25 млн в год. Список можно продолжать.
Данные определяют геополитику века XXI-го, но с одним нюансом.
Предыдущая ценность - нефть (возвращаюсь к первому тезису ;)) была исчерпаема, но в какой-то мере и в какое-то время вполне взаимозаменяема. Баррель есть баррель. Купите вы его у России, Ирана, или Саудовской Аравии – не столь важно. Данные, напротив - уникальны. Второго Reddit не существует. А значит, торг здесь будет не рыночным, а силовым. Теперь уникальные данные и есть ресурсы власти.
Что тут делать?
Кроме того, что стоит:
а) определить свои уникальные данные и
б) попытаться понять как ими не делиться с лишними субъектами, ничего другого не могу предложить. Ну и не стоит создавать новых данных без понимания - какие риски это производство несет для вас лично и для вашего бизнеса.
Информация в цифровую эпоху давно стала новой нефтью (извините за штамп). Однако в последнее время в связи с бурным развитием ИИ, ценность данных стала особенно ощутимой. Масштабирование LLM, появление все большего числа параметров - наглядный показатель как роста эффективности моделей, так и объема уникальных (или не очень) данных, на базе которых эти модели учатся.
Власть постепенно переходит не столько к тем, кто способен создать лучший алгоритм, сколько к тем, кто контролирует доступ к данным. Неслучайно в недавно принятом законе о поддержке развития ИИ в России значительное внимание уделяется именно данным. Саму технологию со временем можно воспроизвести. Вычислительные мощности можно купить или арендовать. Даже специалисты, несмотря на сохраняющийся дефицит, перемещаются между компаниями и странами (правда, только пока, Китай уже вводит ограничения). Но качественный массив данных, особенно уникальных данных, не купить уже сейчас.
Возникает новая форма дефицита. Интернет долгое время создавал иллюзию практически неограниченного доступа к информации. Казалось, что преимущество получает тот, кто умеет быстрее находить, обрабатывать и интерпретировать открытые данные. ИИ постепенно меняет эту модель. Публичная информация доступна всем игрокам и поэтому сама по себе дает все меньше конкурентных преимуществ.
По данным Epoch AI, весь эффективный запас качественного публичного текста, созданного человечеством, составляет порядка 300 трлн. токенов. При сохранении текущих темпов масштабирования языковые модели полностью выберут его между 2026 и 2032 годом. Ценность смещается в сторону закрытых массивов: корпоративных баз, пользовательских историй, медицинских данных и финансовой информации.
Отсюда возникает и новый реструмент (а может и форма) власти - право решать, кто именно получит доступ к информации и на каких условиях. У любого бизнеса есть некие наборы данных. Это информация о клиентах, маркетинговые, финансовые данные. Если речь идет о крупном бизнесе и некоем уникальном продукте, например, фитнес-трекере, то у компании есть ценная информация о физической активности пользователей.
За три года сформировался рынок, которого прежде не существовало. По данным WSJ, пятилетнее соглашение OpenAI с News Corp оценивается более чем в $250 млн. Google платит Reddit около $60 млн в год за доступ к веткам на форуме, на основе которых обучается Gemini. Amazon приобрел доступ к архивам The New York Times за $20–25 млн в год. Список можно продолжать.
Данные определяют геополитику века XXI-го, но с одним нюансом.
Предыдущая ценность - нефть (возвращаюсь к первому тезису ;)) была исчерпаема, но в какой-то мере и в какое-то время вполне взаимозаменяема. Баррель есть баррель. Купите вы его у России, Ирана, или Саудовской Аравии – не столь важно. Данные, напротив - уникальны. Второго Reddit не существует. А значит, торг здесь будет не рыночным, а силовым. Теперь уникальные данные и есть ресурсы власти.
Что тут делать?
Кроме того, что стоит:
а) определить свои уникальные данные и
б) попытаться понять как ими не делиться с лишними субъектами, ничего другого не могу предложить. Ну и не стоит создавать новых данных без понимания - какие риски это производство несет для вас лично и для вашего бизнеса.