Новая гонка в ИИ — за данные. И особенно за научныеThe New York Times
сегодня пишет о менее заметном измерении технологического соперничества США и Китая. Пекин хочет экспортировать миру не только собственные AI-модели, но и
данные, на которых будут обучаться будущие модели.
В начале 2026 года китайская National Data Administration представила план: к концу 2028-го Китай должен стать одной из ведущих «держав данных». Предполагается создавать высококачественные датасеты более чем в двух десятках стратегических областей — от промышленности и автономного транспорта до
научных исследований — и распространять их за рубежом.
У китайской стратегии ИИ четыре компонента:
- модели
- compute
- таланты
- И ДАННЫЕ
Причем не просто гигантские массивы текстов из интернета. По мере усложнения моделей главным дефицитом становятся тщательно собранные, размеченные экспертами и структурированные данные. Китай прямо собирается переходить от дешевой массовой разметки к
expert-type data annotation. Университетам предлагается готовить специалистов по работе с данными, а государству, компаниям и исследовательским организациям — разрушать существующие между ними «силосы».
Современный научный ИИ учится работать с геномами, молекулярными структурами, медицинскими изображениями, результатами экспериментов, климатическими наблюдениями, телеметрией приборов и лабораторными протоколами.
Качество научных данных становится одним из главных ограничений.
Nature Machine Intelligence недавно отдельно подчеркнул: успех AI в биологии все сильнее зависит от постоянной работы по сбору, курированию, аннотированию и стандартизации научных данных.
Есть еще более глубокая проблема. Огромный пласт потенциально полезных данных сегодня вообще не сохраняется.
Nature Methods обращает внимание, что научные приборы выбрасывают массивы информации о том,
как именно проводился эксперимент: команды оператора, последовательности действий, настройки прибора, ошибки и способы их устранения. Именно на таких данных будущий AI мог бы научиться не просто анализировать эксперимент, а проводить его.
Поэтому можно представить следующую фазу AI for Science. Страна, которая создаст большие машинно-читаемые массивы
достоверных экспериментальных данных — с качественными метаданными, отрицательными результатами, историей экспериментов и экспертной разметкой, — получит своего рода
научный pretraining corpus.
Это стратегическая инфраструктура примерно того же уровня, что суперкомпьютеры или синхротроны.
Это мегасайенс данных.Но китайская стратегия показывает и другую сторону проблемы.
Данные никогда не бывают полностью нейтральными. NYT приводит пример WanJuan — созданного Shanghai AI Laboratory огромного набора данных, который прямо заявлен как соответствующий
китайским ценностям. Он доступен уже не только на китайском, но и на русском, арабском, корейском, тайском и вьетнамском языках.
Исследования уже показывают, что даже западные модели могут давать существенно разные ответы о Китае на английском и китайском языках — вероятно, потому что китайскоязычная часть обучающих корпусов непропорционально сильно представлена государственными СМИ.
В науке аналогичная проблема потенциально серьезнее.
Если научные AI-системы будут обучаться преимущественно на данных определенных стран, лабораторий, популяций, приборов и исследовательских традиций, они будут наследовать не только знания, но и
структуру этих данных: что измеряли, что не измеряли, какие гипотезы считали достойными проверки и какие результаты публиковали. Проблема representativeness уже хорошо известна, например, для
медицинских foundation models.
Отсюда возникает формула технологического суверенитета. Свои LLM. Свои GPU. Свои научные AI-модели. И
собственные качественные научные данные и инфраструктуру их накопления.
Возможно, одним из главных научных мегапроектов ближайшего десятилетия окажется вовсе не очередная большая модель, а создание национальных массивов AI-ready scientific data. Вопрос
«кто производит данные?» постепенно становится столь же важным, как вопрос
«кто производит знания?».