В прошлой серии Anthropic покупала книги, отрезала им переплеты и превращала в training data. Оказалось, это был не эксцентричный художественный перформанс отдельно взятой компании, а вполне нормальный производственный процесс новой экономики.
Журналисты 404 Media решили выяснить, кто ещё скупает у букинистов книги партиями по тысяче штук. Метод выбрали простой и надёжный: положили AirTag внутрь одной книги и стали смотреть, куда она поедет.
Книга прошла через несколько логистических центров и в итоге приехала на склад Amazon в Лас-Вегасе, в подразделение VGT3.
Сотрудники VGT3 рассказывают, что там делают ровно то же, что Anthropic в Project Panama: принимают книги, сканируют ISBN, срезают переплёты и прогоняют страницы через сканеры. Amazon подтвердил, что действительно покупает книги «для разработки и улучшения продуктов и сервисов».
Похоже, что здесь есть бизнес-идея.
Пока AI-компании работают с самым простым пластом. Есть ISBN, есть маркетплейсы, есть миллионы книг, которые можно автоматически найти и купить. Фактически ISBN — готовая карта месторождений: вот книга, вот продавец, вот цена.
Но огромные пласты человеческого текста вообще не имеют ISBN и никогда не попадали в интернет: например, советские технические сборники, ведомственные издания, заводские каталоги, материалы конференций, старые учебники, региональные издания, книги малых тиражей.
И вот здесь появляется перспективная профессия будущего — скупщик металлолома геолог данных.
Компания не сканирует всё подряд. Она сначала определяет, каких знаний не хватает конкретной модели. Затем ищет физические источники, которых нет в интернете: у букинистов, в частных коллекциях, на складах закрытых издательств, в распродаваемых корпоративных собраниях.
После чего приходит к OpenAI, Amazon или Anthropic и говорит: «У вас плохо покрыта советская металлургия 1960–1985 годов. Мы нашли 1840 физических источников, которых нет в вашем корпусе. Можем их легально приобрести, оцифровать и собрать в отдельный dataset».
То есть возникает новая цепочка: найти белое пятно в знаниях модели → найти физические источники → выкупить → оцифровать → продать уникальный датасет.
Когда-то нефтяные компании отправляли геологов искать нефть. Теперь AI-компаниям понадобятся другие геологи — искать места, где человечество что-то написало, но интернет до этого ещё не добрался.
Первое издание Диккенса может стоить десятки тысяч долларов и быть бесполезным для модели: его текст давно оцифрован. А какой-нибудь советский сборник 1974 года за триста рублей может оказаться единственным источником нескольких сотен страниц, которых модель никогда не видела.
Следующий дефицитный ресурс — off-web human data.
Фактически появляется рынок месторождений человеческого текста, который ещё не был добыт интернетом.
И тот, кто первым научится составлять карты этих месторождений, искать их и превращать в готовые для обучения, получит очень неплохой бизнес.
@gostev_future
Журналисты 404 Media решили выяснить, кто ещё скупает у букинистов книги партиями по тысяче штук. Метод выбрали простой и надёжный: положили AirTag внутрь одной книги и стали смотреть, куда она поедет.
Книга прошла через несколько логистических центров и в итоге приехала на склад Amazon в Лас-Вегасе, в подразделение VGT3.
Сотрудники VGT3 рассказывают, что там делают ровно то же, что Anthropic в Project Panama: принимают книги, сканируют ISBN, срезают переплёты и прогоняют страницы через сканеры. Amazon подтвердил, что действительно покупает книги «для разработки и улучшения продуктов и сервисов».
Похоже, что здесь есть бизнес-идея.
Пока AI-компании работают с самым простым пластом. Есть ISBN, есть маркетплейсы, есть миллионы книг, которые можно автоматически найти и купить. Фактически ISBN — готовая карта месторождений: вот книга, вот продавец, вот цена.
Но огромные пласты человеческого текста вообще не имеют ISBN и никогда не попадали в интернет: например, советские технические сборники, ведомственные издания, заводские каталоги, материалы конференций, старые учебники, региональные издания, книги малых тиражей.
И вот здесь появляется перспективная профессия будущего — скупщик металлолома геолог данных.
Компания не сканирует всё подряд. Она сначала определяет, каких знаний не хватает конкретной модели. Затем ищет физические источники, которых нет в интернете: у букинистов, в частных коллекциях, на складах закрытых издательств, в распродаваемых корпоративных собраниях.
После чего приходит к OpenAI, Amazon или Anthropic и говорит: «У вас плохо покрыта советская металлургия 1960–1985 годов. Мы нашли 1840 физических источников, которых нет в вашем корпусе. Можем их легально приобрести, оцифровать и собрать в отдельный dataset».
То есть возникает новая цепочка: найти белое пятно в знаниях модели → найти физические источники → выкупить → оцифровать → продать уникальный датасет.
Когда-то нефтяные компании отправляли геологов искать нефть. Теперь AI-компаниям понадобятся другие геологи — искать места, где человечество что-то написало, но интернет до этого ещё не добрался.
Первое издание Диккенса может стоить десятки тысяч долларов и быть бесполезным для модели: его текст давно оцифрован. А какой-нибудь советский сборник 1974 года за триста рублей может оказаться единственным источником нескольких сотен страниц, которых модель никогда не видела.
Следующий дефицитный ресурс — off-web human data.
Фактически появляется рынок месторождений человеческого текста, который ещё не был добыт интернетом.
И тот, кто первым научится составлять карты этих месторождений, искать их и превращать в готовые для обучения, получит очень неплохой бизнес.
@gostev_future