The /llms.txt file
Несмотря на то, что уже давно все AI-ассистенты научились ходить в интернет и парсить страницы, я всё равно предпочитаю формировать контекст запроса самостоятельно, подкладывая нужный контент в запрос.
Уже на автомате я быстро дописываю в начало URL префикс pure.md/, жму Enter и получаю чистый markdown-текст страницы без рекламы, сайдбаров и прочего текстового шума. Простая и тем самым гениальная идея: делать сервисы-прокси, которые парсят страницы и выдают только нужный контент. Уверен, что таких сейчас уже десятки, если не сотни.
До этого какое-то время я пользовался r.jina.ai/ — примерно то же самое, но, сами понимаете, разница между 8 и 10 символами решает многое =) Если знаете сервисы с ещё более короткими URL — делитесь в комментариях. Это, конечно, ирония – про разницу в 2 символа; скорее, в какой-то момент качество преобразования в чистый текст у https://pure.md было получше, на мой взгляд.
Но, на удивление, это не единственный паттерн того, как я «руками» забираю контент к себе в контекст запроса.
С появлением ChatGPT и других LLM-моделей, а в частности функций web search в них, появился пропозал по стандартизации специального .txt-файла в корне сайта — /llms.txt. По аналогии с robots.txt. Идея в том, что если на сайте есть такой файл, то он содержит структурированный контент, который могут использовать LLM-модели без необходимости парсить HTML-страницы.
Так как в последнее время я довольно много ковыряюсь с Claude Code и Anthropic SDK в целом, то уже и представить не могу, что бы я делал без возможности просто зайти на https://modelcontextprotocol.io/llms-full.txt и «прикопать» к себе целиком 1,2 МБ чистого текста документации. Очень удобно. И теперь всё чаще я на удачу проверяю наличие /llms.txt на других сайтах и расстраиваюсь, когда не нахожу их.
Неудивительно, что в процессе популяризации этой идеи появляются и сервисы-каталоги, которые собирают сайты, уже поддерживающие такие файлы — https://directory.llmstxt.cloud/
*️⃣Ну и, конечно же, я тоже иду в ногу со временем, поэтому добавил поддержку /llms.txt и к себе на сайт:
https://vavilov.dev/llms.txt 😄
Несмотря на то, что уже давно все AI-ассистенты научились ходить в интернет и парсить страницы, я всё равно предпочитаю формировать контекст запроса самостоятельно, подкладывая нужный контент в запрос.
Уже на автомате я быстро дописываю в начало URL префикс pure.md/, жму Enter и получаю чистый markdown-текст страницы без рекламы, сайдбаров и прочего текстового шума. Простая и тем самым гениальная идея: делать сервисы-прокси, которые парсят страницы и выдают только нужный контент. Уверен, что таких сейчас уже десятки, если не сотни.
До этого какое-то время я пользовался r.jina.ai/ — примерно то же самое, но, сами понимаете, разница между 8 и 10 символами решает многое =) Если знаете сервисы с ещё более короткими URL — делитесь в комментариях. Это, конечно, ирония – про разницу в 2 символа; скорее, в какой-то момент качество преобразования в чистый текст у https://pure.md было получше, на мой взгляд.
Но, на удивление, это не единственный паттерн того, как я «руками» забираю контент к себе в контекст запроса.
С появлением ChatGPT и других LLM-моделей, а в частности функций web search в них, появился пропозал по стандартизации специального .txt-файла в корне сайта — /llms.txt. По аналогии с robots.txt. Идея в том, что если на сайте есть такой файл, то он содержит структурированный контент, который могут использовать LLM-модели без необходимости парсить HTML-страницы.
Так как в последнее время я довольно много ковыряюсь с Claude Code и Anthropic SDK в целом, то уже и представить не могу, что бы я делал без возможности просто зайти на https://modelcontextprotocol.io/llms-full.txt и «прикопать» к себе целиком 1,2 МБ чистого текста документации. Очень удобно. И теперь всё чаще я на удачу проверяю наличие /llms.txt на других сайтах и расстраиваюсь, когда не нахожу их.
Неудивительно, что в процессе популяризации этой идеи появляются и сервисы-каталоги, которые собирают сайты, уже поддерживающие такие файлы — https://directory.llmstxt.cloud/
*️⃣Ну и, конечно же, я тоже иду в ногу со временем, поэтому добавил поддержку /llms.txt и к себе на сайт:
https://vavilov.dev/llms.txt 😄