Разработчик создал валидатор для llms.txt, но боты почти не запрашивают этот файл
Энтузиаст разработал инструменты для создания и проверки файла llms.txt, который должен помогать языковым моделям понимать содержимое сайтов. Однако мониторинг показал, что ИИ-боты крайне редко обращаются к этому файлу, что ставит под сомнение его практическую ценность на текущем этапе.
Веб-разработчики и SEO-специалисты предложили аналог robots.txt для ИИ - файл llms.txt. Его предлагают размещать в корне сайта, чтобы дать ботам готовое текстовое описание страницы, избавив от парсинга сложного HTML. Идея активно обсуждается с 2024 года, но на практике боты почти не обращают на файл внимания.
Один разработчик проверил концепцию, создав генератор и валидатор для llms.txt. Он написал 64 теста для отладки. Параллельно он отслеживал запросы к файлу на реальных сайтах. Результаты: за период наблюдения - всего 9 запросов от 6 IP-адресов. Для сравнения, robots.txt запрашивали 9639 раз. Разница в востребованности огромна.
Хотя боты файл игнорируют, работа над валидатором оказалась полезной. Инструмент проверяет соответствие формату, который включает обязательные поля (title, description) и опциональные (например, keywords). Схема валидации учитывает 26 полей. Валидатор также оценивает качество контента: длину заголовка (рекомендуется 37-64 символа) и описания (2-40020 символов). Инструмент помогает веб-мастерам избежать ошибок в синтаксисе и подготовить сайт к потенциальному будущему, где ИИ-боты могут использовать этот стандарт.
Ситуация с llms.txt показывает общую проблему внедрения новых стандартов в интернете. Чтобы файл стал полезным, его должны не только создавать владельцы сайтов, но и активно читать краулеры, которые собирают данные для обучения языковых моделей. Крупные разработчики ИИ пока не спешат внедрять поддержку llms.txt. Возникает проблема курицы и яйца: зачем размещать файл, если его не читают, и зачем учить ботов его читать, если его почти нет?
Тем не менее, инициатива - важный эксперимент. Он поднимает вопросы о будущем взаимодействия ИИ с веб-контентом. Возможно, со временем, с ростом потребности в структурированных данных для обучения, стандарт получит распространение. Разработчикам, рассматривающим реализацию llms.txt, стоит воспринимать это как долгосрочную подготовку к возможным изменениям в алгоритмах индексации ИИ. Сейчас основная ценность подобных инструментов - в исследовательской работе. Они позволяют проработать стандарты, выявить сложности и быть готовым к моменту, когда крупные платформы изменят подход к сбору данных.


