ChatGPT-User обошёл robots.txt на 54% проверенных страниц

В первой половине 2026 года ChatGPT-User обращался к страницам, запрещённым для него в robots.txt, в 54% зафиксированных случаев. Среди европейских сайтов это был самый высокий показатель по сравнению с другими отслеживаемыми ботами. Об этом сообщает IXBT News. «Согласно документации OpenAI, этот агент может обращаться к странице, когда пользователь задаёт ChatGPT или пользовательскому GPT вопрос, требующий получения содержимого страницы», — сообщает IXBT News. У Bytespider показатель составил 48%, у PerplexityBot — 42%. В целом по европейским и североамериканским сайтам из выборки TollBit около 15% обращений ИИ-ботов пришлись на страницы с явным запретом в robots.txt. Компания TollBit определяет обход как успешный запрос к URL, который издатель явно запретил соответствующему боту. Статистика показывает факт обращения к запрещённым страницам, но не устанавливает причину каждого запроса и не исключает подмену user-agent. OpenAI отдельно указывает, что агент не используется для автоматического обхода и что из-за инициирования запроса пользователем правила robots.txt могут к нему не применяться. Это отличается от инструмента OAI-SearchBot, который определяет возможность использования содержимого в ответах поиска ChatGPT, и GPTBot, предназначенного для обхода страниц, которые могут использоваться при совершенствовании базовых моделей. Robots.txt не является технической защитой страницы от получения содержимого. Он передаёт автоматизированным агентам указания издателя, но не запрещает серверу отдать файл по запросу. Если ресурс нельзя предоставлять внешнему агенту, необходимы технические механизмы контроля доступа: аутентификация, авторизация, сетевые правила или блокировка на уровне сервера. Для команд, управляющих веб-ресурсами, это означает необходимость отдельно контролировать видимость сайта для поисковых и ИИ-сервисов и фактический доступ к данным.

Source

2 views·1 share