Боты Facebook сканируют ваш сайт: кто они, зачем приходят и что с этим делать

Тег записи:

Защита сайта от поведенческих ботов

Защита сайта от всех видов поведенческих ботов. Интеграция через изменение DNS записи домена. Защита от скликивания контекстной рекламы Яндекс Директ.
ПОПРОБОВАТЬ БЕСПЛАТНО  =>

Вы смотрите в логи сервера и видите сотни запросов от чего-то под названием "facebookexternalhit". Или "meta-externalagent". Первая мысль: "Что за чертовщина? Facebook скрейпит мой сайт? Или это хакер притворяется ботом?". Паниковать легко. Но это в основном легитимные краулеры - армия ботов Meta, которые собирают превью ссылок, собирают данные для ИИ и индексируют контент для поиска. Но, как и любые другие боты, иногда они становятся слишком агрессивными и грузят ваш сервер. И мошенники иногда подделывают User‑Agent, чтобы выглядеть как Facebook.

В этой статье я расскажу всё о краулерах Facebook: их официальные User‑Agent, диапазоны IP, что делает каждый бот, как проверить их подлинность и - самое главное - как управлять ими, не ломая интеграцию вашего сайта с платформами Meta. Никакой воды, только практические советы с реальными командами и примерами конфигурации.

Зачем боты Facebook посещают ваш сайт (и почему вам стоит это знать)

Meta управляет целым семейством краулеров, и у каждого своя цель. Самый распространённый - facebookexternalhit. Этот парень извлекает метаданные Open Graph (og:title, og:image, og:description), когда кто-то делится вашим URL на Facebook, Instagram или в Messenger. Без него ваша опубликованная ссылка будет выглядеть как скучный URL вместо красивого превью. Если вы заблокируете этого бота, ваши шеринги в соцсетях станут некрасивыми.

Затем есть meta-externalagent - относительно новый краулер, появившийся в 2024 году. Он используется для обучения ИИ и индексации контента для AI-продуктов Meta. Он работает аналогично GPTBot от OpenAI. Если вы хотите, чтобы ваш контент был доступен и цитировался в ответах Meta AI, вам стоит разрешить его, по крайней мере, до некоторой степени. Другой краулер, meta-webindexer, используется для поисковой индексации - он помогает Meta AI показывать ваш контент в результатах поиска.

Наконец, есть FacebookBot и Facebot - для общей поисковой индексации и обнаружения контента. Эти боты могут потреблять значительные ресурсы сервера, если начинают "буйствовать". Так что важно понимать их и устанавливать правильные ограничения.

Официальные краулеры Facebook: User‑Agent, которые вы увидите в логах

Вот таблица основных ботов Facebook с их типичными строками User‑Agent. Я собрал это из официальной документации и наблюдений в реальных проектах.

facebookexternalhit (рабочая лошадка для превью ссылок):

Также прочтите:  Долго грузится сайт? Возможно, проблема в домене - разбираем DNS, TTL и NS-записи

meta-externalagent (обучение ИИ и индексация):

meta-webindexer (поисковая индексация для Meta AI):

FacebookBot (поисковый краулер):

Другие, менее распространённые: meta-externalfetcher (пользовательские запросы), meta-externalads (реклама), facebookscraper/1.0 (устаревший скрейпер), Facebot (старый идентификатор).

Все эти строки можно подделать. Злоумышленники часто имитируют User‑Agent, чтобы выглядеть как легитимный краулер. Поэтому никогда не полагайтесь только на UA.

IP-диапазоны: как добавить настоящие краулеры Facebook в белый список

Краулеры Facebook приходят из определённых IP-диапазонов, принадлежащих Meta. Компания использует собственную автономную систему AS32934. Вы можете получить список IP-префиксов с помощью этой команды:

Типичные диапазоны IPv4 (по состоянию на 2026 год):

  • 69.171.224.0/19
  • 66.220.144.0/20
  • 173.252.64.0/18
  • 31.13.64.0/18

Facebook также активно использует IPv6, особенно для facebookexternalhit - вы увидите адреса, оканчивающиеся на "::face:b00c". Пример:

Эти IP-диапазоны иногда меняются, поэтому лучше хранить актуальный список. Можно найти автоматические скрипты на GitHub, которые загружают последние префиксы из RIPE или RADb.

Если вы используете WAF (например, Cloudflare или ModSecurity), вы можете добавить эти IP-диапазоны в белый список для определённых шаблонов User‑Agent. Таким образом, даже если поддельный краулер попытается подделать UA, он не совпадёт по IP-диапазону и будет заблокирован.

Как проверить подлинность краулера Facebook: обратный DNS, PTR и прямое подтверждение

Самый надёжный способ подтвердить, что запрос действительно от Meta, - выполнить обратный DNS-запрос (PTR-запись) и затем проверить, что полученное имя хоста принадлежит Facebook.

Вот алгоритм:

  1. Возьмите IP-адрес из логов.
  2. Выполните обратный DNS-запрос (PTR-запись), чтобы получить имя хоста.
  3. Проверьте, оканчивается ли это имя хоста на ".facebook.com" или ".fbcdn.net".
  4. При желании выполните прямой DNS-запрос этого имени хоста, чтобы убедиться, что он соответствует исходному IP.

Пример команды:

Вы увидите что-то вроде "crawler-2a03-2880-13ff-18--face-b00c.infra.facebook.com". Это хороший признак.

Для IPv4:

Этот метод является отраслевым стандартом. Google, например, рекомендует его для проверки Googlebot. Он работает и для Facebook.

Также прочтите:  Happy Eyeballs: почему сайт не грузился 10 секунд и при чём тут весёлые глазки

Вы можете автоматизировать эту проверку в конфигурации веб-сервера (например, с помощью скрипта Lua в Nginx) или в middleware вашего приложения.

Стратегии управления: от блокировки до белых списков

Универсального подхода не существует. Всё зависит от целей вашего сайта и возможностей сервера.

Разрешить (рекомендуется для большинства сайтов). Если вы хотите, чтобы ваш контент был доступен для шеринга на Facebook и для Meta AI, стоит пропускать этих краулеров. Как минимум, разрешите facebookexternalhit - иначе превью ссылок сломаются.

Белый список (для продвинутых). Если вы используете строгую гео-блокировку или кастомный фаервол, добавьте IP-диапазоны AS32934 в белый список для определённых User‑Agent. Это гарантирует, что настоящие краулеры никогда не будут заблокированы, а поддельные - остановлены.

Ограничение частоты (рекомендуется для высоконагруженных сайтов). Даже легитимные краулеры могут быть агрессивными. Вы можете установить лимит запросов на IP. Пример в Nginx:

Блокировать (только в крайних случаях). Если краулеры потребляют слишком много ресурсов и вам не нужна интеграция с Facebook, вы можете заблокировать их:

Но используйте это с осторожностью - если вы заблокируете их, ваш сайт может исчезнуть из шерингов Facebook и AI-поиска.

Ограничение частоты против полной блокировки: поиск баланса

Я видел случаи, когда один facebookexternalhit скачивал 50+ ГБ с персонального сайта за один день. Это слишком много. В таких ситуациях ограничение частоты - ваш лучший друг.

Хороший баланс: разрешить всех краулеров Meta, но установить лимит на IP, скажем, 5 запросов в секунду с пакетом до 10. Это предотвратит злоупотребление ресурсами сервера, но позволит загружать свежие превью, когда кто-то делится вашей ссылкой.

Другой вариант: отдавать краулерам кэшированные версии страниц. Вы можете использовать кэш обратного прокси или простой статический кэш для наиболее часто запрашиваемых URL.

А как насчёт robots.txt? Уважает ли Facebook его?

Большинство краулеров Meta уважают директивы robots.txt. Для facebookexternalhit и FacebookBot вы можете использовать:

Однако учтите, что некоторые краулеры - например, meta-externalagent - могут игнорировать robots.txt при проверках безопасности или анализе вредоносного ПО. Также они могут игнорировать его для целей обучения ИИ, но Meta заявляет, что "стараются уважать". Как повезёт.

Для лучшего контроля комбинируйте robots.txt с ограничением частоты на стороне сервера.

Также прочтите:  DNS-балансировка против ТСПУ: как несколько A-записей удержат сайт на плаву, когда РКН снова включит фильтр

Обнаружение поддельных ботов Facebook: красные флаги

Злоумышленники часто подделывают User‑Agent Facebook, чтобы обойти фильтры безопасности. Вот как их распознать:

  • IP не из AS32934. Всегда проверяйте, принадлежит ли IP диапазонам Meta. Если нет - это подделка.
  • Несоответствие PTR-записи. Выполните обратный DNS-запрос. У настоящих краулеров PTR-записи оканчиваются на ".facebook.com" или ".fbcdn.net". У поддельных обычно нет PTR или они указывают на generic домен провайдера.
  • Слишком много запросов. Даже настоящий краулер может быть агрессивным, но поддельные часто долбят ваш сайт с очень высокой частотой (например, 50 запросов/сек).
  • Необычные целевые URL. Если краулер запрашивает /wp-admin/ или другие чувствительные пути, это скорее всего зловред.
  • Отсутствие заголовков Accept-Encoding и других. Настоящие краулеры Facebook устанавливают стандартные HTTP-заголовки; у поддельных некоторые отсутствуют.

Вы можете автоматизировать обнаружение с помощью fail2ban или кастомных правил WAF.

Реальные случаи: когда боты Facebook плохо себя ведут

Случай 1: я однажды увидел один IP из диапазона Facebook, делающий 20 HEAD-запросов в минуту к /wp-admin/setup-config.php. Это нетипичное поведение для краулера. Оказалось, что это неправильно настроенный плагин провоцировал бота, а не злонамеренная атака.

Случай 2: сайт электронной коммерции сообщил, что facebookexternalhit постоянно скачивает изображения товаров, вызывая высокое потребление трафика. Решение состояло в установке заголовка кэширования (Cache‑Control: max‑age=86400) для изображений и ограничении частоты для бота.

Случай 3: форум заметил, что бот meta-externalagent скрейпил целые обсуждения. После обращения в поддержку Meta им ответили, что бот должен уважать robots.txt, но они также внедрили ограничение частоты на IP на всякий случай.

Всегда мониторьте логи.

Заключение: сосуществование без боли

Краулеры Facebook - не ваши враги. Они приносят видимость вашему контенту. Но они также могут превратиться в пожирателей ресурсов. Ключ в том, чтобы относиться к ним как к любым другим легитимным ботам: правильно идентифицировать, добавить их IP-диапазоны в белый список, установить разумные лимиты частоты и мониторить логи.

Используйте инструменты, которыми я поделился: добавьте AS32934 в белый список, проверяйте через обратный DNS и настройте ограничение частоты на IP. Не блокируйте их без крайней необходимости - пострадают ваши шеринги в соцсетях и обнаруживаемость в AI-поиске.

Посмотрите сегодня на свои серверные логи. Скорее всего, вы увидите хотя бы одного из этих краулеров в действии. Теперь вы знаете, что с этим делать.

Российская альтернатива Cloudflare

Cloudflare окончательно заблокирован в РФ ещё летом 2025 года.
Функцию фильтрации ботов Cloudflare взял на себя российский антибот Killbot.
Принцип работы отличается от привычного, отслеживаются не знакомые всем при настройке других антибот решений параметры (входящие IP адреса, AS подсети ботов, User Agent и прочее, всё это легко подделывается), а уникальные для каждого набора браузеров слепки.
По отличию оригинального браузера от модифицированного, тот или иной заход определяется либо как заход реального посетителя, либо как заход бота.

Чтобы не повторяться - расписывал более подробно в статьях:

Попробовать бесплатно. При регистрации в Killbot введите промокод
promo13
и получите месяц тестирования платного тарифа Killbot (фильтрация трафика, 1000 руб) и Ads (отключение показа рекламы поведенческим ботам, 1000 руб) в качестве бонуса. Этого вам хватит на то, чтобы понять, подходит вам данное решение, или нет. На данный момент - в Рунете нет более достойной альтернативы, по соотношению цена-качество. Срок действия промокода ограничен по времени, куда-то записывать его нет смысла. В следующий раз промокод уже будет другой, поэтому использовать его нужно сейчас, когда вы читаете этот текст. Промокод действует только в форме регистрации. Если аккаунт уже создан - создайте новый, на другой почте, и при регистрации в последнем поле введите промокод.

Подпишитесь на Telegram канал / MAX для того, чтобы всегда быть в курсе последних новостей и обновленных настроек для защиты от ботов, а также оперативно получать новые материалы, выходящие на antibot24.ru

Автор: Сергей AntiDdos

Автор статей: Сергей (AntiBot24). Эксперт в области фильтрации поведенческого трафика, настройки антибот систем. Высший рейтинг на Kwork, более 680 отзывов, 100% заказов успешно сдано, 56% повторных заказов. Пишу подробные статьи, инструкции по фильтрации ботов в своем блоге antibot24.ru

Всегда нужно иметь в виду, что те советы, которые вы прочли в статьях - это лишь часть настроек, которые я делаю при профессиональной экспертной настройке фильтрации поведенческих ботов. Все остальное - это непубличные профессиональные секреты. Любая информация, становящаяся общедоступной - достаточно быстро устаревает и перестает быть эффективной.
Если вы столкнулись с повышенной роботностью в Яндекс метрике, увеличением числа прямых заходов, увеличением количества отказов - вы всегда можете заказать у меня настройку Killbot.

Услуги

База знаний

Блог

Портфолио

AntiBot24

АнтиБОТ, поведенческие факторы, защита от ботов, настройка КиллБот.
Быстрее всего отвечаю в Telegram или MAX.

Telegram

MAX messenger

Более 900 выполненных работ на Кворк, положительные отзывы, профессионально занимаюсь фильтрацией бот трафика.
Ссылка на кворк
Свяжитесь со мной, для согласования перечня работ и условий оплаты.
Контакты
Copyright © 2026, AntiBOT24. Копирование материалов сайта запрещено.
Политика конфиденциальности
menu-circlecross-circle