
Вы смотрите в логи сервера и видите сотни запросов от чего-то под названием "facebookexternalhit". Или "meta-externalagent". Первая мысль: "Что за чертовщина? Facebook скрейпит мой сайт? Или это хакер притворяется ботом?". Паниковать легко. Но это в основном легитимные краулеры - армия ботов Meta, которые собирают превью ссылок, собирают данные для ИИ и индексируют контент для поиска. Но, как и любые другие боты, иногда они становятся слишком агрессивными и грузят ваш сервер. И мошенники иногда подделывают User‑Agent, чтобы выглядеть как Facebook.
В этой статье я расскажу всё о краулерах Facebook: их официальные User‑Agent, диапазоны IP, что делает каждый бот, как проверить их подлинность и - самое главное - как управлять ими, не ломая интеграцию вашего сайта с платформами Meta. Никакой воды, только практические советы с реальными командами и примерами конфигурации.
Meta управляет целым семейством краулеров, и у каждого своя цель. Самый распространённый - facebookexternalhit. Этот парень извлекает метаданные Open Graph (og:title, og:image, og:description), когда кто-то делится вашим URL на Facebook, Instagram или в Messenger. Без него ваша опубликованная ссылка будет выглядеть как скучный URL вместо красивого превью. Если вы заблокируете этого бота, ваши шеринги в соцсетях станут некрасивыми.
Затем есть meta-externalagent - относительно новый краулер, появившийся в 2024 году. Он используется для обучения ИИ и индексации контента для AI-продуктов Meta. Он работает аналогично GPTBot от OpenAI. Если вы хотите, чтобы ваш контент был доступен и цитировался в ответах Meta AI, вам стоит разрешить его, по крайней мере, до некоторой степени. Другой краулер, meta-webindexer, используется для поисковой индексации - он помогает Meta AI показывать ваш контент в результатах поиска.
Наконец, есть FacebookBot и Facebot - для общей поисковой индексации и обнаружения контента. Эти боты могут потреблять значительные ресурсы сервера, если начинают "буйствовать". Так что важно понимать их и устанавливать правильные ограничения.
Вот таблица основных ботов Facebook с их типичными строками User‑Agent. Я собрал это из официальной документации и наблюдений в реальных проектах.
facebookexternalhit (рабочая лошадка для превью ссылок):
|
1 2 3 |
facebookexternalhit/1.1 facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) facebookexternalhit/1.0 (+http://www.facebook.com/externalhit_uatext.php) |
meta-externalagent (обучение ИИ и индексация):
|
1 |
meta-externalagent/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
meta-webindexer (поисковая индексация для Meta AI):
|
1 |
meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
FacebookBot (поисковый краулер):
|
1 2 |
FacebookBot FacebookBot/1.0 |
Другие, менее распространённые: meta-externalfetcher (пользовательские запросы), meta-externalads (реклама), facebookscraper/1.0 (устаревший скрейпер), Facebot (старый идентификатор).
Краулеры Facebook приходят из определённых IP-диапазонов, принадлежащих Meta. Компания использует собственную автономную систему AS32934. Вы можете получить список IP-префиксов с помощью этой команды:
|
1 |
whois -h whois.radb.net -- '-i origin AS32934' | grep ^route |
Типичные диапазоны IPv4 (по состоянию на 2026 год):
Facebook также активно использует IPv6, особенно для facebookexternalhit - вы увидите адреса, оканчивающиеся на "::face:b00c". Пример:
|
1 |
2a03:2880:13ff:18::face:b00c |
Эти IP-диапазоны иногда меняются, поэтому лучше хранить актуальный список. Можно найти автоматические скрипты на GitHub, которые загружают последние префиксы из RIPE или RADb.
Если вы используете WAF (например, Cloudflare или ModSecurity), вы можете добавить эти IP-диапазоны в белый список для определённых шаблонов User‑Agent. Таким образом, даже если поддельный краулер попытается подделать UA, он не совпадёт по IP-диапазону и будет заблокирован.
Самый надёжный способ подтвердить, что запрос действительно от Meta, - выполнить обратный DNS-запрос (PTR-запись) и затем проверить, что полученное имя хоста принадлежит Facebook.
Вот алгоритм:
Пример команды:
|
1 |
host 2a03:2880:13ff:18::face:b00c |
Вы увидите что-то вроде "crawler-2a03-2880-13ff-18--face-b00c.infra.facebook.com". Это хороший признак.
Для IPv4:
|
1 |
host 31.13.115.2 |
Этот метод является отраслевым стандартом. Google, например, рекомендует его для проверки Googlebot. Он работает и для Facebook.
Вы можете автоматизировать эту проверку в конфигурации веб-сервера (например, с помощью скрипта Lua в Nginx) или в middleware вашего приложения.
Универсального подхода не существует. Всё зависит от целей вашего сайта и возможностей сервера.
Разрешить (рекомендуется для большинства сайтов). Если вы хотите, чтобы ваш контент был доступен для шеринга на Facebook и для Meta AI, стоит пропускать этих краулеров. Как минимум, разрешите facebookexternalhit - иначе превью ссылок сломаются.
Белый список (для продвинутых). Если вы используете строгую гео-блокировку или кастомный фаервол, добавьте IP-диапазоны AS32934 в белый список для определённых User‑Agent. Это гарантирует, что настоящие краулеры никогда не будут заблокированы, а поддельные - остановлены.
Ограничение частоты (рекомендуется для высоконагруженных сайтов). Даже легитимные краулеры могут быть агрессивными. Вы можете установить лимит запросов на IP. Пример в Nginx:
|
1 2 3 4 5 6 |
limit_req_zone $binary_remote_addr zone=fb_limit:10m rate=10r/s; server { if ($http_user_agent ~* (facebookexternalhit|FacebookBot|meta-externalagent)) { limit_req zone=fb_limit burst=20 nodelay; } } |
Блокировать (только в крайних случаях). Если краулеры потребляют слишком много ресурсов и вам не нужна интеграция с Facebook, вы можете заблокировать их:
|
1 2 3 |
if ($http_user_agent ~* (facebookexternalhit|FacebookBot|meta-externalagent)) { return 403; } |
Но используйте это с осторожностью - если вы заблокируете их, ваш сайт может исчезнуть из шерингов Facebook и AI-поиска.
Я видел случаи, когда один facebookexternalhit скачивал 50+ ГБ с персонального сайта за один день. Это слишком много. В таких ситуациях ограничение частоты - ваш лучший друг.
Хороший баланс: разрешить всех краулеров Meta, но установить лимит на IP, скажем, 5 запросов в секунду с пакетом до 10. Это предотвратит злоупотребление ресурсами сервера, но позволит загружать свежие превью, когда кто-то делится вашей ссылкой.
Другой вариант: отдавать краулерам кэшированные версии страниц. Вы можете использовать кэш обратного прокси или простой статический кэш для наиболее часто запрашиваемых URL.
Большинство краулеров Meta уважают директивы robots.txt. Для facebookexternalhit и FacebookBot вы можете использовать:
|
1 2 3 4 5 |
User-agent: facebookexternalhit Disallow: /private/ User-agent: FacebookBot Disallow: /private/ |
Однако учтите, что некоторые краулеры - например, meta-externalagent - могут игнорировать robots.txt при проверках безопасности или анализе вредоносного ПО. Также они могут игнорировать его для целей обучения ИИ, но Meta заявляет, что "стараются уважать". Как повезёт.
Для лучшего контроля комбинируйте robots.txt с ограничением частоты на стороне сервера.
Злоумышленники часто подделывают User‑Agent Facebook, чтобы обойти фильтры безопасности. Вот как их распознать:
Вы можете автоматизировать обнаружение с помощью fail2ban или кастомных правил WAF.
Случай 1: я однажды увидел один IP из диапазона Facebook, делающий 20 HEAD-запросов в минуту к /wp-admin/setup-config.php. Это нетипичное поведение для краулера. Оказалось, что это неправильно настроенный плагин провоцировал бота, а не злонамеренная атака.
Случай 2: сайт электронной коммерции сообщил, что facebookexternalhit постоянно скачивает изображения товаров, вызывая высокое потребление трафика. Решение состояло в установке заголовка кэширования (Cache‑Control: max‑age=86400) для изображений и ограничении частоты для бота.
Случай 3: форум заметил, что бот meta-externalagent скрейпил целые обсуждения. После обращения в поддержку Meta им ответили, что бот должен уважать robots.txt, но они также внедрили ограничение частоты на IP на всякий случай.
Всегда мониторьте логи.
Краулеры Facebook - не ваши враги. Они приносят видимость вашему контенту. Но они также могут превратиться в пожирателей ресурсов. Ключ в том, чтобы относиться к ним как к любым другим легитимным ботам: правильно идентифицировать, добавить их IP-диапазоны в белый список, установить разумные лимиты частоты и мониторить логи.
Используйте инструменты, которыми я поделился: добавьте AS32934 в белый список, проверяйте через обратный DNS и настройте ограничение частоты на IP. Не блокируйте их без крайней необходимости - пострадают ваши шеринги в соцсетях и обнаруживаемость в AI-поиске.
Посмотрите сегодня на свои серверные логи. Скорее всего, вы увидите хотя бы одного из этих краулеров в действии. Теперь вы знаете, что с этим делать.
Cloudflare окончательно заблокирован в РФ ещё летом 2025 года.
Функцию фильтрации ботов Cloudflare взял на себя российский антибот Killbot.
Принцип работы отличается от привычного, отслеживаются не знакомые всем при настройке других антибот решений параметры (входящие IP адреса, AS подсети ботов, User Agent и прочее, всё это легко подделывается), а уникальные для каждого набора браузеров слепки.
По отличию оригинального браузера от модифицированного, тот или иной заход определяется либо как заход реального посетителя, либо как заход бота.
Чтобы не повторяться - расписывал более подробно в статьях:
Попробовать бесплатно. При регистрации в Killbot введите промокод
promo13
и получите месяц тестирования платного тарифа Killbot (фильтрация трафика, 1000 руб) и Ads (отключение показа рекламы поведенческим ботам, 1000 руб) в качестве бонуса. Этого вам хватит на то, чтобы понять, подходит вам данное решение, или нет. На данный момент - в Рунете нет более достойной альтернативы, по соотношению цена-качество. Срок действия промокода ограничен по времени, куда-то записывать его нет смысла. В следующий раз промокод уже будет другой, поэтому использовать его нужно сейчас, когда вы читаете этот текст. Промокод действует только в форме регистрации. Если аккаунт уже создан - создайте новый, на другой почте, и при регистрации в последнем поле введите промокод.
Подпишитесь на Telegram канал / MAX для того, чтобы всегда быть в курсе последних новостей и обновленных настроек для защиты от ботов, а также оперативно получать новые материалы, выходящие на antibot24.ru

Автор статей: Сергей (AntiBot24). Эксперт в области фильтрации поведенческого трафика, настройки антибот систем. Высший рейтинг на Kwork, более 680 отзывов, 100% заказов успешно сдано, 56% повторных заказов. Пишу подробные статьи, инструкции по фильтрации ботов в своем блоге antibot24.ru
Всегда нужно иметь в виду, что те советы, которые вы прочли в статьях - это лишь часть настроек, которые я делаю при профессиональной экспертной настройке фильтрации поведенческих ботов. Все остальное - это непубличные профессиональные секреты. Любая информация, становящаяся общедоступной - достаточно быстро устаревает и перестает быть эффективной.
Если вы столкнулись с повышенной роботностью в Яндекс метрике, увеличением числа прямых заходов, увеличением количества отказов - вы всегда можете заказать у меня настройку Killbot.