Crawler von Meta
Meta betreibt 5 Crawler, die Ihre Website erreichen können. Sie erledigen unterschiedliche Aufgaben; eine pauschale Regel für alle ist fast immer falsch.
| User-Agent | Typ | Was er tut |
|---|---|---|
FacebookBot | Suche | Baut den Index auf, den ein Assistent beim Antworten durchsucht. |
meta-webindexer | Training | Sammelt Seiten zum Trainieren künftiger Modelle. |
meta-externalfetcher | Nutzeranfrage | Ruft Ihre Seite ab, weil jemand gerade danach gefragt hat. |
Meta-ExternalAgent | Nutzeranfrage | Ruft Ihre Seite ab, weil jemand gerade danach gefragt hat. |
Manus-User | Nutzeranfrage | Ruft Ihre Seite ab, weil jemand gerade danach gefragt hat. |
Was das Blockieren kostet
- Suche
- Blockieren entfernt Sie aus Antworten, die gerade entstehen.
- Training
- Blockieren kostet heute nichts, bedeutet aber, dass das nächste Modell Sie nicht kennt.
- Nutzeranfrage
- Blockieren bedeutet, dass dieser Person gesagt wird, die Seite könne nicht gelesen werden.
robots.txt
Um jeden Meta-Crawler durchzulassen:
User-agent: FacebookBot
Allow: /
User-agent: meta-webindexer
Allow: /
User-agent: meta-externalfetcher
Allow: /
User-agent: Meta-ExternalAgent
Allow: /
User-agent: Manus-User
Allow: /Um alle zu blockieren:
User-agent: FacebookBot
Disallow: /
User-agent: meta-webindexer
Disallow: /
User-agent: meta-externalfetcher
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: Manus-User
Disallow: /robots.txt wird freiwillig beachtet. Damit erklären Sie Ihre Absicht. Den Zugriff sperrt die Datei nicht, schützen Sie wirklich vertrauliche Inhalte daher durch Authentifizierung.
Quellen
Darf Meta auf Ihre Website?
Wir lesen Ihre robots.txt und sagen Ihnen, welche KI-Crawler sie durchlässt. Keine Anmeldung.