Crawler von Common Crawl

Common Crawl betreibt 1 Crawler, der Ihre Website erreichen kann. Er erledigt eine bestimmte Aufgabe, daher ist eine pauschale Regel für ihn oft die falsche Wahl.

User-AgentTypWas er tut
CCBotTrainingSammelt Seiten zum Trainieren künftiger Modelle.

Was das Blockieren kostet

Training
Blockieren kostet heute nichts, bedeutet aber, dass das nächste Modell Sie nicht kennt.

robots.txt

Um jeden Common Crawl-Crawler durchzulassen:

User-agent: CCBot
Allow: /

Um alle zu blockieren:

User-agent: CCBot
Disallow: /

robots.txt wird freiwillig beachtet. Damit erklären Sie Ihre Absicht. Den Zugriff sperrt die Datei nicht, schützen Sie wirklich vertrauliche Inhalte daher durch Authentifizierung.

Quellen

Darf Common Crawl auf Ihre Website?

Wir lesen Ihre robots.txt und sagen Ihnen, welche KI-Crawler sie durchlässt. Keine Anmeldung.