Crawlers van Common Crawl
Common Crawl gebruikt 1 crawler die je site kan bereiken. Deze voert een specifieke taak uit, dus één algemene regel ervoor is vaak de verkeerde keuze.
| User-agent | Type | Wat hij doet |
|---|---|---|
CCBot | Training | Verzamelt pagina's om toekomstige modellen te trainen. |
Wat het blokkeren kost
- Training
- Blokkeren kost vandaag niets, maar betekent dat het volgende model je niet kent.
robots.txt
Om elke crawler van Common Crawl toe te laten:
User-agent: CCBot
Allow: /Om ze allemaal te blokkeren:
User-agent: CCBot
Disallow: /robots.txt wordt vrijwillig gerespecteerd. Het is de juiste manier om je intentie te tonen, maar het regelt geen toegang. Bescherm gevoelige inhoud met authenticatie.
Bronnen
Is Common Crawl toegestaan op je site?
We lezen je robots.txt en vertellen welke AI-crawlers worden toegelaten. Geen registratie.