Waarom telt robots.txt?
Een verkeerd ingestelde robots.txt is een klassieke en kostbare fout: blokkeer je per ongeluk je hele site, dan verdwijn je uit de zoekresultaten. Correct gebruikt help je zoekmachines hun crawlbudget richten op wat telt. Het hoort bij de basis van je technische SEO.
Wat moet je over robots.txt weten?
Robots.txt is een openbaar tekstbestand in de hoofdmap van een host dat regels geeft over welke paden bepaalde crawlers wel of niet mogen ophalen.
| Kernpunt | Praktische uitleg |
|---|---|
| Betekenis | Robots.txt is een openbaar tekstbestand in de hoofdmap van een host dat regels geeft over welke paden bepaalde crawlers wel of niet mogen ophalen. |
| Belangrijkste toepassing | Gebruik robots.txt om onnodige crawlactiviteit te beperken, bijvoorbeeld bij interne zoekresultaten of oneindige filtercombinaties. Gebruik het niet om vertrouwelijke informatie te beveiligen. |
| Praktische controle | Open het bestand op /robots.txt, controleer de exacte user-agentgroepen en test belangrijke URL's. Regels gelden per protocol, hostnaam en poort. |
| Veelgemaakte fout | Een geblokkeerde URL kan soms nog als URL in zoekresultaten verschijnen wanneer andere pagina's ernaar linken. Gebruik noindex voor indexuitsluiting en laat de crawler die instructie kunnen lezen. |
Hoe werkt robots.txt in de praktijk?
Gebruik robots.txt om onnodige crawlactiviteit te beperken, bijvoorbeeld bij interne zoekresultaten of oneindige filtercombinaties. Gebruik het niet om vertrouwelijke informatie te beveiligen.
- Bepaal het crawlprobleem: Blokkeer alleen paden waarvan crawling geen nuttige zoekwaarde oplevert.
- Schrijf specifieke groepen: Koppel Allow- en Disallow-regels aan de bedoelde user-agent.
- Publiceer op hostniveau: Plaats het bestand exact op het hoofdniveau van iedere relevante host.
- Test kritieke URL's: Controleer of CSS, JavaScript, afbeeldingen en indexeerbare pagina's bereikbaar blijven.
- Monitor na wijzigingen: Volg crawlfouten, rendering en indexering wanneer regels veranderen.
Hoe controleer je robots.txt?
Open het bestand op /robots.txt, controleer de exacte user-agentgroepen en test belangrijke URL's. Regels gelden per protocol, hostnaam en poort.
- Het bestand is bereikbaar op de exacte URL /robots.txt.
- Belangrijke landingspagina's en renderbestanden zijn niet geblokkeerd.
- Disallow-regels bevatten geen onbedoeld brede patronen.
- Iedere Sitemap-regel gebruikt een volledige absolute URL.
- Crawlergroepen voor Google, OpenAI en Perplexity zijn bewust gekozen.
- Gevoelige informatie is beveiligd met authenticatie, niet met robots.txt.
Welke fouten moet je vermijden bij robots.txt?
Een geblokkeerde URL kan soms nog als URL in zoekresultaten verschijnen wanneer andere pagina's ernaar linken. Gebruik noindex voor indexuitsluiting en laat de crawler die instructie kunnen lezen.
| Fout | Waarom dit belangrijk is |
|---|---|
| Robots.txt als noindex gebruiken | Een crawler kan een noindex-tag niet zien wanneer de pagina niet mag worden opgehaald. |
| Een stagingomgeving alleen blokkeren | Het bestand is openbaar en biedt geen toegangsbeveiliging voor vertrouwelijke omgevingen. |
| CSS en JavaScript blokkeren | Zoekmachines kunnen de pagina dan mogelijk niet correct renderen en beoordelen. |
Hoe controleer je robots.txt in de praktijk?
Combineer een syntactische controle met tests van echte URL's. Het doel is niet zo veel mogelijk blokkeren, maar nuttige crawling voorspelbaar houden.
| Signaal | Interpretatie |
|---|---|
| Geblokkeerde belangrijke URL's | Een crawler toont of indexeerbare pagina's of noodzakelijke assets per ongeluk worden uitgesloten. |
| Crawlactiviteit | Serverlogs en Search Console laten zien welke paden crawlers daadwerkelijk bezoeken. |
| Indexeringswaarschuwingen | Meldingen rond geblokkeerde pagina's tonen waar crawl- en indexeringsdoelen botsen. |
Hoe hangt robots.txt samen met andere SEO-begrippen?
robots.txt staat zelden op zichzelf. Gebruik de begrippen hieronder om deze definitie te verbinden met de volgende technische, inhoudelijke of meetbare beslissing voor je website, doelgroep en markt.
- XML-sitemap: Een XML-sitemap is een machineleesbaar bestand met URL's die je aan zoekmachines wilt aanbieden voor ontdekking en crawling.
- crawlbudget: Crawlbudget is de combinatie van hoeveel crawling een website technisch aankan en hoeveel URL's Google op dat moment wil crawlen.
- Google Search Console: Google Search Console is een gratis dienst van Google waarmee website-eigenaren zoekprestaties, indexering en technische signalen voor hun website in Google Search kunnen volgen.
Welke primaire bron ondersteunt deze uitleg?
De feitelijke basis voor deze pagina omvat Google Search Central over robots.txt en robotsregels. De praktische aanbevelingen combineren die documentatie met SEO-analyse op paginaniveau.
