In deze gids
- 01In het kort
- 02Scheid vindbaarheid in zoekfuncties van modeltraining
- 03Beperk elke regel tot het doel waarvoor je hem nodig hebt
- 04Stem pagina-instructies af op de gewenste vindbaarheid
- 05Controleer ook de server, het CDN en de firewall
- 06Maak essentiële informatie beschikbaar in de weergegeven pagina
- 07Houd interne links, sitemaps en wijzigingssignalen consistent
- 08Controleer crawlergedrag met gegevens van de live omgeving
- 09Vertrouw niet op een universeel AI-bestand; regel de basis
- 10Veelgestelde vragen
Wil je dat AI-zoekfuncties je website kunnen vinden? Controleer het gedocumenteerde doel van elke crawler, kies bewust je robotsregels en zorg dat belangrijke openbare pagina’s opgehaald kunnen worden, met essentiële informatie in toegankelijke HTML. Controleer vervolgens statuscodes, canonieke URL’s, indexeerbaarheid, sitemaps en serverlogs. Een crawler toestaan maakt toegang mogelijk; het garandeert niet dat een pagina wordt getoond of als bron wordt aangehaald.
Onder de term ‘AI-crawler’ vallen verschillende activiteiten. Een crawler kan een zoekfunctie ondersteunen, een pagina ophalen op verzoek van een gebruiker of materiaal verzamelen dat mogelijk wordt gebruikt om een model te verbeteren. Ga er als uitgever niet van uit dat één toestemmings- of blokkeerregel al die doelen regelt.
Deze gids gaat over technische toegang en het ontdekken van content, als aanvulling op de bredere audit van je AI-vindbaarheid en de controles voor de hele website in een technische SEO-audit. Controleer altijd de actuele crawlerdocumentatie voordat je het beleid van een live website wijzigt.
Kiezen
Bepaal welke toegang voor zoekfuncties en welke vormen van modeltraining de uitgever wil toestaan.
Instellen
Stem robotsregels, pagina-instructies, authenticatie, firewall en CDN op elkaar af.
Testen
Controleer het ophalen en weergeven van pagina’s, canonieke URL’s, gestructureerde inhoud en het ontdekken van bronnen.
Volgen
Gebruik logs en platformtools om verslechteringen op te sporen. Verwar toegang niet met opname in zoekresultaten.
Scheid vindbaarheid in zoekfuncties van modeltraining
Leg per relevant gebruik vast wat de uitgever toestaat voordat je robots.txt aanpast. Googlebot regelt de toegang voor Google Search, ook voor de geïndexeerde pagina’s die in aanmerking komen voor de generatieve AI-zoekfuncties van Google. OpenAI beschrijft OAI-SearchBot als crawler voor het tonen van en linken naar pagina’s in ChatGPT search. GPTBot heeft een apart doel: mogelijk gebruik voor modeltraining. Perplexity beschrijft PerplexityBot als crawler voor het tonen van en linken naar websites in zijn zoekresultaten.
| User-agent | Gedocumenteerd doel | Vast te leggen keuze |
|---|---|---|
| Googlebot | Crawlen voor Google Search en de generatieve functies binnen die zoekomgeving | Mag de pagina in aanmerking komen voor indexering en zoekresultaten met tekstfragmenten? |
| OAI-SearchBot | Content ontdekken die ChatGPT search kan tonen, aanhalen en van een link voorzien | Mag ChatGPT search de openbare bron benaderen? |
| GPTBot | Content mogelijk gebruiken om de generatieve basismodellen van OpenAI te verbeteren | Toestemming voor training, los van vindbaarheid in ChatGPT search |
| PerplexityBot | Websites tonen en ernaar linken in de zoekresultaten van Perplexity | Mag Perplexity search de openbare bron crawlen? |
Beperk elke regel tot het doel waarvoor je hem nodig hebt
Plaats robots.txt in de hoofdmap van de site, zorg dat het bestand succesvol wordt opgehaald en controleer welke groep regels op welke crawler van toepassing is. Een brede Disallow-regel met een wildcard, een testregel die op de live site blijft staan of een beveiligingsdienst die alsnog toegang blokkeert, kan het bedoelde beleid doorkruisen. Leg in commentaarregels vast wie verantwoordelijk is en waarvoor een regel dient. Dat vervangt het testen niet.
Controleer welke regels daadwerkelijk gelden
- De exacte hostnaam en het protocol van de canonieke pagina’s
- Specifieke user-agentgroepen en eventuele algemene groepen met een wildcard
- Disallow- en Allow-patronen voor belangrijke mappen en bestanden
- Sitemapverwijzingen en of de genoemde bestanden succesvol worden opgehaald
- Verschillen tussen de live site, preview en testomgeving
- Publicatiesystemen die het bestand opnieuw genereren of overschrijven
- Een verantwoordelijke en een datum voor de volgende beoordeling van het crawlerbeleid
robots.txt geeft crawlinstructies; het is geen toegangsbeveiliging. Bescherm gevoelige inhoud met de juiste authenticatie. Houd er ook rekening mee dat een crawler de instructies op een pagina niet kan lezen als hij die pagina niet mag ophalen.
Stem pagina-instructies af op de gewenste vindbaarheid
Volgens Google moet een pagina geïndexeerd zijn en met een tekstfragment in Google Search kunnen verschijnen om in aanmerking te komen voor generatieve zoekfuncties. Controleer of noindex, nosnippet en beperkingen aan tekstfragmenten passen bij je publicatiedoel. OpenAI legt uit dat sommige producten de URL en titel van een geblokkeerde pagina toch kunnen tonen op basis van signalen van derden. Wil een uitgever ook die link niet laten verschijnen, dan adviseert OpenAI noindex.
| Instelling | Controlevraag | Veelvoorkomend probleem |
|---|---|---|
| Robots-metatag of X-Robots-Tag | Moet deze URL worden geïndexeerd of uitgesloten? | Een algemene noindex-header geldt ook voor pagina’s die openbaar horen te zijn |
| Instructies voor tekstfragmenten | Mogen zoekproducten een fragment tonen en gebruiken? | Een beperkende instelling botst met de gewenste vindbaarheid |
| Canonieke link | Welke URL moet als hoofdversie van dubbele pagina’s gelden? | De zichtbare pagina verwijst naar een verouderde, doorgestuurde of niet-indexeerbare canonieke URL |
| Taalalternatieven | Welke vertaalde URL is bedoeld voor welke doelgroep? | Ongepubliceerde varianten of verwijzingen zonder wederkerigheid worden getoond |
Test de uiteindelijke respons op de openbare URL. Een correcte tag in het template helpt niet als een edge worker, plugin of HTTP-header de instructie op de live site verandert.
Controleer ook de server, het CDN en de firewall
Een pagina kan volgens robots.txt toegankelijk zijn en in de praktijk toch onbereikbaar blijken. Controleer DNS, TLS, doorverwijzingsketens, time-outs, verzoeklimieten, botbeheer, geografische beperkingen en terugkerende fouten op de oorspronkelijke server. Krijgt een crawler een verificatiescherm, een lege respons of herhaaldelijk een 403- of 5xx-status, dan kan hij de bedoelde bron niet betrouwbaar gebruiken.
Status
Belangrijke canonieke pagina’s moeten een stabiele, succesvolle respons geven, geen foutpagina met een schijnbaar succesvolle status.
Doorverwijzingen
Laat noodzakelijke redirects rechtstreeks en consistent naar de bestemming gaan, zonder lussen of afwijkende doelen per apparaat.
Botbeheer
Controleer of firewall- en CDN-regels het bedoelde crawlerbeleid daadwerkelijk uitvoeren.
Bestanden
Maak de CSS, scripts en media bereikbaar die nodig zijn om de belangrijke pagina-inhoud te begrijpen.
Prestaties
Verminder vertraging en foutkansen zonder crawlers een aparte, onvolledige versie van de pagina te geven.
Identiteitscontrole
Gebruik de gedocumenteerde methoden voor IP- en verzoekverificatie als de aanbieder die beschikbaar stelt.
Maak essentiële informatie beschikbaar in de weergegeven pagina
Niet elk zoeksysteem vereist HTML die op de server is opgebouwd. Essentiële informatie mag echter niet afhankelijk zijn van een defect script, een toestemmingsklik, het openen van een tabblad of eindeloos scrollen. Google kan JavaScript verwerken, maar JavaScript vraagt extra aandacht bij SEO. Test de opgebouwde paginastructuur (DOM) en de toegankelijkheid. Ga er niet van uit dat inhoud die een developer in zijn browser ziet voor elk systeem beschikbaar is.
Zorg dat de bron te begrijpen is
- Eén zichtbare H1 en beschrijvende tussenkoppen
- Belangrijke beweringen, beperkingen en brongegevens als tekst op de pagina
- Gewone HTML-links die crawlers kunnen volgen
- Tabellen met duidelijke koppen en begrijpelijke verbanden
- Afbeeldingen en video’s met ondersteunende tekst, bijschriften en alt-attributen waar die van toepassing zijn
- Interactieve onderdelen met toegankelijke namen, rollen en statussen
- Geen aparte inhoud voor crawlers die wezenlijk afwijkt van wat gebruikers te zien krijgen
Gestructureerde gegevens kunnen zoekfuncties ondersteunen waarvoor de pagina in aanmerking komt, mits ze overeenkomen met de zichtbare inhoud. Google verlangt echter geen speciaal AI-schema voor generatieve resultaten. Gebruik de markup om echte inhoud nauwkeurig te beschrijven, niet als een opdracht die het ophalen of aanhalen van een bron afdwingt.
Houd interne links, sitemaps en wijzigingssignalen consistent
Link vanuit relevante, indexeerbare pagina’s naar belangrijke content en neem die op in de juiste XML-sitemap. Pas wijzigingsdatums alleen aan als de hoofdinhoud wezenlijk is veranderd. Bing beveelt sitemaps en IndexNow aan om deelnemende systemen nieuwe, gewijzigde en verwijderde URL’s te laten ontdekken. Google gebruikt voor generatieve zoekfuncties zijn gebruikelijke systemen om pagina’s te ontdekken en te indexeren.
Publiceren
Maak een stabiele canonieke URL beschikbaar, met volledige inhoud en een succesvolle respons.
Verbinden
Voeg relevante interne links toe en zorg voor wederzijdse taalverwijzingen tussen gepubliceerde varianten.
Vermelden
Werk de juiste sitemap bij en gebruik een wijzigingsdatum die een echte inhoudelijke aanpassing weergeeft.
Controleren
Volg met webmastertools en logs of de pagina’s daadwerkelijk worden ontdekt.
Een sitemap indienen lost geen verweesde pagina’s, dubbele URL’s of zwakke inhoud op. Een bron moet eerst worden ontdekt, maar is daarmee nog niet relevant genoeg om geselecteerd te worden.
Controleer crawlergedrag met gegevens van de live omgeving
Combineer gecontroleerde ophaaltests met server- of edgelogs, voor zover beschikbaar. Logs kunnen laten zien welke URL’s zijn opgevraagd, welke statuscodes en responsomvang daarbij horen en welke crawlpatronen ontstaan. Ze bewijzen niet dat een pagina is geïndexeerd, begrepen of geselecteerd. Bewaar alleen de gegevens die je voor de analyse nodig hebt en volg het geldende privacy- en beveiligingsbeleid.
| Controle | Onderbouwing | Schakel hulp in wanneer |
|---|---|---|
| Beleid | De actuele robots.txt en instructies per pagina | Regels botsen, per host verschillen of niet meer aansluiten op het publicatiebeleid |
| Toegang | Een geverifieerd verzoek en de respons van de live omgeving | Belangrijke pagina’s verificatieschermen, blokkades of terugkerende fouten opleveren |
| Rendering | De weergegeven inhoud, links en toegankelijkheidsstructuur | Essentiële informatie pas verschijnt na interactie of herstel van een script |
| Ontdekking | Sitemaps, interne links, webmastertools en logs | Nieuwe of bijgewerkte canonieke pagina’s onontdekt blijven |
| Zichtbaarheid | Platformrapporten en vastgelegde prompttests | Toegang werkt, maar nuttige bronnen voor belangrijke gebruikersvragen nog ontbreken |
Dat laatste onderscheid is belangrijk: succesvol crawlen lost een technisch toegangsprobleem op. Het lost geen probleem met inhoud, autoriteit of productpositionering op. Leg de volgende bevinding neer bij het team dat er daadwerkelijk iets aan kan doen.
Vertrouw niet op een universeel AI-bestand; regel de basis
Google zegt expliciet dat het llms.txt niet gebruikt en geen speciale machineleesbare bestanden of AI-specifieke gestructureerde gegevens vereist voor generatieve zoekfuncties. Een andere dienst kan eigen instellingen documenteren. Presenteer de regels van één platform daarom niet als een universele webstandaard. Onderhoud alleen bestanden waarvoor een gedocumenteerd doel bestaat.
Checklist voor de technische overdracht
- Keuzes van de uitgever voor vindbaarheid in zoekfuncties en modeltraining zijn vastgelegd
- Crawlerregels zijn getoetst aan de actuele documentatie van de aanbieders
- Succesvolle HTTP-responsen zijn gecontroleerd via het echte CDN en de firewall
- Instructies voor indexering, tekstfragmenten, canonieke URL’s en taalvarianten zijn op elkaar afgestemd
- Essentiële inhoud en links zijn beschikbaar in de weergegeven pagina
- Interne links, sitemapvermeldingen en wijzigingsdatums zijn bijgewerkt
- Er is een duidelijke verantwoordelijke voor het volgen van logs en platformrapporten
- Nergens wordt beloofd dat toegang, markup of een speciaal bestand opname in zoekresultaten garandeert
De AI SEO-dienst van Qreativa verbindt crawlerregels en technische uitvoering met de content, onderbouwing en metingen die nodig zijn om aan zinvolle vindbaarheid te werken.
Veelgestelde vragen over AI-crawlers
Zijn OAI-SearchBot en GPTBot hetzelfde?
Nee. Volgens OpenAI ontdekt OAI-SearchBot content die ChatGPT search kan tonen en waarnaar het kan linken. GPTBot gaat over mogelijk gebruik van content om generatieve basismodellen te verbeteren. Als uitgever kun je afzonderlijk beslissen over vindbaarheid in zoekfuncties en gebruik voor training.
Garandeert toegang voor een AI-zoekcrawler een bronverwijzing?
Nee. Toegang neemt alleen een mogelijke technische belemmering weg. Een platform kan nog steeds besluiten dat de pagina voor een bepaald antwoord niet relevant, bruikbaar, actueel of nodig is. Meet opname in antwoorden en bronverwijzingen daarom apart van crawlertoegang.
Moet je elke AI-crawler toestaan in robots.txt?
Niet automatisch. De organisatie moet het gedocumenteerde doel van elke crawler begrijpen en bewust kiezen vanuit publicatiebeleid, juridische afwegingen en productbeleid. Het technische team voert dat beleid vervolgens uit en controleert of het werkt, zonder authenticatie of beveiliging te verzwakken.
Heeft een website llms.txt nodig voor Google AI Overviews of AI Mode?
Nee. Google zegt expliciet dat het llms.txt niet gebruikt en geen speciale AI-bestanden of gestructureerde gegevens vereist voor generatieve zoekfuncties. Volg de normale technische eisen van Google Search en controleer eventuele afzonderlijke instructies voor andere diensten.
Kan een AI-crawler inhoud lezen die met JavaScript wordt opgebouwd?
Dat verschilt per platform en kan veranderen. Google kan JavaScript verwerken, maar dat brengt extra technische aandachtspunten met zich mee. Zorg dat essentiële informatie en links betrouwbaar beschikbaar zijn in de weergegeven pagina. Test het openbare resultaat in plaats van aannames te doen over de mogelijkheden van een crawler.
Hoe houd je crawlertoegang in de gaten?
Gebruik gecontroleerde ophaaltests, verificatiemethoden van de aanbieder, server- of edgelogs en webmastertools, voor zover beschikbaar. Controleer statuscodes, responsomvang en opgevraagde URL’s. Een gelogd verzoek toont toegangsactiviteit aan, geen indexering, begrip of bronverwijzing.
Michele Eccher


