De GEO Specialist
Inhoudstafel

Fundamentals

Technische GEO-fundamenten: crawlability, robots.txt en de llms.txt-mythe

EwoutEwout PutsDigital Marketing Strateeg
Bijgewerkt op 12 min leestijd
Technische GEO Fundamenten

Technische GEO bepaalt of een AI-systeem je content ooit te zien krijgt, nog vóór er één woord wordt gelezen. Een artikel dat objectief onderbouwd is, met cijfers, bronnen en heldere structuur, wordt genegeerd als het "systeem" van ChatGPT of Claude je pagina niet mag bezoeken. Contentkwaliteit en technische toegankelijkheid zijn dus twee aparte lagen, en de tweede laag bepaalt of de eerste ooit een kans krijgt.

Stel je voor: je hebt net een artikel herschreven volgens elke regel van het GEO-boekje. Concrete cijfers, een citaat van een expert, een heldere structuur met korte alinea's. Alles klopt. En toch komt je merk nooit voor in een ChatGPT-antwoord over jouw vakgebied. De reden zit ergens anders dan bij de tekst zelf: het systeem dat het antwoord moet samenstellen, komt je pagina simpelweg nooit binnen. In dit artikel lopen we samen door wat daarvoor nodig is, in mensentaal: van een instellingenbestand dat robots vertelt wat ze mogen bekijken, tot een paar technische valkuilen die je zelf, zonder ontwikkelaar, kan controleren.

Waarom techniek het fundament is, niet de finishing touch

AI-zoeksystemen knippen elke pagina op in kleine, losse stukjes tekst en beoordelen elk stukje apart op het moment dat iemand een vraag stelt. Een traditionele zoekmachine zoals Google doorzoekt je site periodiek en kent je hele pagina een positie toe in een lijst. Een generatieve zoekmachine werkt anders: op het exacte moment dat een gebruiker een vraag stelt, stuurt het systeem een bot naar je pagina om te checken of de inhoud nog steeds bruikbaar is. Dat verschil is de kern van waarom techniek niet iets is dat je "er nog even bij doet" na het schrijven.

Dit verklaart ook waarom "goed geschreven" niet automatisch "vindbaar" betekent. Een tekstfragment dat feitelijk dicht, helder gestructureerd en voorzien van bronnen is, wordt pas gebruikt als de bot die het fragment moet ophalen, er ook daadwerkelijk bij kan. Zit die toegang geblokkeerd, verstopt achter functies die pas laden nadat de pagina al open is, of tegengehouden door je beveiligingssoftware, dan bestaat je perfect geschreven alinea voor het AI-systeem gewoon niet. De volgorde is dus: eerst toegankelijkheid, dan pas contentkwaliteit. Verderop in dit artikel bouwen we die technische laag stap voor stap op, telkens met uitleg in gewone taal.

1 op de 5 sites blokkeert zichzelf onbewust

Uit een technisch onderzoek van Frankwatching naar 500 populaire Nederlandse domeinen blijkt dat 21,1% van de bereikbare websites minstens één AI-crawler actief de toegang ontzegt in het robots.txt-bestand.

Drie bevindingen uit dat onderzoek verdienen extra aandacht:

  • De zwaarst geblokkeerde bots zijn verrassend genoeg GPTBot en CCBot, allebei goed voor 16,3%.
  • Bij de grote nieuwsmedia staat de deur nog steviger dicht: op twee uitzonderingen na sluiten zij 10 van de 11 onderzochte bots buiten.
  • Van de sites die wel openstaan voor AI-crawlers, gebruikt slechts 1,5% ook FAQ-schema op de homepage, wat aantoont dat toegankelijkheid en technische GEO-optimalisatie in de praktijk vaak los van elkaar staan.

De oorzaak is meestal onschuldig. Veel blogs en commerciële sites hebben instellingen overgenomen die oorspronkelijk door nieuwsmedia werden opgesteld om te voorkomen dat AI-bedrijven hun artikels ongevraagd gebruiken om modellen mee te trainen. Die instellingen weren doorgaans alle AI-bots in één klap, zonder onderscheid te maken tussen een bot die je content gebruikt om een toekomstig model te trainen, en een bot die je pagina op het moment zelf bezoekt om een gebruiker vandaag een antwoord te geven met een verwijzing naar jouw site. Dat blinde kopieergedrag zorgt ervoor dat commerciële blogs zichzelf onbewust onzichtbaar maken voor precies de systemen die de antwoorden in ChatGPT en Claude genereren, met een direct verlies aan marktaandeel tot gevolg.

De les hierin is concreet: laat vandaag nog je eigen website checken op dit punt. De kans is reëel dat je, zonder het te beseffen, al maanden onzichtbaar bent voor de bots die er echt toe doen.

Twee soorten AI-bots: het onderscheid dat je moet kennen

Niet elke AI-bot dient hetzelfde doel, en dat onderscheid bepaalt rechtstreeks hoe je je website moet instellen.

Trainingsbots

Trainingsbots verzamelen content om een toekomstig taalmodel offline mee op te leiden, iets wat maanden vóór een modelrelease gebeurt en geen enkele invloed heeft op of jouw merk vandaag wordt aangehaald. Ze nemen als het ware een kopie van je pagina mee voor later gebruik: of je ze binnenlaat, heeft geen invloed op je zichtbaarheid vandaag.

Retrieval-bots

Retrieval-bots bezoeken je pagina precies op het moment dat een gebruiker een vraag stelt, en het is dát bezoek dat resulteert in een vermelding binnen het antwoord. Ze checken live, op het moment dat een klant een vraag stelt aan ChatGPT of Claude, of jouw pagina een goed antwoord bevat. Weiger je een retrieval-bot de toegang, dan mis je die vermelding voorgoed.

Hieronder zowel de training als retrieval-bots van Claude en ChatGPT.

LLM / platform

Trainingsbot(s)

Retrieval-bot(s)

OpenAI (ChatGPT)

GPTBot

OAI-SearchBot / ChatGPT-User

Anthropic (Claude)

ClaudeBot

Claude-SearchBot / Claude-User

Weer je een bot uit de middelste kolom, dan verlies je niets aan zichtbaarheid vandaag, je behoudt alleen controle over of je content ongevraagd in trainingsdata terechtkomt. Weer je een bot uit de rechterkolom, dan sluit je jezelf onmiddellijk uit van elke kans om ooit vermeld te worden in het antwoord van dat platform. Beide categorieën door elkaar behandelen, uit voorzichtigheid of uit onwetendheid, is de meest voorkomende technische fout in GEO-implementaties vandaag.

Hoe stel je dit praktisch in?

Deze instellingen staan in een bestand dat "robots.txt" heet: een simpel tekstbestand op je website dat robots vertelt wat ze wel en niet mogen bezoeken. Je vindt het terug door achter je domeinnaam "/robots.txt" te typen, bijvoorbeeld jouwbedrijf.be/robots.txt. Het is voldoende dat je weet wat erin moet staan, zodat je het kan controleren of kan doorgeven aan je webbouwer of ontwikkelaar.

De juiste aanpak: laat de retrieval-bots (die live antwoorden voeden) altijd toe, en beslis zelf of je de trainingsbots (die trainingsdata verzamelen) wil weren. Concreet betekent dit dat je aan je webbouwer vraagt om OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-SearchBot en Claude-User expliciet toe te laten, en optioneel GPTBot, ClaudeBot, CCBot en Meta-ExternalAgent te weren als je liever niet hebt dat je content in trainingsdata belandt.

Wil je het eenvoudig houden en gewoon alle AI-bots toelaten, dan volstaat onderstaande configuratie. Geef dit gerust door aan je webbouwer of ontwikkelaar:

Nieuwsbrief

Blijf mee met hoe GEO evolueert

Generative Engine Optimization staat nog volop in ontwikkeling: AI-systemen passen voortdurend aan hoe ze bronnen selecteren en antwoorden opbouwen. Schrijf je in en ontvang nieuwe inzichten, praktijkcases en tools zodra ze relevant worden, zodat je zicht houdt op wat er verandert.

User-agent: *

Allow: /

Sitemap: https://jouwdomein.be/sitemap.xml

De verborgen valkuil: je beveiligingssoftware kan alles alsnog blokkeren

Zelfs met de juiste instellingen in je robots.txt-bestand kan je site onbereikbaar blijven voor AI-bots, omdat je beveiligingsdienst het verkeer al eerder tegenhoudt. Veel websites gebruiken een zogenaamde CDN, een beveiligingslaag die vóór je website hangt en verkeer filtert voordat het je server bereikt. Zo'n CDN kan AI-bots al blokkeren nog vóór je robots.txt-bestand ooit wordt geraadpleegd. Je site kan er op papier perfect open uitzien en toch onbereikbaar zijn voor precies de bots die je net had toegelaten.

Bij Cloudflare, een van de meest gebruikte CDN's, regel je dit onder de domeininstellingen, bij "Security" > "Settings" >"Bot traffic" > "Configure AI bot policies". Deze instelling vervangt vanaf 15 september 2026 de oudere "Block AI bots"-optie, en werkt met drie afzonderlijke categorieën die je apart kan aan- of uitzetten:

cloudflare ai bot settings
  • Search: bots die je site scannen om te verschijnen in zoekresultaten.
  • Agent: bots die informatie van je site ophalen om vragen van gebruikers te beantwoorden.
  • Training: crawlers die content verzamelen om AI-modellen te trainen.

Vraag je webbouwer om "Search" en "Agent" toe te laten, dat zijn de categorieën die overeenkomen met de retrieval-bots uit de tabel hierboven. Overweeg je om "Training" te blokkeren, let dan op één addertje onder het gras: een bot die dezelfde naam gebruikt voor zowel training als search, valt in dat geval standaard toch weg, tenzij je daar apart een uitzondering voor instelt. Vraag je webbouwer of hostingpartij expliciet om dit voor je na te kijken en af te stemmen. Wie deze controle overslaat, kan maandenlang denken volledig in orde te zijn, terwijl de beveiligingslaag alles alsnog tegenhoudt.

De llms.txt-mythe: wat wél en niet klopt

Een llms.txt-bestand is een korte, overzichtelijke inhoudsopgave van je website, speciaal geschreven voor AI-systemen in plaats van voor mensen. Het is inmiddels door meer dan 844.000 websites aangemaakt. Het bevat een schone lijst met links naar je belangrijkste pagina's, zonder menu's, knoppen of advertenties, zodat een AI-systeem sneller en goedkoper door je site kan bladeren.

Waar het misverstand ontstaat, is bij de impact op citaties. Woordvoerders van Google hebben dit bestand publiekelijk vergeleken met de inmiddels verouderde "keywords"-instelling uit de begindagen van SEO: een hulpmiddel dat vooral het doorbladeren versnelt. De echte invloed op je citatiekans blijft liggen bij een sterke robots.txt-instelling en feitelijk onderbouwde content, aangevuld met een llms.txt-bestand als extra versnelling voor hoe snel een AI-systeem je site doorgrondt.

De genuanceerde conclusie: voor uitgebreide technische documentatie of grote kennisbanken is zo'n bestand de moeite waard. Voor een gewoon adviesblog zoals dit artikel volstaat het om dit rustig op de planning te zetten, en het serieus te overwegen zodra je site technisch complex genoeg wordt.

Een blik vooruit: websites die straks zelf "taken" aanbieden aan AI

Google en Microsoft kondigden in mei 2026 een nieuwe standaard aan, genaamd WebMCP, waarmee een website expliciet aangeeft welke acties een AI-assistent er rechtstreeks kan uitvoeren, denk aan het invullen van een boekingsformulier of het doorlopen van een bestelproces. Chrome opende hiervoor in mei 2026 een eerste testfase, met ondersteuning voor Google's eigen AI-assistent in de browser die dit jaar verwacht wordt.

Waar GEO vandaag draait om je content zo aanbieden dat een AI-systeem ze kan citeren, gaat deze ontwikkeling een stap verder: de website vertelt de AI-assistent zelf welke handelingen mogelijk zijn, in plaats van dat de assistent moet gissen naar knoppen en velden zoals een mens dat zou doen. Dit staat nog nadrukkelijk in een testfase en is geen vaststaande standaard, met belangrijke open vragen over veiligheid die nog uitgewerkt moeten worden. Toch is het de moeite om te volgen: wie zijn site vandaag al technisch op orde brengt voor AI-systemen, staat morgen ook een stuk dichter bij deze volgende stap.

Waarom je website snel en direct leesbaar moet zijn, niet pas na het laden

Informatie die pas verschijnt nadat de pagina al is opgebouwd, via functies die extra laadtijd vragen, blijft vaak onzichtbaar voor AI-systemen. Deze systemen navigeren niet zoals een mens en klikken doorgaans niet op sliders, uitklaptabbladen of "lees meer"-knoppen: content die daarachter verstopt zit, bestaat voor het systeem simpelweg niet.

In technische termen heet dit "server-side rendering": de pagina wordt kant-en-klaar aangeleverd door de server, in plaats van pas opgebouwd te worden nadat ze al open staat in de browser. Voor jou als marketeer volstaat het om dit als harde eis mee te geven aan wie je website bouwt of onderhoudt: elke belangrijke tekst en elk belangrijk cijfer moet meteen zichtbaar zijn in de brontekst van de pagina, al bij het eerste laadmoment van de pagina.

Praktische checklist: technische GEO-check in 15 minuten

Een technische GEO-check hoeft geen dagenlang project te zijn: met vier gerichte controles breng je de belangrijkste risico's binnen een kwartier in kaart, ook zonder technische achtergrond.

  1. Bekijk je robots.txt-bestand. Typ jouwdomein.be/robots.txt in je browser en kijk of OAI-SearchBot, ChatGPT-User, PerplexityBot en Claude-SearchBot expliciet worden toegelaten.
  2. Vraag je beveiligingsinstellingen na. Vraag aan je webbouwer of hostingpartij of er een instelling actief is die AI-bots blokkeert, en laat die specifiek uitzetten voor de retrieval-bots.
  3. Doe een snelle zichtbaarheidstest. Open een belangrijke pagina, klik met de rechtermuisknop en kies "paginabron weergeven", en check of je kernboodschap daar letterlijk in de tekst staat, niet pas zichtbaar wordt na een laadmoment.
  4. Vraag een technische test aan. Laat je webbouwer testen of de retrieval-bots daadwerkelijk toegang krijgen tot je belangrijkste pagina's, in plaats van een foutmelding te krijgen.

Wie deze vier punten afvinkt, heeft de belangrijkste technische blokkades voor AI-citaties weggenomen, en kan zich vanaf dat moment volledig richten op de content zelf.


Gerelateerde artikelen

Veelgestelde vragen

Moet ik een llms.txt-bestand aanmaken?

Voor de meeste bedrijfswebsites en blogs kan dit lager op de prioriteitenlijst staan: het versnelt vooral hoe snel een AI-systeem je site doorgrondt. Voor uitgebreide technische documentatie of kennisbanken is het wel de moeite waard.

Blokkeert mijn beveiligingssoftware mijn site voor ChatGPT of Claude?

GPTBot verzamelt content voor het offline opleiden van toekomstige modellen en heeft geen invloed op actuele citaties. OAI-SearchBot bezoekt je pagina live tijdens een zoekopdracht in ChatGPT Search en bepaalt rechtstreeks of je wordt aangehaald.

Wat is het verschil tussen GPTBot en OAI-SearchBot?

GPTBot verzamelt content voor het offline opleiden van toekomstige modellen en heeft geen invloed op actuele citaties. OAI-SearchBot bezoekt je pagina live tijdens een zoekopdracht in ChatGPT Search en bepaalt rechtstreeks of je wordt aangehaald.

Moet ik dit allemaal zelf kunnen implementeren?

Nee. Het is voldoende dat je begrijpt wat er moet gebeuren en waarom, zodat je de juiste vragen kan stellen aan je webbouwer of ontwikkelaar en kan controleren of het effectief is uitgevoerd.