Naar de inhoud

Kennisbank · SEO

Wat is indexering door zoekmachines?

Maurits 17 min leestijd

Indexering is het opnemen van je pagina in de database van een zoekmachine. Staat een pagina niet in die index, dan kan hij nooit in de resultaten verschijnen, hoe goed hij ook geschreven is.

Het is de eerste voorwaarde en tegelijk de stap die het vaakst wordt overgeslagen. Ik kom regelmatig sites tegen waar maanden aan teksten en links is gewerkt terwijl de helft van de pagina's nooit is opgenomen. Hoe zoekmachines je pagina's ophalen staat in het artikel over zoekmachine-spiders. Dit artikel gaat over wat er daarna gebeurt.

De drie stappen kort uit elkaar

Crawlen, renderen en indexeren zijn drie losse stappen die elk op een ander moment kunnen misgaan. Ze door elkaar halen kost mensen weken zoekwerk.

Crawlen. Een programma van de zoekmachine haalt je pagina op, zoals een browser dat doet. Het vindt je via links, via je sitemap en via adressen die het al kende.

Renderen. De opgehaalde pagina wordt uitgevoerd, inclusief de JavaScript. Pas daarna weet de zoekmachine wat er echt op staat. Dit gebeurt vaak later dan het ophalen.

Indexeren. De zoekmachine besluit of de pagina wordt opgeslagen en onder welke zoekopdrachten hij mag meedoen. Daar gaat dit artikel over.

Een pagina kan dus prima gecrawld zijn en toch niet geïndexeerd. Dat is geen storing. Dat is een besluit.

Indexeren is een keuze, geen automatisme

Google neemt niet alles op wat het tegenkomt. Er wordt geselecteerd, en die selectie is de laatste jaren strenger geworden. De zoekmachine schat in of jouw pagina iets toevoegt aan wat er al in de index staat.

Een pagina die vrijwel gelijk is aan een andere pagina van jou, of aan een pagina van iemand anders, kan gewoon worden overgeslagen. Dat geldt ook voor pagina's zonder eigen inhoud, zoals een lege categoriepagina of een filtercombinatie in een webshop die één product oplevert.

Dit is precies waar het misgaat bij een reeks locatiepagina's. Twintig pagina's die alleen in de plaatsnaam verschillen zijn voor een zoekmachine twintig keer hetzelfde. Meestal wordt er één opgenomen en verdwijnt de rest in "gecrawld, momenteel niet geïndexeerd". Wil je zulke pagina's, geef ze dan eigen inhoud: eigen projecten, eigen foto's, eigen antwoorden.

Hoe je controleert of je erin staat

De snelle manier duurt tien seconden: tik in Google site:jouwdomein.nl in. Je ziet dan bij benadering wat er van je site in de index staat, want het aantal erboven is een schatting. Eén pagina nalopen doe je met site:jouwdomein.nl/de-pagina/.

De goede manier is Google Search Console. Gratis, je koppelt het aan je domein via een DNS-record of een bestand op je server, en het vertelt je per adres wat Google ermee heeft gedaan. Zonder Search Console gis je. Bing heeft een eigen versie waar je je gegevens uit Search Console kunt importeren, zoals ook in het artikel over de Bing zoekmachine aan de orde komt.

Ik doe dit bij elke nieuwe site en na elke verhuizing. Vijf minuten werk, en het voorkomt maanden onduidelijkheid.

Het rapport Pagina-indexering en wat de statussen betekenen

Search Console heeft een rapport dat per pagina laat zien of hij is opgenomen en zo niet, om welke reden. Google vernieuwde het begin 2023 en noemt het sindsdien Pagina-indexering. Daarvoor heette het Dekking. De statussen die je het vaakst tegenkomt:

  • Gecrawld, momenteel niet geïndexeerd. Google zag de pagina en nam hem bewust niet op. Een inhoudelijk oordeel. Meer links erheen helpen soms, betere inhoud helpt vaker.
  • Gevonden, momenteel niet geïndexeerd. Google kent het adres maar is er nog niet geweest. Wijst op een trage server of op te veel adressen van te weinig gewicht.
  • Uitgesloten door tag noindex. Je zegt zelf dat de pagina er niet in mag. Klopt dat niet, dan zit hier je fout.
  • Geblokkeerd door robots.txt. De crawler mag er niet kijken. Iets anders dan noindex, zie de volgende sectie.
  • Google heeft een andere canonieke pagina gekozen. Google vindt een andere pagina de echte versie. Meestal terecht, soms niet.
  • Alternatieve pagina met correcte canonieke tag. Goed nieuws: je eigen verwijzing naar de hoofdversie is gehonoreerd.
  • Soft 404. De pagina geeft code 200 terug maar ziet eruit als een foutpagina, bijvoorbeeld een leeg zoekresultaat. Laat je server dan een echte 404 sturen.

Klik altijd door naar de voorbeeldadressen. Het aantal zegt weinig, de lijst zegt alles. Vijfhonderd uitgesloten pagina's is prima als het filterpagina's zijn en een ramp als er dienstenpagina's tussen staan.

Waarom pagina's niet in de index komen

In volgorde van hoe vaak ik het tegenkom:

  • Een noindex die is blijven staan. Verreweg nummer één. WordPress heeft een schakelaar om zoekmachines te weren, die op testomgevingen aanstaat en bij de livegang wordt vergeten.
  • Geblokkeerd in robots.txt. Vaak een regel die ooit voor de testomgeving is toegevoegd en is meeverhuisd.
  • Geen enkele link naar de pagina toe. Een pagina die alleen bestaat omdat jij het adres kent, wordt zelden gevonden.
  • Te weinig eigen inhoud. Bijna identieke pagina's worden overgeslagen.
  • Een canonieke verwijzing die ergens anders heen wijst. Je pagina zegt zelf dat een andere pagina de echte is.
  • Een vergeten doorverwijzing. Het adres stuurt door, dus dit adres komt er niet in.
  • Te traag of te vaak onbereikbaar. Een server die er regelmatig uit ligt wordt minder vaak bezocht.

Loop ze in deze volgorde af. Bijna altijd is het een van de eerste twee, en dan ben je binnen een kwartier klaar.

noindex tegenover robots.txt

Twee instructies met een verschillend doel, en ze worden dagelijks door elkaar gehaald.

robots.txt gaat over ophalen. Een tekstbestand in de hoofdmap van je domein dat zegt welke adressen een crawler niet mag bezoeken. Het is een verzoek en geen slot: nette crawlers houden zich eraan, kwaadwillende niet. Sinds september 2022 ligt het vast als internetstandaard in RFC 9309. Google leest er de eerste 500 kibibytes van.

noindex gaat over opnemen. Een instructie in de pagina zelf, als robots-metatag in de kop, of als X-Robots-Tag in de HTTP-header voor bestanden zonder HTML-kop zoals een pdf. Die zegt: bekijk hem gerust, maar neem hem niet op.

Waarom noindex in robots.txt sinds 1 september 2019 niets meer doet

Jarenlang zetten mensen een regel Noindex: in robots.txt. Dat werkte bij Google half en toevallig, want het stond nergens in de standaard en was nooit officieel ondersteund.

Op 2 juli 2019 kondigde Google aan per 1 september van dat jaar te stoppen met regels die niet in de standaard staan. Dat gold voor noindex, voor nofollow en voor crawl-delay in robots.txt. Sindsdien worden ze genegeerd. Tref je zo'n regel aan in een oude robots.txt, dan doet hij niets en heeft hij waarschijnlijk jaren niets gedaan.

De combinatie die het vaakst misgaat

Zet nooit tegelijk een noindex in de pagina en een blokkade in robots.txt voor datzelfde adres. De crawler mag de pagina dan niet ophalen, dus ziet hij je noindex niet. Het adres kan alsnog opduiken in de resultaten, gevonden via links van elders, meestal als kale link zonder omschrijving. Precies wat je niet wilde.

De juiste volgorde: haal de blokkade uit robots.txt, laat de noindex staan, wacht tot Google de pagina heeft opgehaald en de status ziet omslaan. Blokkeer daarna pas als je dat nog wilt, en meestal wil je dat dan niet meer.

Canonieke verwijzingen

Een canonieke verwijzing is een regel in de kop van je pagina, een link rel="canonical", die zegt welk adres de officiële versie is.

Waarvoor het dient: dezelfde inhoud is vaak op meerdere adressen bereikbaar. Met en zonder www, met en zonder slotstreep, met een parameter erachter, via een sorteerlink in je webshop. Zonder canonieke verwijzing moet de zoekmachine zelf raden welke versie de echte is.

Het is een aanwijzing en geen bevel. Google mag een andere pagina als canoniek kiezen, bijvoorbeeld als jouw verwijzing wijst naar een pagina die nauwelijks inhoud heeft. Verder hoort elke hoofdpagina naar zichzelf te verwijzen. Een SEO-plugin regelt dat vanzelf. Waar het misgaat is bij kopieerwerk: iemand dupliceert een pagina en de canonieke verwijzing van het origineel gaat mee. De kopie zegt dan zelf dat hij niet bestaat.

Verwar het niet met een doorverwijzing. Een 301 stuurt de bezoeker naar een ander adres. Een canonieke verwijzing laat de bezoeker waar hij is en praat alleen tegen de zoekmachine. Hoe je je adressen zelf opbouwt staat in het artikel over zoekmachinevriendelijke URL's.

Sitemaps

Een sitemap is een XML-bestand met de adressen die jij geïndexeerd wilt hebben. Je meldt het aan in Search Console en Bing Webmaster Tools, en je zet het adres onderin je robots.txt.

WordPress maakt sinds versie 5.5 uit augustus 2020 zelf een sitemap op /wp-sitemap.xml. Heb je Yoast, Rank Math of SEOPress, dan neemt die plugin het over en krijg je meer sturing over wat er wel en niet in staat. Gebruik er één, niet twee.

Wat een sitemap wel doet: adressen aanreiken die anders slecht bereikbaar zijn, en de datum van laatste wijziging doorgeven. Google gebruikt dat lastmod-veld als het klopt, en negeert het als elke pagina elke dag als gewijzigd wordt opgegeven. Wat hij niet doet: opname afdwingen. Een adres in je sitemap is een suggestie.

De grenzen zijn 50.000 adressen en 50 MB per bestand, ongecomprimeerd. Zit je daarboven, dan splitst je plugin het vanzelf en maakt hij een index-sitemap die naar de losse bestanden verwijst.

Houd hem schoon. Adressen die doorverwijzen, adressen met een noindex en adressen die 404 geven horen er niet in. Search Console meldt dat, en een sitemap vol rommel maakt de rest minder geloofwaardig.

Om indexering vragen, en hoe lang het duurt

In Search Console voer je bij URL-inspectie één adres in en klik je op "Indexering aanvragen". Je pagina komt dan in een wachtrij met voorrang, met een dagelijkse limiet erop. Doe dat bij een nieuwe belangrijke pagina of na een grote wijziging, niet om een hele site erin te duwen. Elke dag hetzelfde adres indienen versnelt niets.

Het ping-adres waarmee je vroeger een sitemap kon aanmelden bestaat niet meer. Google zette dat in juni 2023 uit. Bing biedt sinds eind 2021 IndexNow, waarmee je een gewijzigd adres direct doorgeeft, en Google doet daar niet aan mee.

Doorlooptijd: bij een bestaande site met regelmatig nieuwe inhoud gaat het vaak binnen een dag of een paar dagen. Bij een gloednieuw domein kan het weken duren, en dat is normaal. Wat wel helpt is dat andere sites naar je verwijzen, want zo ontdekt een zoekmachine nog steeds dat je bestaat.

Pagina's die je juist buiten de index houdt

Een index vol rommel is niet neutraal. Een zoekmachine ziet daardoor minder goed welke pagina's er wel toe doen, en jij krijgt vertoningen voor pagina's waar niemand iets aan heeft.

Uit mogen meestal je bedankpagina's na een formulier, de zoekresultatenpagina van je eigen site, filter- en sorteercombinaties in een webshop, winkelwagen en afrekenen, en de losse bijlagepagina per geüploade afbeelding. Die laatste kan elke SEO-plugin doorverwijzen naar het bestand.

Tags en categorieën zijn een discussie op zich. Mijn regel: heeft de archiefpagina een eigen tekst en een reden om te bestaan, dan mag hij erin. Is het een lijst van drie artikelen zonder toelichting, dan niet.

Een aparte categorie is je testomgeving. Een noindex is daar niet genoeg, want die kan wegvallen bij een verhuizing of een export. Zet een wachtwoord op de hele omgeving via de server. Ik heb te vaak een acceptatie-omgeving in Google zien staan, met prijzen die nog niet naar buiten mochten.

Waar de knoppen in WordPress zitten

Onder Instellingen, Lezen staat het vinkje "Zoekmachines ontmoedigen deze site te indexeren". Dat is de beruchte schakelaar. Aanvinken doet twee dingen tegelijk: WordPress zet een noindex in elke pagina en zet in de robots.txt een blokkade voor de hele site. Handig tijdens de bouw, rampzalig als het na de oplevering aan blijft staan. Controleer het bij elke oplevering, want de waarschuwing in je beheerscherm wordt weggeklikt.

Per pagina regel je noindex in je SEO-plugin, meestal onderaan het bewerkscherm onder een kopje geavanceerd. Daar staat ook de canonieke verwijzing als je die met de hand wilt zetten.

Let op dat de robots.txt van WordPress geen bestand op je server is, maar bij het opvragen wordt samengesteld. Zet je er zelf een echt bestand neer, dan wint dat en negeert WordPress zijn eigen versie.

Renderen: waarom inhoud uit JavaScript soms wegvalt

Google voert JavaScript uit en gebruikt daarvoor sinds mei 2019 een actuele versie van Chrome. Inhoud die pas na het laden verschijnt wordt dus in principe gewoon gezien.

In principe. Het uitvoeren gebeurt in een aparte wachtrij en kan later gebeuren dan het ophalen. Soms minuten later, soms dagen. Bij een site die volledig op JavaScript leunt loopt je index daardoor achter op je werkelijkheid.

Wat er misgaat: inhoud die pas laadt na een klik op "meer laden", teksten uit een externe bron die de crawler niet mag benaderen, en interne links die als knop zijn gebouwd. Dat laatste is de stille killer. Een crawler volgt een echte link. Een blok met een klikfunctie eromheen is voor hem geen link, en alles wat alleen daarachter zit blijft onbereikbaar.

Controleren doe je met de URL-inspectie in Search Console. Vraag de weergave van de live pagina op en bekijk de opgehaalde HTML. Staat je tekst daar niet in, dan heb je je antwoord. Bij een gewone WordPress-site met een gangbaar contentmanagementsysteem speelt dit zelden, omdat de server de HTML al kant-en-klaar levert.

Indexering tegenover positie

Deze twee worden constant door elkaar gehaald, ook door bureaus. Geïndexeerd zijn betekent alleen dat je meedoet aan de wedstrijd. Waar je eindigt is een andere vraag: beantwoordt je pagina de zoekopdracht, wie doet er nog meer mee, en wie verwijst er naar je. Hoe die weging werkt staat in het artikel over zoekmachinealgoritmen, en wat je in welke volgorde aanpakt staat in het artikel over hoger scoren in zoekmachines.

De praktische winst van dit onderscheid: sta je nergens, kijk dan eerst of je überhaupt in de index staat. Zo ja, dan is het een inhoudelijk probleem en heeft sleutelen aan je sitemap geen zin. Zo nee, dan is alle inhoudelijke moeite verspild tot je dat oplost. Hoe de twee in het grotere geheel passen staat in het artikel over zoekmachineoptimalisatie.

Iets uit de index halen dat er niet in hoort

Soms staat er iets in Google wat er om andere redenen dan SEO uit moet. Een oude pagina met persoonsgegevens, een geüpload bestand met een adressenlijst, een pagina van een medewerker die vertrokken is.

De volgorde is altijd dezelfde. Haal het eerst van je eigen site af of zet er een noindex op. Daarna vraag je in Search Console een tijdelijke verwijdering aan. Die houdt ongeveer een half jaar stand en is bedoeld om je tijd te geven, niet om iets permanent te verbergen. Staat de pagina daarna nog online, dan komt hij terug.

Voor persoonsgegevens op sites van anderen bestaat het recht op vergetelheid, uit het arrest van het Europese Hof van Justitie van 13 mei 2014 in de zaak Google Spain en later opgenomen in de AVG. Je vraagt met een formulier bij Google om een resultaat niet meer te tonen bij een zoekopdracht op je naam. De pagina zelf blijft bestaan. Weigert Google, dan kun je naar de Autoriteit Persoonsgegevens.

Wat er de laatste jaren veranderd is

Google indexeert sinds eind 2023 alle sites op basis van de mobiele versie. Wat er niet op je mobiele weergave staat, telt niet mee. Verstop dus geen tekst op kleine schermen omdat het lelijk staat, want dan verstop je hem voor de index. Hoe je een site geschikt maakt voor kleine schermen staat in het artikel over optimaliseren voor mobiel.

De selectie is strenger geworden. De status "gecrawld, momenteel niet geïndexeerd" komt vaker voor dan vroeger, ook bij nette sites. Google neemt zichtbaar minder op van sites die veel bijna-identieke pagina's produceren.

Er is ook een laag bij gekomen. Zoekresultaten bevatten steeds vaker samenvattingen die een taalmodel opstelt op basis van geïndexeerde pagina's. Dezelfde harde voorwaarde geldt: je moet in de index staan om erin voor te komen. Wat dat doet met het aantal kliks per vertoning komt aan de orde in het artikel over organische zoekresultaten.

Veelgestelde vragen over indexering door zoekmachines

Hoe weet ik of mijn website in Google staat?

Tik site:jouwdomein.nl in bij Google. Krijg je resultaten, dan staat je site erin. Het getal erboven is een schatting.

Voor een betrouwbaar beeld gebruik je Google Search Console. Daar zie je per adres of het is opgenomen en zo niet, om welke reden.

Waarom staat mijn nieuwe pagina niet in Google?

Meestal om een van drie redenen: er staat een noindex op, er verwijst geen enkele link naar de pagina, of Google is er nog niet geweest. De URL-inspectie in Search Console vertelt je welke van de drie het is. Is de pagina wel bezocht en toch niet opgenomen, dan is het een inhoudelijk oordeel en helpt aandringen niet.

Hoe lang duurt het voordat een pagina geïndexeerd is?

Bij een bestaande site die vaker wordt bijgewerkt vaak binnen een dag tot een paar dagen. Bij een nieuw domein kan het weken duren. Je kunt het aanvragen via de URL-inspectie, wat het meestal versnelt zonder dat het een garantie geeft.

Wat betekent "gecrawld, momenteel niet geïndexeerd"?

Google heeft je pagina opgehaald, bekeken en besloten hem voorlopig niet op te nemen. Een kwaliteitsoordeel, geen technische fout.

Wat helpt: de pagina echt iets eigens geven, hem vanuit relevante pagina's aan linken, en samenvoegen wat te veel op elkaar lijkt. Wat niet helpt: elke week opnieuw indienen.

Wat is het verschil tussen crawlen en indexeren?

Crawlen is het ophalen van je pagina. Indexeren is het besluit om hem op te slaan en te laten meedoen in de resultaten. Het eerste kan gebeuren zonder het tweede.

Werkt noindex in robots.txt nog?

Nee. Google negeert die regel sinds 1 september 2019, na een aankondiging op 2 juli van dat jaar. Ook nofollow en crawl-delay in robots.txt worden genegeerd. Wil je een pagina uit de index houden, gebruik dan de robots-instructie in de pagina zelf of de X-Robots-Tag in de HTTP-header.

Haalt robots.txt een pagina uit de zoekresultaten?

Nee, en dit is de meest voorkomende misvatting. Robots.txt verbiedt het ophalen. Een adres dat elders wordt gelinkt kan alsnog in de resultaten verschijnen, meestal zonder omschrijving omdat de crawler de inhoud niet mocht bekijken. Wil je een pagina echt weg, laat hem dan wel ophalen en zet er een noindex op.

Wat is een canonieke verwijzing?

Een regel in je pagina die aangeeft welk adres de officiële versie is als dezelfde inhoud op meerdere adressen bereikbaar is. Het is een aanwijzing voor de zoekmachine, geen doorverwijzing voor de bezoeker. Google mag afwijken en een andere pagina als canoniek kiezen.

Heb ik een sitemap nodig?

Voor een kleine site met een goed menu is hij niet strikt noodzakelijk, en aanmelden kost vijf minuten dus doe het gewoon. Bij een site met honderden pagina's, een webshop of pagina's die diep weggestopt zitten wordt hij echt nuttig.

WordPress maakt er sinds versie 5.5 zelf een. Gebruik je een SEO-plugin, laat die het dan doen en zet de ingebouwde uit.

Hoe vaak moet ik mijn sitemap opnieuw indienen?

Eén keer. Daarna haalt Google hem zelf periodiek op. Opnieuw indienen na elke wijziging heeft geen effect.

Kan ik Google dwingen mijn pagina op te nemen?

Nee. Je kunt het aanvragen en je kunt alle belemmeringen wegnemen, en het besluit blijft bij de zoekmachine. Wat wel invloed heeft: een pagina die duidelijk iets toevoegt, die vanuit je eigen site goed bereikbaar is, en waar van buitenaf naar verwezen wordt.

Hoeveel pagina's van mijn site horen er geïndexeerd te zijn?

Ongeveer het aantal pagina's dat je bewust hebt gemaakt. Staat er een veelvoud in de index, dan produceert je site adressen die je niet kent, meestal filters, zoekresultaten of paginanummers. Staat er juist veel minder in, dan zit er een blokkade of heeft Google een deel afgewezen.

Wat doe ik met pagina's die ik niet in Google wil hebben?

Zet er een noindex op via je SEO-plugin en laat robots.txt met rust, zodat de crawler die noindex kan lezen. Denk aan bedankpagina's, interne zoekresultaten en winkelwagenpagina's.

Moet mijn testomgeving op noindex staan?

Een noindex is het minimum en niet genoeg. Zet een wachtwoord op de hele omgeving via de server, want dan lekt er niets uit, ook niet als een export of een verhuizing misgaat. Vergeet bij de livegang niet het WordPress-vinkje onder Instellingen, Lezen te controleren.

Hoe krijg ik iets uit Google weg?

Haal het eerst van je site af of zet er een noindex op. Vraag daarna in Search Console een tijdelijke verwijdering aan, die ongeveer een half jaar stand houdt.

Gaat het om persoonsgegevens op de site van iemand anders, dan kun je bij Google een verzoek indienen op grond van het recht op vergetelheid uit het arrest van 13 mei 2014 en de AVG. De pagina zelf blijft dan bestaan, alleen het zoekresultaat verdwijnt.

Telt Bing apart van Google?

Ja. Bing heeft een eigen index en eigen crawlers, en meldt zich apart via Bing Webmaster Tools. Wat goed werkt voor Google werkt in de praktijk ook voor Bing, dus veel extra werk is het niet: aanmelden en je sitemap indienen.

Dit artikel hoort bij SEO. Daar vind je meer uitleg over hetzelfde onderwerp.

Een vraag over dit onderwerp?

Vertel waar je tegenaan loopt.

Maurits denkt met je mee en geeft je een praktisch antwoord.

reactie dezelfde werkdag
Maurits van Platform Pro

Vertel kort waar je aan denkt

Nu gesloten, ik reageer de volgende werkdag

Maurits leest je bericht en neemt persoonlijk contact met je op.

Dit veld is bedoeld voor validatiedoeleinden en moet niet worden gewijzigd.
Dit veld is verborgen bij het bekijken van het formulier