Naar de inhoud

Kennisbank · Internet Marketing Begrippen

Wat is zoekmachine-extractie?

Maurits 15 min leestijd

Zoekmachine-extractie is het geautomatiseerd uit elkaar halen van gegevens rond zoeken. De term wordt voor twee dingen gebruikt: wat een zoekmachine uit jouw pagina haalt, en wat iemand met een programma uit de zoekresultaten haalt.

Die twee kanten hebben weinig met elkaar te maken, behalve dat ze allebei draaien om gegevens die niet als bestand worden aangeleverd maar uit iets anders worden getrokken. Ik behandel ze hieronder apart, te beginnen met de kant waar je zelf iets aan kunt doen.

Wat een zoekmachine uit je pagina haalt

Nadat een pagina is opgehaald en de code is verwerkt, blijft er een boomstructuur over waarin elk element zijn plaats heeft. Uit die structuur wordt informatie getrokken. Hoe het ophalen zelf gaat staat bij de zoekmachine-spiders en bij indexering door zoekmachines.

De eerste stap is scheiden wat de inhoud is en wat eromheen staat. Een menu, een zijbalk, een cookiemelding en een voettekst staan op elke pagina van je site en zeggen dus niets over deze ene pagina. Zoekmachines schatten in welk deel de eigenlijke inhoud is en wegen de rest lichter.

Daarna wordt er structuur uit gelezen: de titel van het document, de koppen en hun rangorde, de alinea's, de lijsten, de tabellen, de links met hun ankertekst, de afbeeldingen met hun alt-tekst. Nette HTML is hier geen schoonheidseis maar de manier waarop je zegt wat wat is.

Vervolgens komt de betekenis. Uit de tekst worden entiteiten herkend: bedrijfsnamen, plaatsen, personen, producten, bedragen, datums. Een pagina waarop staat dat je in Amersfoort zit en op donderdag gesloten bent, levert twee feiten op die los van je zinnen bruikbaar zijn.

De titel en de omschrijving liggen niet vast

Wat je in je titeltag zet is een voorstel, geen opdracht. Google heeft de manier waarop het titels op de resultatenpagina samenstelt in 2021 aangepast en herschrijft ze sindsdien vaker.

Voor de omschrijving geldt hetzelfde en al veel langer: die wordt regelmatig vervangen door een stuk tekst van de pagina zelf dat beter bij de zoekopdracht past. Dat is niet per se slecht, want zo'n stuk sluit vaak nauwer aan bij wat iemand intikte.

Wat je eraan kunt doen: zorg dat je titel de pagina echt dekt en niet volgeplakt is met woorden, zet de kern van je antwoord in de eerste alinea, en herhaal je bedrijfsnaam niet in elke titel. Hoe de resultatenpagina verder is opgebouwd staat bij de organische zoekresultaten.

Fragmenten en hoe je ze stuurt

Het stukje tekst onder een zoekresultaat wordt geknipt uit je pagina. Dat is de meest voorkomende vorm van extractie en je hebt er meer invloed op dan de meeste mensen weten.

Sinds 2019 bestaan er instructies waarmee je aangeeft hoeveel er overgenomen mag worden. Je kunt een maximale lengte in tekens opgeven, aangeven dat er helemaal geen fragment mag worden getoond, de grootte van een voorbeeldafbeelding beperken en de lengte van een videovoorbeeld begrenzen. Er is ook een attribuut waarmee je één stuk van een pagina uitsluit, bijvoorbeeld een prijs of een intern kopje, terwijl de rest gewoon bruikbaar blijft.

Voor een gewone bedrijfssite raad ik af om die instructies te gebruiken. Je fragment is meestal je enige kans om iemand te overtuigen. Voor een nieuwssite of een site achter een betaalmuur ligt dat anders, en daar zijn ze ook voor bedoeld.

Het uitgelichte fragment

Boven de gewone resultaten staat soms een blok met een direct antwoord en daaronder de bron. Dat heet een uitgelicht fragment en het is puur extractie: er wordt een alinea, een lijstje of een tabel uit een bestaande pagina gelicht.

De vorm van je antwoord bepaalt of je in aanmerking komt. Bij een vraag die om een definitie vraagt, wordt meestal een korte alinea gepakt van vlak onder een kop die de vraag herhaalt. Bij een vraag met stappen wordt een genummerde lijst gepakt. Bij een vergelijking een tabel.

Begin 2020 veranderde Google de telling: een pagina die het uitgelichte fragment krijgt, staat niet meer een tweede keer in de gewone resultaten eronder. Je wint dus geen extra plek, je wisselt van plek. Dat is ook meteen de reden om er niet te hard op te jagen. Wie het antwoord volledig weggeeft in een blok bovenaan, krijgt aandacht en minder bezoek.

Het blok met vervolgvragen dat eronder verschijnt, werkt op dezelfde manier en is bruikbaar als bron van echte zoekvragen. Hoe je die vervolgens beoordeelt staat bij zoekwoordanalyse.

Gestructureerde gegevens: extractie zonder gokwerk

Uit lopende tekst afleiden wat een prijs is en wat een openingstijd blijft schatten. Daarom bestaat er een woordenlijst waarmee je het zelf opschrijft: schema.org, in een blok code dat naast je pagina staat.

Google werkt het liefst met de JSON-variant, die je als apart blok in je pagina zet in plaats van verweven in je opmaak. Daarmee vertel je bijvoorbeeld dat dit een artikel is met deze auteur en deze datum, dat dit bedrijf op dit adres zit met deze openingstijden, dat dit product deze prijs en deze voorraadstatus heeft, of dat dit een reeks vragen met antwoorden is.

Wat je ervoor terugkrijgt verschilt per type. Soms een zichtbaar resultaat met sterren, een prijs of een reeks uitklapbare vragen. Soms niets zichtbaars, maar wel een zoekmachine die zeker weet waar je zit en wanneer je open bent. Dat tweede is voor een lokaal bedrijf meer waard dan het eerste.

Twee regels gelden altijd. Wat in de code staat moet ook op de pagina zelf zichtbaar zijn, en het moet kloppen. Een prijs in de code die niet overeenkomt met de prijs op de pagina levert vroeg of laat een handmatige maatregel op, en dan verdwijnen je resultaten met opmaak in één keer.

Wat er sinds 2023 met FAQ-resultaten gebeurde

Dit is een goed voorbeeld van iets dat verandert zonder dat iemand het je vertelt. In augustus 2023 besloot Google de uitklapbare vragen onder een zoekresultaat vrijwel alleen nog te tonen voor overheidssites en gezaghebbende gezondheidssites. Voor de rest verdwenen ze. Tegelijk werd het resultaat met stappen voor doe-het-zelfinstructies uitgefaseerd.

Veel sites hebben die code nog steeds staan en zien er niets meer van terug. Er gaat niets kapot en het kost je niets. Wat het wel laat zien: je plannen bouwen op een weergave die één partij eenzijdig bepaalt is wankel werk.

Ik laat de vragencode gewoon staan. Hij beschrijft nog steeds correct wat er op de pagina gebeurt, en die beschrijving wordt breder gebruikt dan alleen voor dat ene uitklapblok.

Waarom extractie misgaat

Als je gegevens niet worden opgepikt, zit het bijna altijd in een van deze zes dingen.

  • De tekst staat in een afbeelding. Een prijslijst of een openingstijdenkaartje als plaatje is voor extractie leeg. Ook een tabel die eigenlijk een screenshot is.
  • De inhoud komt pas na JavaScript. Dat kan wel gelezen worden, maar het gebeurt in een tweede ronde en soms niet volledig. Wat er meteen in de broncode staat is altijd zekerder.
  • De opmaak zegt iets anders dan de tekst. Een kop die alleen groot en vet is gemaakt in plaats van een echte kop, telt niet als kop.
  • De gegevens spreken elkaar tegen. Een adres in de voettekst, een ander adres in de code, een derde op je contactpagina. Dan wordt er gekozen, en niet altijd voor de juiste.
  • Alles staat op één pagina. Zes diensten in één lange lap tekst leveren geen zes duidelijke onderwerpen op.
  • Het staat achter een handeling. Inhoud die pas verschijnt na inloggen, na klikken op een tabblad of na oneindig scrollen is er voor extractie vaak niet.

Wat AI-antwoorden met die stof doen

De laatste jaren is er een tweede afnemer bij gekomen. Naast de zoekmachine die een fragment toont, zijn er systemen die uit meerdere pagina's een antwoord samenstellen en daar bronnen bij zetten.

Dat gebeurt op twee manieren. Bij de ene wordt jouw tekst tijdens het beantwoorden opgehaald en meteen gebruikt, waarna er een verwijzing bij komt te staan. Bij de andere is jouw tekst eerder gebruikt om een model te trainen, en dan komt er geen verwijzing. Die twee lopen door elkaar in het spraakgebruik en ze hebben heel andere gevolgen.

Google toont sinds 2024 samengestelde antwoorden boven de resultaten, eerst in de Verenigde Staten en daarna in meer landen; in Nederland zijn ze in 2025 verschenen. Wat dat met je bezoek doet verschilt sterk per soort pagina. Een vraag met één feit als antwoord wordt boven aan de pagina afgehandeld en levert weinig klikken meer op. Een vraag waarbij iemand een keuze moet maken of contact wil, doet dat niet.

Wat helpt is niet nieuw en het is wel anders geprioriteerd. Zorg dat je pagina één duidelijk antwoord bevat dat als geheel te citeren is. Zet feiten die van jou zijn en die nergens anders staan in je tekst: je werkgebied, je aanpak, wat je wel en niet doet, wat het bij jou kost. Dat is precies de stof die niet uit tien andere pagina's te halen valt.

Welke robots je binnenlaat

Elk van die systemen komt langs met een eigen naam, en je kunt ze in je robots.txt apart toestaan of weren. Sinds 2022 is dat bestand ook officieel een standaard.

De bekendste zijn de ophaler van OpenAI voor trainingsgegevens, een aparte naam die alleen tijdens het zoeken langskomt, en de robots van Perplexity en Anthropic. Google heeft een aparte naam waarmee je kunt aangeven dat je inhoud niet voor het trainen van hun modellen gebruikt mag worden.

Let op één misverstand dat veel voorkomt. Die Google-instelling houdt je pagina niet uit de samengestelde antwoorden boven de zoekresultaten, want die gebruiken gewoon de zoekindex. Wil je daar niet in staan, dan moet je uit de zoekresultaten verdwijnen, en dat wil vrijwel niemand.

Mijn advies aan de meeste ondernemers: laat ze binnen. Je hebt meer te verliezen door onzichtbaar te zijn dan door geciteerd te worden. Uitzonderingen zijn sites die van hun archief leven, zoals uitgevers en databanken; daar is het een echte afweging.

De andere kant: gegevens uit de zoekresultaten halen

Nu de tweede betekenis. Hier gaat iemand met een programma zoekopdrachten uitvoeren en leest uit wat er verschijnt.

Dat gebeurt voor vier dingen. Posities bijhouden, want niemand kijkt tweehonderd zoekwoorden met de hand na. Concurrenten volgen: wie staat waar, met welke titels en welke pagina's, wat ook de basis is van een concurrentieanalyse. Zoekopdrachten verzamelen uit de suggesties tijdens het typen en uit het vragenblok. En de resultatenpagina zelf onderzoeken: hoeveel advertenties erboven staan, of er een samengesteld antwoord is, of er een kaart in staat. Dat laatste bepaalt hoeveel een positie waard is.

Voor Bing geldt hetzelfde, met als verschil dat Microsoft er een officiële interface voor heeft.

Wat mag en wat niet

Hier moet je eerlijk naar kijken, want het gebeurt overal en dat maakt het niet vanzelf toegestaan.

De voorwaarden van Google verbieden geautomatiseerd zoekopdrachten uitvoeren zonder toestemming. In de praktijk wordt daar tegen kleine gebruikers zelden op gehandhaafd, en de gebruikelijke reactie is dat je adres wordt geblokkeerd of dat je een captcha krijgt.

Los daarvan gelden gewone regels. Persoonsgegevens verzamelen valt onder de AVG, ook als ze openbaar op een pagina staan. Auteursrechtelijk beschermde teksten overnemen blijft overnemen, hoe je ze ook hebt opgehaald. Wel kent de Auteurswet sinds 2021 een uitzondering voor tekst- en datamining, waarbij de rechthebbende dat gebruik uitdrukkelijk kan voorbehouden. Dat voorbehoud is precies waar veel uitgevers zich sinds de opkomst van taalmodellen op beroepen.

Europees is daar in 2024 de AI-verordening bij gekomen. Aanbieders van algemene modellen moeten sinds 2025 een beleid hebben om het auteursrecht te respecteren en een samenvatting publiceren van de gegevens waarmee ze hebben getraind.

Waar het voor een ondernemer op neerkomt: gegevens over posities en zoekopdrachten ophalen voor je eigen analyse is gebruikelijk. Complete pagina's van anderen kopiëren of persoonsgegevens verzamelen is dat niet.

De officiële bronnen zijn beter

Voor bijna alles waarvoor je zou willen schrapen bestaat een toegestane bron die betrouwbaarder is.

  • Search Console. Gratis, en het bevat je eigen gemeten cijfers: welke zoekopdrachten, hoeveel vertoningen, hoeveel klikken, welke gemiddelde positie. De gegevens gaan zestien maanden terug, dus exporteer ze af en toe als je verder wilt kunnen kijken.
  • De Search Console API. Dezelfde gegevens automatisch ophalen, volledig toegestaan, ook voor honderden pagina's tegelijk.
  • Bing Webmaster Tools. Hetzelfde voor Bing, en die cijfers zijn sinds de opkomst van AI-antwoorden interessanter geworden dan ze jaren waren.
  • Google Trends. Voor het verloop van zoekvolume over tijd en voor seizoenen.
  • Bestaande gereedschappen. Ahrefs, Semrush en vergelijkbare partijen hebben de infrastructuur en de juridische afweging al gemaakt. Je koopt hun werk in plaats van je eigen risico.

Google heeft daarnaast een officiële API voor zoekresultaten met een beperkt gratis dagquotum. Die geeft niet precies wat een bezoeker te zien krijgt, maar hij is toegestaan en dat is het punt.

Waarom geschraapte posities minder waard zijn dan je denkt

Er bestaat geen vaste positie. Dat klinkt flauw en het is precies het probleem.

Wat iemand ziet hangt af van zijn locatie, zijn apparaat, zijn eerdere zoekopdrachten en het moment. Een gereedschap dat zegt dat je op plek vier staat, zegt dat je op plek vier stond voor een geanonimiseerde zoekopdracht vanaf een datacenter, op één moment. Twee mensen in dezelfde straat krijgen niet hetzelfde te zien.

Search Console geeft je in plaats daarvan de gemiddelde positie over je echte vertoningen bij echte mensen. Dat is minder bevredigend om naar te kijken en het klopt wel. Combineer het met je bezoekcijfers en je weet meer dan met welke geschraapte lijst dan ook.

Wat een klein bedrijf hiermee doet

Van deze twee kanten is er maar één waar je tijd in moet steken, en dat is de eerste.

Zorg dat je pagina's zo zijn opgebouwd dat er iets uit te halen valt: echte koppen, één onderwerp per pagina, feiten in tekst en niet in een plaatje, en gestructureerde gegevens voor je bedrijfsgegevens en je diensten. Dat werkt voor de gewone resultaten, voor fragmenten en voor AI-antwoorden tegelijk, want ze putten uit dezelfde bron.

Wil je weten hoe je ervoor staat, begin dan bij Search Console. Zelf gaan schrapen kost meer tijd dan het waard is en levert cijfers op die minder betrouwbaar zijn dan wat je al had. En blijf uit de verleiding om alles op één weergave in te richten, want die weergave is de afgelopen jaren twee keer eenzijdig veranderd. Hoe rangschikking in de basis werkt staat bij de zoekmachinealgoritmen.

Veelgestelde vragen over zoekmachine-extractie

Wat is zoekmachine-extractie precies?

Het geautomatiseerd uit elkaar halen van gegevens rond zoeken. De term dekt twee dingen: wat een zoekmachine uit jouw pagina haalt om een resultaat mee te vullen, en wat iemand met een programma uit de zoekresultaten haalt om posities of concurrenten te volgen.

Hoe haalt Google tekst uit mijn pagina?

Nadat de pagina is opgehaald en verwerkt, wordt eerst het menu, de zijbalk en de voettekst van de eigenlijke inhoud gescheiden. Daarna worden de titel, de koppen, de alinea's, de lijsten, de tabellen en de alt-teksten uitgelezen, en tot slot worden er feiten uit herkend zoals adressen, prijzen en datums.

Waarom staat er een andere titel in Google dan ik heb ingevuld?

Omdat je titeltag een voorstel is. Google past sinds 2021 vaker een eigen titel toe, meestal opgebouwd uit je kop op de pagina of uit je bedrijfsnaam. Dat gebeurt vooral bij titels die te lang zijn, die volgestopt zijn met zoekwoorden of die op elke pagina hetzelfde zijn.

Wat is een uitgelicht fragment?

Het blok boven de gewone resultaten waarin een direct antwoord staat, met daaronder de bron. De tekst komt letterlijk uit een bestaande pagina. Het is een alinea, een lijst of een tabel, afhankelijk van wat de vraag vraagt.

Hoe kom ik in een uitgelicht fragment?

Door de vraag als kop op je pagina te zetten en er direct daaronder een kort, volledig antwoord van een paar zinnen te geven. Gaat het om stappen, gebruik dan een genummerde lijst. Je moet daarnaast al redelijk hoog staan voor die zoekopdracht, want de bronnen worden uit de eerste resultaten gekozen.

Kan ik voorkomen dat Google een stuk tekst overneemt?

Ja. Er zijn instructies waarmee je de maximale lengte van een fragment beperkt, fragmenten helemaal uitzet of een specifiek deel van je pagina uitsluit. Voor een gewone bedrijfssite raad ik dat af, omdat je fragment vaak je enige kans is om iemand te laten klikken.

Wat zijn gestructureerde gegevens?

Een blok code naast je pagina waarin je in een vaste woordenlijst opschrijft wat er op de pagina staat: dat dit een bedrijf is met dit adres en deze openingstijden, of een product met deze prijs. Zo hoeft een zoekmachine het niet uit je zinnen af te leiden.

Werkt FAQ-schema nog?

De uitklapbare vragen onder een zoekresultaat toont Google sinds augustus 2023 vrijwel alleen nog voor overheidssites en gezaghebbende gezondheidssites. De code zelf blijft correct en wordt breder gebruikt dan voor die ene weergave, dus verwijderen hoeft niet. Reken alleen niet meer op dat extra blok.

Leest Google mijn pagina als die met JavaScript wordt opgebouwd?

Meestal wel, maar in een tweede ronde en niet altijd volledig. Inhoud die meteen in de broncode staat wordt zekerder opgepikt. Twijfel je, bekijk dan de opgehaalde versie van je pagina in Search Console en kijk of de tekst die je verwacht er echt in staat.

Nemen AI-antwoorden mijn tekst over en verlies ik daardoor bezoek?

Bij vragen met één feit als antwoord wel, want die worden boven aan de pagina afgehandeld. Bij pagina's waar iemand een keuze maakt, prijzen vergelijkt of contact zoekt is dat effect veel kleiner. Wat helpt is stof opschrijven die alleen van jou is: je werkgebied, je werkwijze, je voorwaarden.

Hoe houd ik AI-bots buiten mijn site?

Met regels in je robots.txt per robotnaam. Denk er wel aan dat de instelling waarmee je Google verbiedt je inhoud voor modeltraining te gebruiken, je pagina niet weghoudt uit de samengestelde antwoorden boven de zoekresultaten; die putten uit de gewone zoekindex.

Is het toegestaan om zoekresultaten te schrapen?

Volgens de voorwaarden van Google niet. Tegen kleine gebruikers wordt daar zelden op gehandhaafd, en de gebruikelijke reactie is een blokkade of een captcha. Daarnaast gelden gewoon de AVG als je persoonsgegevens verzamelt en het auteursrecht als je teksten overneemt.

Waar haal ik mijn posities dan wel vandaan?

Uit Search Console. Daar staan je echte vertoningen, klikken en gemiddelde posities over de laatste zestien maanden, gemeten bij je eigen bezoekers. Wil je ook zien wat concurrenten doen, koop dan een bestaand gereedschap in plaats van zelf te gaan ophalen.

Wat is llms.txt en heb ik dat nodig?

Een voorstel voor een bestand waarin je AI-systemen wijst op de belangrijkste pagina's van je site, vergelijkbaar met een sitemap. Het is geen standaard en de grote zoekmachines doen er niets mee. Aanmaken kost je weinig, maar reken er niet op dat het iets oplevert.

Dit artikel hoort bij Internet Marketing Begrippen. Daar vind je meer uitleg over hetzelfde onderwerp.

Een vraag over dit onderwerp?

Vertel waar je tegenaan loopt.

Maurits denkt met je mee en geeft je een praktisch antwoord.

reactie dezelfde werkdag
Maurits van Platform Pro

Vertel kort waar je aan denkt

Nu gesloten, ik reageer de volgende werkdag

Maurits leest je bericht en neemt persoonlijk contact met je op.

Dit veld is bedoeld voor validatiedoeleinden en moet niet worden gewijzigd.
Dit veld is verborgen bij het bekijken van het formulier