Information gain: wat Google er echt over zegt
Information gain heeft een andere bronbasis dan effort. Effort staat letterlijk in de Search Quality Rater Guidelines; information gain niet. Het begrip komt uit een Google-patent, en de gedachte erachter komt terug in de helpful content-documentatie, de reviews-guidance, de “added value”-criteria van de SQRG en één attribuut uit de Content Warehouse-leak. Dit overzicht scheidt die lagen, wat het patent letterlijk zegt, wat Google publiek documenteert, en wat de SEO-industrie ervan heeft gemaakt. Engelse citaten zijn letterlijk uit de genoemde bronnen.
1. Het patent: de enige plek waar “information gain score” gedefinieerd is
Patent US11354342B2, “Contextual estimation of link information gain” — ingediend 18 oktober 2018, verleend 7 juni 2022, uitvinders Victor Carbune en Pedro Gonnet, toegewezen aan Google LLC. De definitie:
“An information gain score for a given document is indicative of additional information that is included in the document beyond information contained in documents that were previously viewed by the user.”
Drie dingen vallen op als je het patent echt leest in plaats van de samenvattingen erover.
Het is contextueel, geen statische paginascore. De score meet wat een document toevoegt ten opzichte van wat déze gebruiker al gezien heeft. De claims beschrijven een eerste set documenten over een onderwerp waarvan de informatie al aan de gebruiker is gepresenteerd, en een tweede set nieuwe documenten over hetzelfde onderwerp: “the information gain score for a given new document of the second set is indicative of additional information that would be gained by the user, beyond the information extracted from the one or more document of the first set.” Dezelfde pagina kan dus voor de ene gebruiker hoge en voor de andere lage information gain hebben.
Het werkt op semantische representaties, niet op woorden. Documenten gaan als “a semantic feature vector or embedding, a ‘bag-of-words’ representation” door een getraind machine learning-model. Synoniemen gebruiken of herformuleren verandert de embedding nauwelijks, parafraseren voegt in deze meting per definitie niets toe.
De consequentie is herordening of uitsluiting. Resultaten “may be reranked and/or one or more documents may be excluded (or significantly demoted) from the search results based on the new information gain scores”. Lage information gain is in het patent geen kleine malus maar een reden om een document niet meer te tonen.
let op: Het patent is geschreven in de context van automated assistants en doorlopende zoeksessies. Dat Google een patent heeft, bewijst niet dat dit exact zo in de ranking van webresultaten draait. Wat vaststaat: Google heeft het mechanisme beschreven, en de publieke documentatie hieronder stuurt op dezelfde uitkomst.
2. De publieke documentatie: dezelfde gedachte, andere woorden
Google’s zelfbeoordelingsvragen voor helpful content zijn de operationele vertaling van information gain, letterlijk:
“Does the content provide original information, reporting, research, or analysis?”
“Does the content provide insightful analysis or interesting information that is beyond the obvious?”
“If the content draws on other sources, does it avoid simply copying or rewriting those sources, and instead provide substantial additional value and originality?”
“Does the content provide substantial value when compared to other pages in search results?”
En de spiegelvragen onder “avoid creating search engine-first content”:
“Are you mainly summarizing what others have to say without adding much value?”
“Does your content leave readers feeling like they need to search again to get better information from other sources?”
Die laatste vraag ís information gain, geformuleerd vanuit de gebruiker: als de lezer na jouw pagina opnieuw moet zoeken, heeft je pagina niets toegevoegd aan wat hij al had.
De reviews-guidance maakt concreet hoe toegevoegde informatie eruitziet:
“Share quantitative measurements about how something measures up in various categories of performance”,
“Provide evidence such as visuals, audio, or other links of your own experience”,
“Describe key choices in how a product has been designed and their effect on the users beyond what the manufacturer says”
en
“Explain what sets something apart from its competitors.”
3. De brug naar de rater guidelines
De SQRG gebruiken de term information gain niet, maar de “added value”-criteria meten hetzelfde. De originality-definitie (§3.2): “Consider the extent to which the content offers unique, original content that is not available on other websites. If other websites have similar content, consider whether the page is the original source.” En de Lowest/Low-beslisregel draait volledig om wat een pagina toevoegt: little to no added value = Lowest, low added value = Low (§4.6.6–4.6.7, §5.2.1). De Low-voorbeelden uit de guidelines, samenvattingen van discussies, “beste/top10”-lijstjes op basis van bestaande reviews, zijn stuk voor stuk pagina’s met een information gain van vrijwel nul.
4. De leak: OriginalContentScore
In de Content Warehouse API-leak van 2024 zit het attribuut OriginalContentScore, gedocumenteerd als:
The original content score is represented as a 7-bits, going from 0 to 127. Only pages with little content have this field.
Google scoort originaliteit dus expliciet, in elk geval voor korte content — wat verklaart waarom korte pagina’s niet per definitie slecht ranken. Kanttekening: de leak toont datastructuren, niet hoe of hoe zwaar attributen in ranking meewegen.
5. Wat information gain níét is
Drie misverstanden die je in de SEO-praktijk vaak ziet. Meer woorden is geen information gain: het patent meet semantische toevoeging, en een langere herformulering van bestaande informatie scoort nul. Uniek geformuleerd is geen information gain: embeddings kijken door synoniemen en zinsbouw heen. En “een uniek onderwerp aansnijden” is maar de halve waarheid: information gain wordt gemeten binnen een onderwerp (“documents that share a topic”), het gaat om wat jij toevoegt aan het bestaande corpus over dat onderwerp, niet om het vermijden van concurrentie.
6. Checklist
A. Basisvragen bij elke pagina
- Wat weet iemand na het lezen van deze pagina dat hij niet al wist uit de top-10 voor dezelfde zoekvraag?
- Kun je de toegevoegde informatie concreet aanwijzen (nieuwe data, nieuwe observatie, nieuw perspectief, nieuwe combinatie), of is het “beter geschreven hetzelfde”?
- Zou de lezer na deze pagina nog moeten doorzoeken voor een beter antwoord? (Zo ja: lage information gain.)
- Is de unieke informatie prominent genoeg om gevonden en geciteerd te worden, of verstopt onder bekende feiten?
B. Rode vlaggen: vrijwel geen information gain
- De pagina vat samen wat elders al staat, zonder eigen toevoeging (“mainly summarizing what others have to say without adding much value”).
- De inhoud overlapt semantisch vrijwel volledig met gevestigde bronnen; alleen de formulering verschilt.
- Alle feiten zijn herleidbaar tot andere pagina’s in dezelfde SERP.
- De pagina drijft op algemeen bekende informatie die iedere concurrent ook heeft.
C. Oranje vlaggen: beperkte information gain
- Er is wel iets eigens (een mening, een voorbeeld), maar het draagt weinig bij aan het antwoord op de zoekvraag.
- De unieke inhoud is dun ten opzichte van de hergebruikte basis.
- De pagina voegt breedte toe (meer subonderwerpen) maar geen diepte die elders ontbreekt.
D. Bronnen van echte information gain
- Eigen data of metingen (“quantitative measurements”): testresultaten, benchmarks, eigen onderzoek, eigen statistieken.
- First-hand ervaring met bewijs: eigen foto’s, video, gedocumenteerd gebruik (“evidence such as visuals, audio, or other links of your own experience”).
- Original reporting: informatie die zonder deze pagina niet publiek zou zijn (interviews, opgevraagde documenten, primaire bronnen).
- Analyse voorbij het voor de hand liggende (“insightful analysis or interesting information that is beyond the obvious”): een verklaring, voorspelling of verband dat elders ontbreekt.
- Expertvertaling met toegevoegde waarde: complexe bronnen toegankelijk maken mag, mits er “substantial additional value and originality” bij komt.
- Vergelijkende inzichten: wat onderscheidt optie A van B op punten die de fabrikant of bestaande reviews niet noemen.
E. Toets tegen het corpus
- Bekijk de top-10 voor de belangrijkste zoekvraag: welke informatie op jouw pagina staat in géén van die resultaten?
- Als je jouw unieke claims in een zoekmachine plakt: kom je dan alleen jouw pagina tegen, of tientallen vergelijkbare?
- Zou een AI-overzicht of chatbot jouw pagina moeten citeren voor iets specifieks, of kan elke willekeurige bron hetzelfde leveren?
Tools
Omdat niemand zin heeft in handwerk heb ik weer een claude skill en Google Gem gemaakt. Voor de mensen die geen idee hoe claude en skills etc. werken heb ik een Google Gem gemaakt:
Bronnen
- US11354342B2 — Contextual estimation of link information gain (Google Patents)
- Creating helpful, reliable, people-first content (Google Search Central)
- Write high quality reviews (Google Search Central)
- Search Quality Evaluator Guidelines, 11 september 2025 (PDF)
- iPullRank — analyse Content Warehouse API-leak
- Search Engine Journal — Google’s Information Gain Patent

Geef een reactie