Datakwaliteit gids: Productdeduplicatie
Ontdek praktische strategieën, concrete stappen en best practices voor Productdeduplicatie in e-commerce.
Productdeduplicatie is het proces van het opsporen, samenvoegen en voorkomen van dubbele productrecords in je catalogus. Duplicaten ontstaan op allerlei manieren: meerdere leveranciers die hetzelfde product onder een andere naam aanleveren, handmatige invoer die net iets afwijkende versies van hetzelfde artikel oplevert, systeemmigraties die overlappende records introduceren, of marketplace-imports die producten toevoegen die al in je catalogus staan. Als je er niets aan doet, versnipperen dubbele producten je voorraaddata, verwarren ze klanten met inconsistente listings, verwateren ze je SEO-autoriteit over meerdere pagina's voor hetzelfde product en zorgen ze voor operationele chaos in fulfilment en rapportage.
Effectieve deduplicatie gaat veel verder dan zoeken op exacte overeenkomsten. Duplicaten in de praktijk zijn zelden identiek. Meestal hebben ze net iets andere titels, afwijkende attribuutopmaak, andere afbeeldingen en inconsistente identifiers. Robuuste deduplicatie vraagt om fuzzy matching-algoritmes die waarschijnlijke duplicaten herkennen op basis van een gewogen gelijkenis over meerdere velden, zoals productnaam, merk, EAN/GTIN, modelnummer, belangrijke specificaties en zelfs beeldgelijkenis. De uitdaging zit in de balans tussen gevoeligheid (zo veel mogelijk echte duplicaten vinden) en precisie (voorkomen dat je verschillende producten per ongeluk samenvoegt).
Een complete deduplicatiestrategie bestaat uit drie fases: detectie (bestaande duplicaten vinden), oplossing (dubbele records samenvoegen of koppelen) en preventie (voorkomen dat er nieuwe duplicaten ontstaan). Moderne PIM-systemen zoals WISEPIM ondersteunen alle drie de fases, met clusters van dubbele EAN's in de analyse en bijna-duplicaten die AI Quality Review markeert, een catalogustaak die lookalikes omzet in varianten van één hoofdproduct, en CSV-imports die op SKU en EAN matchen zodat ze bestaande producten bijwerken in plaats van nieuwe aan te maken. Door duplicatie systematisch aan te pakken houd je een schone, betrouwbare productcatalogus die zorgt voor een kloppende voorraad, een consistente klantervaring en betrouwbare analytics.
In één oogopslag
Kernprincipes van Productdeduplicatie
De belangrijkste concepten en regels voor een effectief resultaat
- 1
Detecteer op meerdere velden tegelijk
Vertrouwen op één identifier is onvoldoende, want hetzelfde product heeft vaak per bron een andere identifier. Combineer velden zoals productnaam, merk, EAN/GTIN, modelnummer, belangrijke specificaties en zelfs image hashes om een gelijkenisscore te berekenen tussen mogelijke duplicaatparen. Weeg elk veld op basis van hoe betrouwbaar het is als unieke identifier.
Match op EAN met 95% zekerheid, maar controleer voor producten zonder EAN ook naam + merk + categorieGebruik perceptual hashing van afbeeldingen om visueel identieke producten te herkennen, zelfs bij afwijkende tekstmetadataBereken samengestelde gelijkenisscores: EAN-match (40%) + naamgelijkenis (25%) + merkmatch (20%) + overlap in specificaties (15%) - 2
Zet fuzzy matching-algoritmes in
Exact matchen op tekst mist het overgrote deel van de duplicaten die je in de praktijk tegenkomt. Zet fuzzy matching-algoritmes in zoals Levenshtein-afstand, Jaro-Winkler-gelijkenis, n-gramvergelijking en TF-IDF-cosinusgelijkenis om duplicaten te vinden met net iets andere naamgeving, afkortingen of opmaak. Stel de drempelwaarden zorgvuldig in, zodat gevoeligheid en het aantal valse treffers met elkaar in balans blijven.
Levenshtein-afstand herkent 'Samsung Galaxy S24 Ultra' en 'Samsung Galaxy S24Ultra' als waarschijnlijke duplicatenN-gramvergelijking ziet 'Mens Running Shoes Nike Air Max' en 'Nike Air Max Running Shoes for Men' als vergelijkbaarTF-IDF-cosinusgelijkenis vindt producten met herschikte maar inhoudelijk identieke beschrijvingen - 3
Bepaal welk record leidend is
Zodra je duplicaten vindt, heb je een duidelijke strategie nodig voor welk record het canonieke (primaire) record wordt en wat er met de data uit de secundaire records gebeurt. Leg regels vast voor het kiezen van het canonieke record op basis van datakwaliteit, volledigheidsscore, betrouwbaarheid van de bron of aanmaakdatum. Stel per veld samenvoegregels op die bepalen hoe je de beste data uit elk duplicaat combineert in het record dat overblijft.
Kies het record met de hoogste volledigheidsscore als canoniek productBehoud per attribuut de waarde uit de meest gezaghebbende bron (bijvoorbeeld fabrikantdata boven leveranciersdata)Bewaar alle unieke afbeeldingen uit de dubbele records en voeg ze toe aan de galerij van het canonieke product - 4
Voorkom duplicaten bij de invoer
De goedkoopste manier om duplicaten aan te pakken is voorkomen dat ze ontstaan. Bouw realtime duplicaatcontroles in bij het aanmaken van producten, bij imports en bij het inlezen van leveranciersdata. Zodra het systeem een mogelijk duplicaat ziet, waarschuw je de gebruiker en bied je aan om de nieuwe data aan het bestaande record te koppelen in plaats van een nieuw product aan te maken.
Toon een waarschuwing 'mogelijk duplicaat gevonden' zodra iemand een product invoert met een bestaande EAN of een vergelijkbare titelSignaleer tijdens een CSV-import de regels die boven een instelbare gelijkenisdrempel overeenkomen met bestaande productenVraag om een bevestiging voordat een nieuw product wordt aangemaakt terwijl het systeem vergelijkbare bestaande records ziet - 5
Houd een audittrail bij van elke samenvoeging
Elke samenvoeging moet volledig te herleiden zijn. Leg vast welke producten zijn samengevoegd, welk record canoniek werd, welke veldwaarden je hebt behouden of verworpen, wie de samenvoeging heeft goedgekeurd en wanneer dat gebeurde. Die audittrail is onmisbaar voor troubleshooting, compliance en het terugdraaien van samenvoegingen als er toch iets misgaat.
Log elke samenvoeging met een voor/na-momentopname van beide records en het resulterende productRegistreer wie de samenvoeging goedkeurde en met welke zekerheidsscore de match is gevondenBied een functie 'samenvoeging ongedaan maken' die de oorspronkelijke losse records uit de audittrail herstelt
Hoe je Productdeduplicatie opzet
Stap voor stap uitleg om deze datakwaliteitspraktijk in je winkel te gebruiken
- 1
Breng de omvang van de duplicatie in kaart
Voordat je een deduplicatiestrategie inricht, wil je weten hoe groot het probleem is. Draai een eerste scan over je catalogus met exacte matches op EAN/GTIN-codes, gevolgd door fuzzy matching op productnamen binnen hetzelfde merk en dezelfde categorie. Deze nulmeting laat zien hoeveel duplicaten er zijn, welke categorieën het hardst geraakt worden en welke databronnen de grootste veroorzakers zijn.
- Scan eerst op exacte EAN-duplicaten: dat zijn definitieve matches die je direct kunt oplossen
- Draai fuzzy matching op namen binnen groepen van merk + categorie met een gelijkenisdrempel van 0,85
- Analyseer de herkomst van dubbele records om structurele oorzaken te vinden (bepaalde leveranciers, importprocessen, enzovoort)
- 2
Stel matchingregels en drempelwaarden in
Leg vast op welke criteria je deduplicatiesysteem mogelijke duplicaten herkent. Bepaal veldgewichten, gelijkenisalgoritmes en zekerheidsdrempels per matchingstrategie. Maak aparte matchingprofielen voor verschillende scenario's: exacte matches op identifiers, fuzzy matches met hoge zekerheid, en kandidaten met lagere zekerheid die handmatige beoordeling vragen.
- Exacte EAN-match: automatisch markeren als duplicaat met 99% zekerheid
- Zelfde merk + categorie + naamgelijkenis > 0,90: markeren als waarschijnlijk duplicaat voor beoordeling
- Zelfde categorie + naamgelijkenis > 0,80 + overlappende specificaties: markeren als mogelijk duplicaat voor nader onderzoek
- 3
Bouw samenvoegworkflows
Richt gestructureerde workflows in om gevonden duplicaten op te lossen. Ontwerp een samenvoeginterface die mogelijke duplicaatparen naast elkaar toont, verschillen uitlicht en gebruikers per veld de beste waarde laat kiezen. Voeg batchsamenvoeging toe voor matches met hoge zekerheid en beoordelingswachtrijen voor twijfelgevallen.
- Een vergelijkingsweergave naast elkaar met alle velden van beide kandidaten en de verschillen gemarkeerd
- Duplicaten met hoge zekerheid (99%+ match op EAN) automatisch samenvoegen op basis van vaste veldregels
- Matches met gemiddelde zekerheid (85-99%) in een wachtrij zetten voor beoordeling, inclusief een voorgestelde samenvoegactie
- 4
Zet preventie aan de voorkant in
Richt realtime duplicaatdetectie in die draait zodra er nieuwe producten worden aangemaakt of geïmporteerd. Laat het systeem binnenkomende records controleren tegen bestaande producten op basis van je matchingcriteria. Kies per zekerheidsniveau de passende reactie: blokkeren, waarschuwen of een koppeling voorstellen.
- Blokkeer het aanmaken van een product met een EAN die exact overeenkomt met een bestaand actief product
- Toon een waarschuwingsvenster met vergelijkbare bestaande producten bij een nieuw product met hetzelfde merk + naampatroon
- Zet mogelijke duplicaten uit een leveranciersfeed in quarantaine voor beoordeling, voordat ze in de catalogus belanden
- 5
Scan periodiek op duplicaten
Plan terugkerende deduplicatiescans om duplicaten te vinden die langs je preventiecontroles glippen of die ontstaan doordat data in de loop van de tijd verandert. Draai maandelijks een volledige scan en wekelijks gerichte scans (bijvoorbeeld binnen specifieke categorieën of over recente imports). Volg hoeveel nieuwe duplicaten je door de tijd heen vindt om te meten hoe goed je preventie werkt.
- Wekelijkse scan van producten die de afgelopen 7 dagen zijn geïmporteerd tegen de volledige catalogus
- Maandelijkse scan over de hele catalogus met steeds verder verfijnde matchingregels
- Een scan die automatisch start zodra een leveranciersfeed is verwerkt
- 6
Monitor en stuur bij
Houd doorlopend bij hoe effectief je deduplicatie is met cijfers als detectiepercentage, percentage valse treffers, slagingspercentage van samenvoegingen en het aantal nieuwe duplicaten dat erbij komt. Gebruik die inzichten om matchingalgoritmes te verfijnen, drempels bij te stellen en preventie te verbeteren. Deel deduplicatierapporten met leveranciers om de oorzaak van binnenkomende dubbele data bij de bron aan te pakken.
- Een dashboard met trends in gevonden duplicaten, oplospercentages en de grootste bronnen van duplicatie
- Elk kwartaal de drempelwaarden herzien op basis van een analyse van valse treffers en gemiste duplicaten
- Leveranciersscorecards die laten zien welke partijen de meeste dubbele productdata aanleveren
Productdeduplicatie best practices
Bewezen do's en don'ts om het meeste uit je datakwaliteitsinspanningen te halen
- Wel doen
Gebruik gewogen matching over meerdere velden: identifiers, productnamen, merk, categorie en specificaties samen leveren de betrouwbaarste detectie.
Niet doenAlleen vertrouwen op een exacte EAN/GTIN-match, waardoor je duplicaten mist met een afwijkende of ontbrekende identifier.
- Wel doen
Werk met zekerheidsniveaus: los definitieve matches automatisch op en laat twijfelgevallen door een mens beoordelen.
Niet doenAlle gevonden duplicaten automatisch samenvoegen zonder zekerheidsscore, met het risico dat je verschillende producten op één hoop gooit.
- Wel doen
Houd een volledige audittrail bij van elke samenvoeging, met voor/na-momentopnamen en de mogelijkheid om terug te draaien.
Niet doenSecundaire records definitief verwijderen bij een samenvoeging, zonder de oorspronkelijke data of de samenvoeghistorie te bewaren.
- Wel doen
Voorkom duplicaten bij de invoer door binnenkomende data te controleren tegen bestaande producten voordat er records worden aangemaakt.
Niet doenProducten onbeperkt laten aanmaken en volledig leunen op periodieke opschoonscans om duplicaten achteraf op te ruimen.
- Wel doen
Leg duidelijke regels vast voor het kiezen van het canonieke record, op basis van datakwaliteit, volledigheid en gezag van de bron.
Niet doenPer geval ad hoc beslissen bij het samenvoegen, waardoor de datakwaliteit van de overblijvende records alle kanten op gaat.
- Wel doen
Onderzoek de oorzaken van duplicatie (bepaalde leveranciers, importprocessen, invoergewoontes) en pak ze structureel aan.
Niet doenDeduplicatie als puur opruimwerk behandelen, zonder de processen te repareren die de duplicaten überhaupt veroorzaken.
Tools voor Productdeduplicatie
Handige tools en WISEPIM-functies om dit in de praktijk te brengen
WISEPIM dubbele SKU's en EAN's
Analytics groepeert producten met dezelfde EAN in duplicaatclusters, zodat je elk cluster en de producten daarin ziet. SKU's zijn binnen een project al uniek, dus dezelfde SKU kan niet twee keer worden aangemaakt. Maak vanuit het paneel een Quality Guard-regel aan die de volgende dubbele EAN bij de export tegenhoudt.
Meer infoBijna-duplicaten in AI Quality Review
AI Quality Review markeert bijna-duplicaten: producten van hetzelfde merk in dezelfde categorie waarvan naam en content zo dicht bij elkaar liggen dat ze op één artikel lijken waarvan maar één attribuut verschilt. Elk cluster toont de betrokken producten, zodat je team beslist wat blijft.
Maak varianten van lookalikes
Zijn bijna-duplicaten eigenlijk varianten van één product? Deze catalogustaak groepeert ze onder een hoofdproduct en meldt de mogelijke duplicaten die hij onderweg vindt. Elke voorgestelde groep wacht in de controlelijst tot iemand hem accepteert, aanpast of afwijst.
Importmatching op SKU en EAN
CSV-imports koppelen binnenkomende rijen op SKU of EAN aan bestaande producten en werken het gevonden product bij in plaats van een tweede aan te maken. Voeg een Quality Guard-uniciteitsregel op EAN met de ernst Blokkeren toe om een duplicaat dat er toch doorheen glipt uit je exports te houden.
Waarschuwing bij dubbele upload
Upload je een bestand, dan waarschuwt de mediabibliotheek als er al een bestand met dezelfde naam of inhoud bestaat. Zo bewaar je dezelfde packshot niet twee keer.
Hoe je Productdeduplicatie succes meet
De belangrijkste metrics en doelen om je voortgang bij te houden
Duplicaatpercentage
Het percentage producten in je catalogus met één of meer dubbele records. Dit is je belangrijkste graadmeter voor de netheid van je catalogus; volg het door de tijd heen om te meten hoe goed zowel je detectie als je preventie werkt.
Detectienauwkeurigheid (precisie)
Het percentage gemarkeerde duplicaatparen dat bij beoordeling ook echt een duplicaat blijkt. Een hoge precisie betekent dat je matchingregels goed zijn afgesteld en dat je team geen tijd verliest aan valse treffers.
Detectiedekking (recall)
Het percentage werkelijke duplicaten in je catalogus dat je matchingalgoritmes ook daadwerkelijk vinden. Een hoge recall betekent dat er nauwelijks duplicaten door de mazen glippen.
Preventiepercentage
Het percentage mogelijke nieuwe duplicaten dat al bij de invoer wordt onderschept (tijdens het aanmaken of importeren), voordat ze onderdeel worden van de actieve catalogus. Een hoog preventiepercentage laat zien dat je controles aan de voorkant werken.
Doorlooptijd van samenvoegen
De gemiddelde tijd tussen het moment waarop een duplicaatpaar wordt gemarkeerd en het moment waarop het is opgelost (samengevoegd, gekoppeld of afgewezen). Kortere doorlooptijden wijzen op efficiënte workflows en duidelijke samenvoegregels.
Voorbeeldscenario
Een B2B-distributeur ruimt duplicaten op na het samenvoegen van leverancierscatalogi
Stel je een distributeur voor met een catalogus van tienduizenden industriële onderdelen van een paar honderd leveranciers. Nadat meerdere leverancierscatalogi en een oude ERP-export over elkaar heen zijn ingeladen, bestaat hetzelfde onderdeel meer dan eens: één keer onder de SKU van de leverancier, één keer onder de interne, soms met dezelfde EAN. De voorraad is over meerdere records verdeeld, B2B-klanten vinden twee versies van één product in de zoekresultaten en sommigen bestellen de verkeerde.
Het team begint bij de duplicaatclusters die WISEPIM in de datakwaliteitsanalyse toont, gegroepeerd op gedeelde EAN, en werkt ze cluster voor cluster af: kies het record dat blijft, neem data over die alleen in het andere record staat en verwijder het extra record. Onderdelen zonder EAN worden gecontroleerd door te filteren op fabrikantartikelnummer en merk. Voor nieuwe leveranciersbestanden matcht de CSV-import op SKU en EAN en werkt hij bestaande producten bij in plaats van nieuwe aan te maken.
Aan de slag met Productdeduplicatie
Drie stappen om vandaag nog je productdatakwaliteit te verbeteren
01
Breng duplicatie in kaart en stel matching in
Draai een eerste scan over je catalogus om de omvang van de duplicatie te bepalen. Begin met exacte matches op identifiers (EAN, fabrikantartikelnummer) om definitieve duplicaten te vinden en breid daarna uit naar fuzzy matching op namen binnen groepen van merk en categorie. Analyseer de resultaten om de patronen te begrijpen: welke categorieën het hardst geraakt worden, welke leveranciers de meeste duplicaten aanleveren en welke invoerprocessen de meeste overlap veroorzaken. Gebruik die inzichten om je matchingregels in te stellen met passende veldgewichten, gelijkenisalgoritmes en zekerheidsdrempels.
02
Los bestaande duplicaten op en richt samenvoegworkflows in
Verwerk gevonden duplicaten in lagen, op basis van zekerheid. Voeg matches met hoge zekerheid automatisch samen op basis van vaste regels voor canonieke selectie en veldkeuze. Stuur matches met gemiddelde zekerheid naar een beoordelingswachtrij, waar productspecialisten de vergelijking naast elkaar bekijken en kiezen tussen samenvoegen, koppelen of afwijzen. Zorg bij elke samenvoeging dat voorraadstanden worden geconsolideerd, bestelhistorie behouden blijft, URL's worden doorverwezen en de audittrail compleet is. Pak eerst de duplicaatclusters met de meeste impact aan: bestsellers, pagina's met veel verkeer of producten met voorraadverschillen.
03
Zet preventie en doorlopende monitoring op
Richt realtime duplicaatcontrole in op elk punt waar data binnenkomt: handmatig aangemaakte producten, CSV/Excel-imports, leveranciersfeeds en marketplace-synchronisatie. Kies per zekerheidsniveau de juiste reactie: definitieve duplicaten blokkeren, waarschuwen bij waarschijnlijke matches en mogelijke matches loggen voor latere beoordeling. Plan terugkerende catalogusscans om duplicaten te vangen die langs de preventie glippen. Volg je belangrijkste cijfers (duplicaatpercentage, detectienauwkeurigheid, preventiepercentage) en verfijn je matchingregels regelmatig op basis van valse en gemiste treffers en feedback uit het team.
Strategiegids productdeduplicatie
Download onze complete gids voor het opsporen, oplossen en voorkomen van dubbele producten in je e-commerce catalogus. Inclusief configuraties voor matchingalgoritmes, sjablonen voor samenvoegworkflows en checklists voor preventie.
- Configuratiesjablonen voor matching over meerdere velden, met aanbevolen veldgewichten en gelijkenisdrempels per veelvoorkomend producttype
- Beslisboom voor samenvoegen, waarmee teams bepalen of ze een duplicaatpaar samenvoegen, koppelen of afwijzen
- Preventiechecklist voor het onboarden van leveranciers, importprocessen en het handmatig aanmaken van producten
- ROI-calculator die de operationele kosten van duplicatie berekent op basis van je catalogusomvang en duplicaatpercentage
Veelgestelde vragen
Veelgestelde vragen over Productdeduplicatie
Meer datakwaliteitsonderwerpen
- Inventariseer je productbronnen
- Definieer je attribuutschema
- Normaliseer merknamen
- Voeg alt-text toe aan primaire beelden
De data-quality herstelchecklist
14 stappen die je écht verder brengen, van het vinden van de top 20% omzetproducten tot het opzetten van maandelijkse regressiechecks. Werk hem af, en je weet dat je geen stille drift meer hebt.
- Eerst het Pareto-principe: fix de 20% die 80% omzet draait
- Concrete regels om vervuiling buiten de deur te houden
- Maandelijkse regressiecheck, zodat het niet terugglipt
Eén mail, geen spam. Printen en aan de slag.
Voorbeeld: je krijgt alleen echte updates.
Laat het me weten wanneer deze gids bijgewerkt wordt
Data-kwaliteit is een bewegend doel, met nieuwe validatiepatronen en nieuwe benchmarks. Wij laten alleen weten wanneer er iets écht verandert in deze gids.
- Eén mail per echte revisie
- Geen wekelijkse nieuwsbrief
- Afmelden met één reply
Alleen echte revisies. Geen wekelijkse nieuwsbrief.
Verder ontdekken
Zorgvuldig gekozen vervolgstappen om dieper te gaan.
Klaar om je productdatakwaliteit te verbeteren?
WISEPIM helpt je productdatakwaliteit te meten, valideren en verbeteren in je hele catalogus met AI-tools.