Datakwaliteit gids: Productdeduplicatie
Ontdek praktische strategieën, concrete stappen en best practices voor Productdeduplicatie in e-commerce.
Productdeduplicatie is het proces van het opsporen, samenvoegen en voorkomen van dubbele productrecords in je catalogus. Duplicaten ontstaan op allerlei manieren: meerdere leveranciers die hetzelfde product onder een andere naam aanleveren, handmatige invoer die net iets afwijkende versies van hetzelfde artikel oplevert, systeemmigraties die overlappende records introduceren, of marketplace-imports die producten toevoegen die al in je catalogus staan. Als je er niets aan doet, versnipperen dubbele producten je voorraaddata, verwarren ze klanten met inconsistente listings, verwateren ze je SEO-autoriteit over meerdere pagina's voor hetzelfde product en zorgen ze voor operationele chaos in fulfilment en rapportage.
Effectieve deduplicatie gaat veel verder dan zoeken op exacte overeenkomsten. Duplicaten in de praktijk zijn zelden identiek. Meestal hebben ze net iets andere titels, afwijkende attribuutopmaak, andere afbeeldingen en inconsistente identifiers. Robuuste deduplicatie vraagt om fuzzy matching-algoritmes die waarschijnlijke duplicaten herkennen op basis van een gewogen gelijkenis over meerdere velden, zoals productnaam, merk, EAN/GTIN, modelnummer, belangrijke specificaties en zelfs beeldgelijkenis. De uitdaging zit in de balans tussen gevoeligheid (zo veel mogelijk echte duplicaten vinden) en precisie (voorkomen dat je verschillende producten per ongeluk samenvoegt).
Een complete deduplicatiestrategie bestaat uit drie fases: detectie (bestaande duplicaten vinden), oplossing (dubbele records samenvoegen of koppelen) en preventie (voorkomen dat er nieuwe duplicaten ontstaan). Moderne PIM-systemen zoals WISEPIM ondersteunen alle drie de fases, met detectietools die je catalogus op aanvraag of doorlopend scannen, samenvoegworkflows waarin je per dubbel record kiest welke data je behoudt, en importvalidatie die mogelijke duplicaten signaleert vóórdat er nieuwe records worden aangemaakt. Door duplicatie systematisch aan te pakken houd je een schone, betrouwbare productcatalogus die zorgt voor een kloppende voorraad, een consistente klantervaring en betrouwbare analytics.
In één oogopslag
Kernprincipes van Productdeduplicatie
De belangrijkste concepten en regels voor een effectief resultaat
- 1
Detecteer op meerdere velden tegelijk
Vertrouwen op één identifier is onvoldoende, want hetzelfde product heeft vaak per bron een andere identifier. Combineer velden zoals productnaam, merk, EAN/GTIN, modelnummer, belangrijke specificaties en zelfs image hashes om een gelijkenisscore te berekenen tussen mogelijke duplicaatparen. Weeg elk veld op basis van hoe betrouwbaar het is als unieke identifier.
Match op EAN met 95% zekerheid, maar controleer voor producten zonder EAN ook naam + merk + categorieGebruik perceptual hashing van afbeeldingen om visueel identieke producten te herkennen, zelfs bij afwijkende tekstmetadataBereken samengestelde gelijkenisscores: EAN-match (40%) + naamgelijkenis (25%) + merkmatch (20%) + overlap in specificaties (15%) - 2
Zet fuzzy matching-algoritmes in
Exact matchen op tekst mist het overgrote deel van de duplicaten die je in de praktijk tegenkomt. Zet fuzzy matching-algoritmes in zoals Levenshtein-afstand, Jaro-Winkler-gelijkenis, n-gramvergelijking en TF-IDF-cosinusgelijkenis om duplicaten te vinden met net iets andere naamgeving, afkortingen of opmaak. Stel de drempelwaarden zorgvuldig in, zodat gevoeligheid en het aantal valse treffers met elkaar in balans blijven.
Levenshtein-afstand herkent 'Samsung Galaxy S24 Ultra' en 'Samsung Galaxy S24Ultra' als waarschijnlijke duplicatenN-gramvergelijking ziet 'Mens Running Shoes Nike Air Max' en 'Nike Air Max Running Shoes for Men' als vergelijkbaarTF-IDF-cosinusgelijkenis vindt producten met herschikte maar inhoudelijk identieke beschrijvingen - 3
Bepaal welk record leidend is
Zodra je duplicaten vindt, heb je een duidelijke strategie nodig voor welk record het canonieke (primaire) record wordt en wat er met de data uit de secundaire records gebeurt. Leg regels vast voor het kiezen van het canonieke record op basis van datakwaliteit, volledigheidsscore, betrouwbaarheid van de bron of aanmaakdatum. Stel per veld samenvoegregels op die bepalen hoe je de beste data uit elk duplicaat combineert in het record dat overblijft.
Kies het record met de hoogste volledigheidsscore als canoniek productBehoud per attribuut de waarde uit de meest gezaghebbende bron (bijvoorbeeld fabrikantdata boven leveranciersdata)Bewaar alle unieke afbeeldingen uit de dubbele records en voeg ze toe aan de galerij van het canonieke product - 4
Voorkom duplicaten bij de invoer
De goedkoopste manier om duplicaten aan te pakken is voorkomen dat ze ontstaan. Bouw realtime duplicaatcontroles in bij het aanmaken van producten, bij imports en bij het inlezen van leveranciersdata. Zodra het systeem een mogelijk duplicaat ziet, waarschuw je de gebruiker en bied je aan om de nieuwe data aan het bestaande record te koppelen in plaats van een nieuw product aan te maken.
Toon een waarschuwing 'mogelijk duplicaat gevonden' zodra iemand een product invoert met een bestaande EAN of een vergelijkbare titelSignaleer tijdens een CSV-import de regels die boven een instelbare gelijkenisdrempel overeenkomen met bestaande productenVraag om een bevestiging voordat een nieuw product wordt aangemaakt terwijl het systeem vergelijkbare bestaande records ziet - 5
Houd een audittrail bij van elke samenvoeging
Elke samenvoeging moet volledig te herleiden zijn. Leg vast welke producten zijn samengevoegd, welk record canoniek werd, welke veldwaarden je hebt behouden of verworpen, wie de samenvoeging heeft goedgekeurd en wanneer dat gebeurde. Die audittrail is onmisbaar voor troubleshooting, compliance en het terugdraaien van samenvoegingen als er toch iets misgaat.
Log elke samenvoeging met een voor/na-momentopname van beide records en het resulterende productRegistreer wie de samenvoeging goedkeurde en met welke zekerheidsscore de match is gevondenBied een functie 'samenvoeging ongedaan maken' die de oorspronkelijke losse records uit de audittrail herstelt
Hoe je Productdeduplicatie opzet
Stap voor stap uitleg om deze datakwaliteitspraktijk in je winkel te gebruiken
- 1
Breng de omvang van de duplicatie in kaart
Voordat je een deduplicatiestrategie inricht, wil je weten hoe groot het probleem is. Draai een eerste scan over je catalogus met exacte matches op EAN/GTIN-codes, gevolgd door fuzzy matching op productnamen binnen hetzelfde merk en dezelfde categorie. Deze nulmeting laat zien hoeveel duplicaten er zijn, welke categorieën het hardst geraakt worden en welke databronnen de grootste veroorzakers zijn.
- Scan eerst op exacte EAN-duplicaten: dat zijn definitieve matches die je direct kunt oplossen
- Draai fuzzy matching op namen binnen groepen van merk + categorie met een gelijkenisdrempel van 0,85
- Analyseer de herkomst van dubbele records om structurele oorzaken te vinden (bepaalde leveranciers, importprocessen, enzovoort)
- 2
Stel matchingregels en drempelwaarden in
Leg vast op welke criteria je deduplicatiesysteem mogelijke duplicaten herkent. Bepaal veldgewichten, gelijkenisalgoritmes en zekerheidsdrempels per matchingstrategie. Maak aparte matchingprofielen voor verschillende scenario's: exacte matches op identifiers, fuzzy matches met hoge zekerheid, en kandidaten met lagere zekerheid die handmatige beoordeling vragen.
- Exacte EAN-match: automatisch markeren als duplicaat met 99% zekerheid
- Zelfde merk + categorie + naamgelijkenis > 0,90: markeren als waarschijnlijk duplicaat voor beoordeling
- Zelfde categorie + naamgelijkenis > 0,80 + overlappende specificaties: markeren als mogelijk duplicaat voor nader onderzoek
- 3
Bouw samenvoegworkflows
Richt gestructureerde workflows in om gevonden duplicaten op te lossen. Ontwerp een samenvoeginterface die mogelijke duplicaatparen naast elkaar toont, verschillen uitlicht en gebruikers per veld de beste waarde laat kiezen. Voeg batchsamenvoeging toe voor matches met hoge zekerheid en beoordelingswachtrijen voor twijfelgevallen.
- Een vergelijkingsweergave naast elkaar met alle velden van beide kandidaten en de verschillen gemarkeerd
- Duplicaten met hoge zekerheid (99%+ match op EAN) automatisch samenvoegen op basis van vaste veldregels
- Matches met gemiddelde zekerheid (85-99%) in een wachtrij zetten voor beoordeling, inclusief een voorgestelde samenvoegactie
- 4
Zet preventie aan de voorkant in
Richt realtime duplicaatdetectie in die draait zodra er nieuwe producten worden aangemaakt of geïmporteerd. Laat het systeem binnenkomende records controleren tegen bestaande producten op basis van je matchingcriteria. Kies per zekerheidsniveau de passende reactie: blokkeren, waarschuwen of een koppeling voorstellen.
- Blokkeer het aanmaken van een product met een EAN die exact overeenkomt met een bestaand actief product
- Toon een waarschuwingsvenster met vergelijkbare bestaande producten bij een nieuw product met hetzelfde merk + naampatroon
- Zet mogelijke duplicaten uit een leveranciersfeed in quarantaine voor beoordeling, voordat ze in de catalogus belanden
- 5
Scan periodiek op duplicaten
Plan terugkerende deduplicatiescans om duplicaten te vinden die langs je preventiecontroles glippen of die ontstaan doordat data in de loop van de tijd verandert. Draai maandelijks een volledige scan en wekelijks gerichte scans (bijvoorbeeld binnen specifieke categorieën of over recente imports). Volg hoeveel nieuwe duplicaten je door de tijd heen vindt om te meten hoe goed je preventie werkt.
- Wekelijkse scan van producten die de afgelopen 7 dagen zijn geïmporteerd tegen de volledige catalogus
- Maandelijkse scan over de hele catalogus met steeds verder verfijnde matchingregels
- Een scan die automatisch start zodra een leveranciersfeed is verwerkt
- 6
Monitor en stuur bij
Houd doorlopend bij hoe effectief je deduplicatie is met cijfers als detectiepercentage, percentage valse treffers, slagingspercentage van samenvoegingen en het aantal nieuwe duplicaten dat erbij komt. Gebruik die inzichten om matchingalgoritmes te verfijnen, drempels bij te stellen en preventie te verbeteren. Deel deduplicatierapporten met leveranciers om de oorzaak van binnenkomende dubbele data bij de bron aan te pakken.
- Een dashboard met trends in gevonden duplicaten, oplospercentages en de grootste bronnen van duplicatie
- Elk kwartaal de drempelwaarden herzien op basis van een analyse van valse treffers en gemiste duplicaten
- Leveranciersscorecards die laten zien welke partijen de meeste dubbele productdata aanleveren
Productdeduplicatie best practices
Bewezen do's en don'ts om het meeste uit je datakwaliteitsinspanningen te halen
- Wel doen
Gebruik gewogen matching over meerdere velden: identifiers, productnamen, merk, categorie en specificaties samen leveren de betrouwbaarste detectie.
Niet doenAlleen vertrouwen op een exacte EAN/GTIN-match, waardoor je duplicaten mist met een afwijkende of ontbrekende identifier.
- Wel doen
Werk met zekerheidsniveaus: los definitieve matches automatisch op en laat twijfelgevallen door een mens beoordelen.
Niet doenAlle gevonden duplicaten automatisch samenvoegen zonder zekerheidsscore, met het risico dat je verschillende producten op één hoop gooit.
- Wel doen
Houd een volledige audittrail bij van elke samenvoeging, met voor/na-momentopnamen en de mogelijkheid om terug te draaien.
Niet doenSecundaire records definitief verwijderen bij een samenvoeging, zonder de oorspronkelijke data of de samenvoeghistorie te bewaren.
- Wel doen
Voorkom duplicaten bij de invoer door binnenkomende data te controleren tegen bestaande producten voordat er records worden aangemaakt.
Niet doenProducten onbeperkt laten aanmaken en volledig leunen op periodieke opschoonscans om duplicaten achteraf op te ruimen.
- Wel doen
Leg duidelijke regels vast voor het kiezen van het canonieke record, op basis van datakwaliteit, volledigheid en gezag van de bron.
Niet doenPer geval ad hoc beslissen bij het samenvoegen, waardoor de datakwaliteit van de overblijvende records alle kanten op gaat.
- Wel doen
Onderzoek de oorzaken van duplicatie (bepaalde leveranciers, importprocessen, invoergewoontes) en pak ze structureel aan.
Niet doenDeduplicatie als puur opruimwerk behandelen, zonder de processen te repareren die de duplicaten überhaupt veroorzaken.
Tools voor Productdeduplicatie
Handige tools en WISEPIM-functies om dit in de praktijk te brengen
WISEPIM duplicaatdetectie-engine
Scan je volledige productcatalogus op mogelijke duplicaten met instelbare matching over meerdere velden en fuzzy algoritmes. Beoordeel de resultaten in een speciaal daarvoor gebouwde interface met vergelijking naast elkaar, zekerheidsscores en batchgewijs oplossen.
Meer infoBeheer van samenvoegworkflows
Los gevonden duplicaten op via een gestructureerde samenvoegworkflow die gebruikers veld voor veld door de keuzes leidt. Selecteer automatisch de beste waarden op basis van instelbare regels, bewaar alle unieke data en leg van elke samenvoeging een volledige audittrail vast.
Duplicaatcontrole bij import
Controleer binnenkomende productdata uit leveranciersfeeds, CSV-imports en API-koppelingen automatisch tegen je bestaande catalogus voordat er records worden aangemaakt. Zet mogelijke duplicaten in quarantaine voor beoordeling en koppel ze met één klik aan een bestaand product.
Detectie van beeldgelijkenis
Gebruik perceptual hashing en beeldvergelijkingsalgoritmes om producten te vinden met visueel identieke of vrijwel identieke productfotografie. Zo vang je duplicaten op die matching op tekst zou missen.
Hoe je Productdeduplicatie succes meet
De belangrijkste metrics en doelen om je voortgang bij te houden
Duplicaatpercentage
Het percentage producten in je catalogus met één of meer dubbele records. Dit is je belangrijkste graadmeter voor de netheid van je catalogus; volg het door de tijd heen om te meten hoe goed zowel je detectie als je preventie werkt.
Detectienauwkeurigheid (precisie)
Het percentage gemarkeerde duplicaatparen dat bij beoordeling ook echt een duplicaat blijkt. Een hoge precisie betekent dat je matchingregels goed zijn afgesteld en dat je team geen tijd verliest aan valse treffers.
Detectiedekking (recall)
Het percentage werkelijke duplicaten in je catalogus dat je matchingalgoritmes ook daadwerkelijk vinden. Een hoge recall betekent dat er nauwelijks duplicaten door de mazen glippen.
Preventiepercentage
Het percentage mogelijke nieuwe duplicaten dat al bij de invoer wordt onderschept (tijdens het aanmaken of importeren), voordat ze onderdeel worden van de actieve catalogus. Een hoog preventiepercentage laat zien dat je controles aan de voorkant werken.
Doorlooptijd van samenvoegen
De gemiddelde tijd tussen het moment waarop een duplicaatpaar wordt gemarkeerd en het moment waarop het is opgelost (samengevoegd, gekoppeld of afgewezen). Kortere doorlooptijden wijzen op efficiënte workflows en duidelijke samenvoegregels.
Praktijkvoorbeeld
Hoe een B2B-distributeur van industriële onderdelen 4.200 dubbele producten opruimde en de voorraadnauwkeurigheid met 28% verbeterde
De distributeur beheerde een catalogus van 85.000 industriële onderdelen van ruim 200 leveranciers. Door meerdere leverancierscatalogi, migraties uit oude systemen en inconsistente naamgeving lag het duplicaatpercentage naar schatting op 5 à 7%. Duizenden producten hadden dus meerdere records, wat leidde tot versnipperde voorraadstanden, verwarrende zoekresultaten voor B2B-klanten, hogere kosten voor catalogusbeheer en onbetrouwbare inkoopprognoses. Klanten meldden gemiddeld 15 keer per week dat ze de verkeerde variant van een product hadden besteld.
Het team ging matchen op meerdere velden tegelijk: fabrikantartikelnummers, productnamen met fuzzy matching, merkherkenning en vergelijking van specificaties. Een eerste scan over de hele catalogus leverde 4.200 bevestigde duplicaatclusters op. Matches met hoge zekerheid (2.800 producten) werden automatisch samengevoegd op basis van vaste regels; matches met gemiddelde zekerheid (1.400 producten) gingen door een handmatige beoordeling van twee weken. In de importpijplijn voor leveranciersdata kwamen preventiecontroles, die per maandelijkse importronde gemiddeld 45 mogelijke duplicaten onderschepten.
Aan de slag met Productdeduplicatie
Drie stappen om vandaag nog je productdatakwaliteit te verbeteren
Breng duplicatie in kaart en stel matching in
Draai een eerste scan over je catalogus om de omvang van de duplicatie te bepalen. Begin met exacte matches op identifiers (EAN, fabrikantartikelnummer) om definitieve duplicaten te vinden en breid daarna uit naar fuzzy matching op namen binnen groepen van merk en categorie. Analyseer de resultaten om de patronen te begrijpen: welke categorieën het hardst geraakt worden, welke leveranciers de meeste duplicaten aanleveren en welke invoerprocessen de meeste overlap veroorzaken. Gebruik die inzichten om je matchingregels in te stellen met passende veldgewichten, gelijkenisalgoritmes en zekerheidsdrempels.
Los bestaande duplicaten op en richt samenvoegworkflows in
Verwerk gevonden duplicaten in lagen, op basis van zekerheid. Voeg matches met hoge zekerheid automatisch samen op basis van vaste regels voor canonieke selectie en veldkeuze. Stuur matches met gemiddelde zekerheid naar een beoordelingswachtrij, waar productspecialisten de vergelijking naast elkaar bekijken en kiezen tussen samenvoegen, koppelen of afwijzen. Zorg bij elke samenvoeging dat voorraadstanden worden geconsolideerd, bestelhistorie behouden blijft, URL's worden doorverwezen en de audittrail compleet is. Pak eerst de duplicaatclusters met de meeste impact aan: bestsellers, pagina's met veel verkeer of producten met voorraadverschillen.
Zet preventie en doorlopende monitoring op
Richt realtime duplicaatcontrole in op elk punt waar data binnenkomt: handmatig aangemaakte producten, CSV/Excel-imports, leveranciersfeeds en marketplace-synchronisatie. Kies per zekerheidsniveau de juiste reactie: definitieve duplicaten blokkeren, waarschuwen bij waarschijnlijke matches en mogelijke matches loggen voor latere beoordeling. Plan terugkerende catalogusscans om duplicaten te vangen die langs de preventie glippen. Volg je belangrijkste cijfers (duplicaatpercentage, detectienauwkeurigheid, preventiepercentage) en verfijn je matchingregels regelmatig op basis van valse en gemiste treffers en feedback uit het team.
Strategiegids productdeduplicatie
Download onze complete gids voor het opsporen, oplossen en voorkomen van dubbele producten in je e-commerce catalogus. Inclusief configuraties voor matchingalgoritmes, sjablonen voor samenvoegworkflows en checklists voor preventie.
- Configuratiesjablonen voor matching over meerdere velden, met aanbevolen veldgewichten en gelijkenisdrempels per veelvoorkomend producttype
- Beslisboom voor samenvoegen, waarmee teams bepalen of ze een duplicaatpaar samenvoegen, koppelen of afwijzen
- Preventiechecklist voor het onboarden van leveranciers, importprocessen en het handmatig aanmaken van producten
- ROI-calculator die de operationele kosten van duplicatie berekent op basis van je catalogusomvang en duplicaatpercentage
Veelgestelde vragen
Veelgestelde vragen over Productdeduplicatie
Meer datakwaliteitsonderwerpen
- Inventariseer je productbronnen
- Definieer je attribuutschema
- Normaliseer merknamen
- Voeg alt-text toe aan primaire beelden
De data-quality herstelchecklist
14 stappen die je écht verder brengen — van het vinden van de top 20% omzetproducten tot het opzetten van maandelijkse regressiechecks. Werk hem af, en je weet dat je geen stille drift meer hebt.
- Eerst het Pareto-principe: fix de 20% die 80% omzet draait
- Concrete regels om vervuiling buiten de deur te houden
- Maandelijkse regressiecheck — zodat het niet terugglipt
Eén mail, geen spam. Printen en aan de slag.
Voorbeeld — je krijgt alleen echte updates.
Laat het me weten wanneer deze gids bijgewerkt wordt
Data-kwaliteit is een bewegend doel — nieuwe validatiepatronen, nieuwe benchmarks. Wij laten alleen weten wanneer er iets écht verandert in deze gids.
- Eén mail per echte revisie
- Geen wekelijkse nieuwsbrief
- Afmelden met één reply
Alleen echte revisies. Geen wekelijkse nieuwsbrief.
Verder ontdekken
Zorgvuldig gekozen vervolgstappen om dieper te gaan.
Klaar om je productdatakwaliteit te verbeteren?
WISEPIM helpt je productdatakwaliteit te meten, valideren en verbeteren in je hele catalogus met AI-tools.