Datakwaliteit gids

Datakwaliteit gids: Productdeduplicatie

Ontdek praktische strategieën, concrete stappen en best practices voor Productdeduplicatie in e-commerce.

Diego Nijboer — WISEPIM··Bijgewerkt
7/10
Impact score
3-6 weken
Tijd om te starten
Alle
Relevante sectoren

Productdeduplicatie is het proces van het opsporen, samenvoegen en voorkomen van dubbele productrecords in je catalogus. Duplicaten ontstaan op allerlei manieren: meerdere leveranciers die hetzelfde product onder een andere naam aanleveren, handmatige invoer die net iets afwijkende versies van hetzelfde artikel oplevert, systeemmigraties die overlappende records introduceren, of marketplace-imports die producten toevoegen die al in je catalogus staan. Als je er niets aan doet, versnipperen dubbele producten je voorraaddata, verwarren ze klanten met inconsistente listings, verwateren ze je SEO-autoriteit over meerdere pagina's voor hetzelfde product en zorgen ze voor operationele chaos in fulfilment en rapportage.

Effectieve deduplicatie gaat veel verder dan zoeken op exacte overeenkomsten. Duplicaten in de praktijk zijn zelden identiek. Meestal hebben ze net iets andere titels, afwijkende attribuutopmaak, andere afbeeldingen en inconsistente identifiers. Robuuste deduplicatie vraagt om fuzzy matching-algoritmes die waarschijnlijke duplicaten herkennen op basis van een gewogen gelijkenis over meerdere velden, zoals productnaam, merk, EAN/GTIN, modelnummer, belangrijke specificaties en zelfs beeldgelijkenis. De uitdaging zit in de balans tussen gevoeligheid (zo veel mogelijk echte duplicaten vinden) en precisie (voorkomen dat je verschillende producten per ongeluk samenvoegt).

Een complete deduplicatiestrategie bestaat uit drie fases: detectie (bestaande duplicaten vinden), oplossing (dubbele records samenvoegen of koppelen) en preventie (voorkomen dat er nieuwe duplicaten ontstaan). Moderne PIM-systemen zoals WISEPIM ondersteunen alle drie de fases, met detectietools die je catalogus op aanvraag of doorlopend scannen, samenvoegworkflows waarin je per dubbel record kiest welke data je behoudt, en importvalidatie die mogelijke duplicaten signaleert vóórdat er nieuwe records worden aangemaakt. Door duplicatie systematisch aan te pakken houd je een schone, betrouwbare productcatalogus die zorgt voor een kloppende voorraad, een consistente klantervaring en betrouwbare analytics.

In één oogopslag

Moeilijkheid
Gevorderd
Tijd om te starten
3-6 weken
Relevante sectoren
Alle
Impact score
7/10
Kernprincipes

Kernprincipes van Productdeduplicatie

De belangrijkste concepten en regels voor een effectief resultaat

  1. 1

    Detecteer op meerdere velden tegelijk

    Vertrouwen op één identifier is onvoldoende, want hetzelfde product heeft vaak per bron een andere identifier. Combineer velden zoals productnaam, merk, EAN/GTIN, modelnummer, belangrijke specificaties en zelfs image hashes om een gelijkenisscore te berekenen tussen mogelijke duplicaatparen. Weeg elk veld op basis van hoe betrouwbaar het is als unieke identifier.

    Match op EAN met 95% zekerheid, maar controleer voor producten zonder EAN ook naam + merk + categorie
    Gebruik perceptual hashing van afbeeldingen om visueel identieke producten te herkennen, zelfs bij afwijkende tekstmetadata
    Bereken samengestelde gelijkenisscores: EAN-match (40%) + naamgelijkenis (25%) + merkmatch (20%) + overlap in specificaties (15%)
  2. 2

    Zet fuzzy matching-algoritmes in

    Exact matchen op tekst mist het overgrote deel van de duplicaten die je in de praktijk tegenkomt. Zet fuzzy matching-algoritmes in zoals Levenshtein-afstand, Jaro-Winkler-gelijkenis, n-gramvergelijking en TF-IDF-cosinusgelijkenis om duplicaten te vinden met net iets andere naamgeving, afkortingen of opmaak. Stel de drempelwaarden zorgvuldig in, zodat gevoeligheid en het aantal valse treffers met elkaar in balans blijven.

    Levenshtein-afstand herkent 'Samsung Galaxy S24 Ultra' en 'Samsung Galaxy S24Ultra' als waarschijnlijke duplicaten
    N-gramvergelijking ziet 'Mens Running Shoes Nike Air Max' en 'Nike Air Max Running Shoes for Men' als vergelijkbaar
    TF-IDF-cosinusgelijkenis vindt producten met herschikte maar inhoudelijk identieke beschrijvingen
  3. 3

    Bepaal welk record leidend is

    Zodra je duplicaten vindt, heb je een duidelijke strategie nodig voor welk record het canonieke (primaire) record wordt en wat er met de data uit de secundaire records gebeurt. Leg regels vast voor het kiezen van het canonieke record op basis van datakwaliteit, volledigheidsscore, betrouwbaarheid van de bron of aanmaakdatum. Stel per veld samenvoegregels op die bepalen hoe je de beste data uit elk duplicaat combineert in het record dat overblijft.

    Kies het record met de hoogste volledigheidsscore als canoniek product
    Behoud per attribuut de waarde uit de meest gezaghebbende bron (bijvoorbeeld fabrikantdata boven leveranciersdata)
    Bewaar alle unieke afbeeldingen uit de dubbele records en voeg ze toe aan de galerij van het canonieke product
  4. 4

    Voorkom duplicaten bij de invoer

    De goedkoopste manier om duplicaten aan te pakken is voorkomen dat ze ontstaan. Bouw realtime duplicaatcontroles in bij het aanmaken van producten, bij imports en bij het inlezen van leveranciersdata. Zodra het systeem een mogelijk duplicaat ziet, waarschuw je de gebruiker en bied je aan om de nieuwe data aan het bestaande record te koppelen in plaats van een nieuw product aan te maken.

    Toon een waarschuwing 'mogelijk duplicaat gevonden' zodra iemand een product invoert met een bestaande EAN of een vergelijkbare titel
    Signaleer tijdens een CSV-import de regels die boven een instelbare gelijkenisdrempel overeenkomen met bestaande producten
    Vraag om een bevestiging voordat een nieuw product wordt aangemaakt terwijl het systeem vergelijkbare bestaande records ziet
  5. 5

    Houd een audittrail bij van elke samenvoeging

    Elke samenvoeging moet volledig te herleiden zijn. Leg vast welke producten zijn samengevoegd, welk record canoniek werd, welke veldwaarden je hebt behouden of verworpen, wie de samenvoeging heeft goedgekeurd en wanneer dat gebeurde. Die audittrail is onmisbaar voor troubleshooting, compliance en het terugdraaien van samenvoegingen als er toch iets misgaat.

    Log elke samenvoeging met een voor/na-momentopname van beide records en het resulterende product
    Registreer wie de samenvoeging goedkeurde en met welke zekerheidsscore de match is gevonden
    Bied een functie 'samenvoeging ongedaan maken' die de oorspronkelijke losse records uit de audittrail herstelt
Aan de slag

Hoe je Productdeduplicatie opzet

Stap voor stap uitleg om deze datakwaliteitspraktijk in je winkel te gebruiken

  1. 1

    Breng de omvang van de duplicatie in kaart

    Voordat je een deduplicatiestrategie inricht, wil je weten hoe groot het probleem is. Draai een eerste scan over je catalogus met exacte matches op EAN/GTIN-codes, gevolgd door fuzzy matching op productnamen binnen hetzelfde merk en dezelfde categorie. Deze nulmeting laat zien hoeveel duplicaten er zijn, welke categorieën het hardst geraakt worden en welke databronnen de grootste veroorzakers zijn.

    • Scan eerst op exacte EAN-duplicaten: dat zijn definitieve matches die je direct kunt oplossen
    • Draai fuzzy matching op namen binnen groepen van merk + categorie met een gelijkenisdrempel van 0,85
    • Analyseer de herkomst van dubbele records om structurele oorzaken te vinden (bepaalde leveranciers, importprocessen, enzovoort)
  2. 2

    Stel matchingregels en drempelwaarden in

    Leg vast op welke criteria je deduplicatiesysteem mogelijke duplicaten herkent. Bepaal veldgewichten, gelijkenisalgoritmes en zekerheidsdrempels per matchingstrategie. Maak aparte matchingprofielen voor verschillende scenario's: exacte matches op identifiers, fuzzy matches met hoge zekerheid, en kandidaten met lagere zekerheid die handmatige beoordeling vragen.

    • Exacte EAN-match: automatisch markeren als duplicaat met 99% zekerheid
    • Zelfde merk + categorie + naamgelijkenis > 0,90: markeren als waarschijnlijk duplicaat voor beoordeling
    • Zelfde categorie + naamgelijkenis > 0,80 + overlappende specificaties: markeren als mogelijk duplicaat voor nader onderzoek
  3. 3

    Bouw samenvoegworkflows

    Richt gestructureerde workflows in om gevonden duplicaten op te lossen. Ontwerp een samenvoeginterface die mogelijke duplicaatparen naast elkaar toont, verschillen uitlicht en gebruikers per veld de beste waarde laat kiezen. Voeg batchsamenvoeging toe voor matches met hoge zekerheid en beoordelingswachtrijen voor twijfelgevallen.

    • Een vergelijkingsweergave naast elkaar met alle velden van beide kandidaten en de verschillen gemarkeerd
    • Duplicaten met hoge zekerheid (99%+ match op EAN) automatisch samenvoegen op basis van vaste veldregels
    • Matches met gemiddelde zekerheid (85-99%) in een wachtrij zetten voor beoordeling, inclusief een voorgestelde samenvoegactie
  4. 4

    Zet preventie aan de voorkant in

    Richt realtime duplicaatdetectie in die draait zodra er nieuwe producten worden aangemaakt of geïmporteerd. Laat het systeem binnenkomende records controleren tegen bestaande producten op basis van je matchingcriteria. Kies per zekerheidsniveau de passende reactie: blokkeren, waarschuwen of een koppeling voorstellen.

    • Blokkeer het aanmaken van een product met een EAN die exact overeenkomt met een bestaand actief product
    • Toon een waarschuwingsvenster met vergelijkbare bestaande producten bij een nieuw product met hetzelfde merk + naampatroon
    • Zet mogelijke duplicaten uit een leveranciersfeed in quarantaine voor beoordeling, voordat ze in de catalogus belanden
  5. 5

    Scan periodiek op duplicaten

    Plan terugkerende deduplicatiescans om duplicaten te vinden die langs je preventiecontroles glippen of die ontstaan doordat data in de loop van de tijd verandert. Draai maandelijks een volledige scan en wekelijks gerichte scans (bijvoorbeeld binnen specifieke categorieën of over recente imports). Volg hoeveel nieuwe duplicaten je door de tijd heen vindt om te meten hoe goed je preventie werkt.

    • Wekelijkse scan van producten die de afgelopen 7 dagen zijn geïmporteerd tegen de volledige catalogus
    • Maandelijkse scan over de hele catalogus met steeds verder verfijnde matchingregels
    • Een scan die automatisch start zodra een leveranciersfeed is verwerkt
  6. 6

    Monitor en stuur bij

    Houd doorlopend bij hoe effectief je deduplicatie is met cijfers als detectiepercentage, percentage valse treffers, slagingspercentage van samenvoegingen en het aantal nieuwe duplicaten dat erbij komt. Gebruik die inzichten om matchingalgoritmes te verfijnen, drempels bij te stellen en preventie te verbeteren. Deel deduplicatierapporten met leveranciers om de oorzaak van binnenkomende dubbele data bij de bron aan te pakken.

    • Een dashboard met trends in gevonden duplicaten, oplospercentages en de grootste bronnen van duplicatie
    • Elk kwartaal de drempelwaarden herzien op basis van een analyse van valse treffers en gemiste duplicaten
    • Leveranciersscorecards die laten zien welke partijen de meeste dubbele productdata aanleveren
Best practices

Productdeduplicatie best practices

Bewezen do's en don'ts om het meeste uit je datakwaliteitsinspanningen te halen

  • Wel doen

    Gebruik gewogen matching over meerdere velden: identifiers, productnamen, merk, categorie en specificaties samen leveren de betrouwbaarste detectie.

    Niet doen

    Alleen vertrouwen op een exacte EAN/GTIN-match, waardoor je duplicaten mist met een afwijkende of ontbrekende identifier.

  • Wel doen

    Werk met zekerheidsniveaus: los definitieve matches automatisch op en laat twijfelgevallen door een mens beoordelen.

    Niet doen

    Alle gevonden duplicaten automatisch samenvoegen zonder zekerheidsscore, met het risico dat je verschillende producten op één hoop gooit.

  • Wel doen

    Houd een volledige audittrail bij van elke samenvoeging, met voor/na-momentopnamen en de mogelijkheid om terug te draaien.

    Niet doen

    Secundaire records definitief verwijderen bij een samenvoeging, zonder de oorspronkelijke data of de samenvoeghistorie te bewaren.

  • Wel doen

    Voorkom duplicaten bij de invoer door binnenkomende data te controleren tegen bestaande producten voordat er records worden aangemaakt.

    Niet doen

    Producten onbeperkt laten aanmaken en volledig leunen op periodieke opschoonscans om duplicaten achteraf op te ruimen.

  • Wel doen

    Leg duidelijke regels vast voor het kiezen van het canonieke record, op basis van datakwaliteit, volledigheid en gezag van de bron.

    Niet doen

    Per geval ad hoc beslissen bij het samenvoegen, waardoor de datakwaliteit van de overblijvende records alle kanten op gaat.

  • Wel doen

    Onderzoek de oorzaken van duplicatie (bepaalde leveranciers, importprocessen, invoergewoontes) en pak ze structureel aan.

    Niet doen

    Deduplicatie als puur opruimwerk behandelen, zonder de processen te repareren die de duplicaten überhaupt veroorzaken.

Tools & functies

Tools voor Productdeduplicatie

Handige tools en WISEPIM-functies om dit in de praktijk te brengen

WISEPIM duplicaatdetectie-engine

Scan je volledige productcatalogus op mogelijke duplicaten met instelbare matching over meerdere velden en fuzzy algoritmes. Beoordeel de resultaten in een speciaal daarvoor gebouwde interface met vergelijking naast elkaar, zekerheidsscores en batchgewijs oplossen.

Meer info

Beheer van samenvoegworkflows

Los gevonden duplicaten op via een gestructureerde samenvoegworkflow die gebruikers veld voor veld door de keuzes leidt. Selecteer automatisch de beste waarden op basis van instelbare regels, bewaar alle unieke data en leg van elke samenvoeging een volledige audittrail vast.

Duplicaatcontrole bij import

Controleer binnenkomende productdata uit leveranciersfeeds, CSV-imports en API-koppelingen automatisch tegen je bestaande catalogus voordat er records worden aangemaakt. Zet mogelijke duplicaten in quarantaine voor beoordeling en koppel ze met één klik aan een bestaand product.

Detectie van beeldgelijkenis

Gebruik perceptual hashing en beeldvergelijkingsalgoritmes om producten te vinden met visueel identieke of vrijwel identieke productfotografie. Zo vang je duplicaten op die matching op tekst zou missen.

Succes meten

Hoe je Productdeduplicatie succes meet

De belangrijkste metrics en doelen om je voortgang bij te houden

Duplicaatpercentage

Het percentage producten in je catalogus met één of meer dubbele records. Dit is je belangrijkste graadmeter voor de netheid van je catalogus; volg het door de tijd heen om te meten hoe goed zowel je detectie als je preventie werkt.

Doel: < 1%

Detectienauwkeurigheid (precisie)

Het percentage gemarkeerde duplicaatparen dat bij beoordeling ook echt een duplicaat blijkt. Een hoge precisie betekent dat je matchingregels goed zijn afgesteld en dat je team geen tijd verliest aan valse treffers.

Doel: > 95%

Detectiedekking (recall)

Het percentage werkelijke duplicaten in je catalogus dat je matchingalgoritmes ook daadwerkelijk vinden. Een hoge recall betekent dat er nauwelijks duplicaten door de mazen glippen.

Doel: > 90%

Preventiepercentage

Het percentage mogelijke nieuwe duplicaten dat al bij de invoer wordt onderschept (tijdens het aanmaken of importeren), voordat ze onderdeel worden van de actieve catalogus. Een hoog preventiepercentage laat zien dat je controles aan de voorkant werken.

Doel: > 85%

Doorlooptijd van samenvoegen

De gemiddelde tijd tussen het moment waarop een duplicaatpaar wordt gemarkeerd en het moment waarop het is opgelost (samengevoegd, gekoppeld of afgewezen). Kortere doorlooptijden wijzen op efficiënte workflows en duidelijke samenvoegregels.

Doel: < 48 uur

Praktijkvoorbeeld

Hoe een B2B-distributeur van industriële onderdelen 4.200 dubbele producten opruimde en de voorraadnauwkeurigheid met 28% verbeterde

Vóór

De distributeur beheerde een catalogus van 85.000 industriële onderdelen van ruim 200 leveranciers. Door meerdere leverancierscatalogi, migraties uit oude systemen en inconsistente naamgeving lag het duplicaatpercentage naar schatting op 5 à 7%. Duizenden producten hadden dus meerdere records, wat leidde tot versnipperde voorraadstanden, verwarrende zoekresultaten voor B2B-klanten, hogere kosten voor catalogusbeheer en onbetrouwbare inkoopprognoses. Klanten meldden gemiddeld 15 keer per week dat ze de verkeerde variant van een product hadden besteld.

Na

Het team ging matchen op meerdere velden tegelijk: fabrikantartikelnummers, productnamen met fuzzy matching, merkherkenning en vergelijking van specificaties. Een eerste scan over de hele catalogus leverde 4.200 bevestigde duplicaatclusters op. Matches met hoge zekerheid (2.800 producten) werden automatisch samengevoegd op basis van vaste regels; matches met gemiddelde zekerheid (1.400 producten) gingen door een handmatige beoordeling van twee weken. In de importpijplijn voor leveranciersdata kwamen preventiecontroles, die per maandelijkse importronde gemiddeld 45 mogelijke duplicaten onderschepten.

Verbetering:De catalogus werd 4,9% kleiner terwijl het volledige productaanbod intact bleef. De voorraadnauwkeurigheid verbeterde met 28% doordat eerder versnipperde voorraadstanden werden samengevoegd. Het aantal klachten over verkeerd bestelde varianten daalde van 15 naar 3 per week, een afname van 80%. De kwaliteit van de zoekresultaten ging merkbaar omhoog, wat zorgde voor 12% meer conversie van zoekopdracht naar bestelling. De preventiecontroles verminderden het ontstaan van nieuwe duplicaten met 92%, waardoor deduplicatie veranderde van een terugkerend opruimproject in behapbaar onderhoud.

Aan de slag met Productdeduplicatie

Drie stappen om vandaag nog je productdatakwaliteit te verbeteren

1

Breng duplicatie in kaart en stel matching in

Draai een eerste scan over je catalogus om de omvang van de duplicatie te bepalen. Begin met exacte matches op identifiers (EAN, fabrikantartikelnummer) om definitieve duplicaten te vinden en breid daarna uit naar fuzzy matching op namen binnen groepen van merk en categorie. Analyseer de resultaten om de patronen te begrijpen: welke categorieën het hardst geraakt worden, welke leveranciers de meeste duplicaten aanleveren en welke invoerprocessen de meeste overlap veroorzaken. Gebruik die inzichten om je matchingregels in te stellen met passende veldgewichten, gelijkenisalgoritmes en zekerheidsdrempels.

2

Los bestaande duplicaten op en richt samenvoegworkflows in

Verwerk gevonden duplicaten in lagen, op basis van zekerheid. Voeg matches met hoge zekerheid automatisch samen op basis van vaste regels voor canonieke selectie en veldkeuze. Stuur matches met gemiddelde zekerheid naar een beoordelingswachtrij, waar productspecialisten de vergelijking naast elkaar bekijken en kiezen tussen samenvoegen, koppelen of afwijzen. Zorg bij elke samenvoeging dat voorraadstanden worden geconsolideerd, bestelhistorie behouden blijft, URL's worden doorverwezen en de audittrail compleet is. Pak eerst de duplicaatclusters met de meeste impact aan: bestsellers, pagina's met veel verkeer of producten met voorraadverschillen.

3

Zet preventie en doorlopende monitoring op

Richt realtime duplicaatcontrole in op elk punt waar data binnenkomt: handmatig aangemaakte producten, CSV/Excel-imports, leveranciersfeeds en marketplace-synchronisatie. Kies per zekerheidsniveau de juiste reactie: definitieve duplicaten blokkeren, waarschuwen bij waarschijnlijke matches en mogelijke matches loggen voor latere beoordeling. Plan terugkerende catalogusscans om duplicaten te vangen die langs de preventie glippen. Volg je belangrijkste cijfers (duplicaatpercentage, detectienauwkeurigheid, preventiepercentage) en verfijn je matchingregels regelmatig op basis van valse en gemiste treffers en feedback uit het team.

Gratis download

Strategiegids productdeduplicatie

Download onze complete gids voor het opsporen, oplossen en voorkomen van dubbele producten in je e-commerce catalogus. Inclusief configuraties voor matchingalgoritmes, sjablonen voor samenvoegworkflows en checklists voor preventie.

  • Configuratiesjablonen voor matching over meerdere velden, met aanbevolen veldgewichten en gelijkenisdrempels per veelvoorkomend producttype
  • Beslisboom voor samenvoegen, waarmee teams bepalen of ze een duplicaatpaar samenvoegen, koppelen of afwijzen
  • Preventiechecklist voor het onboarden van leveranciers, importprocessen en het handmatig aanmaken van producten
  • ROI-calculator die de operationele kosten van duplicatie berekent op basis van je catalogusomvang en duplicaatpercentage
Download gratis template

Veelgestelde vragen

Veelgestelde vragen over Productdeduplicatie

Meer datakwaliteitsonderwerpen

checklist.html
  • Inventariseer je productbronnen
  • Definieer je attribuutschema
  • Normaliseer merknamen
  • Voeg alt-text toe aan primaire beelden
+ meer stappen in de bijlage
Afvinkbare lijstHTML · 14 stappen

De data-quality herstelchecklist

Acties:14Fases:4Format:HTML · print → PDFMet eigenaren:Ja

14 stappen die je écht verder brengen — van het vinden van de top 20% omzetproducten tot het opzetten van maandelijkse regressiechecks. Werk hem af, en je weet dat je geen stille drift meer hebt.

  • Eerst het Pareto-principe: fix de 20% die 80% omzet draait
  • Concrete regels om vervuiling buiten de deur te houden
  • Maandelijkse regressiecheck — zodat het niet terugglipt

Eén mail, geen spam. Printen en aan de slag.

We updaten de benchmark...2d
Nieuwe sectie toegevoegd...1w

Voorbeeld — je krijgt alleen echte updates.

Update-alerts

Laat het me weten wanneer deze gids bijgewerkt wordt

Frequentie:Alleen echte revisiesGeen nieuwsbrief:BelofteAfmelden:Eén reply

Data-kwaliteit is een bewegend doel — nieuwe validatiepatronen, nieuwe benchmarks. Wij laten alleen weten wanneer er iets écht verandert in deze gids.

  • Eén mail per echte revisie
  • Geen wekelijkse nieuwsbrief
  • Afmelden met één reply

Alleen echte revisies. Geen wekelijkse nieuwsbrief.

Verder ontdekken

Zorgvuldig gekozen vervolgstappen om dieper te gaan.

Klaar om je productdatakwaliteit te verbeteren?

WISEPIM helpt je productdatakwaliteit te meten, valideren en verbeteren in je hele catalogus met AI-tools.