Naar hoofdinhoud
Terug naar E-commerce Woordenboek

Data Deduplication

DatabeheerIntermediate niveau

Data-ontdubbeling is het proces van het identificeren en verwijderen van dubbele productinformatie om de integriteit van gegevens en één 'single source of truth' te waarborgen.

Image by · CC BY 4.0

Wat is Data Deduplication?

Data deduplication is een proces waarbij u dubbele gegevens uit uw database verwijdert. Het zorgt ervoor dat elk stukje informatie maar één keer voorkomt. In een PIM-systeem zoekt de software naar producten die hetzelfde zijn. Deze dubbele regels worden samengevoegd tot één juiste versie. De software vergelijkt hiervoor kenmerken zoals EAN-codes of artikelnummers van de fabrikant. Door deze extra kopieën te verwijderen, blijft uw database overzichtelijk en nauwkeurig. U kunt kiezen voor exact matching of fuzzy matching. Bij exact matching moeten de gegevens precies hetzelfde zijn. Fuzzy matching herkent producten ook als er kleine verschillen zijn in spelling of tekst. Goede ontdubbeling voorkomt vervuilde data. Dit is vooral belangrijk als u informatie van verschillende leveranciers combineert. Met een systeem zoals WISEPIM zorgt u dat elke SKU maar één keer in uw systeem staat. Dit maakt uw productinformatie betrouwbaar voor uw klanten.

Waarom Data Deduplication belangrijk is voor e-commerce

Data-ontdubbeling is het proces waarbij u dubbele gegevens uit uw systeem verwijdert. Het zorgt ervoor dat elk product slechts één keer in uw database voorkomt. Dit is belangrijk voor een professionele uitstraling van uw webshop. Dubbele producten verwarren uw klanten en zijn slecht voor uw SEO. Stel dat een artikel drie keer in uw shop staat. Een klant ziet op de ene pagina "niet op voorraad", terwijl het product elders wel beschikbaar is. Hierdoor loopt u direct verkopen mis. Daarnaast werkt uw team efficiënter door ontdubbeling. Marketingmedewerkers hoeven informatie niet voor hetzelfde product in verschillende systemen aan te passen. Uw klantenservice geeft ook betere antwoorden omdat zij één betrouwbare bron gebruiken. Dit noemen we ook wel een "golden record". Goede datahygiëne helpt u om te groeien naar meer verkoopkanalen zonder extra administratief werk. Met WISEPIM beheert u al deze productgegevens eenvoudig op één centrale plek.

Voorbeelden van Data Deduplication

  • 1U voegt productgegevens van een 'Samsung 65-inch QLED TV' samen. Deze informatie komt uit een ERP-systeem en een Excel-bestand.
  • 2U koppelt verschillende productnamen aan één SKU. U gebruikt de EAN-code om te zien dat het om hetzelfde toestel gaat.
  • 3U verwijdert dubbele foto's uit de mediagalerij. Dit is nodig als dezelfde afbeelding meerdere keren is geüpload met een andere naam.
  • 4U voegt klantprofielen in een CRM samen. Dit doet u wanneer een klant hetzelfde e-mailadres gebruikt, maar de naam anders schrijft.

Hoe WISEPIM helpt

  • WISEPIM herkent dubbele producten automatisch. Het systeem gebruikt regels voor GTIN of SKU om kopieën direct te vinden.
  • U maakt één 'golden record' per product. Dit is de enige juiste versie van uw data. WISEPIM voegt informatie uit verschillende bronnen samen tot één foutloos profiel.
  • Klanten vinden producten sneller in uw webshop. Schone data zorgt dat zoekopdrachten en filters direct de juiste resultaten tonen.
  • Uw team bespaart veel tijd. Medewerkers hoeven niet meer zelf in spreadsheets naar dubbele regels te zoeken. Zij kunnen zich nu richten op het verbeteren van productinformatie.

Veelgemaakte fouten met Data Deduplication

  • U kijkt alleen naar exact dezelfde tekst. Hierdoor mist u dubbele items met kleine typefouten of een andere schrijfwijze.
  • U maakt geen back-up voordat u data in bulk samenvoegt. Als er iets misgaat, bent u uw gegevens voor altijd kwijt.
  • U voegt producten samen die eigenlijk verschillende varianten zijn. Dit gebeurt vaak bij producten met dezelfde parent SKU, zoals verschillende maten.
  • U negeert de source of truth, de bron met de meest betrouwbare informatie. Hierdoor vervangt u goede data per ongeluk door minder goede data van leveranciers.

Tips voor Data Deduplication

  • Maak dataformaten zoals hoofdletters en maateenheden gelijk voordat u begint met ontdubbelen. Zo herkent het systeem dubbele gegevens sneller.
  • Gebruik unieke codes zoals GTIN of EAN om producten te vergelijken. Deze nummers zijn de meest betrouwbare manier om dubbele items te vinden.
  • Voeg een handmatige controle toe voor twijfelachtige resultaten. Dit voorkomt dat u per ongeluk verschillende producten samenvoegt in uw systeem.
  • Controleer uw regels voor ontdubbelen regelmatig. Doe dit zeker wanneer u nieuwe leveranciers of databronnen aan uw PIM toevoegt.

Trends rondom Data Deduplication

  • AI en Machine Learning: Inzet van neurale netwerken voor geavanceerde fuzzy matching die context begrijpt.
  • Real-time ontdubbeling: Systemen die de aanmaak van een duplicaat voorkomen op het moment van invoer of API-import.
  • Cross-Channel Identity Resolution: Het koppelen van productdata over verschillende marktplaatsen om consistentie te waarborgen.

Tools voor Data Deduplication

  • WISEPIM voor geautomatiseerde productdata-ontdubbeling en golden record beheer.
  • Akeneo of Salsify voor productinformatiebeheer op enterprise-niveau.
  • OpenRefine voor open-source data-opschoning en transformatie.
  • SQL-scripts voor aangepaste ontdubbeling op databaseniveau.

Gerelateerde termen

Ook bekend als

Data-ontdubbelingDuplicaatdetectieData opschonen

Veelgestelde vragen

Exact matching vereist dat elk teken in een veld, zoals een SKU of EAN, identiek is om een duplicaatmelding te activeren. Fuzzy matching gebruikt algoritmen om records te identificeren die waarschijnlijk hetzelfde zijn maar kleine verschillen vertonen, zoals 'iPhone 14' versus 'iPhone-14'. Fuzzy matching is effectiever voor het opsporen van menselijke fouten.

Dubbele producten veroorzaken keyword cannibalization, waarbij meerdere pagina's op uw site strijden om dezelfde zoektermen. Dit verwart zoekengines zoals Google, wat uw ranking kan schaden. Bovendien wordt de autoriteit van backlinks verspreid over meerdere URL's in plaats van gebundeld op één sterke pagina.

Je automatiseert dit door regelgebaseerde workflows in te stellen die geactiveerd worden zodra er nieuwe data wordt geïmporteerd of gewijzigd. Deze workflows gebruiken unieke identifiers zoals SKU of GTIN om dubbele records te signaleren en te blokkeren voordat ze je webshop of marktplaatsen bereiken.

Het voorkomt versnipperde voorraad waarbij hetzelfde fysieke product onder verschillende records wordt bijgehouden, wat leidt tot oververkoop of foutieve voorraadstanden. Door deze records samen te voegen, zorg je ervoor dat elke verkoop wordt afgeschreven van één centrale voorraadtelling.

Het is ideaal om deduplicatie uit te voeren in de staging fase, direct na de data-ingestie maar voordat de informatie in de live catalogus wordt gepubliceerd. Dit voorkomt dat kwalitatief slechte of overbodige data je Golden Record vervuilt en de klantervaring negatief beïnvloedt.

Ja, deduplicatie is het belangrijkste hulpmiddel om meerdere leveranciersfeeds te consolideren tot één enkel productrecord. Door verschillende artikelnummers van leveranciers te koppelen aan een gemeenschappelijke EAN of UPC, creëer je een uniform productoverzicht met de beste kenmerken uit elke bron.

Een veelgemaakte fout is het blindelings vertrouwen op automatische scripts zonder handmatige controle van de resultaten. Hierdoor kunnen unieke producten die veel op elkaar lijken, zoals verschillende maten of kleuren van hetzelfde kledingstuk, per ongeluk worden samengevoegd. Ook het negeren van kleine verschillen in artikelnummers door typefouten kan leiden tot het wissen van waardevolle informatie. Het is daarom cruciaal om eerst een testrun te doen op een subset van de data voordat u de volledige database definitief opschoont.

Gebruik een stapsgewijze aanpak waarbij u begint met exact matching op unieke identifiers zoals EAN- of SKU-codes. Pas daarna fuzzy matching toe voor subtielere verschillen. Stel altijd een master record in; dit is de bron die als leidend wordt beschouwd bij conflicterende informatie. Door een back-up te maken en een logboek bij te houden van alle samengevoegde records, kunt u eventuele fouten altijd herstellen en blijft de integriteit van uw productcatalogus gewaarborgd zonder dat er per ongeluk unieke details verdwijnen.

U kunt het succes meten aan de hand van de deduplicatieratio, wat het percentage verwijderde duplicaten ten opzichte van de totale dataset is. Een andere belangrijke KPI is de foutmarge: hoe vaak zijn unieke items onterecht als duplicaat gemarkeerd? Daarnaast wijzen een snellere zoekfunctie in de webshop en minder klantvragen over inconsistente productinformatie op een geslaagd proces. Uiteindelijk leidt een schone database tot een hogere conversie en lagere operationele kosten voor het beheer van uw productinformatie.

Meestal ligt de verantwoordelijkheid bij de Data Steward of de PIM-beheerder. De Data Steward bewaakt de algemene datakwaliteit en stelt de regels op voor het identificeren van dubbele gegevens. De PIM-beheerder voert de technische acties uit binnen de software. Bij grotere organisaties zijn ook de Category Managers betrokken; zij kennen de producten het beste en kunnen bij twijfelgevallen beoordelen of twee records daadwerkelijk hetzelfde artikel betreffen of dat er sprake is van verschillende varianten die behouden moeten blijven.

Stel dat u schoenen verkoopt en informatie ontvangt van twee verschillende leveranciers. Leverancier A noemt een model 'Nike Air Max 90 - Zwart', terwijl Leverancier B hetzelfde model omschrijft als 'Air Max 90 Black'. Zonder ontdubbeling verschijnen er twee aparte producten op uw site. Het PIM-systeem herkent dat de EAN-code voor beide hetzelfde is en voegt de beschrijvingen, afbeeldingen en voorraadgegevens samen tot één compleet record. Hierdoor ziet de klant één duidelijke pagina in plaats van twee identieke opties.

Hoewel ontdubbeling in PIM vaak over producten gaat, is het ook relevant voor klantgegevens. Volgens de AVG moeten persoonsgegevens accuraat en up-to-date zijn. Door dubbele klantprofielen samen te voegen, voorkomt u dat u marketingmails stuurt naar iemand die zich al heeft uitgeschreven via een ander profiel. Dit verkleint het risico op privacy-inbreuken en boetes. Bovendien helpt een gecentraliseerd record bij het sneller voldoen aan wettelijke verzoeken, zoals het recht op inzage of het recht om vergeten te worden.

Nog vragen?

Kan je het antwoord niet vinden? Neem contact op met ons team.

Contact opnemen

Verder ontdekken

Zorgvuldig gekozen vervolgstappen om dieper te gaan.