Start gratis proefperiode

Hoe je dubbele bestanden vindt in cloud & on-prem

Dubbele bestanden zijn de makkelijkste opslagverspilling om te verwijderen en de moeilijkste om te zien. Deze gids legt uit waarom ze zich vermenigvuldigen, waarom handmatige methodes tekortschieten, en hoe één scan over systemen heen elke kopie in SharePoint, OneDrive, NAS en lokale schijven tegelijk vindt.

Waarom dubbele bestanden zich vermenigvuldigen

Niemand slaat bewust hetzelfde bestand tien keer op. Het gebeurt gewoon. Een rapport gaat rond per mail en iedereen bewaart de bijlage in zijn eigen OneDrive. Een gedeelde pdf wordt geüpload naar drie verschillende teamsites. Iemand kopieert "voor de zekerheid" een map voordat hij gaat bewerken, en die kopie wordt nooit verwijderd. Synchronisatieclients dupliceren bestanden bij conflicten. Migraties kopiëren hele bomen naar een nieuw systeem zonder het oude uit te faseren.

Het resultaat is voorspelbaar: identieke bytes verspreid over repositories, plus een lange staart aan bijna-duplicaten: hetzelfde document opgeslagen als v1, v2 en v2-definitief, of dezelfde afbeelding geëxporteerd in drie formaten. Elke kopie neemt opslag in beslag, wordt meegenomen in back-ups en vertroebelt zoekresultaten. Duplicaten zijn de "redundante" in ROT-data, en meestal de snelste verspilling om terug te winnen.

Ze brengen ook verborgen kosten met zich mee die verder gaan dan opslag. Als hetzelfde document op vijf plekken staat, weet niemand welke kopie leidend is, worden wijzigingen in de verkeerde versie gemaakt, en levert zoeken een muur van bijna identieke treffers op. Duplicaten verwijderen gaat niet alleen over ruimte terugwinnen, maar over het herstellen van één bron van waarheid, zodat mensen kunnen vertrouwen op wat ze vinden.

Handmatige aanpakken en waar ze stukgaan

De reflex is om handmatig op te ruimen, en voor één map kan dat werken. Sorteer een map op naam om "Budget (kopie).xlsx" naast "Budget.xlsx" te vinden; sorteer op grootte om verdacht identieke bestanden te zien; loop een documentbibliotheek visueel na. Ingebouwde tools helpen een beetje: verkenners, PowerShell-scripts en de zoekfunctie van je besturingssysteem kunnen grote bestanden opsommen of namen matchen.

Maar handmatige methodes lopen snel vast:

  • Ze leunen op namen. Twee identieke bestanden met de namen "rapport.pdf" en "definitief.pdf" lijken op naam niets met elkaar te maken te hebben, dus sorteren op naam mist ze volledig.
  • Ze leveren snel valse treffers op. Dezelfde naam en grootte betekent nog niet dat twee bestanden echt hetzelfde zijn. Je loopt het risico de verkeerde kopie te verwijderen.
  • Ze kijken niet over silo's heen. Een bestand dat zowel in SharePoint als op een NAS staat, zie je nooit in één mapweergave. Je zou elk systeem apart moeten nalopen en handmatig moeten vergelijken.
  • Ze schalen niet. Met het oog beoordelen werkt bij honderden bestanden, niet bij de miljoenen in een echte organisatie.

Wat duplicaten betrouwbaar vangt

De betrouwbare manier om echte duplicaten te vangen is een tool die hetzelfde bestand herkent waar het ook staat, ongeacht naam, map, systeem of tijdstempel. Twee bestanden kunnen dezelfde naam hebben en volstrekt verschillend zijn; twee bestanden met verschillende namen, in verschillende mappen of zelfs verschillende systemen, kunnen één en hetzelfde zijn. Je wilt een aanpak die die echte duplicaten samenbrengt en nooit twee werkelijk verschillende bestanden voor één aanziet.

Als je het goed doet, komt elke kopie van een bestand in dezelfde groep terecht, ongeacht waar het staat of hoe het heet. Zo kun je elke groep veilig terugbrengen tot één gezaghebbende kopie en de ruimte terugwinnen die de rest verspilde.

Verder dan exacte kopieën: bijna-duplicaten

Exacte kopieën zijn maar de helft van het probleem. Een document waarin één regel is gewijzigd, of een foto die opnieuw is opgeslagen in een andere kwaliteit, is niet identiek maar verspilt nog steeds ruimte en vertroebelt je bron van waarheid. De kopieën die het waard zijn om te tonen omvatten daarom ook bijna-duplicaten (hernoemde, licht bewerkte of herhaaldelijk opnieuw opgeslagen versies van hetzelfde bestand), zodat jij kunt bepalen welke ene versie je bewaart.

Het in alle systemen tegelijk doen

De echte waarde zit in het controleren van je hele omgeving in één doorloop, niet silo voor silo. Duplicaten verstoppen zich het vaakst tussen systemen: de presentatie die in SharePoint staat, op een gedeelde NAS én in de OneDrive-mappen van drie mensen. Alleen een scan die SharePoint, OneDrive, NetApp, NAS en lokale schijven samen bekijkt, kan zien dat één logisch bestand op vijf plekken bestaat en je vertellen hoeveel ruimte samenvoegen oplevert.

Zodra duplicaten zijn gegroepeerd, moet het opruimen weloverwogen blijven: bewaar één gezaghebbende kopie, vervang de rest waar nuttig door links, en archiveer of verwijder de overige onder regels die jij bepaalt. Het doel is één bron van waarheid, niet blind verwijderen. Let ook op waar de bewaarde kopie terechtkomt. Alles samenbrengen in één beheerde bibliotheek is meestal beter dan de overlever op een onbeheerde persoonlijke schijf laten staan.

Behandel ontdubbelen tot slot als een doorlopend proces, niet als een eenmalige actie. Elke dag ontstaan er nieuwe duplicaten door dezelfde routinehandelingen die de oude veroorzaakten, dus een scan die je één keer draait en daarna vergeet, is binnen enkele maanden weer terug bij af. Hem periodiek herhalen houdt de winst vast en maakt van duplicaatbeheer een achtergrondgewoonte in plaats van een terugkerende brandoefening.

Vind elk duplicaat met TerraBytes

TerraBytes doet precies dit. Eén serverless scan omvat SharePoint, OneDrive, NetApp, NAS en lokale schijven (je data verlaat je omgeving nooit en blijft versleuteld), groepeert vervolgens exacte en bijna-duplicaten en laat zien hoeveel opslag, euro's en CO2 je terugwint door elke set samen te voegen. Er wordt niets automatisch verwijderd: jij bepaalt de regels voor bewaren, archiveren en verwijderen en houdt de regie. Wil je duplicaten aanpakken naast verouderde, te grote en risicovolle bestanden in je hele omgeving, begin dan bij de storage cleaner en optimizer.

Verder lezen

Vind elk dubbel bestand,
in één scan