Skanowanie dokumentów jest często traktowane jako proste zamienienie papieru w plik. Samo wykonanie skanów nie tworzy jednak użytecznego archiwum. Jeśli pliki mają przypadkowe nazwy, znajdują się w jednym katalogu i nie posiadają kopii bezpieczeństwa, odnalezienie właściwego dokumentu może trwać dłużej niż przeszukiwanie segregatorów. Dobra digitalizacja obejmuje skanowanie, kontrolę jakości, uporządkowanie oraz bezpieczne przechowywanie danych.
Najpierw trzeba określić cel digitalizacji
Inaczej skanuje się faktury potrzebne do codziennej pracy, inaczej stare projekty techniczne, a jeszcze inaczej fotografie lub materiały przeznaczone do wieloletniego przechowywania. Parametry skanu powinny wynikać z przyszłego zastosowania dokumentu. Nie zawsze potrzebna jest najwyższa możliwa rozdzielczość, ponieważ zwiększa ona rozmiar plików i wydłuża ich przesyłanie.
Przed rozpoczęciem warto ustalić, które materiały należy digitalizować, w jakiej kolejności oraz czy po zeskanowaniu nadal trzeba zachować papierowy oryginał. Skan nie powoduje automatycznie, że dokument źródłowy traci znaczenie prawne, historyczne lub dowodowe.
Format i rozdzielczość muszą pasować do materiału
PDF jest wygodny w przypadku wielostronicowych dokumentów przeznaczonych do czytania, udostępniania i wyszukiwania. TIFF może być wykorzystywany do przechowywania plików wzorcowych wymagających wysokiej jakości, natomiast JPG i PNG sprawdzają się w określonych zastosowaniach graficznych. Nie ma jednego najlepszego formatu dla każdego rodzaju dokumentu.
Rozdzielczość 300 dpi jest często wystarczająca dla czytelnych dokumentów kolorowych i w skali szarości. Drobny tekst, słabe oryginały albo materiały przeznaczone do dokładnego odwzorowania mogą wymagać wyższych parametrów. Skanowanie wielkoformatowe umożliwia digitalizowanie planów, map i dokumentacji, których nie da się poprawnie połączyć ze zdjęć wykonywanych telefonem.
OCR zmienia obraz dokumentu w użyteczny zasób
Zwykły skan jest obrazem strony. Można go otworzyć i przeczytać, ale nie zawsze da się wyszukać w nim nazwisko, numer faktury lub fragment zdania. Technologia OCR rozpoznaje znaki i dodaje warstwę tekstową. Dzięki OCR wielostronicowe archiwum może być przeszukiwane podobnie jak dokument utworzony w edytorze tekstu.
Rozpoznanie nie jest bezbłędne. Problemy pojawiają się przy niewyraźnym druku, odręcznych notatkach, przekrzywionych stronach i nietypowych czcionkach. Ważne dane należy więc zweryfikować, szczególnie jeśli mają być automatycznie przenoszone do innych systemów.
Nazwy plików i katalogi decydują o porządku
Nazwy takie jak „skan1”, „nowy dokument” albo „ostateczny2” szybko przestają cokolwiek wyjaśniać. Dobry schemat nazewnictwa powinien być konsekwentny, zrozumiały i możliwy do sortowania. Może zawierać datę w układzie rok–miesiąc–dzień, typ dokumentu, nazwę kontrahenta oraz numer sprawy.
Struktura katalogów powinna odpowiadać sposobowi korzystania z dokumentacji. Firma może dzielić materiały według lat, działów, klientów lub projektów. Pomocne są także podstawowe metadane opisujące autora, datę, temat i związek pliku z konkretną sprawą. Ich wartość rośnie wraz z rozmiarem archiwum.
Jedna kopia pliku nie jest archiwum
Dysk komputera może ulec awarii, konto chmurowe może zostać zablokowane, a pliki mogą zostać przypadkowo usunięte lub zaszyfrowane przez złośliwe oprogramowanie. Dokumenty powinny być przechowywane w więcej niż jednej niezależnej lokalizacji, a możliwość odtworzenia kopii trzeba okresowo sprawdzać.
Należy również ograniczyć dostęp do danych osobowych, umów i dokumentacji poufnej. Digitalizacja ułatwia korzystanie z informacji, ale zwiększa też możliwość szybkiego skopiowania dużego zbioru. Dobrze zaplanowane archiwum łączy więc wygodne wyszukiwanie z kontrolą uprawnień, kopiami bezpieczeństwa i ustalonymi zasadami usuwania dokumentów.