Narzędzia

OCR - PDF z wyszukiwaniem tekstu

Skan to obraz: nie ma w nim czego szukać, zaznaczać ani kopiować. OCR odczytuje z niego słowa i kładzie na stronie niewidoczną warstwę tekstową, słowo po słowie tam, gdzie każde zostało wydrukowane, więc wyszukiwanie podświetla właściwe miejsce, a zaznaczenie podąża za wierszem. Rozpoznawanie działa w twojej przeglądarce dzięki Tesseract, w trzydziestu czterech językach, a zeskanowany obraz zostaje dokładnie taki, jaki był.

Upuść tutaj pliki PDF

Przeciągnij je prosto z pulpitu

lub
  • Tylko pliki PDF
  • Do 15 MB każdy
  • 2 pliki na raz - bez limitu z Pro

Najczęściej zadawane pytania

Czy OCR zmienia wygląd skanu?

Nie. Zeskanowany obraz zostaje bajt w bajt taki, jaki był; dodawana jest nad nim niewidoczna warstwa tekstowa - ta sama konstrukcja, której Acrobat i każde oprogramowanie skanera używają do tworzenia przeszukiwalnego PDF. Wyszukiwanie, zaznaczanie i kopiowanie działają; wydruk się nie zmienia.

Jak dobre jest rozpoznawanie?

To silnik neuronowy Tesseract 5, ten sam, który stoi za większością otwartoźródłowego OCR, uruchomiony jako WebAssembly w twojej przeglądarce. Czysty skan drukowanego tekstu w 300 dpi wychodzi niemal bez błędów; krzywa, blada lub sfotografowana strona - gorzej, więc najpierw wyprostuj ją narzędziem Wyprostuj PDF. Słowa, co do których silnik nie miał pewności, i tak są umieszczane, by wyszukiwanie je znalazło, a narzędzie mówi, ile ich było.

Jakie języki i czy mogę wybrać kilka?

Węgierski, angielski, niemiecki, francuski, włoski, hiszpański, polski, rumuński, słowacki, czeski, chorwacki, słoweński, serbski (łacinka i cyrylica), ukraiński, rosyjski, bułgarski, grecki, turecki, duński, szwedzki, norweski, fiński, niderlandzki, portugalski, łacina, arabski, perski, hebrajski, chiński (uproszczony i tradycyjny), japoński, koreański oraz niemiecka fraktura dla przedwojennego druku gotyckiego, w dowolnym połączeniu - dwujęzyczną umowę można odczytać z dwoma. Każdy język to osobne pobranie, które przeglądarka potem zachowuje.

Czy PDF jest przesyłany?

Nic nie jest przesyłane: plik jest otwierany i przetwarzany w twojej przeglądarce i nigdy nie opuszcza twojego urządzenia. Zamknij kartę, a zniknie. Silnik OCR i jego pliki językowe też pochodzą z tej strony, więc nawet wybór języka nigdzie nie jest wysyłany.

Które strony odczytuje?

Domyślnie tylko te, które nie mają jeszcze warstwy tekstowej, bo strona utworzona cyfrowo już ją ma, a druga podwoiłaby każdy wynik wyszukiwania. Jeśli wcześniejszy OCR spisał się słabo, przełącz na każdą stronę - nowa warstwa trafi pod starą.

Ile to trwa?

Dłużej niż cokolwiek innego tutaj - rozpoznawanie to prawdziwa praca i każda strona zajmuje chwilę nawet na szybkim komputerze, więc długi skan warto uruchomić i zostawić. Pierwsze uruchomienie pobiera też silnik rozpoznawania i dane językowe (kilka megabajtów, z tej strony, a nie z CDN); potem przeglądarka ma je w pamięci podręcznej, a przycisk pokazuje postęp strona po stronie.

Czegoś brakuje albo wynik cię zaskoczył?