OCR - PDF z wyszukiwaniem tekstu
Skan to obraz: nie ma w nim czego szukać, zaznaczać ani kopiować. OCR odczytuje z niego słowa i kładzie na stronie niewidoczną warstwę tekstową, słowo po słowie tam, gdzie każde zostało wydrukowane, więc wyszukiwanie podświetla właściwe miejsce, a zaznaczenie podąża za wierszem. Rozpoznawanie działa w twojej przeglądarce dzięki Tesseract, w trzydziestu czterech językach, a zeskanowany obraz zostaje dokładnie taki, jaki był.
Upuść tutaj pliki PDF
Przeciągnij je prosto z pulpitu
- Tylko pliki PDF
- Do 15 MB każdy
- 2 pliki na raz - bez limitu z Pro
Najczęściej zadawane pytania
Czy OCR zmienia wygląd skanu?
Nie. Zeskanowany obraz zostaje bajt w bajt taki, jaki był; dodawana jest nad nim niewidoczna warstwa tekstowa - ta sama konstrukcja, której Acrobat i każde oprogramowanie skanera używają do tworzenia przeszukiwalnego PDF. Wyszukiwanie, zaznaczanie i kopiowanie działają; wydruk się nie zmienia.
Jak dobre jest rozpoznawanie?
To silnik neuronowy Tesseract 5, ten sam, który stoi za większością otwartoźródłowego OCR, uruchomiony jako WebAssembly w twojej przeglądarce. Czysty skan drukowanego tekstu w 300 dpi wychodzi niemal bez błędów; krzywa, blada lub sfotografowana strona - gorzej, więc najpierw wyprostuj ją narzędziem Wyprostuj PDF. Słowa, co do których silnik nie miał pewności, i tak są umieszczane, by wyszukiwanie je znalazło, a narzędzie mówi, ile ich było.
Jakie języki i czy mogę wybrać kilka?
Węgierski, angielski, niemiecki, francuski, włoski, hiszpański, polski, rumuński, słowacki, czeski, chorwacki, słoweński, serbski (łacinka i cyrylica), ukraiński, rosyjski, bułgarski, grecki, turecki, duński, szwedzki, norweski, fiński, niderlandzki, portugalski, łacina, arabski, perski, hebrajski, chiński (uproszczony i tradycyjny), japoński, koreański oraz niemiecka fraktura dla przedwojennego druku gotyckiego, w dowolnym połączeniu - dwujęzyczną umowę można odczytać z dwoma. Każdy język to osobne pobranie, które przeglądarka potem zachowuje.
Czy PDF jest przesyłany?
Nic nie jest przesyłane: plik jest otwierany i przetwarzany w twojej przeglądarce i nigdy nie opuszcza twojego urządzenia. Zamknij kartę, a zniknie. Silnik OCR i jego pliki językowe też pochodzą z tej strony, więc nawet wybór języka nigdzie nie jest wysyłany.
Które strony odczytuje?
Domyślnie tylko te, które nie mają jeszcze warstwy tekstowej, bo strona utworzona cyfrowo już ją ma, a druga podwoiłaby każdy wynik wyszukiwania. Jeśli wcześniejszy OCR spisał się słabo, przełącz na każdą stronę - nowa warstwa trafi pod starą.
Ile to trwa?
Dłużej niż cokolwiek innego tutaj - rozpoznawanie to prawdziwa praca i każda strona zajmuje chwilę nawet na szybkim komputerze, więc długi skan warto uruchomić i zostawić. Pierwsze uruchomienie pobiera też silnik rozpoznawania i dane językowe (kilka megabajtów, z tej strony, a nie z CDN); potem przeglądarka ma je w pamięci podręcznej, a przycisk pokazuje postęp strona po stronie.
Czegoś brakuje albo wynik cię zaskoczył?
Powiązane narzędzia
- PDF do tekstuWyodrębnij tekst z PDF do zwykłego pliku .txt, strona po stronie
- PDF do WordaZamień PDF w edytowalny dokument Word (.docx), który zachowuje układ
- Wyprostuj PDFPopraw krzywe skany - wykryj nachylenie każdej strony i wyrównaj je
- Automatyczne obracanie PDFObróć do pionu strony leżące na boku i odwrócone do góry nogami - wykrywane strona po stronie
- Anonimizuj PDFUsuń tekst i obrazy na dobre