Salta al contenuto
Torna a tutti gli strumenti
Converti

OCR PDF

Riconosce il testo nei PDF scansionati per renderlo ricercabile e selezionabile.

Un PDF scansionato è la fotografia di una pagina. Sembra un documento ma non contiene testo, ed è per questo che la ricerca non trova nulla e la copia non restituisce niente. L'OCR legge le forme nell'immagine, riconosce i caratteri e aggiunge un livello di testo invisibile dietro la figura: la pagina resta identica ma diventa cercabile e selezionabile.

Il riconoscimento gira interamente nel browser con Tesseract compilato in WebAssembly. Al primo utilizzo viene scaricato il modello della lingua scelta; dalle volte successive è in cache.

Come funziona

  1. Apri il PDF scansionato o l'immagine.
  2. Scegli la lingua del testo: da questa dipende molto la precisione.
  3. Avvia il riconoscimento e attendi: una pagina richiede qualche secondo.
  4. Scarica il PDF cercabile con il suo livello di testo.

Quando si usa

  • Rendere ricercabile per nome fornitore un archivio di fatture scansionate.
  • Preparare una scansione per la conversione in Word, che ha bisogno di un vero livello di testo.
  • Citare un capitolo di un libro scansionato senza riscriverlo a mano.

Domande frequenti

Il mio file viene caricato su un server?
No. Il file viene aperto da JavaScript e WebAssembly che girano nella scheda del tuo browser. Non viene caricato da nessuna parte, non c'è elaborazione lato server e non viene conservato nulla: chiudendo la scheda sparisce tutto.
Perché il riconoscimento è lento?
Perché gira davvero sul tuo dispositivo e non su una server farm. Metti in conto qualche secondo per pagina, di più su telefono. In cambio il documento non esce mai dalla macchina.
Il testo riconosciuto ha degli errori.
La precisione dell'OCR dipende dalla qualità della scansione. Punta ad almeno 300 dpi, pagine dritte e buon contrasto. La causa più frequente di risultati scadenti è la lingua sbagliata, seguita da foto da telefono storte o in ombra.
La pagina cambia aspetto?
No. L'immagine originale viene mantenuta e il testo riconosciuto è collocato invisibile dietro di essa, quindi l'aspetto resta identico.