OCR PDF
Riconosce il testo nei PDF scansionati per renderlo ricercabile e selezionabile.
Un PDF scansionato è la fotografia di una pagina. Sembra un documento ma non contiene testo, ed è per questo che la ricerca non trova nulla e la copia non restituisce niente. L'OCR legge le forme nell'immagine, riconosce i caratteri e aggiunge un livello di testo invisibile dietro la figura: la pagina resta identica ma diventa cercabile e selezionabile.
Il riconoscimento gira interamente nel browser con Tesseract compilato in WebAssembly. Al primo utilizzo viene scaricato il modello della lingua scelta; dalle volte successive è in cache.
Come funziona
- Apri il PDF scansionato o l'immagine.
- Scegli la lingua del testo: da questa dipende molto la precisione.
- Avvia il riconoscimento e attendi: una pagina richiede qualche secondo.
- Scarica il PDF cercabile con il suo livello di testo.
Quando si usa
- Rendere ricercabile per nome fornitore un archivio di fatture scansionate.
- Preparare una scansione per la conversione in Word, che ha bisogno di un vero livello di testo.
- Citare un capitolo di un libro scansionato senza riscriverlo a mano.
Domande frequenti
- Il mio file viene caricato su un server?
- No. Il file viene aperto da JavaScript e WebAssembly che girano nella scheda del tuo browser. Non viene caricato da nessuna parte, non c'è elaborazione lato server e non viene conservato nulla: chiudendo la scheda sparisce tutto.
- Perché il riconoscimento è lento?
- Perché gira davvero sul tuo dispositivo e non su una server farm. Metti in conto qualche secondo per pagina, di più su telefono. In cambio il documento non esce mai dalla macchina.
- Il testo riconosciuto ha degli errori.
- La precisione dell'OCR dipende dalla qualità della scansione. Punta ad almeno 300 dpi, pagine dritte e buon contrasto. La causa più frequente di risultati scadenti è la lingua sbagliata, seguita da foto da telefono storte o in ombra.
- La pagina cambia aspetto?
- No. L'immagine originale viene mantenuta e il testo riconosciuto è collocato invisibile dietro di essa, quindi l'aspetto resta identico.
Strumenti correlati
PDF in Word
Ottieni un .docx modificabile: paragrafi continui, titoli e immagini incluse.
Word in PDF
Converti documenti .docx in un PDF impaginato — titoli, elenchi, tabelle e immagini. Interamente nel tuo browser.
Excel in PDF
Trasforma fogli .xlsx, .xls, .ods o .csv in un PDF tabellare pulito — orientamento automatico, intestazioni ripetute, tabelle larghe divise per colonne. Le formule usano i valori salvati.
PDF in Excel
Estrai tabelle e testo da un PDF in una cartella di lavoro .xlsx — un foglio per pagina, formati numerici europei riconosciuti. I PDF scansionati richiedono prima l’OCR.