PDF in Excel
Estrai tabelle e testo da un PDF in una cartella di lavoro .xlsx — un foglio per pagina, formati numerici europei riconosciuti. I PDF scansionati richiedono prima l’OCR.
Un PDF non contiene oggetti tabella. Contiene caratteri con delle coordinate: la griglia che vedi è un'illusione prodotta dall'allineamento. Recuperare un foglio di calcolo significa quindi dedurre la struttura all'indietro: lo strumento raggruppa i caratteri in righe secondo la linea di base, poi trova le colonne raccogliendo il bordo sinistro di ogni elemento della pagina e cercando le posizioni che si ripetono. Quei bordi ricorrenti sono i confini delle colonne, e su fatture ed estratti conto veri reggono molto meglio di una divisione a larghezza fissa.
Ogni pagina diventa un foglio a sé nell'.xlsx, quindi un estratto conto di dodici pagine ti dà dodici fogli nell'ordine originale, invece di un unico blocco in cui indovinare dove finiva ciascuna pagina. I numeri scritti all'europea, con il punto per le migliaia e la virgola per i decimali, vengono riconosciuti come numeri e non importati come testo.
Come funziona
- Trascina un PDF che contenga testo vero, cioè un file da cui puoi selezionare e copiare.
- Lascia che ogni pagina venga analizzata per righe e colonne.
- Scarica la cartella .xlsx, un foglio per pagina.
- Controlla una o due pagine contro l'originale prima di costruire qualcosa su quei numeri.
Quando si usa
- Portare un estratto conto in un foglio di calcolo per categorizzare i movimenti.
- Recuperare un listino dal catalogo PDF di un fornitore senza riscriverlo a mano.
- Estrarre i dati da un report pubblicato per farci i propri grafici.
Domande frequenti
- Il mio file viene caricato su un server?
- No. Il file viene aperto da JavaScript e WebAssembly che girano nella scheda del tuo browser. Non viene caricato da nessuna parte, non c'è elaborazione lato server e non viene conservato nulla: chiudendo la scheda sparisce tutto.
- Non è uscito niente. Perché?
- Il PDF è quasi certamente una scansione: la fotografia di una pagina, senza uno strato di testo sotto. Non ci sono caratteri da raggruppare, quindi non c'è nulla da recuperare. Passalo prima dallo strumento OCR per aggiungere il testo, poi converti il risultato.
- Alcune colonne sono divise o unite nel punto sbagliato. Si può correggere?
- Succede dove l'allineamento della tabella è davvero ambiguo: una colonna di numeri allineati a destra accanto a una di testo allineato a sinistra può condividere lo stesso bordo. Il rimedio è nel foglio di calcolo, dopo: i dati ci sono tutti, si è spostato il confine. Le tabelle con righe di riquadro visibili e allineamenti coerenti si convertono meglio di tutte.
- Bordi, colori e celle unite vengono mantenuti?
- No. Quello che ottieni sono i valori dentro una griglia. La formattazione nel PDF è disegnata, non strutturale, quindi non c'è nulla da riportare — e inventare bordi che l'originale non dichiara sarebbe tirare a indovinare.
- Funziona con un PDF che ha più tabelle nella stessa pagina?
- In parte. Tutto ciò che sta nella pagina finisce nel foglio di quella pagina, quindi due tabelle una sopra l'altra arrivano in sequenza e si separano facilmente. Due tabelle affiancate condividono invece l'analisi delle colonne della pagina e richiederanno più lavoro a mano.
Strumenti correlati
PDF in Word
Ottieni un .docx modificabile: paragrafi continui, titoli e immagini incluse.
Word in PDF
Converti documenti .docx in un PDF impaginato — titoli, elenchi, tabelle e immagini. Interamente nel tuo browser.
Excel in PDF
Trasforma fogli .xlsx, .xls, .ods o .csv in un PDF tabellare pulito — orientamento automatico, intestazioni ripetute, tabelle larghe divise per colonne. Le formule usano i valori salvati.
PowerPoint in PDF
Converti le slide .pptx in un PDF direttamente nel tuo browser — una pagina per slide alla dimensione reale, con testo e immagini posizionati in modo approssimativo. Al meglio possibile, senza upload.