Prodotto
Cosa sa fare doc2data, e cosa non ancora
Le pagine prodotto di solito elencano cosa fa un prodotto. Questa dedica altrettanto spazio a ciò che doc2data non fa ancora, perché è ciò che devi sapere prima di inviargli anche una sola fattura.

Cos'è doc2data
doc2data trasforma una cartella di PDF o scansioni di fatture e scontrini in un unico file Excel, CSV o JSON, con un elenco dei documenti da far guardare a una persona. Nella modalità predefinita funziona offline sul tuo computer, senza costi API a pagina. Il formato del file non garantisce un'estrazione completa o corretta: l'elenco da controllare esiste per questo.
Stato: demo. Nessuno al di fuori di Snello l'ha usato, nulla è stato consegnato a un cliente pagante, e la precisione su documenti reali non è stata misurata.
Cosa prova a fare
Estrarre: fornitore, partita IVA, numero fattura, data, valuta, imponibile, IVA, totale e le righe supportate (descrizione, quantità, prezzo unitario, importo). I limiti di impaginazione e le righe che vanno a capo impediscono di garantire ogni riga.
Leggere due tipi di documento:
- PDF con un livello di testo incorporato, letti direttamente;
- scansioni che sono solo immagine, tramite OCR (riconoscimento ottico dei caratteri) in locale. Le foto dal telefono non sono state provate.
Regole per quattro lingue: regole sulle etichette per fatture in italiano, inglese, tedesco e francese, provate su fatture sintetiche in queste lingue e in 4 valute (EUR, GBP, CHF, USD). Altri formati e valute non sono stati provati.
Controllare ogni documento:
- imponibile + IVA = totale, e IVA = aliquota × imponibile (fatture con una sola aliquota);
- le righe tornano, e quantità × prezzo unitario = importo della riga;
- date plausibili e partite IVA in un formato valido;
- presenza dei campi obbligatori.
Segnalare in un foglio "Da controllare", con il motivo, tutto ciò che non supera un controllo. Le lacune non vengono mai colmate tirando a indovinare. Superare tutti i controlli non dimostra che ogni campo sia giusto (vedi gli errori silenziosi qui sotto).
Passaggio di IA facoltativo, spento di default. Se attivi l'opzione cloud, invia fino ai primi 6.000 caratteri del testo estratto a un fornitore compatibile con OpenAI scelto da te, usando la tua chiave API. Il passaggio facoltativo con Ollama gira sullo stesso computer (localhost); nulla lascia il computer. I campi compilati dall'IA vengono segnalati. Entrambe le opzioni sono realizzate e coperte da test unitari con un backend simulato; nessuna è ancora stata provata con un modello reale.
Cosa abbiamo misurato
Misurato il 2 ottobre 2026 nella nostra build Docker (commit e4bfc58), ricontrollato lo stesso giorno alla revisione 708168d con risultati identici. Tutti i documenti sono sintetici: aziende, indirizzi e partite IVA inventati.
| Set di prova | Cos'è | Documenti | Errori sui campi |
|---|---|---|---|
| Principale | Set di sviluppo; le regole sono state scritte su di esso | 16 | 0 su 189 campi |
| Valori di verifica | Stessi formati, valori nuovi | 16 | 0 su 191 campi |
| Terzo set | Valori nuovi; secondo lo sviluppatore, misurato prima (174 su 178) e dopo il cambio di OCR e non usato deliberatamente per ottimizzarlo; incluso nei test automatici per tutto lo sviluppo | 16 | 0 su 178 campi |
| Scansioni degradate | 110 dpi, inclinate, sfocate, compresse; usate durante lo sviluppo di una correzione | 12 | 10 su 141 (131 corretti, 92,9%) |
| Scansioni degradate, verifica | Stesso tipo di danno; secondo il registro dello sviluppatore, non guardate durante quella correzione | 12 | 12 su 139 (127 corretti, 91,4%) |
- La fattura con un errore di calcolo voluto è stata segnalata in ogni set.
- Errori silenziosi (un documento supera tutti i controlli ma un campo è sbagliato): 0 sui set puliti, 1 sul set degradato di sviluppo (un nome di fornitore letto "S.n.C." invece di "S.n.c."), 0 sul set degradato di verifica.
- Falsi allarmi: sui set degradati sono state segnalate anche 6 fatture altrimenti valide su 11 e 7 su 11, soprattutto perché un totale non era leggibile.
- La suite di test automatici supera 21 test su 21.
Perché questi numeri non sono una promessa
- Le fatture sintetiche vengono da 2 formati più uno scontrino, e le regole sono state scritte conoscendoli. Gli altri set cambiano i valori e la qualità dell'immagine, non i formati, quindi nessuno prova formati mai visti.
- Con 16 o 12 documenti per set, zero errori sui set puliti dimostra che il flusso funziona dall'inizio alla fine, ma non giustifica alcuna soglia di precisione per fatture reali. Questi piccoli set sintetici non stabiliscono una differenza affidabile nelle prestazioni generali; non è stata eseguita un'analisi che tenga conto del raggruppamento dei campi per documento.
- Le prestazioni su documenti reali di fornitori non sono state misurate e possono essere diverse, anche più basse. Altri formati, fatture su più pagine, sconti, foto dal telefono e scrittura a mano non sono stati provati.
Cosa non sa ancora fare
- Più aliquote IVA nella stessa fattura: non gestite.
- Tabelle di righe che continuano su più pagine: non gestite.
- Note di credito: non gestite.
- Descrizioni delle righe che vanno a capo su due righe: non gestite in modo affidabile.
- Validità delle partite IVA: solo il formato, non la cifra di controllo né il registro europeo VIES.
- Errori di un solo carattere in nomi e partite IVA sulle scansioni scadenti non si possono scoprire con i controlli aritmetici.
- Deduzione della valuta: una valuta illeggibile resta vuota e il documento viene segnalato; non viene mai dedotta dal paese della partita IVA.
- Precisione nel mondo reale: non misurata.
Una nota sulla piattaforma: nelle esecuzioni dello sviluppatore sulla revisione e4bfc58, i due set degradati hanno ottenuto 95,7% e 94,2% su Windows, contro i numeri di Docker (Linux) qui sopra. È un'evidenza dello sviluppatore legata a quell'ambiente, non un confronto generale tra piattaforme. Come riferimento riportiamo i numeri di Docker.
A cosa serve oggi
- A verificare se le tue fatture in PDF di testo sembrano adatte all'elaborazione automatica.
- A una verifica di fattibilità su 3 dei tuoi documenti: un primo sguardo, non una stima affidabile della precisione.
- Come punto di partenza per un flusso su misura per i tuoi formati, con controlli ed elenco da controllare.
Cosa cambierebbe questa pagina
Aggiorneremo questo articolo quando doc2data gestirà uno dei casi mancanti, o quando la precisione sarà stata misurata su documenti reali con il permesso del proprietario.
Provalo sui tuoi documenti
Inviaci 3 documenti di esempio, senza dati sensibili. Invia 3 documenti di esempio
Fonti
- Report di valutazione di doc2data, cinque set sintetici con conteggi dei campi, segnalazioni ed errori silenziosi, generati il 2 ottobre 2026 (commit e4bfc58), ricontrollati alla 708168d; registro dello sviluppatore per la cronologia del set di verifica. Risultati pubblicati con denominatori e limiti: evidenze dei test di doc2data.
- Codice di doc2data per il passaggio di IA (limite di 6.000 caratteri), verificato il 3 ottobre 2026 (interno).
- Schermata della scheda "Results & errors" della demo, 3 ottobre 2026, dati sintetici (immagine di copertina di questo articolo).
- Verifica dei fatti di company-engineer e revisione di company-researcher, 3 ottobre 2026 (interne).
Diamo forma al tuo prossimo strumento.
Inviaci fino a 3 esempi o descrivi un processo. Ti rispondiamo via email spiegandoti cosa è fattibile e come lo misureremmo.