Evidenze dei test di doc2data
Questa pagina pubblica i risultati che stanno dietro a ogni numero su doc2data presente in questo sito, così puoi verificarli. Tutti i documenti di prova sono sintetici: generati da un nostro script, con aziende, indirizzi e partite IVA inventati. Non sono risultati su fatture reali di fornitori, e nulla di quanto segue viene da un cliente.
Test automatici
Durante la build sono stati superati tutti i 21 test automatici.
Risultati per set (sintetici)
| Set | Come è stato costruito | Documenti | Campi corretti | Errori sui campi | Segnalata correttamente (errore voluto) | Falsi allarmi | Errori silenziosi |
|---|---|---|---|---|---|---|---|
| Principale | Set di sviluppo: le regole sono state scritte su questi formati | 16 | 189 su 189 | 0 | 1 su 1 | 0 su 15 | 0 |
| Valori di verifica | Stessi formati, valori nuovi | 16 | 191 su 191 | 0 | 1 su 1 | 0 su 15 | 0 |
| Terzo set | Valori nuovi; secondo lo sviluppatore, misurato prima (174 su 178) e dopo il cambio di OCR e non usato deliberatamente per ottimizzarlo; incluso nei test automatici per tutto lo sviluppo | 16 | 178 su 178 | 0 | 1 su 1 | 0 su 15 | 0 |
| Scansioni degradate | Ogni fattura come scansione degradata; usato durante lo sviluppo di una correzione dell'inclinazione | 12 | 131 su 141 (92,9%) | 10 | 1 su 1 | 6 su 11 | 1 |
| Scansioni degradate, verifica | Stesso danno, valori nuovi; secondo il registro dello sviluppatore, non guardato durante quella correzione | 12 | 127 su 139 (91,4%) | 12 | 1 su 1 | 7 su 11 | 0 |
Come leggere le colonne
- Campi corretti: campi estratti che corrispondono ai valori noti creati dal generatore: 8 campi per documento (fornitore, partita IVA, numero fattura, data, valuta, imponibile, IVA, totale) più ogni riga. Ad esempio, principale = 8 × 16 + 61 righe = 189.
- Segnalata correttamente: ogni set contiene una fattura con un errore di calcolo voluto, ed è finita ogni volta nell'elenco da controllare.
- Falsi allarmi: documenti altrimenti validi messi anch'essi nell'elenco da controllare, soprattutto perché un totale non era leggibile.
- Errori silenziosi: documenti che hanno superato tutti i controlli ma contenevano un campo sbagliato. L'unico caso è un nome di fornitore letto "S.n.C." invece di "S.n.c.".
Campo per campo sui set degradati (sintetici)
| Campo | Scansioni degradate | Scansioni degradate, verifica |
|---|---|---|
| Fornitore | 10 su 12 | 11 su 12 |
| Partita IVA del fornitore | 11 su 12 | 12 su 12 |
| Numero fattura | 12 su 12 | 12 su 12 |
| Data | 12 su 12 | 12 su 12 |
| Valuta | 12 su 12 | 12 su 12 |
| Imponibile | 12 su 12 | 11 su 12 |
| IVA | 12 su 12 | 12 su 12 |
| Totale | 8 su 12 | 7 su 12 |
| Righe (descrizione, quantità e importo corretti) | 42 su 45 | 38 su 43 |
Come sono stati costruiti i set
- Uno script generatore crea fatture e scontrini con valori corretti noti. Ogni set usa un seed casuale diverso (7, 99, 123, 2024 e 5150).
- Set puliti (16 documenti ciascuno): 12 fatture in italiano, inglese, tedesco e francese con 4 valute (EUR, GBP, CHF, USD), 2 scontrini e 2 scansioni pulite (copie in immagine di 2 delle fatture). Vengono da 2 formati di fattura più un formato di scontrino.
- Set degradati (12 documenti ciascuno): ogni fattura è resa come scansione a 110 dpi, inclinata di 1,5°, sfocata e salvata come JPEG a qualità 30.
- In ogni set una fattura contiene un errore di calcolo voluto che deve essere segnalato.
Limiti di queste evidenze
- Nessun formato mai visto. Tutti i set condividono le stesse famiglie di formati generati. I set di verifica cambiano i valori, non i formati.
- Campioni piccoli. Con 16 o 12 documenti per set, zero errori sui set puliti non giustifica alcuna soglia di precisione per fatture reali. Per i due risultati degradati (92,9% e 91,4%): questi piccoli set sintetici non stabiliscono una differenza affidabile nelle prestazioni generali; non è stata eseguita un'analisi che tenga conto del raggruppamento dei campi per documento. I campi di uno stesso documento non sono indipendenti.
- La cronologia del set di verifica viene dal registro dello sviluppatore. Nessun documento datato dimostra che sia stato congelato in anticipo. Il terzo set faceva parte dei test automatici (soglia 95%) per tutto lo sviluppo.
- Differenze di piattaforma. Su Windows lo sviluppatore ha misurato 95,7% e 94,2% sui due set degradati. Come riferimento valgono i numeri di Docker (Linux) qui sopra. È un'osservazione su un solo ambiente, non un confronto tra piattaforme.
- Non provati: documenti reali di fornitori, foto dal telefono, scrittura a mano, tabelle su più pagine, più aliquote IVA nella stessa fattura, note di credito e il passaggio di IA facoltativo con un modello reale.
- La precisione nel mondo reale non è stata misurata e può essere diversa, anche più bassa.
Verificalo sui tuoi documenti
L'unica precisione che conta per te è quella sui tuoi documenti. Inviaci 3 esempi per una verifica di fattibilità gratuita: un primo sguardo, non una stima affidabile. Invia 3 documenti di esempio Torna a doc2data
Come funziona il passaggio di IA facoltativo (codice verificato il 3 ottobre 2026)
- Spento di default.
- Opzione cloud (solo nello strumento a riga di comando): chiede i campi mancati dalle regole, e la richiesta include fino ai primi 6.000 caratteri del testo estratto. Quel testo va al fornitore compatibile con OpenAI scelto da te, con la tua chiave API.
- Opzione locale (Ollama): Il passaggio facoltativo con Ollama gira sullo stesso computer (localhost); nulla lascia il computer.
- L'app demo offre solo l'opzione locale.
- Entrambe le opzioni sono realizzate e coperte da test unitari con un backend simulato; nessuna è ancora stata provata con un modello reale.
Fonte: trascrizione dei report privati dello sviluppatore di Snello (accuracy.json per ogni set) e verifica del codice, non un benchmark pubblico riproducibile in modo indipendente. Report generati il 2 ottobre 2026 al commit e4bfc58; ricontrollati da company-engineer lo stesso giorno ricostruendo l'immagine Docker al commit 708168d (risultati identici); descrizione delle valute corretta nel commit 2eddaff. Il risultato di 174 su 178 prima del cambio e la cronologia del set di verifica sono riportati dallo sviluppatore. Numeri trascritti per questa pagina il 3 ottobre 2026.
Diamo forma al tuo prossimo strumento.
Inviaci fino a 3 esempi o descrivi un processo. Ti rispondiamo via email spiegandoti cosa è fattibile e come lo misureremmo.