Kuinka kuitin jäsentäminen toimii: Sisällä Yomio OCR putki (AWS + Azure)

Tekninen syvällinen kuitin OCR putkeen — kuinka AWS Textract ja Azure asiakirja älykkyys purkaa, normalisoi ja luokittelee kuitin tiedot asteikolla.

Alex Chen

Alex Chen

Product Manager & Personal Finance Advocate

Updated
8 min read
Tekoäly ja tekniikkaOminaisuusoppaat#OCR kuitin käsittely#kuitin tiedot purkaminen#OCR putki#AWS Textract#Azure asiakirja älykkyys#kuitin jäsentäminen#OCR tekniikka
Kuinka kuitin jäsentäminen toimii: Sisällä Yomio OCR putki (AWS + Azure)

Kuinka kuitin jäsentäminen toimii: Sisällä Yomio OCR putki (AWS + Azure)

Kun skannataan kuitti Yomiossa, paljon tapahtuu painike sulkemisen ja kategorisoidut tapahtuma näkemisen välillä kojelautassasi. Kuitti valokuva matkaa multi-vaiheen OCR putkeen, joka purkaa, normalisoi ja rikastuttaa raaka teksti järjestelmäksi rahoituksellinen tieto.

Tämä artikkeli käy läpi mitä tapahtuu sisällä putki. Se on tekninen — mutta se on myös hyödyllinen ymmärryksen miksi jotkut kuitit skannataan täydellisesti ja toiset tarvitsevat korjaukset, ja kuinka olemme työskentelevät sulkeminen että aukko.

Tärkeimmät asiat

  • Yomio käyttää sekä AWS Textract ja Azure asiakirja älykkyys — dual-toimittaja arkkitehtuuri redundanssille ja tarkkuudelle
  • Putki on 5 vaiheen: ingest, OCR purkaminen, normalisaatio, luokittelu, rikastuksella
  • Linja-tuote purkaminen on vaikeimpana ongelma — kuitit on ei standardia muoto
  • Luottamus pisteytys lippuja matala-luottamus kenttiä manuaalisen tarkistamisen osalta
  • Multi-modal tuki — vastaanottaa kuvia, PDF-tiedostot ja jäsennetty tiedot
  • Nykyinen tarkkuus: 94,7% rivi-tuotteen purkaminen, 99,3% kokonaisen valinta
  • Käsittely aika: 2–6 sekuntia per kuitti skannuksesta kategorisoidun merkinnän

Putki yleiskatsaus

OCR putki on viisi vaihetta:

  1. Ingest — kuva esikäsittely ja muoto validointi
  2. OCR purkaminen — teksti ja rakenne purkaminen via AWS Textract / Azure asiakirja älykkyys
  3. Normalisaatio — kauppias nimen vastaavuus, päivämäärä muotoileminen, valuutta havaitseminen
  4. Luokittelu — rivi-tuotteen ja yhteensä-taso kategorian tehtävä
  5. Rikastuksella — viivakoodilla haku, tuotteen tieto, käyttäjä tilin linkitys

Jokainen vaihe on sisäänrakennettu fallbacks. Jos vaihe tuottaa matala-luottamus tuotanta, putki lippuja sitä pikemminkin kuin juoksevat huono tieto eteenpäin.

Vaihe 1: Ingest — kuva esikäsittely

Ennen OCR moottoreita koskettaa kuitti, kuva kulkee esikäsittely:

Muoto normalisaatio:

  • Valokuvat muutetaan korkeintaan 2048px pisin reuna
  • JPEG pakkaus sovelletaan (laatu 85%) tallennusta tehokkuus
  • PDF sivut esitetään kuvat osoitteessa 300 DPI

Laatu tarkistuksissa:

  • Sumentaa havaitseminen — jos kuva on liian sumea (Laplacian varianssi alle kynnys), käyttäjä pyydetään uudestaan
  • Kaltevuus havaitseminen — kuitit ammuttu äärimmäinen kulmat korjattu näkökulma muuntaa
  • Kontrastin normalisaatio — matala-kontrastin kuitit (haalistua termiset paperi) saada adaptiivinen histogrammi tasaus

Monet sivut tuki:

  • Kuitit pidempi kuin yksi sivu automaattisesti havaitsin (sivu katkaise merkkejä, taittaa reunat)
  • Multi-sivun kuitit on stitched yhdessä asiakirjassa käsittely

Tiedot

Raaka puhelin valokuvia kuiteista ovat yllättävän muuttuva. Tumma ravintola valaistus, ryppyinen termiset paperi kuitit kauppaa ja kuitteja kanssa taita rivit ovat yleinen. Esikäsittely normalisoi nämä johdonmukaisesti muoto, joka sekä OCR moottoreita käsitellä hyvin. Laatu tarkistuksissa tämä vaihe estää 3–5% skannauksista, jotka muutoin tuottava käyttökelpoisesti tuloksia.

Vaihe 2: OCR purkaminen — AWS Textract ja Azure asiakirja älykkyys

Tämä on putken ydin. Yomio käyttää kaksi OCR toimittajat:

AWS Textract:

  • Pää-toimittaja standardia kuiteille
  • Best-in-luokan tulostettu teksti purkaminen
  • Kuitti API (Kulu) erityisesti koulutettu kuitin asettelun
  • Havaitsee: kauppaa nimi, tapahtuma päivä, kokonainen, välituotanto, vero, rivi tuotteita, maksu menetelmä

Azure asiakirja älykkyys (muoto tunnistaja):

  • Toinen toimittaja kuiteille monimutkaisia asettelun
  • Parempi havaitsemalla taulukko rakenteet kuiteissa
  • Käytetään fallback kun Textract luottamus pisteet ovat alle kynnys
  • Parempi käsinkirjoitettu havaitseminen käsinkirjoitetulle kuiteille

Toimittaja valinta logiikka:

  1. Pää-yritys: AWS Textract
  2. Jos Textract luottamus < 70% avain kenttiä: myös käyttää Azure asiakirja älykkyys
  3. Vertaa tuotanta — valitse korkeampi-luottamus tulos kunkin kentän
  4. Jos molemmat alla kynnys: lippuja kuitti manuaalinen tarkistamisen

Tämä dual-toimittaja arkkitehtuuri tarkoittaa, että jos yksi toimittaja on sokea paikka erityisiä kuitin muoto (yleinen kanssa ei-englanti kuitit tai epätavallinen asettelun), muut toimittaja voi kompensoida.

Mitä kukin toimittaja purkaa

Sekä toimittajat purkaa samankaltaisia kenttiä, mutta eri vahvuudet:

KenttäTextract vahvuusAzure asiakirja älykkyys vahvuus
Kauppaa nimiKorkea (standardi)Korkea (standardi)
Tapahtuma päiväKorkeaKorkea
Kokonainen määräErittäin korkeaErittäin korkea
Rivi tuotteitaKorkea (yksinkertainen asettelun)Korkea (taulukko asettelun)
Vero määräKeskiarvonKorkea
DiskonttiKeskiarvonKorkea (tuotteen-taso)
Valuutta havaitseminenKorkeaKorkea
KäsinkirjoitettuMatalaKeskiarvon

Vaihe 3: Normalisaatio — Tekemällä tieto johdonmukainen

Raaka OCR tuotanto on tarkkaa mutta sotkuinen. "Starbucks kahvi #4521" ja "Starbucks" pitää tunnistaa samana kauppaa. "05/08/2026" ja "Toukokuu 8, 2026" pitää olla sama päivä. Tämä vaihe käsittely nämä muutokset.

Kauppaa normalisaatio:

  • Epäselvä merkkijono vastaavuus vastaan kauppaa tietokanta (yli 50,000 kaupat)
  • Brändi-taso ryhmittely: "Starbucks kahvi #4521" → "Starbucks"
  • Ketju tunnistaminen: paikallinen franchises yhdistetty niiden isäntä brändi
  • Käyttäjä-määrittää alias: jos nimeät kauppaa kerran, järjestelmä oppii se

Päivämäärä normalisaatio:

  • Havaitsee päivämäärä muoto kuitista (USA: KK/PP/YYYY, EU: PP/KK/YYYY, ISO: YYYY-KK-PP)
  • Ratkaisee epäselvyys käyttäen konteksti (kuitti UK kauppaa osoitteessa 03/04/2026 → Huhtikuu 3, 2026)
  • Aika vyöhyke havaitseminen kauppaa sijainnista

Valuutta normalisaatio:

  • Valuutta symboli havaitseminen ($, €, £, ¥, jne.)
  • Kolme-kirjain koodi havaitseminen (USD, EUR, GBP)
  • Epäselvyys ratkaisu ($ voi olla USD, CAD, AUD, MXN — ratkaistu via kauppaa sijainti)

Määrä validointi:

  • Cross-tarkistuksiin: välituotanto + vero = kokonainen? Todennettu vastaan rivi-tuotteen summa
  • Diskontto havaitseminen: jos rivi tuotteita summa miinus kokonainen > kynnys, diskontto oli käytetty
  • Tipsi havaitseminen (ravintola kuitit): ero välituotanto ja kokonainen kun tipsi linja on

Vaihe 4: Luokittelu — älykäs tunnisteiden

Purettu rivi tuotteita pitää osoittaa budjetti kategoriaan. Tämä tapahtuu kahdella tasolla järjestelmä:

Taso 1: Kauppaa-pohjainen säännöt

  • Tunnettu kaupat on oletuksena kategoria yhdistykset
  • "Kroger" → päivittäistavarat (oletuksena), "Shell" → kuljetus (oletuksena), "Netflix" → viihde (oletuksena)
  • Käyttäjät voivat ohittaa per-kauppaa: "Haluan Shell kategorisoidut kuljetus"

Taso 2: Tuotteen taso AI luokittelu

  • Tuntemattomia kauppaa tai sekalaiset-kategoria kuiteille (tavoite kanssa sekä päivittäistavarat ja elektroniikka)
  • Jokainen rivi tuotteesta on kategorisoidaan erikseen perustuu tuotteen nimi, hinta ja historiallinen tieto
  • Kategoriat sisältö: päivittäistavarat, ruokailu, kuljetus, ostokset, viihde, terveydenhuolto, kasvot, asuminen, koulutus, henkilöllinen hoito, ja 12+ subcategoriat

Luokittelu luottamus pisteet määrittää onko määritys on automaattinen tai ehdotettu tarkistamisen. Osoitteessa 90%+ luottamus, kategorian on soveltaa hiljaa. Alla sitä, se on korostettu käyttäjä vahvistuksella.

Vaihe 5: Rikastuksella — Yhdistäminen tilin

Lopullinen vaihe yhdistää käsitellyt kuitti tilin:

  • Käyttäjä tehtävä — kuitti on linkitetty tilin (tai perheryhmä jos jakaminen on otettu käyttöön)
  • Inventaarion päivitys — rivi tuotteet vastaavuus tunnettu inventaarion tuotteet laukaise määrä päivitykset (katso inventaarion syvällinen)
  • Tilaus havaitseminen — toistuva kaupat säännöllisesti määrillä lippuja mahdollisia tilaukset
  • Viivakoodilla ratkaisu — skannattu viivakoodit sovitettavasti Open ruoka tosiasiat ja tuotteen tietokannat
  • Viiva päivitys — päivittäinen viiva laskuri on korotettu
  • XP palkinto — skannaus XP on luotto tilin

Käsittely aika ja skaalattavuus

  • Keskimääräinen käsittely aika: 2–6 sekuntia per kuitti
  • Huippu läpäisyä: tuhansien kuittia minuutissa (Lambda-pohjainen auto-skaalaus)
  • Tallennusta: kuitti kuvia S3, jäsennetty tieto PostgreSQL
  • CDN: kuitti kuvia tarjoillaan via CDN nopea nouto

Vinkki

OCR toimittajat itse kestää 1–3 sekuntia kuitin käsittely. Loput aika on jakaa välillä esikäsittely (0,5s), normalisaatio (0,3s), luokittelu (0,2s) ja rikastuksella (0,5s). Monet sivut kuitit kestää pidempään sivulla-sivulla käsittely.

Tarkkuus vertailuarvo

Olemme jatkuva mittaus putken tarkkuus vastaan manuaalisesti kuratoidut testi asettaa 10,000 kuitit:

MetriikkaNykyinen tarkkuus
Kokonainen määrä valinta99,3%
Rivi-tuotteen purkaminen94,7%
Kauppaa havaitseminen98,1%
Päivämäärä havaitseminen99,5%
Kategoria tehtävä92,4%
Valuutta havaitseminen99,7%

Missä virheet tapahtuu vielä:

  • Käsinkirjoitettu kuitit (30% alempi tarkkuus kuin tulostettu)
  • Vakavasti vaurioituneet termiset paperi (haalistua, kaareva, säikö)
  • Kuitit kanssa muuttuja diskontto rakenteet (BOGO, lojaalisuus pisteen lunastus)
  • Mikro-tulostettu ehdot ja edellytykset (OCR jättää nämä tarkoituksella)

Interactive review aid

Receipt review checklist

Select conditions that apply, then review the extracted fields against the receipt. No accuracy score is calculated.

Receipt or document type
Image or paper condition
Layout
Tool type you are reviewing
Receipt language or script

Tulevaisuus parannukset

Putki on aktiivisesti parannettu kolme alueita:

1. Käsinkirjoitettu tunnistaminen. Nykyinen käsinkirjoitettu tarkkuus on suurin aukko. Olemme koulutus mukautettu malleille kuitin-spesifinen käsinkirjoitettu (tipsi määrät, käsinkirjoitettu kauppaa nimet, henkilöllinen muistiinpanot kuiteissa).

2. Kuitti muoto suoja. Kansainvälinen kuittia on erilaisia asettelun, vero rakenteet ja kieliä. Olemme laajentaa toimittaja koulussa tieto kattaa lisää alueellinen muodot.

3. Reaaliaikainen korjaus ehdotukset. Sen sijaan joka vaatii manuaalinen korjaus jälkeen skannaus, seuraava putki versio ehdottaa korjaukset aikana skannaus virtaa — ennen kuitin on viimeistä.

Yritä OCR putki

Skannaa mikä tahansa kuitti juuri nyt ja nähdä putki toiminta. Shutter kategorisoidun merkinnän: alle 10 sekuntia.

Skannaa kuitin ilmainen

Usein kysytyt kysymykset