Besplatan OCR — Izdvajanje teksta iz slike

Izdvojite tekst iz slika, snimaka ekrana, skeniranih dokumenata i PDF-ova (ili sačuvajte PDF u kojem se može pretraživati) pomoću PP-OCRv5, potpuno u vašem pregledniku. Čita latinicu, kinesko, japansko, korejsko, ćirilično, arapsko, devanagari, tajlandsko, grčko, tamilsko i telugu pismo.

Mnoge online OCR stranice ograničavaju besplatne stranice po satu ili danu — ovdje nema ograničenja, a slika ostaje na vašem uređaju.

Ispustite datoteke ovdje ili kliknite da ih pregledate

JPG, PNG, WebP, BMP, PDF, HEIC, HEIF · Nema ograničenja veličine datoteke

ili pritisnite Ctrl+V za lijepljenje iz međuspremnika

Možete ispustiti više datoteka odjednom

Pregledaj fajlove

Savjet: možete nalijepiti snimak ekrana pomoću Ctrl+V

Skenirani PDF-ovi također rade: svaka stranica se čita, a vi dobijate PDF s mogućnošću pretrage.

Vaši fajlovi nikada ne napuštaju vaš uređaj. Sva obrada se odvija lokalno u vašem pretraživaču.

Kako radi

OCR (optičko prepoznavanje karaktera) ovdje pokreće PP-OCRv5, otvoreni skup modela iz projekta PaddleOCR, direktno u vašem pregledniku. Čita štampani tekst sa fotografije ili skena bez slanja slike na server.

  1. 1
    Prvo se pronalaze regioni teksta
    Model za detekciju skenira sliku i označava svaki dio koji liči na red teksta, radeći na kopiji skaliranoj tako da joj je najduža ivica oko 960 piksela. Zato ovaj alat radi i sa fotografijom računa: model pronalazi tekst umjesto da pretpostavlja da je cijela slika čista stranica. Ova faza je ista bez obzira na jezik koji čitate, pa se preuzima jednom - oko 12 MB - i ponovo koristi.
  2. 2
    Jedan model za prepoznavanje se preuzima za vaše pismo
    Čitanje oblika je specifično za pismo, pa se drugi model preuzima za odabrani pisani sistem - oko 8 MB za većinu, 13 MB za korejski, i 17 MB za kineski i japanski. Odabir latiničnog pisma košta ukupno oko 19 MB. Svaki je keširan, tako da povratak na pismo koje ste ranije koristili ne preuzima ništa.
  3. 3
    Svaki red se ispravlja i čita
    Svaki otkriveni red se provjerava zbog orijentacije, rotira uspravno ako je potrebno, a zatim prosljeđuje modelu za prepoznavanje, koji ga čita karakter po karakter. Redoslijed čitanja se naknadno rekonstruiše, od vrha ka dnu i slijeva nadesno, tako da izlaz odgovara rasporedu koji vidite, a ne redoslijedu kojim je detektor pronašao okvire.
  4. 4
    Tekst se vraća sa okvirima i pouzdanošću
    Svaki red nosi ocjenu pouzdanosti i koordinate sa kojih potiče, tako da tačno vidite šta je pročitano i odakle, i možete izvesti hOCR koji čuva te pozicije. Čist tekst sa visokim kontrastom postiže ocjenu iznad 90%; niska rezolucija, odsjaj i rukopis je smanjuju.

Vaše slike ostaju na vašem uređaju - čak se ni privremeno ne šalju na obradu. Fajlovi modela se preuzimaju sa našeg vlastitog servera, nikad sa CDN-a treće strane. Bezbjedno za lične dokumente, ugovore, medicinsku dokumentaciju, ili bilo koji tekst sa osjetljivim sadržajem.

Povezani alati

Često postavljana pitanja