Bepul OCR — Rasmdan Matn Ajratuvchi

Rasmlar, skrinshotlar, skanerlangan hujjatlar va PDF'lardan matnni ajratib oling (yoki qidiriladigan PDF saqlang) — PP-OCRv5 bilan, to'liq brauzeringizda ishlaydi. Lotin, xitoy, yapon, koreys, kirill, arab, devanagari, tay, yunon, tamil va telugu yozuvlarini o'qiydi.

Ko'p onlayn OCR saytlari bepul sahifalarni soatiga yoki kuniga cheklaydi — bu yerda chegara yo'q, rasm qurilmangizda qoladi.

Fayllarni shu yerga tashlang yoki ko'rish uchun bosing

JPG, PNG, WebP, BMP, PDF, HEIC, HEIF · Fayl hajmi cheklovsiz

yoki buferdan joylash uchun Ctrl+V bosing

Bir vaqtda bir nechta fayl tashlashingiz mumkin

Fayllarni ko'rish

Maslahat: Ctrl+V bilan skrinshot joylashtirsangiz bo'ladi

Skanerlangan PDF-lar ham ishlaydi: har bir sahifa o'qiladi va sizga qidiriladigan PDF qaytariladi.

Fayllaringiz qurilmangizdan hech qachon chiqmaydi. Barcha ishlov berish brauzeringizda mahalliy tarzda amalga oshiriladi.

Qanday ishlaydi

Bu yerdagi OCR (Optik Belgi Tanish) PaddleOCR loyihasining ochiq manbali PP-OCRv5 model to'plamini to'g'ridan-to'g'ri brauzeringizda ishlatadi. U rasm yoki skandan bosma matnni rasmni qurilmangizdan chiqarmasdan o'qiydi.

  1. 1
    Avval matn hududlari topiladi
    Aniqlash modeli rasmni skanerlab, matn qatoriga o'xshagan har bir bo'lakni belgilaydi, eng uzun tomoni taxminan 960 piksel bo'ladigan miqyosga keltirilgan nusxa bilan ishlaydi. Shuning uchun chek fotosi ishlaydi: model butun rasmni toza sahifa deb hisoblash o'rniga matnni topadi. Bu bosqich qaysi tilni o'qiyotganingizdan qat'i nazar bir xil, shuning uchun u bir marta (taxminan 12 MB) yuklanadi va qayta ishlatiladi.
  2. 2
    Skriptingiz uchun bitta tanuvchi yuklanadi
    Shakllarni o'qish skriptga bog'liq, shuning uchun tanlagan yozuv tizimi uchun ikkinchi model yuklab olinadi - ko'pchiligi uchun taxminan 8 MB, Koreys uchun 13 MB va Xitoy hamda Yapon uchun 17 MB. Lotin tanlash jami taxminan 19 MB'ni tashkil qiladi. Har biri keshlanadi, shuning uchun oldin ishlatgan skriptga qaytish hech narsa yuklamaydi.
  3. 3
    Har bir qator to'g'irlanadi va o'qiladi
    Har bir aniqlangan qator yo'nalish uchun tekshiriladi, kerak bo'lsa tik holatga aylantiriladi, so'ng tanuvchiga uzatiladi, u uni belgi-ma-belgi o'qiydi. O'qish tartibi keyin yuqoridan pastga, chapdan o'ngga tiklanadi, shuning uchun natija aniqlagich qutilarni topgan tartibi emas, ko'rinadigan tartibga mos keladi.
  4. 4
    Matn qutilar va ishonch darajasi bilan qaytadi
    Har bir qator ishonch darajasi va u kelib chiqqan koordinatalarni o'z ichiga oladi, shuning uchun qayerdan nima o'qilganini aniq ko'rasiz va shu pozitsiyalarni saqlaydigan hOCR eksport qilishingiz mumkin. Toza, yuqori kontrastli matn 90%dan yuqori ball oladi; past aniqlik, yaltirash va qo'lyozma buni pasaytiradi.

Rasmlaringiz qurilmangizda qoladi - qayta ishlash uchun hatto vaqtincha ham yuklanmaydi. Model fayllarining o'zi bizning o'z serverimizdan yuklanadi, hech qachon uchinchi tomon CDN'idan emas. Shaxsiy guvohnoma hujjatlari, shartnomalar, tibbiy qog'ozlar yoki har qanday maxfiy kontentli matn uchun xavfsiz.

Tegishli asboblar

Ko'p so'raladigan savollar