Акысыз OCR — Сүрөттөн текст чыгаруучу

Сүрөттөрдөн, скриншоттордон, сканерленген документтерден жана PDF'тен текст чыгарыңыз (же издөөгө жарактуу PDF сактаңыз). PP-OCRv5 толугу менен браузериңизде иштейт. Латын, кытай, жапон, корей, кирилл, араб, деванагари, тай, грек, тамил жана телугу жазууларын окийт.

Көптөгөн онлайн OCR сайттары акысыз баракты саатына же күнүнө чектейт — бул жерде чек жок, сүрөт түзмөгүңүздө калат.

Файлдарды бул жерге таштаңыз же серептөө үчүн чыкылдатыңыз

JPG, PNG, WebP, BMP, PDF, HEIC, HEIF · Файлдын өлчөмүнө чектөө жок

же буферден коюу үчүн Ctrl+V басыңыз

Сиз бир эле учурда бир нече файлды таштай аласыз

Файлдарды карап чыгуу

Кеңеш: скриншотту Ctrl+V менен чаптасаңыз болот

Scanned PDFs work too: every page is read, and you get a searchable PDF back.

Файлдарыңыз түзмөгүңүздөн эч качан кетпейт. Бардык иштетүүлөр браузериңизде локалдуу түрдө ишке ашат.

Бул кантип иштейт

Бул жердеги OCR (Оптикалык Символ Тааныгыч) PaddleOCR долбоорунан ачык булактуу модель топтому болгон PP-OCRv5'ти түз браузериңизде иштетет. Ал сүрөт же скандан басма текстти сүрөт эч качан түзмөгүңүздөн чыкпастан окуйт.

  1. 1
    Алгач текст аймактары табылат
    Аныктоо модели сүрөттү карап, текст сабы сыяктуу көрүнгөн ар бир аймакты белгилейт, эң узун четин болжол менен 960 пикселге масштабдалган көчүрмөдө иштейт. Ошондуктан бул чек баракчанын сүрөтү иштейт: модель бүт сүрөттү таза бет деп болжолдоонун ордуна текстти табат. Бул этап кайсы тил окулуп жатканына карабай бирдей, ошондуктан ал бир жолу жүктөлөт — болжол менен 12 МБ — жана кайра колдонулат.
  2. 2
    Жазуу тутумуңуз үчүн бир тааныгыч жүктөлөт
    Формаларды окуу жазуу тутумуна тиешелүү болгондуктан, тандаган жазуу тутумуңуз үчүн экинчи модель жүктөлөт — көпчүлүгү үчүн болжол менен 8 МБ, корей тили үчүн 13 МБ, кытай жана япон тилдери үчүн 17 МБ. Латынды тандоо жалпы болжол менен 19 МБ турат. Ар бири кэштелет, ошондуктан мурда колдонгон жазуу тутумуңузга кайтуу эч нерсе жүктөбөйт.
  3. 3
    Ар бир сап түзөтүлүп окулат
    Табылган ар бир сап багыты боюнча текшерилип, керек болсо туурасынан оң абалга бурулуп, андан кийин тааныгычка берилет, ал аны символ боюнча окуйт. Окуу иреттиги кийин калыбына келтирилет, жогорудан төмөн жана солдон оң, ошондуктан жыйынтык аныктагыч кутучаларды таап калган иретинин ордуна сиз көргөн жайгаштыруу менен дал келет.
  4. 4
    Текст кутучалар жана ишенимдүүлүк менен кайтарылат
    Ар бир сап ишенимдүүлүк баллын жана ал алынган координаттарды алып жүрөт, ошондуктан эмне кайдан окулганын так көрөсүз жана ошол абалдарды сактаган hOCR экспорттой аласыз. Таза, жогорку контрасттуу текст 90%дан жогору упай алат; төмөн ажыратымдуулук, жаркыроо жана кол жазма аны түшүрөт.

Сүрөттөрүңүз түзмөгүңүздө калат — иштетүү үчүн убактылуу да жүктөлбөйт. Модель файлдары биздин өз серверибизден жүктөлөт, эч качан үчүнчү тараптын CDN'инен эмес. ID документтери, келишимдер, медициналык кагаздар же купуя мазмуну бар каалаган текст үчүн коопсуз.

Байланыштуу куралдар

Көп берилүүчү суроолор