LibraTool logoLibraTool

Бесплатен OCR — извлекувач на текст од слика

Извлечете текст од слики, снимки на екранот, скенирани документи и PDF-датотеки (или зачувајте PDF со можност за пребарување) со PP-OCRv5, целосно во вашиот прелистувач. Чита латиница, кинески, јапонски, корејски, кирилица, арапски, деванагари, тајландски, грчки, тамилски и телугу писмо.

Многу онлајн OCR страници ограничуваат бесплатни страници на час или дневно — овде нема ограничување, а сликата останува на вашиот уред.

Спуштете ги датотеките овде или кликнете за да пребарувате

JPG, PNG, WebP, BMP, PDF, HEIC, HEIF · Нема ограничување на големината на датотеката

или притиснете Ctrl+V за да залепите од таблата со исечоци

Можете да испуштите повеќе датотеки одеднаш

Прелистувајте датотеки

Совет: можете да залепите слика од екран со Ctrl+V

Работат и скенирани PDF-датотеки: секоја страница се чита, а вие добивате PDF со можност за пребарување.

Вашите датотеки никогаш не го напуштаат уредот. Целата обработка се случува локално во вашиот прелистувач.

Како функционира

OCR (Оптичко препознавање карактери) овде работи со PP-OCRv5, отворен модел од проектот PaddleOCR, директно во вашиот прелистувач. Тој чита печатен текст од фотографија или скен без сликата да го напушти вашиот уред.

  1. 1
    Прво се наоѓаат текстуалните области
    Модел за детекција ja скенира сликата и ги обиколува сите делови што личат на ред текст, работејќи на копија скалирана така што нејзиниот најдолг раб е околу 960 пиксели. Затоа фотографија од сметка функционира: моделот го лоцира текстот наместо да претпоставува дека целата слика е чиста страница. Оваа фаза е иста без оглед на јазикот што го читате, така што се презема еднаш - околу 12 MB - и се повторно користи.
  2. 2
    Еден препознавач се презема за вашето писмо
    Читањето на облиците зависи од писмото, така што се презема втор модел за писмото што сте го избрале - околу 8 MB за повеќето, 13 MB за корејски и 17 MB за кинески и јапонски. Изборот на латиница чини околу 19 MB вкупно. Секој се кешира, така што враќањето на писмо што веќе сте го користеле не презема ништо.
  3. 3
    Секој ред се исправа и чита
    Секој откриен ред се проверува за ориентација, ротира исправено ако е потребно, потоа се проследува до препознавачот, кој го чита карактер по карактер. Редоследот на читање потоа се реконструира, од горе кон долу и од лево кон десно, така што излезот одговара на распоредот што го гледате, а не на редоследот по кој детекторот ги нашол полињата.
  4. 4
    Текстот се враќа со рамки и доверба
    Секој ред носи оценка на доверба и координатите од кои потекнува, за да можете точно да видите што е прочитано и од каде, и да извезете hOCR кој ги задржува тие позиции. Чист текст со висок контраст добива оценка над 90%; ниска резолуција, одблесок и ракопис ja намалуваат.

Вашите слики остануваат на вашиот уред - дури ни привремено не се прикачуваат за обработка. Самите датотеки на моделот се преземаат од нашиот сопствен сервер, никогаш од CDN на трета страна. Безбедно за лични документи, договори, медицинска документација, или каков било текст со чувствителна содржина.

Поврзани алатки

Најчесто поставувани прашања