Бесплатен OCR — извлекувач на текст од слика
Извлечете текст од слики, снимки на екранот, скенирани документи и PDF-датотеки (или зачувајте PDF со можност за пребарување) со PP-OCRv5, целосно во вашиот прелистувач. Чита латиница, кинески, јапонски, корејски, кирилица, арапски, деванагари, тајландски, грчки, тамилски и телугу писмо.
Многу онлајн OCR страници ограничуваат бесплатни страници на час или дневно — овде нема ограничување, а сликата останува на вашиот уред.
Спуштете ги датотеките овде или кликнете за да пребарувате
JPG, PNG, WebP, BMP, PDF, HEIC, HEIF · Нема ограничување на големината на датотеката
или притиснете Ctrl+V за да залепите од таблата со исечоци
Можете да испуштите повеќе датотеки одеднаш
Совет: можете да залепите слика од екран со Ctrl+V
Работат и скенирани PDF-датотеки: секоја страница се чита, а вие добивате PDF со можност за пребарување.
Вашите датотеки никогаш не го напуштаат уредот. Целата обработка се случува локално во вашиот прелистувач.
Како функционира
OCR (Оптичко препознавање карактери) овде работи со PP-OCRv5, отворен модел од проектот PaddleOCR, директно во вашиот прелистувач. Тој чита печатен текст од фотографија или скен без сликата да го напушти вашиот уред.
- 1Прво се наоѓаат текстуалните областиМодел за детекција ja скенира сликата и ги обиколува сите делови што личат на ред текст, работејќи на копија скалирана така што нејзиниот најдолг раб е околу 960 пиксели. Затоа фотографија од сметка функционира: моделот го лоцира текстот наместо да претпоставува дека целата слика е чиста страница. Оваа фаза е иста без оглед на јазикот што го читате, така што се презема еднаш - околу 12 MB - и се повторно користи.
- 2Еден препознавач се презема за вашето писмоЧитањето на облиците зависи од писмото, така што се презема втор модел за писмото што сте го избрале - околу 8 MB за повеќето, 13 MB за корејски и 17 MB за кинески и јапонски. Изборот на латиница чини околу 19 MB вкупно. Секој се кешира, така што враќањето на писмо што веќе сте го користеле не презема ништо.
- 3Секој ред се исправа и читаСекој откриен ред се проверува за ориентација, ротира исправено ако е потребно, потоа се проследува до препознавачот, кој го чита карактер по карактер. Редоследот на читање потоа се реконструира, од горе кон долу и од лево кон десно, така што излезот одговара на распоредот што го гледате, а не на редоследот по кој детекторот ги нашол полињата.
- 4Текстот се враќа со рамки и довербаСекој ред носи оценка на доверба и координатите од кои потекнува, за да можете точно да видите што е прочитано и од каде, и да извезете hOCR кој ги задржува тие позиции. Чист текст со висок контраст добива оценка над 90%; ниска резолуција, одблесок и ракопис ja намалуваат.
Вашите слики остануваат на вашиот уред - дури ни привремено не се прикачуваат за обработка. Самите датотеки на моделот се преземаат од нашиот сопствен сервер, никогаш од CDN на трета страна. Безбедно за лични документи, договори, медицинска документација, или каков било текст со чувствителна содржина.
Поврзани алатки
Извлекувач на рамки од видео
Снимете неподвижна слика од која било рамка на видео во полна резолуција. Лизгајте, чекор по чекор по рамки, и зачувајте како PNG или JPG. Веднаш и целосно во вашиот прелистувач.
Стеганографија на слика (криење текст во слика)
Скријте тајна текстуална порака во PNG користејќи стеганографија со најмалку значаен бит, со опционална AES-256-GCM енкрипција со лозинка. Извадете ја подоцна со истата алатка. Сè се извршува во вашиот прелистувач.
Извлекувач на палета на бои од слика
Извлечете ги доминантните бои од која било слика користејќи k-средства квантизација на бои. Добијте хекс кодови за топ 2-16 бои во вашата фотографија или лого.