Aktuální OCR

Software potřebné k práci s elektronikou

Moderátor: Moderátoři

Odpovědět
Zpráva
Autor
Uživatelský avatar
Celeron
Příspěvky: 20508
Registrován: 02 dub 2011, 00:00
Bydliště: Nový Bydžov

Aktuální OCR

#1 Příspěvek od Celeron »

Potřebuju pro sebe a dva kámoše přeložit manuál oscanovanej do PDF. Ideální by bylo pokud by se zachoval formát grafiky a fotky jen se pod PDF texty podložila vrstva s ASCII texty. Adobe Acrobat Pro DC je placenej, ABBYY FineReader PDF taky.
V Google disku je něco podobnýho ale nějak mi to nefunguje. Prý je hodně dobrej Tesseract OCR, je free ale nějak mi nejde nainstalovat.
Co jinýho Free co by umělo textovou vrstvu a nebo PDF rovnou přehrnulo do Wordu a tam přeložit a zeditovat?
Jirka

Proč mi nemůže všechno chodit hned ?!!
Uživatelský avatar
Dekker
Příspěvky: 403
Registrován: 11 led 2017, 00:00

#2 Příspěvek od Dekker »

inscape umí otevřít PDF a pokud to nebude něco šílenýho a divnej font tak si i poradí s textem, jen to chce pak trpělivost s přepisováním. Akorát mívá trable s obrázky, že je zesvětluje pak při převodu zpět do PDF a tak postupně mizej
Uživatelský avatar
ok1hga
Příspěvky: 12600
Registrován: 28 lis 2006, 00:00
Bydliště: Česká Třebová

#3 Příspěvek od ok1hga »

Celeron píše:Prý je hodně dobrej Tesseract OCR, je free ale nějak mi nejde nainstalovat.
to můžu potvrdit, je dobrej, ale neumí češtinu . . .
používám ho ve spojení s irfanview
žádný problém s instalací jsem neměl.
Uživatelský avatar
Mikras
Příspěvky: 659
Registrován: 04 zář 2019, 00:00
Bydliště: Praha
Kontaktovat uživatele:

#4 Příspěvek od Mikras »

Na překlad různých, převážně technických mauálů v pdf používám tuto online službu.

Ohledně naskenovaného PDF doporučují tento postup:

Jak přeložit naskenovaný dokument?
Naskenovaný text můžete přeložit, ale nejprve musíte naskenovaný dokument převést do Wordu pomocí naší partnerské stránky PDF to Word Converter, která umožňuje převést naskenovaný dokument PDF, PNG a JPG pomocí OCR do dokumentu Word.


Je to zdarma a bez instalace, tak za zkoušku nic nedáš.

Pokud by šlo o něco maličkého a nezáleží na kráse, lze použít na MT aplikaci Translator, v ní dokument vyfotit a obrázek uložit, přeposlat nebo vytisknout.

Pokud se převod do textu podaří a jsou potřebné ještě nějaké korekce, používám SW Infix. Vyžaduje ale licenční klíč (našel jsem ho na netu).

Trochu se mi klepala ruka, tak to píše trošku nesmysly, ale zvládá mi to překládat i ručně psanou a špatně naskenovanou japonštinu :-D
Přílohy
CZ.jpg
CZ.jpg
EN.jpg
EN.jpg
Uživatelský avatar
Hape
Příspěvky: 825
Registrován: 08 úno 2010, 00:00
Bydliště: Dolní Cerekev, Česko (Czechia)
Kontaktovat uživatele:

#5 Příspěvek od Hape »

Já to pro vlastní potřebu dělám v online nástrojích Adobe.
Je to za cenu vytvoření účtu, ale z mé zkušenosti to má nejlepší výsledky.
Zdarma je tam ještě omezení na jeden dokument, nebo jedno použití nástroje za 30 dní. Mně se to ale podařilo nějak prolomit a dnes jsem na zkoušku převedl jeden vícestránkový soubor *.pdf na editovatelný *.docx a jeden jednostránkový skenovaný *.pdf jsem nejprve OCR nástrojem převedl na textový *.pdf a pak na editovatelný *.docx. Akorát ten jejich OCR nástroj při použití na češtinu odstraní háčky a čárky.
Pokud je převáděný originální (ne skenovaný) *.pdf a jsou v něm definovány nadpisy a záložky s odkazy na kapitoly a www odkazy, tak ty zůstanou v nově vytvořeném souboru *.docx funkční. Určité malé chyby se stávají u obrázků. Někdy to nevadí a když mi to vadí, tak ho nahradím obrázkem z originálu. Sice je to piplačka, ale jde to.
Pro editaci *.docx používám LibreOffice Writer. Microsoft Office nepoužívám a nikdy jsem je nepoužíval.
Jinak pro práci s *.pdf soubory ještě používám nástroje PDF24, ale jejich výsledky nejsou tak dobré, jako těch od Adobe.
Kdybys chtěl a ten tvůj soubor někam upnul ke stažení, tak bych ho zkusil těmi Adobe nástroji převést.
Uživatelský avatar
Hill
Administrátor
Příspěvky: 21230
Registrován: 10 zář 2004, 02:00
Bydliště: Jičín, Český ráj

#6 Příspěvek od Hill »

Nestěžuji si na OCR funkci v programu PDF XChange Viewer (od Tracker Software), je to alternativa k AcroReaderu. Na to, že je zdarma, umí toho moc, včetně vestavěné funkce OCR, která podloží PDF textovou vrstvou, přičemž rozeznává i češtinu.
A pak to označím a zkopíruji holý text do některých ofifficů nebo do poznámkového bloku.
Uživatelský avatar
eleferner
Příspěvky: 894
Registrován: 04 čer 2016, 00:00
Bydliště: Brno

#7 Příspěvek od eleferner »

Ja na ty moje skeny manualu pouzivam skript OCRmyPDF:

https://ocrmypdf.readthedocs.io/en/latest/

Je free a jako zaklad pouziva TesseractOCR. ok1hga neposlouchej, samozrejme cestinu umi a velice dobre, vyrazne lepe nez treba Adobe Acrobat XI. Tady ma vyhodu v tom, ze pro textovou vrstvu pouziva tzv. glyphless font. Diky tomu vysledne soubory tolik nenabydou a take se rychleji renderuji.

Hlavni nevyhodou je, ze se ovlada jen z prikazove radky a blbe se instaluje. Na Linuxu je to jednodussi, staci (jako admin) pastnout par prikazu podle navodu vyse. Na Windows je nutne nektere komponenty doinstalovat rucne, ale jde to, zkousel jsem to.
Uživatelský avatar
Hill
Administrátor
Příspěvky: 21230
Registrován: 10 zář 2004, 02:00
Bydliště: Jičín, Český ráj

#8 Příspěvek od Hill »

Každý OCR program je jinak dobrý a jinak špatný. Takže záleží na tom,
Jak jsem se zmínil o tom PDF-X-Change Vieweru, tak ten je dobrý na zkopírování pouze textu. PDF v 300 dpi interpretuje bezchybně, i když je tištěný petitem (odpovídá patkovému písmu velikosti 6 v libovolných Officech). Textovým nástrojem stačí pak označit text a zkopírovat ho jinam.
Obrázky a tabulky je nutné vykopírovat zvlášť.
A ještě jsem narazil na nedostatek - verze pro Win7 nemá problém ani s výběrem čísla jediné stránky, o kterou je zájem, zatímco novější verze pro Win10 potřebuje vybrat nejméně 2 stránky, jinak jen nahlásí, že narastroval text, ale rozeznávání jsem se nedočkal.

Občas použiju i ABBYY FineReader Sprint. Nejlepší výsledky dává s PDF v rozlišení 300, někdy dokonce ponechá použitelné formátování textu na velikost stránky A4. Ale jinak to formátování dokáže zparchantit dost nepříjemně - zvlášť u dvou- či třísloupcového tisku je z toho bezradný a musí se jednak hodně cvičit s posuvníky na pravítkách ve Wordu, jednak i s velikostí a fonty, než z toho bude použitelný *.doc(x)
U textů na dvě tři stránky bývá výhodnější zkopírovat jen obrázky a překlad napsat celý ručně.
masar
Příspěvky: 14452
Registrován: 03 pro 2005, 00:00

#9 Příspěvek od masar »

Hill píše:...
A ještě jsem narazil na nedostatek - verze pro Win7 nemá problém ani s výběrem čísla jediné stránky, o kterou je zájem, zatímco novější verze pro Win10 potřebuje vybrat nejméně 2 stránky, jinak jen nahlásí, že narastroval text, ale rozeznávání jsem se nedočkal...
Na Win11 žádný takový problém není a nesetkal jsem se s ním ani v minulosti na Win10.
PDF-XChange Editor 10.3.1.387
:wink:
Uživatelský avatar
Hill
Administrátor
Příspěvky: 21230
Registrován: 10 zář 2004, 02:00
Bydliště: Jičín, Český ráj

#10 Příspěvek od Hill »

Jenže píšu o vieweru, nikoli o editoru.
masar
Příspěvky: 14452
Registrován: 03 pro 2005, 00:00

#11 Příspěvek od masar »

To jsem přehlídl, pardon. :oops:
Uživatelský avatar
JirkaZ
Příspěvky: 3650
Registrován: 26 úno 2021, 00:00

#12 Příspěvek od JirkaZ »

Tesseract samozřejmě češtinu umí, je třeba ji (případně) doinstalovat.

Jo a k Tesseractu je víc než vhodné nějaké grafické rozhraní (GUI), viz třeba zde.
Kdo chce, hledá způsob;
kdo ne - hledá důvod.

Ze dvou možností často volím tu třetí.
Uživatelský avatar
Celeron
Příspěvky: 20508
Registrován: 02 dub 2011, 00:00
Bydliště: Nový Bydžov

#13 Příspěvek od Celeron »

Mikras píše:Na překlad různých, převážně technických mauálů v pdf používám tuto online službu.
Zkusil jsem PDF datasheet ATtiny84 převýst přes tuhle službu do DOC. Staženej soubor se neotevře, hlásí spoustu neopravitelných chyb. Ať zkusím převýst cokoliv, vždy to skončí stejně. Office 2007.
Jirka

Proč mi nemůže všechno chodit hned ?!!
Odpovědět

Zpět na „Software“