Stránka 1 z 1

Aktuální OCR

Napsal: 12 srp 2024, 11:57
od Celeron
Potřebuju pro sebe a dva kámoše přeložit manuál oscanovanej do PDF. Ideální by bylo pokud by se zachoval formát grafiky a fotky jen se pod PDF texty podložila vrstva s ASCII texty. Adobe Acrobat Pro DC je placenej, ABBYY FineReader PDF taky.
V Google disku je něco podobnýho ale nějak mi to nefunguje. Prý je hodně dobrej Tesseract OCR, je free ale nějak mi nejde nainstalovat.
Co jinýho Free co by umělo textovou vrstvu a nebo PDF rovnou přehrnulo do Wordu a tam přeložit a zeditovat?

Napsal: 12 srp 2024, 12:53
od Dekker
inscape umí otevřít PDF a pokud to nebude něco šílenýho a divnej font tak si i poradí s textem, jen to chce pak trpělivost s přepisováním. Akorát mívá trable s obrázky, že je zesvětluje pak při převodu zpět do PDF a tak postupně mizej

Napsal: 12 srp 2024, 12:59
od ok1hga
Celeron píše:Prý je hodně dobrej Tesseract OCR, je free ale nějak mi nejde nainstalovat.
to můžu potvrdit, je dobrej, ale neumí češtinu . . .
používám ho ve spojení s irfanview
žádný problém s instalací jsem neměl.

Napsal: 12 srp 2024, 13:08
od Mikras
Na překlad různých, převážně technických mauálů v pdf používám tuto online službu.

Ohledně naskenovaného PDF doporučují tento postup:

Jak přeložit naskenovaný dokument?
Naskenovaný text můžete přeložit, ale nejprve musíte naskenovaný dokument převést do Wordu pomocí naší partnerské stránky PDF to Word Converter, která umožňuje převést naskenovaný dokument PDF, PNG a JPG pomocí OCR do dokumentu Word.


Je to zdarma a bez instalace, tak za zkoušku nic nedáš.

Pokud by šlo o něco maličkého a nezáleží na kráse, lze použít na MT aplikaci Translator, v ní dokument vyfotit a obrázek uložit, přeposlat nebo vytisknout.

Pokud se převod do textu podaří a jsou potřebné ještě nějaké korekce, používám SW Infix. Vyžaduje ale licenční klíč (našel jsem ho na netu).

Trochu se mi klepala ruka, tak to píše trošku nesmysly, ale zvládá mi to překládat i ručně psanou a špatně naskenovanou japonštinu :-D

Napsal: 12 srp 2024, 18:52
od Hape
Já to pro vlastní potřebu dělám v online nástrojích Adobe.
Je to za cenu vytvoření účtu, ale z mé zkušenosti to má nejlepší výsledky.
Zdarma je tam ještě omezení na jeden dokument, nebo jedno použití nástroje za 30 dní. Mně se to ale podařilo nějak prolomit a dnes jsem na zkoušku převedl jeden vícestránkový soubor *.pdf na editovatelný *.docx a jeden jednostránkový skenovaný *.pdf jsem nejprve OCR nástrojem převedl na textový *.pdf a pak na editovatelný *.docx. Akorát ten jejich OCR nástroj při použití na češtinu odstraní háčky a čárky.
Pokud je převáděný originální (ne skenovaný) *.pdf a jsou v něm definovány nadpisy a záložky s odkazy na kapitoly a www odkazy, tak ty zůstanou v nově vytvořeném souboru *.docx funkční. Určité malé chyby se stávají u obrázků. Někdy to nevadí a když mi to vadí, tak ho nahradím obrázkem z originálu. Sice je to piplačka, ale jde to.
Pro editaci *.docx používám LibreOffice Writer. Microsoft Office nepoužívám a nikdy jsem je nepoužíval.
Jinak pro práci s *.pdf soubory ještě používám nástroje PDF24, ale jejich výsledky nejsou tak dobré, jako těch od Adobe.
Kdybys chtěl a ten tvůj soubor někam upnul ke stažení, tak bych ho zkusil těmi Adobe nástroji převést.

Napsal: 12 srp 2024, 20:07
od Hill
Nestěžuji si na OCR funkci v programu PDF XChange Viewer (od Tracker Software), je to alternativa k AcroReaderu. Na to, že je zdarma, umí toho moc, včetně vestavěné funkce OCR, která podloží PDF textovou vrstvou, přičemž rozeznává i češtinu.
A pak to označím a zkopíruji holý text do některých ofifficů nebo do poznámkového bloku.

Napsal: 12 srp 2024, 21:06
od eleferner
Ja na ty moje skeny manualu pouzivam skript OCRmyPDF:

https://ocrmypdf.readthedocs.io/en/latest/

Je free a jako zaklad pouziva TesseractOCR. ok1hga neposlouchej, samozrejme cestinu umi a velice dobre, vyrazne lepe nez treba Adobe Acrobat XI. Tady ma vyhodu v tom, ze pro textovou vrstvu pouziva tzv. glyphless font. Diky tomu vysledne soubory tolik nenabydou a take se rychleji renderuji.

Hlavni nevyhodou je, ze se ovlada jen z prikazove radky a blbe se instaluje. Na Linuxu je to jednodussi, staci (jako admin) pastnout par prikazu podle navodu vyse. Na Windows je nutne nektere komponenty doinstalovat rucne, ale jde to, zkousel jsem to.

Napsal: 13 srp 2024, 08:41
od Hill
Každý OCR program je jinak dobrý a jinak špatný. Takže záleží na tom,
Jak jsem se zmínil o tom PDF-X-Change Vieweru, tak ten je dobrý na zkopírování pouze textu. PDF v 300 dpi interpretuje bezchybně, i když je tištěný petitem (odpovídá patkovému písmu velikosti 6 v libovolných Officech). Textovým nástrojem stačí pak označit text a zkopírovat ho jinam.
Obrázky a tabulky je nutné vykopírovat zvlášť.
A ještě jsem narazil na nedostatek - verze pro Win7 nemá problém ani s výběrem čísla jediné stránky, o kterou je zájem, zatímco novější verze pro Win10 potřebuje vybrat nejméně 2 stránky, jinak jen nahlásí, že narastroval text, ale rozeznávání jsem se nedočkal.

Občas použiju i ABBYY FineReader Sprint. Nejlepší výsledky dává s PDF v rozlišení 300, někdy dokonce ponechá použitelné formátování textu na velikost stránky A4. Ale jinak to formátování dokáže zparchantit dost nepříjemně - zvlášť u dvou- či třísloupcového tisku je z toho bezradný a musí se jednak hodně cvičit s posuvníky na pravítkách ve Wordu, jednak i s velikostí a fonty, než z toho bude použitelný *.doc(x)
U textů na dvě tři stránky bývá výhodnější zkopírovat jen obrázky a překlad napsat celý ručně.

Napsal: 13 srp 2024, 11:29
od masar
Hill píše:...
A ještě jsem narazil na nedostatek - verze pro Win7 nemá problém ani s výběrem čísla jediné stránky, o kterou je zájem, zatímco novější verze pro Win10 potřebuje vybrat nejméně 2 stránky, jinak jen nahlásí, že narastroval text, ale rozeznávání jsem se nedočkal...
Na Win11 žádný takový problém není a nesetkal jsem se s ním ani v minulosti na Win10.
PDF-XChange Editor 10.3.1.387
:wink:

Napsal: 14 srp 2024, 07:31
od Hill
Jenže píšu o vieweru, nikoli o editoru.

Napsal: 14 srp 2024, 08:01
od masar
To jsem přehlídl, pardon. :oops:

Napsal: 15 srp 2024, 21:57
od JirkaZ
Tesseract samozřejmě češtinu umí, je třeba ji (případně) doinstalovat.

Jo a k Tesseractu je víc než vhodné nějaké grafické rozhraní (GUI), viz třeba zde.

Napsal: 16 srp 2024, 18:54
od Celeron
Mikras píše:Na překlad různých, převážně technických mauálů v pdf používám tuto online službu.
Zkusil jsem PDF datasheet ATtiny84 převýst přes tuhle službu do DOC. Staženej soubor se neotevře, hlásí spoustu neopravitelných chyb. Ať zkusím převýst cokoliv, vždy to skončí stejně. Office 2007.