Scanování manuálu, OCR a překlad
Moderátor: Moderátoři
Scanování manuálu, OCR a překlad
Takže se ptám, jak na to nejlíp. Zkusil jsem oscanovat pár stran do html, že bych to pak přeložil přímo v Maxthon prohlížeči ale je tam nějaká nekompatibilita a dělá to hroznej guláš s formátem. OCR to umí přímo do HTML, Corel word perfect 8, Word Pad. Corela nemám, takže zbývá jen ten WorldPad. Ovšem narazil jsem na problém v HP-čkový OCR, využívá jen 300 DPI a US engl si plete c, o a dalších pár podobných znaků. Bohužel učící režim nemá, je to jen takovej blb, co má pouze nastavení kolik sloupců. Výstup je RTF. Takže to znamená vše projít , opravit a naformátovat. Pak přeložit, opravit a finál poskládat s obrázky v Word 2007.
Není nějaká jiná cesta? Hlavně s lepší OCR, kde by se daly vyladit ty sporný znaky? HP umí vygenerovat všechny klasický grafický formáty v rozlišení až 9600.
Nechci žádný teorie, ale rady od lidí, kteří tohle už někdy dělali.
Díky
Jirka
Ak sa da manual rozobrat na jednotlive listy, tak dost pomoze skener s automatickym podavacom (a pripadne duplexom).
- serviceman
- Příspěvky: 4093
- Registrován: 09 črc 2013, 00:00
Zkusím toho ABBYY jestli to nebude lepší.
Díky za tip.
to servicemann: Ty 2 programy jsou nějaký vylepšovače kontůr písma a čističe pozadí písma?
Jirka
- serviceman
- Příspěvky: 4093
- Registrován: 09 črc 2013, 00:00
Jinak, Finereader pracuje s 300dpi, takže nemá cenu ztrácet čas s vyšším rozlišením. Lépe nežli černobíle, je také scanovat text ve stupních šedi. Na ebookforum.sk jsou podrobné návody, nebo v ruštině zde.
Nakonec to vypadá, že funguje původní cesta přes HP scaner s OCR do RTF. Předloha je velmi kvalitní a moc chyb nenaseká. Natvrto blbne na will kdy dává 2 jedničky a občas zablbnou tabelátory, pomlčky, přidá mezeru ve slově a projeví se kazy tisku. S kolmostí problém není, scaner má boční vodítko. RTF natáhnu do Word 2007, srovnám odstavce a tabelace, vyházím obrázky a zapnu US pravopis a ten mi najde všechny chyby scanu, který pak opravím. To je dost zásadní věc. Pak si s tím až na pár složenin a američtin už strejda Gůgl poradí. Už mám slíznutých a opravených kolem 2/3 manuálu. Až to bude celý přeložený, přidám do toho nákresy a obrázky a půjdu zkoumat, co ten Gould vlastně všechno umí. Už teď vím, že je o dost lepší než Schlumberger 7600, co jsem měl. Nejvíc mě překvapilo, že má dissas na 48, 51, 85, 86, Z80, 96, M68, co podle prodávajícího nemá.
to serviceman: Scanování obrázků na 600 DPI je strašně pomalý a ještě jede 2x ale naštěstí je jich tam jen pár. Zkusím ten ScanTailor na vyčištění obrázků. A propo, umí to nebo jen text?
Díky všem za snahu pomoci.
Jirka