Stránka 46 z 115
Napsal: 21 srp 2010, 07:59
od PvvS
Tohle se da nekde sehnat primo na netu, nebo jsem to videl i jako aplikaci. Jak prijdu dom, tak se rozhlidnu po disku.
Napsal: 21 srp 2010, 21:08
od Jirka
EKKAR píše:Můžu Ti to otevřít v Adobe a nadělat printscreeny z obrazovky.... Ale nezaručím, že o bude mít 300dpi.
Tak zkus udělat jednu stránku s obsahem a pošli ji. Uvidím, jestli to půjde. Ale obávám se, že je to hodně komprimovaný, takže to stejně OCR nerozluští.
Napsal: 21 srp 2010, 23:44
od masar
EKKAR píše:Můžu Ti to otevřít v Adobe a nadělat printscreeny z obrazovky.... Ale nezaručím, že o bude mít 300dpi.
To teda nevím, jak to může řešit problém. Zobrazením skenu na obrazovce se přece množství informace nezvýší.

Napsal: 22 srp 2010, 08:01
od PvvS
Napsal: 22 srp 2010, 09:34
od masar
To
Pvvs:
Jirka chce něco jiného - převod originálních naskenovaných obsahů, tj. bitmapových souborů, do textových souborů pomocí OCR programu. K tomu potřebuje kvalitní sken (pro zlepšení rozpoznatelnosti znaků pro OCR) a dobrý OCR program, aby výsledek byl "k nerozeznání" od původního skenu a přitom to byl textový pdf soubor.

Napsal: 22 srp 2010, 10:13
od Cust
masar píše:EKKAR píše:Můžu Ti to otevřít v Adobe a nadělat printscreeny z obrazovky.... Ale nezaručím, že o bude mít 300dpi.
To teda nevím, jak to může řešit problém. Zobrazením skenu na obrazovce se přece množství informace nezvýší.

Úplně v pohodě, stačí extrapolovat...
Pak ještě můžeš použít gassovské rozmazání a nakonec převod do B/W (1 bit na barvu) aby neměl OCR tak velké problémy.

Napsal: 22 srp 2010, 10:39
od Cust
Třeba takhle, ale je fakt, že původní JPG je tak mizerný, že s tím nic rozumného udělat nepůjde...
Napsal: 22 srp 2010, 11:39
od masar
Myslím, že ve výsledku těch informací je ještě méně. Tady se jedná spíše o princip, že "méně znamená více". Tedy jakousi filtraci "nežádoucích" informací z původního skenu, aby se to mohlo OCR předat na zlatém podnose.
p.s. Nebo je to spíše dodatečná výroba nových informací. Jeden původní pixel, který nese "spornou" informaci rozdělím na čtyři díly (zvětším rozlišení 2x) a pak s novými hraničními pixely provádím různé operace (ostření, zmenšení počtu barev atd.), jejichž výsledek je pro OCR lépe stravitelný.

Napsal: 22 srp 2010, 17:35
od Cust
hlasuji pro dodatečnou výrobu nových informací

Napsal: 22 srp 2010, 20:58
od Jirka
Přesně tak. Potřebuju z toho dostat text. Aby bylo po převodu nejméně chyb, tak musí být docela kvalitní, proto těch 300 DPI. Jinak to nejde ...
Napsal: 22 srp 2010, 21:01
od Crifodo
proč vůbec potřebuješ ty stránky v datové podobě a ne v bitmapě nebo dokonce na papíře? Budeš snad ty články editovat?
Napsal: 22 srp 2010, 21:27
od masar
Podle mně je to snaha vytvořit ze skenu dokonalé podklady takové, jaké jsou běžné u dnes tištěných AR. Navíc je tady větší možnost vyhledat libovolné slovo, což se od obsahů očekává nejvíce.

Napsal: 22 srp 2010, 21:49
od Jirka
Kvůli vyhledávání. Asi každý tady máme starší AR v PDF, ale jak v nich něco konkrétního vyhledat?
Napsal: 22 srp 2010, 21:59
od Crifodo
Obsahy časopisů většinou jsou na webu v datové podobě. Celé články z doby elektronické sazby asi mají redakce v archivech a zřejmě by vyhledávání byly schopné nabídnout jako placenou službu. Informace z 20-30 let starých časopisů, které jsou ještě dneska užitečné, to je zajímavý úkaz.
Kvalitní sken a OCR s následnou korekcí bych si tipnul jako časově stejně náročný jako přepsání písařkou, navíc časopisecké články málokdy mají hladkou jednosloupcovou sazbu na stránce jako román. Spíš tři sloupce a složitou osnovu prokládanou schématy a tabulkama, grafy, rovnice s řeckou abecedou, přesahy přes víc stránek nebo i čísel na pokračování. Dost článků v AR mívalo šedý podtisk. To všechno by OCR dalo pěkně zabrat.
Napsal: 22 srp 2010, 22:23
od masar
Crifodo píše:...Informace z 20-30 let starých časopisů, které jsou ještě dneska užitečné, to je zajímavý úkaz...
Nevidím na tom nic "zajímavého" v tom pejorativním slova smyslu. Informace z těchto (i starších) časopisů, pokud jsou pravdivé, svou cenu neztrácejí, spíše naopak.
