Stránka 46 z 115

Napsal: 21 srp 2010, 07:59
od PvvS
Tohle se da nekde sehnat primo na netu, nebo jsem to videl i jako aplikaci. Jak prijdu dom, tak se rozhlidnu po disku.

Napsal: 21 srp 2010, 21:08
od Jirka
EKKAR píše:Můžu Ti to otevřít v Adobe a nadělat printscreeny z obrazovky.... Ale nezaručím, že o bude mít 300dpi.

Tak zkus udělat jednu stránku s obsahem a pošli ji. Uvidím, jestli to půjde. Ale obávám se, že je to hodně komprimovaný, takže to stejně OCR nerozluští.

Napsal: 21 srp 2010, 23:44
od masar
EKKAR píše:Můžu Ti to otevřít v Adobe a nadělat printscreeny z obrazovky.... Ale nezaručím, že o bude mít 300dpi.

To teda nevím, jak to může řešit problém. Zobrazením skenu na obrazovce se přece množství informace nezvýší. :wink:

Napsal: 22 srp 2010, 08:01
od PvvS

Napsal: 22 srp 2010, 09:34
od masar
To Pvvs: Jirka chce něco jiného - převod originálních naskenovaných obsahů, tj. bitmapových souborů, do textových souborů pomocí OCR programu. K tomu potřebuje kvalitní sken (pro zlepšení rozpoznatelnosti znaků pro OCR) a dobrý OCR program, aby výsledek byl "k nerozeznání" od původního skenu a přitom to byl textový pdf soubor. :wink:

Napsal: 22 srp 2010, 10:13
od Cust
masar píše:
EKKAR píše:Můžu Ti to otevřít v Adobe a nadělat printscreeny z obrazovky.... Ale nezaručím, že o bude mít 300dpi.

To teda nevím, jak to může řešit problém. Zobrazením skenu na obrazovce se přece množství informace nezvýší. :wink:
Úplně v pohodě, stačí extrapolovat...
Pak ještě můžeš použít gassovské rozmazání a nakonec převod do B/W (1 bit na barvu) aby neměl OCR tak velké problémy. ;-)

Napsal: 22 srp 2010, 10:39
od Cust
Třeba takhle, ale je fakt, že původní JPG je tak mizerný, že s tím nic rozumného udělat nepůjde...

Napsal: 22 srp 2010, 11:39
od masar
Myslím, že ve výsledku těch informací je ještě méně. Tady se jedná spíše o princip, že "méně znamená více". Tedy jakousi filtraci "nežádoucích" informací z původního skenu, aby se to mohlo OCR předat na zlatém podnose. :wink:

p.s. Nebo je to spíše dodatečná výroba nových informací. Jeden původní pixel, který nese "spornou" informaci rozdělím na čtyři díly (zvětším rozlišení 2x) a pak s novými hraničními pixely provádím různé operace (ostření, zmenšení počtu barev atd.), jejichž výsledek je pro OCR lépe stravitelný. :wink:

Napsal: 22 srp 2010, 17:35
od Cust
hlasuji pro dodatečnou výrobu nových informací :-)

Napsal: 22 srp 2010, 20:58
od Jirka
Přesně tak. Potřebuju z toho dostat text. Aby bylo po převodu nejméně chyb, tak musí být docela kvalitní, proto těch 300 DPI. Jinak to nejde ...

Napsal: 22 srp 2010, 21:01
od Crifodo
proč vůbec potřebuješ ty stránky v datové podobě a ne v bitmapě nebo dokonce na papíře? Budeš snad ty články editovat?

Napsal: 22 srp 2010, 21:27
od masar
Podle mně je to snaha vytvořit ze skenu dokonalé podklady takové, jaké jsou běžné u dnes tištěných AR. Navíc je tady větší možnost vyhledat libovolné slovo, což se od obsahů očekává nejvíce. :wink:

Napsal: 22 srp 2010, 21:49
od Jirka
Kvůli vyhledávání. Asi každý tady máme starší AR v PDF, ale jak v nich něco konkrétního vyhledat?

Napsal: 22 srp 2010, 21:59
od Crifodo
Obsahy časopisů většinou jsou na webu v datové podobě. Celé články z doby elektronické sazby asi mají redakce v archivech a zřejmě by vyhledávání byly schopné nabídnout jako placenou službu. Informace z 20-30 let starých časopisů, které jsou ještě dneska užitečné, to je zajímavý úkaz.
Kvalitní sken a OCR s následnou korekcí bych si tipnul jako časově stejně náročný jako přepsání písařkou, navíc časopisecké články málokdy mají hladkou jednosloupcovou sazbu na stránce jako román. Spíš tři sloupce a složitou osnovu prokládanou schématy a tabulkama, grafy, rovnice s řeckou abecedou, přesahy přes víc stránek nebo i čísel na pokračování. Dost článků v AR mívalo šedý podtisk. To všechno by OCR dalo pěkně zabrat.

Napsal: 22 srp 2010, 22:23
od masar
Crifodo píše:...Informace z 20-30 let starých časopisů, které jsou ještě dneska užitečné, to je zajímavý úkaz...
Nevidím na tom nic "zajímavého" v tom pejorativním slova smyslu. Informace z těchto (i starších) časopisů, pokud jsou pravdivé, svou cenu neztrácejí, spíše naopak. :wink: