Back to results
Vysoké učení technické v Brně. Fakulta informačních technologií
Filtrování textů extrahovaných z PDF, OCR nebo webu
Abstract
dc:description.abstractPředmětem této práce je pomocí sadou skriptů zdokonalit převod různých typů dokumentů do čistě textové podoby. Převodem různých nástrojů dochází ke vzniku šumu a ne zcela korektním převodem znaků. Tyto skripty extrahovaný textový soubor vyčistí tak, aby výsledný text byl čitelný, dával smysl a neobsahoval zbytky různě vyskytujících se znaků z převodu grafů, tabulek, vzorců apod. Skript pracuje univerzálně a nevyžaduje vstup vzniklý pouze z nástrojů OCR nebo převodu z formátu PDF či webu.
Degree
thesis:*- Grantor dc:publisher
- Vysoké učení technické v Brně. Fakulta informačních technologií
Author and committee
dc:creator, dc:contributor.*- Author dc:creator
-
- Lehnert, Filip
- Advisor dc:contributor.advisor
-
- Szőke, Igor
Subjects
dc:subject × 18Rights
dc:rights- Statement dc:rights
-
- Standardní licenční smlouva - přístup k plnému textu bez omezení
- Language dc:language.iso
- cs
Identifiers
dc:identifier.*- Dc Identifier Other
- 78445
- OAI identifier oai:identifier
- oai:dspace.vut.cz:11012/187459