Back to results

Vysoké učení technické v Brně. Fakulta informačních technologií

Filtrování textů extrahovaných z PDF, OCR nebo webu

Abstract

dc:description.abstract

Předmětem této práce je pomocí sadou skriptů zdokonalit převod různých typů dokumentů do čistě textové podoby. Převodem různých nástrojů dochází ke vzniku šumu a ne zcela korektním převodem znaků. Tyto skripty extrahovaný textový soubor vyčistí tak, aby výsledný text byl čitelný, dával smysl a neobsahoval zbytky různě vyskytujících se znaků z převodu grafů, tabulek, vzorců apod. Skript pracuje univerzálně a nevyžaduje vstup vzniklý pouze z nástrojů OCR nebo převodu z formátu PDF či webu.

Degree

thesis:*
Grantor dc:publisher
Vysoké učení technické v Brně. Fakulta informačních technologií

Author and committee

dc:creator, dc:contributor.*
Author dc:creator
  • Lehnert, Filip
Advisor dc:contributor.advisor
  • Szőke, Igor

Subjects

dc:subject × 18

Rights

dc:rights
Statement dc:rights
  • Standardní licenční smlouva - přístup k plnému textu bez omezení
Language dc:language.iso
cs

Identifiers

dc:identifier.*
Dc Identifier Other
78445
OAI identifier oai:identifier
oai:dspace.vut.cz:11012/187459

Chain of custody

source
Harvested from
Brno University of Technology
Base URL
dspace.vut.cz/oai/request
Last updated
2026-07-24
Source record
OAI-PMH GetRecord
citation

Lehnert, Filip. Filtrování textů extrahovaných z PDF, OCR nebo webu. Vysoké učení technické v Brně. Fakulta informačních technologií, http://hdl.handle.net/11012/187459