{"id":{"repo_id":"brno-tech","oai_identifier":"oai:dspace.vut.cz:11012/187459"},"canonical_url":"https://search.dev.ndltd.org/etd/brno-tech/oai:dspace.vut.cz:11012/187459","repository":{"repo_id":"brno-tech","name":"Brno University of Technology","base_url":"https://dspace.vut.cz/oai/request"},"display":{"title":"Filtrování textů extrahovaných z PDF, OCR nebo webu","abstract":"Předmětem této práce je pomocí sadou skriptů zdokonalit převod různých typů dokumentů do čistě textové podoby. Převodem různých nástrojů dochází ke vzniku šumu a ne zcela korektním převodem znaků. Tyto skripty extrahovaný textový soubor vyčistí tak, aby výsledný text byl čitelný, dával smysl a neobsahoval zbytky různě vyskytujících se znaků z převodu grafů, tabulek, vzorců apod. Skript pracuje univerzálně a nevyžaduje vstup vzniklý pouze z nástrojů OCR nebo převodu z formátu PDF či webu.","abstract_html":"Předmětem této práce je pomocí sadou skriptů zdokonalit převod různých typů dokumentů do čistě textové podoby. Převodem různých nástrojů dochází ke vzniku šumu a ne zcela korektním převodem znaků. Tyto skripty extrahovaný textový soubor vyčistí tak, aby výsledný text byl čitelný, dával smysl a neobsahoval zbytky různě vyskytujících se znaků z převodu grafů, tabulek, vzorců apod. Skript pracuje univerzálně a nevyžaduje vstup vzniklý pouze z nástrojů OCR nebo převodu z formátu PDF či webu.","abstract_has_math":false,"creators":["Lehnert, Filip"],"institution":"Vysoké učení technické v Brně. Fakulta informačních technologií","degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":["Szőke, Igor"],"committee_chairs":[],"committee_members":[],"year":null,"date_issued":"","date_published":null,"updated_at":"2026-07-24T01:22:12Z","subjects":["filtrovat","extrahovat","PDF","OCR","čistý text","slovník","gramatická pravidla","skripty","filtrování dat","převod dat","filter","extract","plain text","dictionary","grammar rules","scripts","filtering data","data conversion"],"languages":["cs"],"rights":["Standardní licenční smlouva - přístup k plnému textu bez omezení"],"rights_urls":[],"identifier_entries":[{"key":"dc:identifier.other","label":"Dc Identifier Other","values":["78445"],"render_values":[{"text":"78445","href":null,"code":true}]}]},"links":{"outbound_url":"http://hdl.handle.net/11012/187459","outbound_label":"Handle","outbound_source":"dc:identifier.uri"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:contributor.advisor","label":"Advisor","values":["Szőke, Igor"]},{"key":"dc:creator","label":"Author","values":["Lehnert, Filip"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:publisher","label":"Institution","values":["Vysoké učení technické v Brně. Fakulta informačních technologií"]},{"key":"dc:type","label":"Dc Type","values":["Text"]},{"key":"thesis:institution_name","label":"Thesis Institution Name","values":["Bc."]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["filtrovat","extrahovat","PDF","OCR","čistý text","slovník","gramatická pravidla","skripty","filtrování dat","převod dat","filter","extract","plain text","dictionary","grammar rules","scripts","filtering data","data conversion"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language.iso","label":"Language (ISO)","values":["cs"]},{"key":"dc:rights","label":"Dc Rights","values":["Standardní licenční smlouva - přístup k plnému textu bez omezení"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier.other","label":"Dc Identifier Other","values":["78445"]},{"key":"dc:identifier.uri","label":"Identifier URI","values":["http://hdl.handle.net/11012/187459"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description.abstract","label":"Abstract","values":["Předmětem této práce je pomocí sadou skriptů zdokonalit převod různých typů dokumentů do čistě textové podoby. Převodem různých nástrojů dochází ke vzniku šumu a ne zcela korektním převodem znaků. Tyto skripty extrahovaný textový soubor vyčistí tak, aby výsledný text byl čitelný, dával smysl a neobsahoval zbytky různě vyskytujících se znaků z převodu grafů, tabulek, vzorců apod. Skript pracuje univerzálně a nevyžaduje vstup vzniklý pouze z nástrojů OCR nebo převodu z formátu PDF či webu.","The objective of this thesis is to implement a set of scripts to improve the transfer of various types of documents into fully text. There appears noise and not entirely correct character conversion by converting various file formats. These scripts extracted text file cleans so that the resulting text is readable, make sense and does not contain any residues of various characters appearing by the transfer of graphs, tables, formulas, etc. The script works universally and does not require input solely by OCR tools or converting from PDF or web."]},{"key":"dc:title","label":"Title","values":["Filtrování textů extrahovaných z PDF, OCR nebo webu"]}]}],"canonical_facts":{"dc:contributor.advisor":["Szőke, Igor"],"dc:creator":["Lehnert, Filip"],"dc:description.abstract":["Předmětem této práce je pomocí sadou skriptů zdokonalit převod různých typů dokumentů do čistě textové podoby. Převodem různých nástrojů dochází ke vzniku šumu a ne zcela korektním převodem znaků. Tyto skripty extrahovaný textový soubor vyčistí tak, aby výsledný text byl čitelný, dával smysl a neobsahoval zbytky různě vyskytujících se znaků z převodu grafů, tabulek, vzorců apod. Skript pracuje univerzálně a nevyžaduje vstup vzniklý pouze z nástrojů OCR nebo převodu z formátu PDF či webu.","The objective of this thesis is to implement a set of scripts to improve the transfer of various types of documents into fully text. There appears noise and not entirely correct character conversion by converting various file formats. These scripts extracted text file cleans so that the resulting text is readable, make sense and does not contain any residues of various characters appearing by the transfer of graphs, tables, formulas, etc. The script works universally and does not require input solely by OCR tools or converting from PDF or web."],"dc:identifier.other":["78445"],"dc:identifier.uri":["http://hdl.handle.net/11012/187459"],"dc:language.iso":["cs"],"dc:publisher":["Vysoké učení technické v Brně. Fakulta informačních technologií"],"dc:rights":["Standardní licenční smlouva - přístup k plnému textu bez omezení"],"dc:subject":["filtrovat","extrahovat","PDF","OCR","čistý text","slovník","gramatická pravidla","skripty","filtrování dat","převod dat","filter","extract","plain text","dictionary","grammar rules","scripts","filtering data","data conversion"],"dc:title":["Filtrování textů extrahovaných z PDF, OCR nebo webu"],"dc:type":["Text"],"thesis:institution_name":["Bc."]},"updated_at":"2026-07-24T01:22:12Z"}