Back to results

University of Tartu

Optimizing Statistical Machine Translation via Input Modification

Abstract

Väitekiri kuulub statistilise masintõlke valdkonda ja käsitleb selle ühte komponenti - tõlkemudelite masinõpet. Esmalt uuritakse osaliselt kattuvaid joondatud paralleelkorpusi. Esitatakse meetod, mis võimaldab analüüsida korpuste kattuvaid osi, leida valesid lausete joondusi ning produtseerida olemasolevatest korpustest suuremaid ja kvaliteetsemaid. Seejärel analüüsitakse, kuidas flekteerivates keeltes (s.h. eesti keeles) segmenteerida sõnu enne tõlkemudeli treenimist väiksemateks osadeks, selleks et pehmendada andmete hõreduse mõju. Esitatakse meetod, mis rakendab juhendamata segmenteerimisel lingvistikapõhise segmenteerimise printsiipe, eesmärgiga saavutada tõlkekvaliteedi samasugust paranemist nagu keelest sõltuvate lingvistiliste vahendite kasutamisega. Lõpuks analüüsitakse sõnade joondamise meetodeid, eesmärgiga asendada neid lihtsamatega, ilma tõlkekvaliteedi kahanemiseta. Kõik pakutud meetodid on saanud eksperimentaalse hinnangu, kasutades erinevaid keelekorpusi ja erinevaid keeltepaare, k.a. eesti-inglise.

Author and committee

dc:creator, dc:contributor.*
Author
  • Fišel, Mark

Subjects

dc:subject × 3

Identifiers

dc:identifier.*
Identifier
hdl:10062/16487
OAI identifier oai:identifier
oai:dspace.ut.ee:10062/16487

Chain of custody

source
Harvested from
University of Tartu
Base URL
dspace.ut.ee/oai/request
Last updated
2026-07-24
Source record
OAI-PMH GetRecord
citation

Fišel, Mark. Optimizing Statistical Machine Translation via Input Modification. 2011.