Automatická morfologická disambiguace korpusů řady SYN: spolupráce lingvistické introspekce a strojového učení
Identifikátory výsledku
Kód výsledku v IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216208%3A11210%2F25%3A10508084" target="_blank" >RIV/00216208:11210/25:10508084 - isvavai.cz</a>
Výsledek na webu
<a href="https://verso.is.cuni.cz/pub/verso.fpl?fname=obd_publikace_handle&handle=lZHmOlxWOC" target="_blank" >https://verso.is.cuni.cz/pub/verso.fpl?fname=obd_publikace_handle&handle=lZHmOlxWOC</a>
DOI - Digital Object Identifier
<a href="http://dx.doi.org/10.58756/n11082501" target="_blank" >10.58756/n11082501</a>
Alternativní jazyky
Jazyk výsledku
čeština
Název v původním jazyce
Automatická morfologická disambiguace korpusů řady SYN: spolupráce lingvistické introspekce a strojového učení
Popis výsledku v původním jazyce
Tento článek se zabývá metodou automatického morfologického značkování korpusů současné češtiny řady SYN a dalších korpusů v rámci Českého národního korpusu. Počínaje korpusem SYN2020 jsou korpusy anotovány na základě nového standardu. Článek začíná stručným popisem nově zavedených funkcí týkajících se tokenizace a lematizace (zavedení sublemmat) a značkování víceslovných tokenů (tj. složených tvarů jako abys, cos); představen je také nový atribut verbtag. Následně jsou popsány jednotlivé kroky celého procesu anotace.Ústřední část článku nabízí podrobný popis postupu automatické morfologické disambiguace, konkrétně kombinace dvou metodologicky odlišných přístupů: systému LanGr, založeného na lingvisticky motivovaných pravidlech odvozených introspekcí, a nástroje MorphoDiTa založeného na strojovém učení - tuto kombinaci nazýváme hybridním přístupem. Zvláštní důraz je kladen na detailní charakteristiku systému LanGr, především na sestavení specifických seznamů bigramů a trigramů lemmat a tvarů označovaných jako globální identifikátory a na využití těchto identifikátorů v pravidlech pro disambiguaci. Představena je také úspěšnost hybridního systému ve srovnání s úspěšností samostatného systému MorphoDiTa a stručně jsou nastíněny plány pro další rozvoj našeho hybridního přístupu k morfologickému značkování.
Název v anglickém jazyce
Automatic morphological disambiguation of corpora of the SYN series:
Popis výsledku anglicky
The paper deals with the current method of automatic morphological tagging of corpora of contemporary Czech of the SYN series and other corpora within the Czech National Corpus. From SYN2020 onwards, the corpora are annotated on the basis of an improved concept. The paper starts with a brief description of newly introduced features concerning tokenization and lemmatization (introduction of sublemmata), and of the tagging of multiword tokens (i.e. compound forms like abys, cos); a new attribute, verbtag, is also presented. Then the successive steps of the entire annotation process are described. The core of the paper provides a detailed description of the procedure of automatic morphological disambiguation, namely the combination of two methodologically different approaches: the LanGr system of linguistically motivated disambiguation rules based on introspection, and the MorphoDiTa tool based on machine learning – we call this combination a hybrid approach. Particular emphasis is laid on the detailed characterization of the LanGr system, primarily on compiling specific lists of bigrams and trigrams of lemmas and forms labeled as global identifiers and on using these identifiers in disambiguation rules. The success rate of the hybrid system compared to the success rate of the stand-alone MorphoDiTa system is also presented and plans are briefly outlined for further development of our hybrid morphological tagging approach.
Klasifikace
Druh
J<sub>ost</sub> - Ostatní články v recenzovaných periodicích
CEP obor
—
OECD FORD obor
60203 - Linguistics
Návaznosti výsledku
Projekt
<a href="/cs/project/LM2023044" target="_blank" >LM2023044: Český národní korpus</a><br>
Návaznosti
P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)<br>I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace
Ostatní
Rok uplatnění
2025
Kód důvěrnosti údajů
S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů
Údaje specifické pro druh výsledku
Název periodika
Naše řeč
ISSN
0027-8203
e-ISSN
2571-0893
Svazek periodika
108
Číslo periodika v rámci svazku
1
Stát vydavatele periodika
CZ - Česká republika
Počet stran výsledku
38
Strana od-do
3-40
Kód UT WoS článku
—
EID výsledku v databázi Scopus
—