Vše

Co hledáte?

Vše
Projekty
Výsledky výzkumu
Subjekty

Rychlé hledání

  • Projekty podpořené TA ČR
  • Významné projekty
  • Projekty s nejvyšší státní podporou
  • Aktuálně běžící projekty

Chytré vyhledávání

  • Takto najdu konkrétní +slovo
  • Takto z výsledků -slovo zcela vynechám
  • “Takto můžu najít celou frázi”

Automatická morfologická disambiguace korpusů řady SYN: spolupráce lingvistické introspekce a strojového učení

Identifikátory výsledku

  • Kód výsledku v IS VaVaI

    <a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216208%3A11210%2F25%3A10508084" target="_blank" >RIV/00216208:11210/25:10508084 - isvavai.cz</a>

  • Výsledek na webu

    <a href="https://verso.is.cuni.cz/pub/verso.fpl?fname=obd_publikace_handle&handle=lZHmOlxWOC" target="_blank" >https://verso.is.cuni.cz/pub/verso.fpl?fname=obd_publikace_handle&handle=lZHmOlxWOC</a>

  • DOI - Digital Object Identifier

    <a href="http://dx.doi.org/10.58756/n11082501" target="_blank" >10.58756/n11082501</a>

Alternativní jazyky

  • Jazyk výsledku

    čeština

  • Název v původním jazyce

    Automatická morfologická disambiguace korpusů řady SYN: spolupráce lingvistické introspekce a strojového učení

  • Popis výsledku v původním jazyce

    Tento článek se zabývá metodou automatického morfologického značkování korpusů současné češtiny řady SYN a dalších korpusů v rámci Českého národního korpusu. Počínaje korpusem SYN2020 jsou korpusy anotovány na základě nového standardu. Článek začíná stručným popisem nově zavedených funkcí týkajících se tokenizace a lematizace (zavedení sublemmat) a značkování víceslovných tokenů (tj. složených tvarů jako abys, cos); představen je také nový atribut verbtag. Následně jsou popsány jednotlivé kroky celého procesu anotace.Ústřední část článku nabízí podrobný popis postupu automatické morfologické disambiguace, konkrétně kombinace dvou metodologicky odlišných přístupů: systému LanGr, založeného na lingvisticky motivovaných pravidlech odvozených introspekcí, a nástroje MorphoDiTa založeného na strojovém učení - tuto kombinaci nazýváme hybridním přístupem. Zvláštní důraz je kladen na detailní charakteristiku systému LanGr, především na sestavení specifických seznamů bigramů a trigramů lemmat a tvarů označovaných jako globální identifikátory a na využití těchto identifikátorů v pravidlech pro disambiguaci. Představena je také úspěšnost hybridního systému ve srovnání s úspěšností samostatného systému MorphoDiTa a stručně jsou nastíněny plány pro další rozvoj našeho hybridního přístupu k morfologickému značkování.

  • Název v anglickém jazyce

    Automatic morphological disambiguation of corpora of the SYN series:

  • Popis výsledku anglicky

    The paper deals with the current method of automatic morphological tagging of corpora of contemporary Czech of the SYN series and other corpora within the Czech National Corpus. From SYN2020 onwards, the corpora are annotated on the basis of an improved concept. The paper starts with a brief description of newly introduced features concerning tokenization and lemmatization (introduction of sublemmata), and of the tagging of multiword tokens (i.e. compound forms like abys, cos); a new attribute, verbtag, is also presented. Then the successive steps of the entire annotation process are described. The core of the paper provides a detailed description of the procedure of automatic morphological disambiguation, namely the combination of two methodologically different approaches: the LanGr system of linguistically motivated disambiguation rules based on introspection, and the MorphoDiTa tool based on machine learning – we call this combination a hybrid approach. Particular emphasis is laid on the detailed characterization of the LanGr system, primarily on compiling specific lists of bigrams and trigrams of lemmas and forms labeled as global identifiers and on using these identifiers in disambiguation rules. The success rate of the hybrid system compared to the success rate of the stand-alone MorphoDiTa system is also presented and plans are briefly outlined for further development of our hybrid morphological tagging approach.

Klasifikace

  • Druh

    J<sub>ost</sub> - Ostatní články v recenzovaných periodicích

  • CEP obor

  • OECD FORD obor

    60203 - Linguistics

Návaznosti výsledku

  • Projekt

    <a href="/cs/project/LM2023044" target="_blank" >LM2023044: Český národní korpus</a><br>

  • Návaznosti

    P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)<br>I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace

Ostatní

  • Rok uplatnění

    2025

  • Kód důvěrnosti údajů

    S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů

Údaje specifické pro druh výsledku

  • Název periodika

    Naše řeč

  • ISSN

    0027-8203

  • e-ISSN

    2571-0893

  • Svazek periodika

    108

  • Číslo periodika v rámci svazku

    1

  • Stát vydavatele periodika

    CZ - Česká republika

  • Počet stran výsledku

    38

  • Strana od-do

    3-40

  • Kód UT WoS článku

  • EID výsledku v databázi Scopus