Změny v morfologické anotaci korpusů řady SYN: nové možnosti zkoumání české gramatiky a lexikonu
Identifikátory výsledku
Kód výsledku v IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216208%3A11210%2F22%3A10450406" target="_blank" >RIV/00216208:11210/22:10450406 - isvavai.cz</a>
Výsledek na webu
<a href="https://verso.is.cuni.cz/pub/verso.fpl?fname=obd_publikace_handle&handle=yGmL_09fYh" target="_blank" >https://verso.is.cuni.cz/pub/verso.fpl?fname=obd_publikace_handle&handle=yGmL_09fYh</a>
DOI - Digital Object Identifier
—
Alternativní jazyky
Jazyk výsledku
čeština
Název v původním jazyce
Změny v morfologické anotaci korpusů řady SYN: nové možnosti zkoumání české gramatiky a lexikonu
Popis výsledku v původním jazyce
Tento článek představuje některá významná koncepční vylepšení morfologické anotace korpusů řady SYN Českého národního korpusu. Kromě menších změn v tokenizaci a v pozičním tagsetu byly zavedeny tři velké koncepční změny, které ovlivňují reprezentaci různých lexikálních a gramatických jevů. V příspěvku představujeme dopady těchto změn na lingvistická data a na vyhledávání ve třech jazykových oblastech. Za prvé je diskutováno zacházení s hláskovými, grafickými a morfologickými variantami prostřednictvím dvojúrovňové struktury lemmatu; za druhé je vysvětlen nový přístup ke složeným slovesným tvarům, pomocným slovesům, participiím a k zachycení slovesných gramatických kategorií prostřednictvím nového atributu zvaného verbtag; za třetí je představeno komplexní zpracování víceslovných tokenů pomocí tzv. multihodnot.
Název v anglickém jazyce
Changes in the morphological annotation of the SYN series corpora: new possibilities for researching Czech grammar and lexicon
Popis výsledku anglicky
This paper introduces some major conceptual enhancements to the morphological annotation of the SYN series corpora of the Czech National Corpus. Apart from minor changes in tokenization and in the positional tagset, three major conceptual changes have been applied which affect the representation of various lexical and grammatical patterns. In the paper, we present the actual impact of the changes in linguistic data and search for possibilities in three linguistic areas. First, the treatment of phonic, graphemic, and morphological variants via a two-tier lemma structure is discussed; second, a new approach to periphrastic verb forms, auxiliaries, participles and the interpretation of verbal grammatical categories through a new attribute, called verbtag, is explained; and third, a complex multi-value treatment of multiword tokens is introduced.
Klasifikace
Druh
J<sub>imp</sub> - Článek v periodiku v databázi Web of Science
CEP obor
—
OECD FORD obor
60203 - Linguistics
Návaznosti výsledku
Projekt
<a href="/cs/project/LM2018137" target="_blank" >LM2018137: Český národní korpus</a><br>
Návaznosti
P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)<br>I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace
Ostatní
Rok uplatnění
2022
Kód důvěrnosti údajů
S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů
Údaje specifické pro druh výsledku
Název periodika
Slovo a slovesnost
ISSN
0037-7031
e-ISSN
—
Svazek periodika
83
Číslo periodika v rámci svazku
2
Stát vydavatele periodika
CZ - Česká republika
Počet stran výsledku
24
Strana od-do
122-145
Kód UT WoS článku
000885518700001
EID výsledku v databázi Scopus
2-s2.0-85131229363