Vše

Co hledáte?

Vše
Projekty
Výsledky výzkumu
Subjekty

Rychlé hledání

  • Projekty podpořené TA ČR
  • Významné projekty
  • Projekty s nejvyšší státní podporou
  • Aktuálně běžící projekty

Chytré vyhledávání

  • Takto najdu konkrétní +slovo
  • Takto z výsledků -slovo zcela vynechám
  • “Takto můžu najít celou frázi”

Změny v morfologické anotaci korpusů řady SYN: nové možnosti zkoumání české gramatiky a lexikonu

Identifikátory výsledku

  • Kód výsledku v IS VaVaI

    <a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216208%3A11210%2F22%3A10450406" target="_blank" >RIV/00216208:11210/22:10450406 - isvavai.cz</a>

  • Výsledek na webu

    <a href="https://verso.is.cuni.cz/pub/verso.fpl?fname=obd_publikace_handle&handle=yGmL_09fYh" target="_blank" >https://verso.is.cuni.cz/pub/verso.fpl?fname=obd_publikace_handle&handle=yGmL_09fYh</a>

  • DOI - Digital Object Identifier

Alternativní jazyky

  • Jazyk výsledku

    čeština

  • Název v původním jazyce

    Změny v morfologické anotaci korpusů řady SYN: nové možnosti zkoumání české gramatiky a lexikonu

  • Popis výsledku v původním jazyce

    Tento článek představuje některá významná koncepční vylepšení morfologické anotace korpusů řady SYN Českého národního korpusu. Kromě menších změn v tokenizaci a v pozičním tagsetu byly zavedeny tři velké koncepční změny, které ovlivňují reprezentaci různých lexikálních a gramatických jevů. V příspěvku představujeme dopady těchto změn na lingvistická data a na vyhledávání ve třech jazykových oblastech. Za prvé je diskutováno zacházení s hláskovými, grafickými a morfologickými variantami prostřednictvím dvojúrovňové struktury lemmatu; za druhé je vysvětlen nový přístup ke složeným slovesným tvarům, pomocným slovesům, participiím a k zachycení slovesných gramatických kategorií prostřednictvím nového atributu zvaného verbtag; za třetí je představeno komplexní zpracování víceslovných tokenů pomocí tzv. multihodnot.

  • Název v anglickém jazyce

    Changes in the morphological annotation of the SYN series corpora: new possibilities for researching Czech grammar and lexicon

  • Popis výsledku anglicky

    This paper introduces some major conceptual enhancements to the morphological annotation of the SYN series corpora of the Czech National Corpus. Apart from minor changes in tokenization and in the positional tagset, three major conceptual changes have been applied which affect the representation of various lexical and grammatical patterns. In the paper, we present the actual impact of the changes in linguistic data and search for possibilities in three linguistic areas. First, the treatment of phonic, graphemic, and morphological variants via a two-tier lemma structure is discussed; second, a new approach to periphrastic verb forms, auxiliaries, participles and the interpretation of verbal grammatical categories through a new attribute, called verbtag, is explained; and third, a complex multi-value treatment of multiword tokens is introduced.

Klasifikace

  • Druh

    J<sub>imp</sub> - Článek v periodiku v databázi Web of Science

  • CEP obor

  • OECD FORD obor

    60203 - Linguistics

Návaznosti výsledku

  • Projekt

    <a href="/cs/project/LM2018137" target="_blank" >LM2018137: Český národní korpus</a><br>

  • Návaznosti

    P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)<br>I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace

Ostatní

  • Rok uplatnění

    2022

  • Kód důvěrnosti údajů

    S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů

Údaje specifické pro druh výsledku

  • Název periodika

    Slovo a slovesnost

  • ISSN

    0037-7031

  • e-ISSN

  • Svazek periodika

    83

  • Číslo periodika v rámci svazku

    2

  • Stát vydavatele periodika

    CZ - Česká republika

  • Počet stran výsledku

    24

  • Strana od-do

    122-145

  • Kód UT WoS článku

    000885518700001

  • EID výsledku v databázi Scopus

    2-s2.0-85131229363