Morfologické značkování a lemmatizace v korpusech ČNK
Identifikátory výsledku
Kód výsledku v IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216208%3A11210%2F07%3A00103203" target="_blank" >RIV/00216208:11210/07:00103203 - isvavai.cz</a>
Nalezeny alternativní kódy
RIV/68378092:_____/08:00099582
Výsledek na webu
—
DOI - Digital Object Identifier
—
Alternativní jazyky
Jazyk výsledku
čeština
Název v původním jazyce
Morfologické značkování a lemmatizace v korpusech ČNK
Popis výsledku v původním jazyce
Tento článek představuje metody, jimiž byly označkovány tři velké textové korpusy (SYN2000, SYN2005 a SYN2006PUB). Postup značkování má několik fází: tokenizaci a segmentaci, morfologickou analýzu a disambiguaci. Při značkování korpusů byly použity jak stochastické, tak pravidlové metody.
Název v anglickém jazyce
Morphological tagging and lemmatization in the Czech National Corpus
Popis výsledku anglicky
This paper presents the methods by which three large textual corpora (SYN2000, SYN2005 and SYN2006PUB) of the Czech National Corpus have been tagged and lemmatized. The process proceeded in several phases: tokenization and segmentation, morphological analysis and disambiguation.
Klasifikace
Druh
D - Stať ve sborníku
CEP obor
AI - Jazykověda
OECD FORD obor
—
Návaznosti výsledku
Projekt
Výsledek vznikl pri realizaci vícero projektů. Více informací v záložce Projekty.
Návaznosti
P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)<br>Z - Vyzkumny zamer (s odkazem do CEZ)
Ostatní
Rok uplatnění
2007
Kód důvěrnosti údajů
S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů
Údaje specifické pro druh výsledku
Název statě ve sborníku
Grammar and Corpora
ISBN
978-80-200-1634-8
ISSN
—
e-ISSN
—
Počet stran výsledku
11
Strana od-do
—
Název nakladatele
Academia
Místo vydání
Liblice
Místo konání akce
—
Datum konání akce
—
Typ akce podle státní příslušnosti
—
Kód UT WoS článku
—