Spremljevalni korpus Trendi: metode, vsebina in kategorizacija besedil
Identifikátory výsledku
Kód výsledku v IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216208%3A11320%2F26%3AW6NHVRCJ" target="_blank" >RIV/00216208:11320/26:W6NHVRCJ - isvavai.cz</a>
Výsledek na webu
<a href="http://dx.doi.org/10.4312/slo2.0.2023.1.161-188" target="_blank" >http://dx.doi.org/10.4312/slo2.0.2023.1.161-188</a>
DOI - Digital Object Identifier
<a href="http://dx.doi.org/10.4312/slo2.0.2023.1.161-188" target="_blank" >10.4312/slo2.0.2023.1.161-188</a>
Alternativní jazyky
Jazyk výsledku
slovinština
Název v původním jazyce
Spremljevalni korpus Trendi: metode, vsebina in kategorizacija besedil
Popis výsledku v původním jazyce
V prispevku opisujemo postopek gradnje korpusa Trendi – prvega spremljevalnega korpusa za slovenščino. Prva različica korpusa, imenovana Trendi 2022-05, vsebuje več kot 565 milijonov pojavnic iz več kot 1,4 milijona besedil. Namen korpusa je, da tako strokovni kot nestrokovni javnosti ponudi podatke o aktualni jezikovni rabi in omogoči spremljanje pojavljanja novih besed ter upadanja ali naraščanja rabe že obstoječih. Predstavimo metodologijo izdelave in vsebino korpusa ter prve korake pri načrtovani strojni klasifikaciji korpusnih besedil v kategorije (npr. gospodarstvo, okolje), s katerimi bo mogoče v korpusu spremljati jezikovno rabo tudi po tematskih področjih. Predstavimo tudi rezultate ankete, s katero smo preverili uporabniška pričakovanja o jezikovnem viru za spremljanje jezikovne rabe.
Název v anglickém jazyce
Spremljevalni korpus Trendi: metode, vsebina in kategorizacija besedil
Popis výsledku anglicky
In the paper, we present the compilation of the Trendi corpus – the first monitor corpus of Slovene. The first version of the corpus,named Trendi 022-05, contains over 565 million tokens coming from more than 1.4 million different texts. The purpose of the corpus is to provide both experts and non-experts with data on contemporary language use and enable the monitoring of the appearance of new words or the increase/decrease in the use of existing words. We present the methodology of corpus compilation, its content, and the first steps for the automatic classification of corpus texts into categories (such as economics and environment), which will enable the
Klasifikace
Druh
J<sub>ost</sub> - Ostatní články v recenzovaných periodicích
CEP obor
—
OECD FORD obor
10201 - Computer sciences, information science, bioinformathics (hardware development to be 2.2, social aspect to be 5.8)
Návaznosti výsledku
Projekt
—
Návaznosti
—
Ostatní
Rok uplatnění
2023
Kód důvěrnosti údajů
S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů
Údaje specifické pro druh výsledku
Název periodika
Slovenscina 2.0
ISSN
2335-2736
e-ISSN
—
Svazek periodika
2023
Číslo periodika v rámci svazku
11
Stát vydavatele periodika
SK - Slovenská republika
Počet stran výsledku
7
Strana od-do
86-92
Kód UT WoS článku
—
EID výsledku v databázi Scopus
—