Vše

Co hledáte?

Vše
Projekty
Výsledky výzkumu
Subjekty

Rychlé hledání

  • Projekty podpořené TA ČR
  • Významné projekty
  • Projekty s nejvyšší státní podporou
  • Aktuálně běžící projekty

Chytré vyhledávání

  • Takto najdu konkrétní +slovo
  • Takto z výsledků -slovo zcela vynechám
  • “Takto můžu najít celou frázi”

Spremljevalni korpus Trendi: metode, vsebina in kategorizacija besedil

Identifikátory výsledku

  • Kód výsledku v IS VaVaI

    <a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216208%3A11320%2F26%3AW6NHVRCJ" target="_blank" >RIV/00216208:11320/26:W6NHVRCJ - isvavai.cz</a>

  • Výsledek na webu

    <a href="http://dx.doi.org/10.4312/slo2.0.2023.1.161-188" target="_blank" >http://dx.doi.org/10.4312/slo2.0.2023.1.161-188</a>

  • DOI - Digital Object Identifier

    <a href="http://dx.doi.org/10.4312/slo2.0.2023.1.161-188" target="_blank" >10.4312/slo2.0.2023.1.161-188</a>

Alternativní jazyky

  • Jazyk výsledku

    slovinština

  • Název v původním jazyce

    Spremljevalni korpus Trendi: metode, vsebina in kategorizacija besedil

  • Popis výsledku v původním jazyce

    V prispevku opisujemo postopek gradnje korpusa Trendi – prvega spremljevalnega korpusa za slovenščino. Prva različica korpusa, imenovana Trendi 2022-05, vsebuje več kot 565 milijonov pojavnic iz več kot 1,4 milijona besedil. Namen korpusa je, da tako strokovni kot nestrokovni javnosti ponudi podatke o aktualni jezikovni rabi in omogoči spremljanje pojavljanja novih besed ter upadanja ali naraščanja rabe že obstoječih. Predstavimo metodologijo izdelave in vsebino korpusa ter prve korake pri načrtovani strojni klasifikaciji korpusnih besedil v kategorije (npr. gospodarstvo, okolje), s katerimi bo mogoče v korpusu spremljati jezikovno rabo tudi po tematskih področjih. Predstavimo tudi rezultate ankete, s katero smo preverili uporabniška pričakovanja o jezikovnem viru za spremljanje jezikovne rabe.

  • Název v anglickém jazyce

    Spremljevalni korpus Trendi: metode, vsebina in kategorizacija besedil

  • Popis výsledku anglicky

    In the paper, we present the compilation of the Trendi corpus – the first monitor corpus of Slovene. The first version of the corpus,named Trendi 022-05, contains over 565 million tokens coming from more than 1.4 million different texts. The purpose of the corpus is to provide both experts and non-experts with data on contemporary language use and enable the monitoring of the appearance of new words or the increase/decrease in the use of existing words. We present the methodology of corpus compilation, its content, and the first steps for the automatic classification of corpus texts into categories (such as economics and environment), which will enable the

Klasifikace

  • Druh

    J<sub>ost</sub> - Ostatní články v recenzovaných periodicích

  • CEP obor

  • OECD FORD obor

    10201 - Computer sciences, information science, bioinformathics (hardware development to be 2.2, social aspect to be 5.8)

Návaznosti výsledku

  • Projekt

  • Návaznosti

Ostatní

  • Rok uplatnění

    2023

  • Kód důvěrnosti údajů

    S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů

Údaje specifické pro druh výsledku

  • Název periodika

    Slovenscina 2.0

  • ISSN

    2335-2736

  • e-ISSN

  • Svazek periodika

    2023

  • Číslo periodika v rámci svazku

    11

  • Stát vydavatele periodika

    SK - Slovenská republika

  • Počet stran výsledku

    7

  • Strana od-do

    86-92

  • Kód UT WoS článku

  • EID výsledku v databázi Scopus