Vše

Co hledáte?

Vše
Projekty
Výsledky výzkumu
Subjekty

Rychlé hledání

  • Projekty podpořené TA ČR
  • Významné projekty
  • Projekty s nejvyšší státní podporou
  • Aktuálně běžící projekty

Chytré vyhledávání

  • Takto najdu konkrétní +slovo
  • Takto z výsledků -slovo zcela vynechám
  • “Takto můžu najít celou frázi”

Datová sada větné podobnosti a klíčová slova.

Identifikátory výsledku

  • Kód výsledku v IS VaVaI

    <a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F47115068%3A_____%2F21%3AN0000004" target="_blank" >RIV/47115068:_____/21:N0000004 - isvavai.cz</a>

  • Výsledek na webu

    <a href="https://aijournalism.fsv.cuni.cz/" target="_blank" >https://aijournalism.fsv.cuni.cz/</a>

  • DOI - Digital Object Identifier

Alternativní jazyky

  • Jazyk výsledku

    čeština

  • Název v původním jazyce

    Datová sada větné podobnosti a klíčová slova.

  • Popis výsledku v původním jazyce

    V rámci řešení projektu byl vytvořen výsledek č. TL02000288-V14, a to dvojice datových sad. První datová sada obsahuje ručně anotované větné podobnosti (116 956 párů vět trénovací části sady označkované jedním anotátorem a 1 200 vět testovací části označkované devíti anotatátory). Druhá sada obsahuje označená klíčová slova, konkrétně 86 902 skupin klíčových slov. K tomuto výsledku (dále jen „Datové sady“) vykonává majetková autorská práva UK. Datové sady vychází z textů tiskových zpráv. Konkrétně jde o 1 593 zpráv z období let 2006 až 2019 (dále jen „Texty“), k nimž majetková práva vykonává ČTK. Datové sady byly vytvořeny softwarovou anotační webovou aplikací (dále jen „SW“), která umožňuje značkovat větné podobnosti a určovat klíčová slova velkou skupinou anotátorů z FSV UK. K tomuto SW majetková práva vykonává ZČU.

  • Název v anglickém jazyce

    Sentence similarity dataset and keywords.

  • Popis výsledku anglicky

    The project produced the result TL02000288-V14, a pair of datasets. The first dataset contains manually annotated sentence similarities (116,956 sentence pairs of the training part of the set annotated with one annotator and 1,200 sentences of the test part annotated with nine annotators). The second set contains tagged keywords, specifically 86,902 keyword groups. The UK exercises the proprietary copyright in this result (hereinafter referred to as the 'Datasets'). The Datasets are based on the texts of press releases. Specifically, there are 1 593 news items from the period 2006 to 2019 ('Texts') for which CTK holds the property rights. The datasets were created by a software annotation web application (hereinafter referred to as "SW"), which allows to tag sentence similarities and identify keywords by a large group of annotators from FSV UK. The property rights to this SW are held by the University of Veterinary and Pharmaceutical Sciences.

Klasifikace

  • Druh

    O - Ostatní výsledky

  • CEP obor

  • OECD FORD obor

    20205 - Automation and control systems

Návaznosti výsledku

  • Projekt

    <a href="/cs/project/TL02000288" target="_blank" >TL02000288: Proměna etických aspektů s nástupem žurnalistiky umělé inteligence</a><br>

  • Návaznosti

    P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)

Ostatní

  • Rok uplatnění

    2021

  • Kód důvěrnosti údajů

    S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů