Automatizovaná konverze a obohacení dat z digitálních knihoven do standardu TEI
Identifikátory výsledku
Kód výsledku v IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00094943%3A_____%2F25%3AN0000002" target="_blank" >RIV/00094943:_____/25:N0000002 - isvavai.cz</a>
Výsledek na webu
<a href="https://itlib.cvtisr.sk/clanky/uzivatelske-testovani-knihovny-cz-dopad-uprav-domovske-stranky-na-pouzitelnost-portalu/" target="_blank" >https://itlib.cvtisr.sk/clanky/uzivatelske-testovani-knihovny-cz-dopad-uprav-domovske-stranky-na-pouzitelnost-portalu/</a>
DOI - Digital Object Identifier
<a href="http://dx.doi.org/10.52036/1335793X.2025.2.85-104" target="_blank" >10.52036/1335793X.2025.2.85-104</a>
Alternativní jazyky
Jazyk výsledku
čeština
Název v původním jazyce
Automatizovaná konverze a obohacení dat z digitálních knihoven do standardu TEI
Popis výsledku v původním jazyce
Článek představuje výsledky spolupráce českých odborníků v oblasti knihovnictví a digitálních humanitních věd, který zefektivní další využití publikací z digitálních knihoven při primárním a sekundárním výzkumu nebo při trénování kvalitnějších velkých jazykových modelů: automatizovaný proces konverze publikací z digitálních knihoven do standardu TEI včetně obohacení jazykových dat. Autor popisuje data a metadata dostupná díky Standardu Národní digitální knihovny pro jednotlivé publikace, možnosti jejich obohacení pomocí služeb pro zpracování přirozeného jazyka (UDPipe a NameTag) a jejich převod na odpovídající elementy ve standardu TEI. Zaměřuje se na problémy spojené zejména s formátem ALTO a na jejich řešení.
Název v anglickém jazyce
Automated conversion and enrichment of data from digital libraries to the TEI standard
Popis výsledku anglicky
The paper presents the results of cooperation between Czech experts in the field of librarianship and digital humanities, which will streamline the further use of publications from digital libraries in primary and secondary research or in training higher-quality large language models: an automated process of converting publications from digital libraries to the TEI standard, including enrichment of language data. The author describes available (meta)data thanks to the Czech National Digital Library Standard for individual publications, the possibilities for enriching them by natural language processing services (UDPipe and NameTag), and their conversion to corresponding elements in the TEI standard. He focuses on problems associated in particular with the ALTO format and their solutions.
Klasifikace
Druh
J<sub>ost</sub> - Ostatní články v recenzovaných periodicích
CEP obor
—
OECD FORD obor
60500 - Other Humanities and the Arts
Návaznosti výsledku
Projekt
—
Návaznosti
I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace
Ostatní
Rok uplatnění
2025
Kód důvěrnosti údajů
S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů
Údaje specifické pro druh výsledku
Název periodika
ITlib – Informačné technológie a knižnice
ISSN
1336-0779
e-ISSN
—
Svazek periodika
2025
Číslo periodika v rámci svazku
2
Stát vydavatele periodika
SK - Slovenská republika
Počet stran výsledku
20
Strana od-do
85-104
Kód UT WoS článku
—
EID výsledku v databázi Scopus
—