Vše

Co hledáte?

Vše
Projekty
Výsledky výzkumu
Subjekty

Rychlé hledání

  • Projekty podpořené TA ČR
  • Významné projekty
  • Projekty s nejvyšší státní podporou
  • Aktuálně běžící projekty

Chytré vyhledávání

  • Takto najdu konkrétní +slovo
  • Takto z výsledků -slovo zcela vynechám
  • “Takto můžu najít celou frázi”

Digitální studovna Ministerstva obrany ČR / Využití technologií na pokročilou indexaci historických dokumentů

Identifikátory výsledku

  • Kód výsledku v IS VaVaI

    <a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F68378114%3A_____%2F24%3A00599817" target="_blank" >RIV/68378114:_____/24:00599817 - isvavai.cz</a>

  • Výsledek na webu

    <a href="https://sd.usd.cas.cz/pdfs/sod/2024/02/05.pdf" target="_blank" >https://sd.usd.cas.cz/pdfs/sod/2024/02/05.pdf</a>

  • DOI - Digital Object Identifier

    <a href="http://dx.doi.org/10.51134/sod.2024.027" target="_blank" >10.51134/sod.2024.027</a>

Alternativní jazyky

  • Jazyk výsledku

    čeština

  • Název v původním jazyce

    Digitální studovna Ministerstva obrany ČR / Využití technologií na pokročilou indexaci historických dokumentů

  • Popis výsledku v původním jazyce

    Vývoj v oblasti informačních technologií a umělé inteligence přináší nástroje, které mají značný potenciál usnadnit a obohatit výzkum v oborech historických a jim příbuzných věd. Předpokladem pro jejich efektivní uplatnění je však co nejdokonalejší převod analogových historických pramenů do strojově čitelné podoby, aby vyhledávání, třídění a vytěžování informací v nich obsažených bylo stejně účinné jako v digitálně „zrozených” (born digital) zdrojích. Autoři v této studii nejprve rekapitulují vývoj digitálních knihoven a zpřístupňování výsledků digitalizace v České republice, přičemž si všímají rozdílných strategií a technologických zázemí knihoven a archivů. Zamýšlejí se nad limity fulltextového vyhledávání a poukazují na překvapivý systémový deficit současných digitálních knihoven spočívající v absenci diagnostiky kvality strojového přepisu provedeného programy pro optické rozpoznávání znaků (Optical Recognition Character – OCR). Zvláštní pozornost pak věnují představení parametrů a možností Digitální studovny Ministerstva obrany ČR (DSMO), jež funguje na bázi systému digitální knihovny Kramerius. Díky své roli agregátora digitalizační produkce paměťových institucí resortu Ministerstva obrany ČR studovna zpřístupňuje zároveň knihovní dokumenty i digitalizované předlohy z archivních fondů a muzejních sbírek. Na modelovém příkladu tištěného úředního periodika z doby první světové války je představen proces dodatečného vylepšení výsledků OCR pomocí nástroje pokročilé extrakce a rozpoznávání obsahu (PERO) OCR, jež zachycuje rozložení grafických a textových objektů (Analyzed Layout and Text Objects – ALTO) a umožňuje přesnou lokalizaci hledaného textu na digitalizovaném obrazu. S využitím tohoto programu lze získat mnohem efektivněji a ve znatelně vyšší kvalitě textový obsah nejen tištěných či strojopisných, ale dokonce i rukopisných textů. Údaje ve schématu ALTO by navíc bylo možné využít i k automatickému monitoringu kvality výsledků OCR. Tento postup by znatelně zvýšil využitelnost sémantického vyhledávání, strojového překladu, sumarizace a mnoha dalších nástrojů umělé inteligence, které plné nasazení v prostředí českých digitálních knihoven teprve čeká.

  • Název v anglickém jazyce

    The Digital Reading Room of the Ministry of Defence of the Czech Republic / Using Technology for Advanced Indexing of Historical Documents

  • Popis výsledku anglicky

    Developments in information technology and artificial intelligence are providing tools that have considerable potential to facilitate and enrich research in the fields of history and related sciences. A prerequisite for their effective use, however, is the most perfect conversion of analogue historical sources into machine-readable form, so that the search, classification and extraction of the information contained in them is as efficient as in born-digital sources. In their study, Kykal and Fišer first provide an overview of the development of digital libraries and the making available of the results of digitization in the Czech Republic, taking into account the different strategies and technological backgrounds of libraries and archives. They reflect on the limitations of full-text search and point out a surprising systemic deficit in current digital libraries, namely the absence of the diagnostics of the quality of machine transcription performed by Optical Character Recognition (OCR) programs. They then pay special attention to presenting the parameters and possibilities of the Digital Reading Room of the Ministry of Defence of the Czech Republic (Digitální studovna Ministerstva obrany ČR, DSMO), which is based on the Kramerius Digital Library system. Thanks to its role as an aggregator of the digitization production of the memory institutions of the Ministry of Defence, the Reading Room makes available both library documents and digitized items from archive collections and museum collections. Using the example of a printed periodical of the Austro-Hungarian Army from the First World War, the process of the additional enhancement of OCR results using the PERO tool (Czech abbreviation for pokročilá extrakce a rozpoznávání obsahu - Advanced Extraction and Recognition of Content) is presented, including enrichment with a metadata scheme which captures the layout of graphic and text objects (Analysed Layout and Text Objects, ALTO) and allows the precise localization of the searched text on the digitized image. Using this program, the textual content of not only printed or typewritten texts, but also handwrit­ten texts, can be retrieved much more efficiently and with noticeably higher quality. Moreover, the data in the ALTO scheme could be used to automatically monitor the quality of OCR results. This procedure would significantly increase the usability of semantic search, machine translation, summarization and many other artificial intelligence tools that are yet to be fully deployed in the Czech Digital Library environment.

Klasifikace

  • Druh

    J<sub>SC</sub> - Článek v periodiku v databázi SCOPUS

  • CEP obor

  • OECD FORD obor

    60101 - History (history of science and technology to be 6.3, history of specific sciences to be under the respective headings)

Návaznosti výsledku

  • Projekt

    <a href="/cs/project/DH23P03OVV054" target="_blank" >DH23P03OVV054: Služba vlasti jako zdroj národní identity. Identifikace, dokumentace a prezentace historických pramenů k institutu povinné vojenské služby v českých zemích (1868–2004)</a><br>

  • Návaznosti

    P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)

Ostatní

  • Rok uplatnění

    2024

  • Kód důvěrnosti údajů

    S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů

Údaje specifické pro druh výsledku

  • Název periodika

    Soudobé dějiny

  • ISSN

    1210-7050

  • e-ISSN

  • Svazek periodika

    31

  • Číslo periodika v rámci svazku

    2

  • Stát vydavatele periodika

    CZ - Česká republika

  • Počet stran výsledku

    21

  • Strana od-do

    447-467

  • Kód UT WoS článku

  • EID výsledku v databázi Scopus

    2-s2.0-85215768238