Softwarový modul pro prohledávání justičních rozhodnutí přirozeným jazykem (JUSEARCH)
Identifikátory výsledku
Kód výsledku v IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F46747885%3A24220%2F25%3A00013775" target="_blank" >RIV/46747885:24220/25:00013775 - isvavai.cz</a>
Výsledek na webu
—
DOI - Digital Object Identifier
—
Alternativní jazyky
Jazyk výsledku
čeština
Název v původním jazyce
Softwarový modul pro prohledávání justičních rozhodnutí přirozeným jazykem (JUSEARCH)
Popis výsledku v původním jazyce
Modulu umožňuje efektivní, přesné a sémanticky bohaté vyhledávání v rozsáhlých korpusech justičních rozhodnutí. Pro tento účel využívá dvojí indexační strukturu: 1) klasický lexikální index pro rychlé filtrování a přesné dotazy nad metadaty (např. spisové značky, datum) a 2) vektorový index, který reprezentuje významový obsah textů ve vícerozměrném prostoru, což umožňuje vyhledávání podle sémantické podobnosti. Součástí řešení je API rozhraní, které poskytuje přístup k funkcím pro indexaci, aktualizaci dat, sémantické i fulltextové vyhledávání a filtrování podle metadat.
Název v anglickém jazyce
Software module for searching judicial decisions using natural language (JUSEARCH)
Popis výsledku anglicky
The module enables efficient, accurate, and semantically rich searches in large corpora of judicial decisions. For this purpose, it uses a dual indexing structure: 1) a classic lexical index for fast filtering and precise queries on metadata (e.g., file numbers, dates) and 2) a vector index that represents the semantic content of texts in a multidimensional space, enabling searches based on semantic similarity. The solution includes an API interface that provides access to functions for indexing, data updating, semantic and full-text search, and filtering by metadata.
Klasifikace
Druh
R - Software
CEP obor
—
OECD FORD obor
10201 - Computer sciences, information science, bioinformathics (hardware development to be 2.2, social aspect to be 5.8)
Návaznosti výsledku
Projekt
—
Návaznosti
I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace
Ostatní
Rok uplatnění
2025
Kód důvěrnosti údajů
S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů
Údaje specifické pro druh výsledku
Interní identifikační kód produktu
JUSEARCH2025
Technické parametry
Základem systému je vektorizační jazykový model postavený na transformer architektuře XLM-RoBERTa, která umožňuje vícejazyčné zpracování a hluboké porozumění kontextu právních textů. Model je dále adaptován a doladěn (fine-tuned) na rozsáhlém korpusu soudních rozhodnutí, čímž se optimalizuje jeho schopnost rozpoznávat právní pojmy, vztahy a významové nuance mezi jednotlivými rozhodnutími. Výsledné vektory mají rozměr 768 a jsou ukládány do vektorového indexu umožňujícího rychlé nearest-neighbor vyhledávání (např. pomocí FAISS nebo HNSW struktur). Vyhledávání probíhá hybridním způsobem – systém kombinuje lexikální skóre (BM25) s kosinovou podobností vektorů, čímž dosahuje vysoké přesnosti i sémantické relevance výsledků. V interních testech dosahuje modul přesnosti nad 90 % při vyhledávání podle významu a odezvy pod nižší stovky milisekund u běžných dotazů. Kontaktní osoba Petr Červa (petr.cerva@tul.cz).
Ekonomické parametry
Modul je navržen jako škálovatelná a rozšiřitelná komponenta, kterou je možné pomocí API integrovat do soudních informačních systémů, chatbotů nebo analytických platforem pro zpracování právních dokumentů.
IČO vlastníka výsledku
46747885
Název vlastníka
Technická univerzita v Liberci