Topicer - Software pro analýzu témat v dokumentech
Identifikátory výsledku
Kód výsledku v IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216305%3A26230%2F26%3A0201349" target="_blank" >RIV/00216305:26230/26:0201349 - isvavai.cz</a>
Výsledek na webu
<a href="https://github.com/DCGM/topicer" target="_blank" >https://github.com/DCGM/topicer</a>
DOI - Digital Object Identifier
—
Alternativní jazyky
Jazyk výsledku
čeština
Název v původním jazyce
Topicer - Software pro analýzu témat v dokumentech
Popis výsledku v původním jazyce
Topicer je framework založený na jazyce Python pro objevování témat a návrh sémantických štítků ve velkých textových kolekcích, navržený pro použití jako knihovna i jako služba. Poskytuje jednotné API a konfiguračně řízené nastavení (YAML / factory pattern) pro spouštění end-to-end pipeline pro modelování témat a tagování nad dokumentovými korpusy. Mezi jeho hlavní schopnosti patří objevování témat včetně pojmenování a popisu témat, tvorba přiřazení témat k dokumentům a několik backendů pro tagování (extrakce pomocí LLM s lokalizací úseků textu, tagování pomocí GLiNER a doladěné BERT cross-encodery), s modulárními komponentami pro embeddingy, vektorové databáze a poskytovatele LLM (včetně OpenAI API nebo lokálních backendů, jako je Ollama). Pro nasazení nabízí Topicer REST API a připravené pro nasazení pomocí Dockeru, umožňující hostovat více nakonfigurovaných metod a přistupovat k nim vzdáleně.
Název v anglickém jazyce
Topicer - Software for document topic analysis
Popis výsledku anglicky
Topicer is a Python-based framework for topic discovery and semantic tag proposal in large text collections, designed to be used both as a library and as a service. It provides a unified API and configuration-driven setup (YAML/factory pattern) to run end-to-end topic modeling and tagging pipelines over document corpora. Its main capabilities include unsupervised topic discovery with topic naming/description, producing topic–document assignments, and multiple tagging backends (LLM-based extraction with span localization, GLiNER-based tagging, and fine-tuned BERT cross-encoders), with pluggable components for embeddings, vector stores, and LLM providers (including OpenAI APIs or local backends such as Ollama). For deployment, Topicer offers a REST API and Docker-based packaging so multiple configured methods can be hosted and accessed remotely.
Klasifikace
Druh
R - Software
CEP obor
—
OECD FORD obor
10201 - Computer sciences, information science, bioinformathics (hardware development to be 2.2, social aspect to be 5.8)
Návaznosti výsledku
Projekt
<a href="/cs/project/DH23P03OVV060" target="_blank" >DH23P03OVV060: semANT – Sémantický průzkumník textového kulturního dědictví</a><br>
Návaznosti
P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)
Ostatní
Rok uplatnění
2025
Kód důvěrnosti údajů
S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů
Údaje specifické pro druh výsledku
Interní identifikační kód produktu
Topicer
Technické parametry
Software je volně volně dostupný na základě bezplatné open-source licence. Software p umožňuje analyzovat témata v kolekcích textů a navrhovat tagy pro texty. Software poskytuje python balíček se základní funkcionalitou, REST API i samostatně nasaditelné služby (např. výpočet textových embeddingů). Software poskytuje několik metod využívajících různé přístupy včetně modelů natrénovaných speciálně pro navrhování tagů v češtině.
Ekonomické parametry
N/N - výsledek je uvolněn pod volnou licencí BSD 3-Clause License, která umožňuje libovolé použití a úpravy bez poplatků. Natrénované modely jsou uvolněny také pod permisivní licencí. Software bude, mimo jiné, využit v knihovních přístupových systémech k práci a vyhledávání v kolekcích digitalizovaných dokumentů.
IČO vlastníka výsledku
00216305
Název vlastníka
Vysoké učení technické v Brně