Vše

Co hledáte?

Vše
Projekty
Výsledky výzkumu
Subjekty

Rychlé hledání

  • Projekty podpořené TA ČR
  • Významné projekty
  • Projekty s nejvyšší státní podporou
  • Aktuálně běžící projekty

Chytré vyhledávání

  • Takto najdu konkrétní +slovo
  • Takto z výsledků -slovo zcela vynechám
  • “Takto můžu najít celou frázi”

Topicer - Software pro analýzu témat v dokumentech

Identifikátory výsledku

  • Kód výsledku v IS VaVaI

    <a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216305%3A26230%2F26%3A0201349" target="_blank" >RIV/00216305:26230/26:0201349 - isvavai.cz</a>

  • Výsledek na webu

    <a href="https://github.com/DCGM/topicer" target="_blank" >https://github.com/DCGM/topicer</a>

  • DOI - Digital Object Identifier

Alternativní jazyky

  • Jazyk výsledku

    čeština

  • Název v původním jazyce

    Topicer - Software pro analýzu témat v dokumentech

  • Popis výsledku v původním jazyce

    Topicer je framework založený na jazyce Python pro objevování témat a návrh sémantických štítků ve velkých textových kolekcích, navržený pro použití jako knihovna i jako služba. Poskytuje jednotné API a konfiguračně řízené nastavení (YAML / factory pattern) pro spouštění end-to-end pipeline pro modelování témat a tagování nad dokumentovými korpusy. Mezi jeho hlavní schopnosti patří objevování témat včetně pojmenování a popisu témat, tvorba přiřazení témat k dokumentům a několik backendů pro tagování (extrakce pomocí LLM s lokalizací úseků textu, tagování pomocí GLiNER a doladěné BERT cross-encodery), s modulárními komponentami pro embeddingy, vektorové databáze a poskytovatele LLM (včetně OpenAI API nebo lokálních backendů, jako je Ollama). Pro nasazení nabízí Topicer REST API a připravené pro nasazení pomocí Dockeru, umožňující hostovat více nakonfigurovaných metod a přistupovat k nim vzdáleně.

  • Název v anglickém jazyce

    Topicer - Software for document topic analysis

  • Popis výsledku anglicky

    Topicer is a Python-based framework for topic discovery and semantic tag proposal in large text collections, designed to be used both as a library and as a service. It provides a unified API and configuration-driven setup (YAML/factory pattern) to run end-to-end topic modeling and tagging pipelines over document corpora. Its main capabilities include unsupervised topic discovery with topic naming/description, producing topic–document assignments, and multiple tagging backends (LLM-based extraction with span localization, GLiNER-based tagging, and fine-tuned BERT cross-encoders), with pluggable components for embeddings, vector stores, and LLM providers (including OpenAI APIs or local backends such as Ollama). For deployment, Topicer offers a REST API and Docker-based packaging so multiple configured methods can be hosted and accessed remotely.

Klasifikace

  • Druh

    R - Software

  • CEP obor

  • OECD FORD obor

    10201 - Computer sciences, information science, bioinformathics (hardware development to be 2.2, social aspect to be 5.8)

Návaznosti výsledku

  • Projekt

    <a href="/cs/project/DH23P03OVV060" target="_blank" >DH23P03OVV060: semANT – Sémantický průzkumník textového kulturního dědictví</a><br>

  • Návaznosti

    P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)

Ostatní

  • Rok uplatnění

    2025

  • Kód důvěrnosti údajů

    S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů

Údaje specifické pro druh výsledku

  • Interní identifikační kód produktu

    Topicer

  • Technické parametry

    Software je volně volně dostupný na základě bezplatné open-source licence. Software p umožňuje analyzovat témata v kolekcích textů a navrhovat tagy pro texty. Software poskytuje python balíček se základní funkcionalitou, REST API i samostatně nasaditelné služby (např. výpočet textových embeddingů). Software poskytuje několik metod využívajících různé přístupy včetně modelů natrénovaných speciálně pro navrhování tagů v češtině.

  • Ekonomické parametry

    N/N - výsledek je uvolněn pod volnou licencí BSD 3-Clause License, která umožňuje libovolé použití a úpravy bez poplatků. Natrénované modely jsou uvolněny také pod permisivní licencí. Software bude, mimo jiné, využit v knihovních přístupových systémech k práci a vyhledávání v kolekcích digitalizovaných dokumentů.

  • IČO vlastníka výsledku

    00216305

  • Název vlastníka

    Vysoké učení technické v Brně