Vše

Co hledáte?

Vše
Projekty
Výsledky výzkumu
Subjekty

Rychlé hledání

  • Projekty podpořené TA ČR
  • Významné projekty
  • Projekty s nejvyšší státní podporou
  • Aktuálně běžící projekty

Chytré vyhledávání

  • Takto najdu konkrétní +slovo
  • Takto z výsledků -slovo zcela vynechám
  • “Takto můžu najít celou frázi”

Systém pro online diarizaci mluvčích v audiovizuálních datových proudech

Identifikátory výsledku

  • Kód výsledku v IS VaVaI

    <a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F46747885%3A24220%2F24%3A00013475" target="_blank" >RIV/46747885:24220/24:00013475 - isvavai.cz</a>

  • Výsledek na webu

  • DOI - Digital Object Identifier

Alternativní jazyky

  • Jazyk výsledku

    čeština

  • Název v původním jazyce

    Systém pro online diarizaci mluvčích v audiovizuálních datových proudech

  • Popis výsledku v původním jazyce

    Jedná se o softwarovou technologii umožňující v reálném čase rozdělovat vstupní audiovizuální datové streamy na segmenty obsahující promluvu pouze jednoho mluvčího. Pro zpracování čistě akustických dat využívá audio modul systému extraktor tzv. x-vektorů založený ResNET architektuře, která je pomocí kešování optimalizovaná pro provoz v online režimu s konstantním zpožděním. Vektory extrahované ze vstupního signálu jsou následně klastrovány pomocí blokového online k-means algoritmu. Pro zpracování vizuální slažky dat je uvedený systém doplněn o audio-video modul, který využívá model SyncNet ve spojení s vektory, které reprezentují tváře mluvčích. Výsledný multimodální systém pro diarizaci mluvčích pak kombinuje výstupy z audio a audio-video modulu prostřednictvím nové fúzní strategie, která je založená na časovém překrývání.

  • Název v anglickém jazyce

    System for online speaker diarization in audiovisual data streams

  • Popis výsledku anglicky

    This software technology enables real-time segmentation of input audiovisual data streams into segments containing the speech of only one speaker. To process purely acoustic data, the system‘s audio module uses an x-vector extractor based on the ResNET architecture, which is optimized for constant delay in online operation by caching. The vectors extracted from the input signal are then clustered using a block-based online k-means algorithm. The above system is complemented by an audio-video module that uses the SyncNet model and vectors representing the speakers‘ faces to process the visual data streams. The resulting multimodal speaker diarization system then combines the outputs from the audio and audio-video modules through a novel fusion strategy based on temporal overlapping.

Klasifikace

  • Druh

    R - Software

  • CEP obor

  • OECD FORD obor

    10201 - Computer sciences, information science, bioinformathics (hardware development to be 2.2, social aspect to be 5.8)

Návaznosti výsledku

  • Projekt

  • Návaznosti

    I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace

Ostatní

  • Rok uplatnění

    2024

  • Kód důvěrnosti údajů

    C - Předmět řešení projektu podléhá obchodnímu tajemství (§ 504 Občanského zákoníku), ale název projektu, cíle projektu a u ukončeného nebo zastaveného projektu zhodnocení výsledku řešení projektu (údaje P03, P04, P15, P19, P29, PN8) dodané do CEP, jsou upraveny tak, aby byly zveřejnitelné.

Údaje specifické pro druh výsledku

  • Interní identifikační kód produktu

    DIAR2024

  • Technické parametry

    Pracování čistě akustických datových proudů je možné provádět pouze s využitím CPU, nízkým faktorem reálného času pod 0,1 a konstantní latencí o velikosti přibližně 5,5 sekundy. Pro zpracování dat obsahujících vizuální složku je třeba GPU. Podrobný popis systému je předmětem vědeckého článku v časopisu EURASIP (3Q). Odkaz: KYNYCH, Frantisek, Petr CERVA, Jindrich ZDANSKY, Torbjørn SVEND- SEN, and Giampiero SALVI. A lightweight approach to real-time speaker diarization: from audio toward audio-visual data streams. EURASIP. 2024, vol. 2024, no. 1, pp. 1–16 Kontaktní osoba Petr Červa (petr.cerva@tul.cz).

  • Ekonomické parametry

    Modul je optimalizován jen pro použití na CPU tak, aby šetřil výpočetní náklady související s provozem GPU.

  • IČO vlastníka výsledku

    46747885

  • Název vlastníka

    Technická univerzita v Liberci