Systém pro online diarizaci mluvčích v audiovizuálních datových proudech
Identifikátory výsledku
Kód výsledku v IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F46747885%3A24220%2F24%3A00013475" target="_blank" >RIV/46747885:24220/24:00013475 - isvavai.cz</a>
Výsledek na webu
—
DOI - Digital Object Identifier
—
Alternativní jazyky
Jazyk výsledku
čeština
Název v původním jazyce
Systém pro online diarizaci mluvčích v audiovizuálních datových proudech
Popis výsledku v původním jazyce
Jedná se o softwarovou technologii umožňující v reálném čase rozdělovat vstupní audiovizuální datové streamy na segmenty obsahující promluvu pouze jednoho mluvčího. Pro zpracování čistě akustických dat využívá audio modul systému extraktor tzv. x-vektorů založený ResNET architektuře, která je pomocí kešování optimalizovaná pro provoz v online režimu s konstantním zpožděním. Vektory extrahované ze vstupního signálu jsou následně klastrovány pomocí blokového online k-means algoritmu. Pro zpracování vizuální slažky dat je uvedený systém doplněn o audio-video modul, který využívá model SyncNet ve spojení s vektory, které reprezentují tváře mluvčích. Výsledný multimodální systém pro diarizaci mluvčích pak kombinuje výstupy z audio a audio-video modulu prostřednictvím nové fúzní strategie, která je založená na časovém překrývání.
Název v anglickém jazyce
System for online speaker diarization in audiovisual data streams
Popis výsledku anglicky
This software technology enables real-time segmentation of input audiovisual data streams into segments containing the speech of only one speaker. To process purely acoustic data, the system‘s audio module uses an x-vector extractor based on the ResNET architecture, which is optimized for constant delay in online operation by caching. The vectors extracted from the input signal are then clustered using a block-based online k-means algorithm. The above system is complemented by an audio-video module that uses the SyncNet model and vectors representing the speakers‘ faces to process the visual data streams. The resulting multimodal speaker diarization system then combines the outputs from the audio and audio-video modules through a novel fusion strategy based on temporal overlapping.
Klasifikace
Druh
R - Software
CEP obor
—
OECD FORD obor
10201 - Computer sciences, information science, bioinformathics (hardware development to be 2.2, social aspect to be 5.8)
Návaznosti výsledku
Projekt
—
Návaznosti
I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace
Ostatní
Rok uplatnění
2024
Kód důvěrnosti údajů
C - Předmět řešení projektu podléhá obchodnímu tajemství (§ 504 Občanského zákoníku), ale název projektu, cíle projektu a u ukončeného nebo zastaveného projektu zhodnocení výsledku řešení projektu (údaje P03, P04, P15, P19, P29, PN8) dodané do CEP, jsou upraveny tak, aby byly zveřejnitelné.
Údaje specifické pro druh výsledku
Interní identifikační kód produktu
DIAR2024
Technické parametry
Pracování čistě akustických datových proudů je možné provádět pouze s využitím CPU, nízkým faktorem reálného času pod 0,1 a konstantní latencí o velikosti přibližně 5,5 sekundy. Pro zpracování dat obsahujících vizuální složku je třeba GPU. Podrobný popis systému je předmětem vědeckého článku v časopisu EURASIP (3Q). Odkaz: KYNYCH, Frantisek, Petr CERVA, Jindrich ZDANSKY, Torbjørn SVEND- SEN, and Giampiero SALVI. A lightweight approach to real-time speaker diarization: from audio toward audio-visual data streams. EURASIP. 2024, vol. 2024, no. 1, pp. 1–16 Kontaktní osoba Petr Červa (petr.cerva@tul.cz).
Ekonomické parametry
Modul je optimalizován jen pro použití na CPU tak, aby šetřil výpočetní náklady související s provozem GPU.
IČO vlastníka výsledku
46747885
Název vlastníka
Technická univerzita v Liberci