System for online speaker diarization in audiovisual data streams
The result's identifiers
Result code in IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F46747885%3A24220%2F24%3A00013475" target="_blank" >RIV/46747885:24220/24:00013475 - isvavai.cz</a>
Result on the web
—
DOI - Digital Object Identifier
—
Alternative languages
Result language
čeština
Original language name
Systém pro online diarizaci mluvčích v audiovizuálních datových proudech
Original language description
Jedná se o softwarovou technologii umožňující v reálném čase rozdělovat vstupní audiovizuální datové streamy na segmenty obsahující promluvu pouze jednoho mluvčího. Pro zpracování čistě akustických dat využívá audio modul systému extraktor tzv. x-vektorů založený ResNET architektuře, která je pomocí kešování optimalizovaná pro provoz v online režimu s konstantním zpožděním. Vektory extrahované ze vstupního signálu jsou následně klastrovány pomocí blokového online k-means algoritmu. Pro zpracování vizuální slažky dat je uvedený systém doplněn o audio-video modul, který využívá model SyncNet ve spojení s vektory, které reprezentují tváře mluvčích. Výsledný multimodální systém pro diarizaci mluvčích pak kombinuje výstupy z audio a audio-video modulu prostřednictvím nové fúzní strategie, která je založená na časovém překrývání.
Czech name
Systém pro online diarizaci mluvčích v audiovizuálních datových proudech
Czech description
Jedná se o softwarovou technologii umožňující v reálném čase rozdělovat vstupní audiovizuální datové streamy na segmenty obsahující promluvu pouze jednoho mluvčího. Pro zpracování čistě akustických dat využívá audio modul systému extraktor tzv. x-vektorů založený ResNET architektuře, která je pomocí kešování optimalizovaná pro provoz v online režimu s konstantním zpožděním. Vektory extrahované ze vstupního signálu jsou následně klastrovány pomocí blokového online k-means algoritmu. Pro zpracování vizuální slažky dat je uvedený systém doplněn o audio-video modul, který využívá model SyncNet ve spojení s vektory, které reprezentují tváře mluvčích. Výsledný multimodální systém pro diarizaci mluvčích pak kombinuje výstupy z audio a audio-video modulu prostřednictvím nové fúzní strategie, která je založená na časovém překrývání.
Classification
Type
R - Software
CEP classification
—
OECD FORD branch
10201 - Computer sciences, information science, bioinformathics (hardware development to be 2.2, social aspect to be 5.8)
Result continuities
Project
—
Continuities
I - Institucionalni podpora na dlouhodoby koncepcni rozvoj vyzkumne organizace
Others
Publication year
2024
Confidentiality
C - Předmět řešení projektu podléhá obchodnímu tajemství (§ 504 Občanského zákoníku), ale název projektu, cíle projektu a u ukončeného nebo zastaveného projektu zhodnocení výsledku řešení projektu (údaje P03, P04, P15, P19, P29, PN8) dodané do CEP, jsou upraveny tak, aby byly zveřejnitelné.
Data specific for result type
Internal product ID
DIAR2024
Technical parameters
Pracování čistě akustických datových proudů je možné provádět pouze s využitím CPU, nízkým faktorem reálného času pod 0,1 a konstantní latencí o velikosti přibližně 5,5 sekundy. Pro zpracování dat obsahujících vizuální složku je třeba GPU. Podrobný popis systému je předmětem vědeckého článku v časopisu EURASIP (3Q). Odkaz: KYNYCH, Frantisek, Petr CERVA, Jindrich ZDANSKY, Torbjørn SVEND- SEN, and Giampiero SALVI. A lightweight approach to real-time speaker diarization: from audio toward audio-visual data streams. EURASIP. 2024, vol. 2024, no. 1, pp. 1–16 Kontaktní osoba Petr Červa (petr.cerva@tul.cz).
Economical parameters
Modul je optimalizován jen pro použití na CPU tak, aby šetřil výpočetní náklady související s provozem GPU.
Owner IČO
46747885
Owner name
Technická univerzita v Liberci