Speaker trait characterization in web videos: Uniting speech, language, and facial features

Abstract: We present a multi-modal approach to speaker characterization using acoustic, visual and linguistic features. Full realism is provided by evaluation on a database of real-life web videos and automatic feature extraction including face and eye detection, and automatic speech recognition. Different segmentations are evaluated for the audio and video streams, and the statistical relevance of Linguistic Inquiry and Word Count (LIWC) features is confirmed. In the result, late multimodal fusion delivers 73, 92 and 73% average recall in binary age, gender and race classification on unseen test subjects, outperforming the best single modalities for age and race

Standort
Deutsche Nationalbibliothek Frankfurt am Main
Umfang
Online-Ressource, 3647-3651 S.
Sprache
Englisch
Anmerkungen
Veröffentlichungsversion
begutachtet (peer reviewed)
In: Proceedings of the 38th International Conference on Acoustics, Speech and Signal Processing (ICASSP 2013). 2013. S. 3647-3651. ISBN 978-1-4799-0356-6

Ereignis
Veröffentlichung
(wo)
New York
(wer)
IEEE
(wann)
2013
Ereignis
Veröffentlichung
(wo)
Mannheim
(wer)
SSOAR - Social Science Open Access Repository
(wann)
2013
Urheber
Weninger, Felix
Wagner, Claudia
Wöllmer, Martin
Schuller, Björn
Morency, Louis-Philipp

DOI
10.1109/ICASSP.2013.6638338
URN
urn:nbn:de:0168-ssoar-66084-2
Rechteinformation
Open Access unbekannt; Open Access; Der Zugriff auf das Objekt ist unbeschränkt möglich.
Letzte Aktualisierung
25.03.2025, 13:45 MEZ

Datenpartner

Dieses Objekt wird bereitgestellt von:
Deutsche Nationalbibliothek. Bei Fragen zum Objekt wenden Sie sich bitte an den Datenpartner.

Beteiligte

  • Weninger, Felix
  • Wagner, Claudia
  • Wöllmer, Martin
  • Schuller, Björn
  • Morency, Louis-Philipp
  • IEEE
  • SSOAR - Social Science Open Access Repository

Entstanden

  • 2013

Ähnliche Objekte (12)