login

Speaker-independent continuous speech dictation

Speech CommunicationPublished 1 October 1994
J.-L. Gauvain, Lori Lamel, Gilles Adda, Martine Adda‐Decker
Citations70
SJR quartileQ1
SJR score0.49
SNIP1.25

TL;DR

Progress is reported on in speaker-independent large vocabulary speech dictation using newspaper-based speech corpora in English and French at LIMSI using continuous density HMMs with Gaussian mixtures and n -gram statistics estimated on newspaper texts for language modeling.

Abstract

In this paper we report on progress made at LIMSI in speaker-independent large vocabulary speech dictation using newspaper-based speech corpora in English and French. The recognizer makes use of continuous density HMMs with Gaussian mixtures for acoustic modeling and n-gram statistics estimated on newspaper texts for language modeling. Acoustic modeling uses cepstrum-based features, context-dependent phone models (intra and interword), phone duration models, and sex-dependent models. For English the ARPA Wall Street Journal-based CSR corpus is used and for French the BREF corpus containing recordings of texts from the French newspaper Le Monde is used. Experiments were carried out with both these corpora at the phone level and at the word level with vocabularies containing up to 20,000 words. Word recognition experiments are also described for the ARPA RM task which has been widely used to evaluate and compare systems. In diesem Beitrag beschreiben wir Fortschritte in der Entwicklung eines sprecherunahängigen Spracherkennungssystems für groβen Wortschatz, welches mit (gesprochenem und geschriebenem) Datenmaterial von Zeitungartikeln trainiert wurde. Die akustische Modellierung des Spracherkennungssystems besteht aus Mischungen kontinuierlicher gauβ'schen Dichten in Hidden Markov Modellen (HMM). Die Modellierung der (geschriebenen) Sprache beruht auf statistischen n-grams, deren Wahrscheinlichkeiten aus einer Datenbasis bestehendaus Zeitungsartikeln geschätzt wurden. Was die akustischen Modelle betrifft, verwenden wir Cepstrum Parameter in kontextabhängigen Phonmodellen, mit zeitlicher Modellierung und geschlechtspezifischen Modellen. Für die englische Sprache benutzen wir die ARPA Wall Street Journal Datenbasis und für die französische, die BREF Daten, die gesprochene Texte der französischen Zeitung Le Monde enthalten. Für beide Sprachen wurden Experimente auf Phonem- und Wortbasis durchgeführt. Der Wortschatz besteht aus bis zu 20K Wörter. Weiterhin präsentieren wir Ergebnisse auf der ARPA RM Datenbasis, da diese weltweit zur Bewertung von Spracherkennungssystemen verwendet wurde. Nous présentons dans cet article les avancées réalisées au LIMSI sur la reconnaissance de parole continue de grand vocabulaire, indépendante du locuteur dans une application de dictée de textes. Le système utilise des modèles de Markov cachés à densités continues au niveau acoustique, et des modèles de langage n-grammes au niveau syntaxique. La modélisation acoustique repose sur une analyse cepstrale du signal vocal, des modèles de phones en contexte (inter-et intramot) dépendant du genre du locuteur, et des modèles de durée phonémique. Nous avons utilisé, pour la langue anglaise, le corpus de parole continue ARPA-WSJ contenant des enregistrements de textes lus extraits du Wall Street Journal, et, pour la langue française, le corpus BREF contenant des enregistrements de textes lus extraits du journal Le Monde. Les performances du système de reconnaissance, mesurées au niveau phonétique et au niveau mot sont données sur ces deux corpus pour des vocabulaires contenant jusqu'à 20.000 mots. Nous donnons également pour référence les résultats obtenus sur le corpus ARPA-RM qui a été très largement utilisé pour évaluer et comparer des systèmes de reconnaissance de parole.

Keywords

Computer Science