login

Testing the correlation of word error rate and perplexity

Speech CommunicationPublished 1 September 2002
Dietrich Klakow, Jörg Peters
Citations235
SJR quartileQ1
SJR score0.49
SNIP1.25

TL;DR

This paper first presents some theoretical arguments for a close relationship between perplexity and word error rate, and the notion of uncertainty of a measurement is introduced and is then used to test the hypothesis thatword error rate and perplexity are correlated by a power law.

Abstract

Many groups have investigated the relationship of word error rate and perplexity of language models. This issue is of central interest because perplexity optimization can be done independent of a recognizer and in most cases it is possible to find simple perplexity optimization procedures. Moreover, many tasks in language model training such as the optimization of word classes may use perplexity as target function resulting in explicit optimization formulas which are not available if error rates are used as target. This paper first presents some theoretical arguments for a close relationship between perplexity and word error rate. Thereafter the notion of uncertainty of a measurement is introduced and is then used to test the hypothesis that word error rate and perplexity are correlated by a power law. There is no evidence to reject this hypothesis. Viele Gruppen haben sich bereits mit der Frage des Zusammenhangs von Perplexität und Wortfehlerrate beschäftigt. Diese Frage ist von zentraler Bedeutung, da eine Perplexitätsoptimierung unabhängig von einem Spracherkenner gemacht werden kann und weil die Perplexität häufig auch einer einfachen, direkten Optimierung zugänglich ist. So gibt es viele Aufgaben im Sprachmodelltraining, wie die Optimierung von Wortklassen, die die Perplexität als Zielfunktion benutzen und für die eine direkte Optimierung der Fehlerrate praktisch unmöglich ist oder zu zeitaufwendig. Diese Arbeit erläutert einige theoretische Argumente, dass Perplexität und Fehlerrate zusammenhängen. Danach wird die Messungenauigkeit eines Experiments im allgemeinen eingeführt und auf Perplexitätsmessungen und Fehlerraten angewendet. Dies wird benutzt, um die Hypothese zu überprüfen, ob Perplexität und Fehlerrate in signifikanter Weise über ein Potenzgesetz korreliert sind. Wir finden keine Hinweise, diese Hypothese zu verwerfen. Plusieurs groupes ont étudié la relation entre le taux d'erreur au niveau du mot et la perplexité du modèle de langage. Cette question est d'un intérêt central dans la mesure où la perplexité peut être optimisée indépendamment du système de reconnaissance et que, dans la plupart des cas, il est possible d'aboutir à des procédures simples d'optimisation. De plus, de nombreuses tâches intervenant lors de l'entraı̂nement d'un modèle de langage, par exemple, l'optimisation des classes de mots, sont suceptibles d'utiliser la mesure de perplexité comme objectif ce qui conduit à des formules explicites d'optimisation qui ne seraient pas accessibles si le taux d'erreur avait été choisi comme objectif. Cet article présente d'abord des arguments théoriques en faveur d'une relation étroite entre perplexité et taux d'erreur. Ensuite, la notion d'incertitude d'une mesure est introduite et appliquée aux fins de tester l'hypothèse que la corrélation entre perplexité et taux d'erreur est régie par une loi de puissance. Il n'y a pas d'évidence pour rejeter une telle hypothèse.

Keywords

Computer Science