La transcription locale peut insérer des mots pendant les silences, car le décodeur doit résoudre de faibles indices acoustiques à l’aide de schémas linguistiques appris et du contexte hérité.
Un enregistrement domestique supposé silencieux contient tout de même le bruit propre du microphone, les ventilateurs, le ronronnement de la pièce, les artefacts de compression et les queues de réverbération. Si le pipeline envoie ce segment à un reconnaisseur autorégressif, le modèle reçoit des caractéristiques plutôt qu’une instruction explicite de ne rien produire. Le texte précédent, la sélection de la langue, les seuils de décodage et les limites des segments peuvent transformer un son incertain en phrases plausibles.
Le silence produit des caractéristiques même en l’absence de parole
Le silence numérique peut être constitué de zéros, mais le silence réellement capturé contient une énergie de faible niveau et du bruit structuré. L’extraction des caractéristiques convertit ce spectre en trames qui peuvent ressembler à de faibles motifs phonétiques, notamment après que le contrôle automatique du gain a relevé le niveau de bruit ou qu’un codec a créé des artefacts périodiques.
Une étude sur les hallucinations non vocales expose délibérément Whisper à des sons non vocaux et observe des phrases hallucinées récurrentes. Cette répétition indique que des sons acoustiques ambigus interagissent avec des schémas de sortie appris plutôt que de produire des caractères arbitraires. Cette distinction reste visible lors des tests domestiques ultérieurs.
Un détecteur d’activité vocale peut bloquer les régions clairement non vocales avant le décodage, mais ses propres faux positifs augmentent en présence du son de la télévision, de musique, de respiration et d’appareils électroménagers. La détection du silence et la transcription sont deux classificateurs distincts, avec des seuils et des modes d’échec différents.
Le décodage autorégressif comble l’incertitude acoustique avec des a priori linguistiques
Les décodeurs vocaux évaluent le texte à partir des indices acoustiques et de la probabilité des séquences apprises. Lorsque le terme acoustique est faible, les phrases courantes, la ponctuation, les conventions de sous-titrage ou le texte fourni comme invite précédente peuvent dominer la décision concernant le prochain token.
Une étude sur la reconnaissance vocale sous supervision faible décrit la reconnaissance vocale sous supervision faible à grande échelle, sur des données et des tâches variées. Cette ampleur fournit de fortes régularités linguistiques, mais elle signifie également que le décodage peut continuer à produire un texte plausible lorsqu’un segment local apporte peu d’indices vocaux.
Les fenêtres longues peuvent inclure quelques mots réels suivis de silence, ce qui permet au modèle de prolonger leur schéma. Les fenêtres courtes peuvent supprimer le contexte nécessaire pour rejeter le bruit. Le chevauchement des segments, la transmission de l’invite, le repli de température et les seuils d’absence de parole influencent donc le type d’échec observé.
Le post-traitement peut masquer la fréquence, mais pas établir la vérité
Une liste noire peut supprimer les phrases qui reviennent pendant les silences, et les filtres de confiance peuvent masquer les segments à faible probabilité. Ces protections réduisent les erreurs visibles, mais peuvent aussi supprimer de véritables paroles faibles contenant les mêmes mots. Le résultat intermédiaire doit rester consultable avant toute automatisation.
Une étude sur les phrases transcrites non étayées rapporte des phrases entièrement inventées et souligne qu’un résultat fluide peut sembler crédible même lorsqu’il n’est pas étayé par l’audio. La leçon opérationnelle consiste à conserver les informations temporelles et les preuves acoustiques à des fins de vérification, plutôt qu’à faire confiance à la grammaticalité.
La limite à ne pas franchir consiste à qualifier d’hallucination chaque mot produit sur une forme d’onde silencieuse. Une parole distante, une fuite sonore provenant d’un casque, des interférences ultrasonores repliées dans la bande ou une suppression agressive du bruit peuvent rendre la parole difficile à entendre tout en la laissant présente. Examinez l’audio brut et les niveaux synchronisés avant de mettre le modèle en cause.
Créez un jeu de test du silence avant de modifier les seuils
Enregistrez un véritable silence numérique, le bruit ambiant de la pièce, des ventilateurs, le système CVC, le bruit du clavier, le son de la télévision, de la musique, de la respiration et de véritables paroles faibles avec plusieurs niveaux de gain. Conservez l’audio brut, puis exécutez des segments identiques avec et sans filtrage par activité vocale, transmission de l’invite et repli de température.
Mesurez le nombre de mots erronés par minute silencieuse ainsi que les paroles faibles manquées, en utilisant le mécanisme de filtrage décrit dans le filtrage par activité vocale. Pour chaque échec, enregistrez la probabilité d’absence de parole, la décision du détecteur d’activité vocale, l’énergie moyenne, la confiance du décodeur, la langue choisie, la limite du segment et les tokens produits.
Définissez les seuils de manière à réduire les insertions silencieuses sans perte inacceptable de paroles faibles. Pour les notes importantes, conservez les horodatages et prévoyez une vérification audio ; si une phrase récurrente persiste malgré plusieurs contrôles, considérez-la comme un artefact du décodeur plutôt que comme une preuve qu’une parole a été prononcée.
Centre Tech & IA
Plus à lire

Quel est l’effet de la réduction de la fréquence d’échantillonnage des séries temporelles sur la détection des anomalies dans les maisons intelligentes ?
Découvrez comment la largeur des intervalles, l’agrégation, l’anticrénelage, les données manquantes, la durée des événements et la rétention multiscalaire modifient le rappel des anomalies...

Comment une grille d’occupation combine-t-elle de faibles signaux domotiques ?
Découvrez comment les cellules spatiales, les modèles de capteurs, les mises à jour en log-odds, la décroissance, les éléments de preuve corrélés et les...

Quel est l’effet de la normalisation photométrique sur le regroupement de visages privés ?
Découvrez comment la correction de l’éclairage modifie les recadrages de visages, les représentations vectorielles, les distances entre clusters, les seuils, la sur-normalisation et l’évaluation...

