La detección de actividad de voz reduce el trabajo de transcripción local al marcar primero los intervalos de habla, de modo que el costoso reconocimiento de voz pueda omitir el silencio y el audio irrelevante.
En un servidor doméstico, ese filtrado puede ser más importante que una pequeña optimización del decodificador cuando los micrófonos o los archivos contienen horas de pausas, ruido ambiental o sonidos que no son habla.
La VAD convierte el audio continuo en decisiones sobre el habla
La VAD procesa el audio en fragmentos cortos y estima si cada fragmento contiene habla. El resultado es un mapa temporal, no una transcripción.
SpeechBrain define la VAD como la detección de los segmentos que contienen habla. Su salida documentada puede representarse como fragmentos de habla frente a fragmentos sin habla. SpeechBrain presenta la VAD como la localización de regiones de actividad vocal en el audio, lo que coincide con la etapa de decisión entre habla y ausencia de habla descrita en el tutorial de VAD de SpeechBrain.
Esta clasificación inicial es mucho más económica que decodificar cada segundo con un modelo ASR completo, especialmente en micrófonos siempre activos y grabaciones domésticas largas.
Los umbrales convierten las probabilidades en límites de inicio y final
Un modelo de VAD puede emitir probabilidades, pero la transcripción necesita intervalos contiguos. Los umbrales y el suavizado convierten las puntuaciones de los fragmentos en tiempos de inicio y final utilizables.
SpeechBrain documenta la puntuación posterior, la aplicación de umbrales, la creación de límites, la combinación de segmentos y la eliminación de segmentos cortos. Estos pasos determinan lo que el ASR recibe posteriormente. Google Research muestra que las decisiones de VAD pueden condicionarse y someterse a umbrales para decidir cuándo está presente el habla objetivo, lo que respalda la lógica de establecimiento de límites del trabajo de investigación sobre VAD personal de Google.
Los umbrales agresivos ahorran más recursos de cómputo, pero pueden recortar consonantes suaves. Los umbrales conservadores preservan el contexto, pero dejan pasar más silencio y ruido a las etapas posteriores.
Solo el habla aceptada necesita el procesamiento completo de ASR
Una vez conocidos los intervalos de habla, la canalización puede recortar o filtrar la grabación para que el reconocedor procese las regiones seleccionadas en lugar de toda la línea temporal.
NVIDIA utiliza las marcas de tiempo de la VAD como capa de presencia del habla antes de realizar análisis de audio posteriores. El mismo mecanismo puede filtrar directamente la transcripción. NVIDIA Riva coloca la VAD antes del reconocimiento de voz completo para que las regiones sin habla puedan filtrarse antes del costoso procesamiento de ASR, ilustrando este filtro de cómputo en la descripción general de ASR de NVIDIA Riva.
La VAD no hace que el modelo ASR sea más rápido por cada segundo aceptado.
Reduce la cantidad de segundos que llegan a las costosas etapas del codificador y el decodificador.
El relleno protege las palabras en los límites del habla
Las consonantes iniciales y los sonidos finales pueden quedar por debajo de un umbral aunque el oyente los considere parte del enunciado. Por eso, en la práctica, la VAD conserva un breve contexto alrededor de una región detectada.
La API de inferencia de SpeechBrain describe el refinamiento de límites y el posprocesamiento a nivel de segmento. Ese posprocesamiento explica por qué la VAD es más que una sola llamada a un clasificador binario. La investigación de Apple sobre la detección personalizada de actividad de voz analiza el comportamiento de los límites del habla y las compensaciones entre errores, lo que respalda el uso de relleno alrededor de las regiones detectadas, tal como se describe en la investigación de Apple sobre VAD personalizada.
El relleno devuelve deliberadamente una pequeña parte de los recursos ahorrados mediante el recorte. Por lo general, es preferible a perder el primer fonema de un comando o cortar un nombre.
La VAD y la detección de palabras de activación son filtros distintos
Un detector de palabras de activación pregunta si se ha pronunciado una frase de activación específica.
La VAD pregunta si existe habla, por lo que un sistema de voz siempre activo puede utilizar ambos mecanismos de forma secuencial.
El análisis de la latencia de la detección de palabras de activación de ZimaSpace aborda el ciclo de activación; la VAD gestiona los límites del habla después de ese filtro o alrededor de él. La investigación sobre VAD personalizada en dispositivos distingue entre el filtrado del habla objetivo y la lógica más amplia de activación por voz, lo que ayuda a separar la VAD de la detección de palabras de activación en el estudio sobre VAD personalizada en dispositivos.
La distinción también aparece en el procesamiento local de voz a texto e intenciones, donde la activación, el reconocimiento de voz, la gestión de intenciones y la generación de respuestas son etapas separadas.
El habla omitida y el habla falsa definen la compensación
Un falso negativo elimina habla real antes de que el ASR pueda recuperarla. Un falso positivo envía ruido que desperdicia recursos de cómputo y puede convertirse en texto erróneo.
La secuencia documentada por SpeechBrain de aplicación de umbrales, combinación y filtrado de segmentos muestra dónde pueden ajustarse esos errores. La investigación sobre VAD en condiciones ruidosas muestra por qué el habla falsa y el habla omitida se mueven en direcciones opuestas cuando cambian los umbrales, en línea con el límite analizado en la investigación sobre VAD robusta.
La acústica doméstica hace que el límite sea más difícil de establecer. El análisis del reconocimiento de voz en campo lejano de ZimaSpace explica por qué el ruido y la reverberación pueden modificar las entradas de la VAD antes de que comience la transcripción.
Centro de Tecnología e IA
Más para leer

Estado de ejecución frente a estado persistente en Home Assistant: ¿qué debe sobrevivir al reinicio?
Home Assistant no conserva todos los valores en tiempo real; la configuración, los registros, los estados restaurados seleccionados, el historial y los datos de...

¿Cómo autentica Home Assistant las sesiones locales y remotas?
Las sesiones locales y remotas de Home Assistant utilizan el mismo modelo de identidad del servidor; el acceso remoto cambia la ruta y el...

¿Por qué pueden volverse lentas las consultas del historial de Home Assistant a medida que crecen los datos del grabador?
El crecimiento del grabador puede aumentar el costo de las consultas del historial cuando el rango solicitado abarca más filas, aumentan los fallos de...

