Un servidor doméstico puede transcribir desde menos de una hasta cientos de horas de audio al día, según su factor de tiempo real medido y el ciclo de trabajo disponible.
Un factor de tiempo real de 0,25 significa que una hora de audio tarda 15 minutos, es decir, cuatro horas de audio por cada hora de procesamiento. Si la transcripción puede ejecutarse durante 20 horas de tiempo real, la capacidad diaria teórica es de 80 horas de audio, antes de contar los reintentos y la sobrecarga de ingesta. Los nombres del hardware por sí solos no pueden proporcionar esa cifra de forma fiable durante toda la ventana de procesamiento nocturno prevista.
El factor de tiempo real convierte la velocidad en capacidad diaria
El factor de tiempo real es el tiempo de procesamiento dividido por la duración del audio. Un RTF de 1,0 funciona en tiempo real; 0,5 procesa dos horas de audio por cada hora real; 0,1 procesa diez. La capacidad diaria equivale a las horas de procesamiento programadas divididas por el RTF.
Los puntos de referencia de rendimiento de Whisper publicados muestran que el modelo, la GPU, la duración del audio y el procesamiento por lotes pueden modificar considerablemente el rendimiento. La configuración medida debe coincidir con la carga de trabajo doméstica.
Este cálculo cuenta la duración del audio de origen, no los archivos transcurridos. La eliminación de silencios puede reducir el trabajo, mientras que la diarización, la alineación, la traducción y el formato de subtítulos añaden etapas. Una grabación de 24 horas puede contener solo unas pocas horas de conversación, pero aun así requerir decodificación y segmentación.
El modelo y el tamaño del lote determinan el equilibrio entre velocidad y precisión
Los modelos más pequeños o destilados suelen procesar más rápido y usar menos memoria, mientras que los modelos multilingües más grandes pueden mejorar la precisión en idiomas difíciles. El procesamiento por lotes puede aumentar la utilización de la GPU para muchos archivos, pero añade tiempo de espera para un clip urgente.
Una recopilación de mediciones comunitarias de tiempo de ejecución señala que la capacidad de cálculo teórica no se traduce linealmente en velocidad de transcripción a menos que se tengan en cuenta el procesamiento por lotes y la utilización de la canalización.
Los clips cortos tienen proporcionalmente más sobrecarga de configuración, apertura de archivos y programación que las grabaciones largas. La detección de idioma y la búsqueda de haces también pueden cambiar el tiempo de ejecución. Más audio al día no es automáticamente mejor si la tasa de errores de palabras hace que las transcripciones sean inutilizables.
Dónde deja de aplicarse la fórmula de capacidad
El RTF medido con voz mono limpia puede fallar con reuniones estéreo, grabaciones ruidosas, varios idiomas o archivos largos que provoquen un comportamiento de memoria diferente. La limitación térmica y los trabajos simultáneos del NAS reducen la capacidad de cálculo disponible a lo largo del día.
Un factor de tiempo real práctico muestra una variación considerable entre dispositivos y refuerza la necesidad de medir el modelo real en lugar de inferir el rendimiento únicamente a partir de la categoría de GPU.
La fórmula también falla en la transcripción en directo si la latencia debe mantenerse por debajo del flujo entrante. El rendimiento sin conexión puede usar procesamiento por lotes y contexto futuro que un asistente en tiempo real no puede utilizar. La capacidad diaria y el retraso interactivo son resultados distintos.
Convierte el RTF medido en un intervalo de capacidad diaria
Selecciona un conjunto representativo de notas de voz cortas, reuniones largas, idiomas, niveles de ruido y cantidades de canales. Mide el tiempo de procesamiento de extremo a extremo, la duración del audio, el error de palabras en un subconjunto etiquetado, la memoria máxima y el consumo energético durante al menos tres horas. Incluye la diarización o la alineación si la producción las requiere.
Ejecuta la prueba junto con los servicios de la carga de trabajo de voz local prevista para que el ciclo de trabajo real del servidor sea visible. Registra por separado los arranques en frío y el rendimiento en caliente.
Calcula la capacidad diaria como las horas de procesamiento utilizables divididas por el RTF mediano; después, aplica el RTF p95 más lento y una reserva operativa del 20 % para la planificación. Si la precisión no alcanza el objetivo, cambia a un modelo más potente y vuelve a calcular, en lugar de anunciar el resultado más rápido pero inutilizable.
Centro de Tecnología e IA
Más para leer

Cómo medir la calidad de recuperación de RAG local e interpretar la exhaustividad, la precisión y la cobertura de citas
Crea un conjunto de pruebas RAG local, calcula las métricas principales de recuperación, interpreta sus ventajas y desventajas, y audita si las afirmaciones de...

¿Por qué es cada vez más importante la computación de funciones del hogar inteligente a medida que aumenta la cantidad de sensores con la misma frecuencia de muestreo?
Rastrea el procesamiento por sensor y entre sensores a medida que aumenta el número de dispositivos, identifica los costos no lineales de la fusión...

¿Por qué importa más el costo de evaluar RAG a medida que crece la biblioteca de documentos con el mismo volumen de consultas?
Comprende por qué el crecimiento del corpus aumenta el esfuerzo de evaluación de RAG sin más consultas de los usuarios y cómo las pruebas...

