ElevenLabs ha anunciado oficialmente Scribe v2, una nueva generación de su modelo de transcripción automática que la compañía define como el más preciso que ha lanzado hasta la fecha. El anuncio marca un paso importante en la evolución del reconocimiento de voz basado en inteligencia artificial, un campo cada vez más estratégico para medios, empresas y desarrolladores de productos digitales.
Scribe v2 llega como sucesor directo del primer modelo Scribe, con mejoras centradas en precisión, estabilidad y comprensión contextual del audio. Según la compañía, el nuevo sistema reduce de forma notable la tasa de errores en comparación con modelos anteriores y con otras soluciones ampliamente utilizadas en el sector.
Uno de los puntos clave de Scribe v2 es su enfoque dual. Por un lado, el modelo está optimizado para transcripción por lotes, pensada para audios largos, entrevistas, podcasts, contenido audiovisual y procesos de documentación. Por otro, ElevenLabs ha presentado Scribe v2 Realtime, una variante diseñada específicamente para transcripción en tiempo real con una latencia extremadamente baja, cercana a los 150 milisegundos.
Esta baja latencia permite que el modelo se utilice en aplicaciones interactivas, como asistentes de voz, sistemas de atención al cliente, herramientas de accesibilidad o plataformas de comunicación en directo. En estos contextos, la velocidad de respuesta es tan importante como la precisión, y es ahí donde ElevenLabs busca diferenciarse.
Otro aspecto destacado es la capacidad multilingüe. Scribe v2 es capaz de transcribir más de 90 idiomas de forma automática, sin necesidad de seleccionar previamente la lengua del audio. Además, el modelo puede manejar audios en los que se mezclan varios idiomas, una situación cada vez más común en contenidos internacionales y entornos profesionales globales.
La compañía también ha puesto énfasis en la comprensión contextual. El modelo incorpora funciones avanzadas como el reconocimiento de términos clave en función del contexto, en lugar de depender únicamente de listas cerradas de palabras. Esto resulta especialmente útil en sectores técnicos, legales o médicos, donde la terminología específica suele ser una de las principales fuentes de error en la transcripción automática.
Scribe v2 incluye además identificación de hablantes, marcas de tiempo precisas y detección de eventos de audio como pausas, risas o música. Estas capacidades permiten generar transcripciones más estructuradas y útiles, no solo como texto plano, sino como datos listos para análisis, búsqueda o cumplimiento normativo.
En pruebas internas y benchmarks publicados por ElevenLabs, Scribe v2 muestra un rendimiento superior frente a otros modelos populares de reconocimiento de voz. Aunque la compañía no oculta su ambición competitiva, el mensaje principal del lanzamiento se centra en ofrecer una herramienta más fiable para usos profesionales a gran escala.
Con este lanzamiento, ElevenLabs refuerza su posición más allá de la síntesis de voz, el área por la que se hizo conocida inicialmente, y consolida su apuesta por convertirse en un proveedor integral de tecnologías de audio basadas en inteligencia artificial. La transcripción, especialmente en tiempo real y con alta precisión, se perfila como uno de los pilares clave de esta estrategia.
Scribe v2 ya está disponible a través de la plataforma y las APIs de ElevenLabs, y se espera que su adopción crezca rápidamente en sectores como medios digitales, educación, investigación, accesibilidad y software empresarial.





