Ilustración de tuput
Español
Saaras V3 de Sarvam obtuvo cerca de un 19% de error de palabras en la prueba IndicVoices en febrero de 2026, y el modelo abierto de Meta anota una tasa de error de caracteres de 3,6 para el hindi. La única prueba construida con llamadas telefónicas indias mantiene privado su conjunto de evaluación, y las páginas de Google y OpenAI sobre sus productos de voz más recientes dan el número de idiomas pero no tasas de error en lenguas de la India.
El modelo de voz Saaras V3 de Sarvam AI obtuvo cerca de un 19% de error de palabras en la prueba IndicVoices, según la propia publicación de Sarvam del 11 de febrero de 2026. El modelo abierto Omnilingual ASR de Meta, lanzado el 10 de noviembre de 2025, anota una tasa de error de caracteres de 3,6 para el hindi en su tabla de resultados. Las dos cifras miden cosas distintas sobre audios distintos, y la mayoría de las demás puntuaciones publicadas es igual de difícil de alinear.
La tasa de error de palabras (WER) es la proporción de palabras que un sistema falla frente a una transcripción humana. La tasa de error de caracteres (CER) cuenta en cambio los caracteres erróneos. Las lenguas de la India añaden un problema más. Investigadores de AI4Bharat, el laboratorio de tecnología del lenguaje del IIT Madras, escribieron en un preprint del 1 de marzo de 2026 que la ortografía flexible y la separación o unión opcional de palabras hacen que el WER simple califique a los sistemas peor de lo que los califican los usuarios.
Los modelos de Sarvam para 22 lenguas
Saaras V3 maneja en un solo modelo las 22 lenguas oficiales de la India más el inglés. La publicación de Sarvam da cerca de un 19% de WER en IndicVoices para todas las lenguas y un 19,31% para las diez más habladas. Dice que el anterior Saaras V2.5, que cubría 11 lenguas, puntuó cerca de un 22% en el mismo conjunto.
IndicVoices es un conjunto de datos de AI4Bharat. Su artículo de 2024 describe 7.348 horas de habla de 16.237 hablantes en 145 distritos y 22 lenguas, de las cuales 1.639 horas estaban transcritas en ese momento. La publicación de Sarvam nombra a GPT-4o Transcribe, Gemini 3 Pro, Deepgram Nova3 y ElevenLabs Scribe v2 como rivales a los que supera, pero no imprime puntuaciones para ellos. No nombra a ningún evaluador externo.
Saaras V4 llegó el 25 de septiembre de 2026. Sarvam reporta un 16,03% de WER en IndicContextEval, una prueba de AI4Bharat en la que el usuario aporta términos clave, y un error de identificación de idioma del 5,22% en las 22 lenguas y del 2,9% en las diez principales. La mayoría de los resultados de precisión de V4 aparecen solo en gráficos. La API síncrona acepta audio de menos de 30 segundos, y los trabajos por lotes aceptan archivos de hasta dos horas.
Sarvam Audio, anunciado el 3 de febrero de 2026, es un modelo aparte, una extensión de audio del modelo de lenguaje de 3.000 millones de parámetros de Sarvam. La publicación lo compara con GPT-4o Transcribe y Gemini 3 Flash en IndicVoices sin dar cifras, y dice que aún no estaba disponible de forma general.
El preprint de AI4Bharat de marzo de 2026, que cuenta con personal investigador de Sarvam entre sus autores y no ha pasado revisión por pares, midió cuánto distorsionan las puntuaciones las variantes ortográficas. Su WER con información ortográfica (OIWER) acepta cualquier grafía listada de una palabra. Resultó 6,3 puntos más bajo en promedio para un modelo, y la brecha media fue de 14,4 puntos para el tamil y 13,9 para el malayalam, frente a cerca de 5,3 para el maratí y el guyaratí.
Las 1.600 lenguas de Meta
Omnilingual ASR cubre más de 1.600 lenguas, y Meta dice que más de 500 de ellas nunca habían sido transcritas por una IA. Los modelos van de 300 millones a 7.000 millones de parámetros. El código y los modelos tienen licencia Apache 2.0, y el decodificador del artículo toma ideas de los grandes modelos de lenguaje. El titular de la propia Meta es un CER por debajo de 10 en el 78% de las lenguas con su modelo de 7.000 millones de parámetros.
La tabla de resultados del proyecto en GitHub da el panorama indio. El hindi puntúa 3,6 de CER con 236,7 horas de audio de entrenamiento, el tamil 5,2 con 379,3 horas, el bengalí 2,8 y el odia 5,8 con 51,8 horas. El bhojpuri tiene 5,5 horas de entrenamiento y un CER de 16,5. El santali está en 4,9 con 0,4 horas. La tabla no tiene ninguna columna que nombre el audio de prueba.
Constan dos límites. Meta dice que enseñar al modelo una lengua nueva a partir de pocos ejemplos es menos preciso que un entrenamiento completo. Y la página de GitHub dice que la mayoría de los puntos de control rechazan clips de 40 segundos o más, aunque una actualización de diciembre de 2025 añadió variantes “Unlimited” para audio más largo.
En traducción, el artículo Omnilingual MT de Meta del 17 de marzo de 2026 describe lo que los autores llaman el primer sistema que admite más de 1.600 lenguas. Sus modelos de 1.000 a 8.000 millones de parámetros igualan o superan a una base de comparación de 70.000 millones de parámetros, dicen los autores. También reportan que los modelos de base a menudo entienden una lengua de pocos recursos pero la generan mal. tuput no encontró puntuaciones por lengua india en el resumen ni en las páginas que abrió.
La única prueba construida con llamadas telefónicas indias
Voice of India, dirigida por Josh Talks con AI4Bharat y aceptada en Interspeech 2026, usa 536 horas de habla telefónica espontánea de 36.691 hablantes en 15 lenguas. Puntúa con OI-WER, un retículo de grafías válidas. El conjunto de prueba principal es privado, así que los externos no pueden reproducir los resultados, y solo se prevé una pequeña muestra pública.
El informe de Josh Talks de abril de 2026 puntúa 15 sistemas en su tabla. Son porcentajes de OI-WER, y menor es mejor.
| Modelo | Hindi | Bengalí | Tamil |
|---|---|---|---|
| Sarvam Audio | 5,0 | 6,0 | 14,2 |
| Gemini 3 Pro | 6,0 | 8,5 | 15,7 |
| ElevenLabs Scribe v2 | 7,7 | 10,0 | 20,4 |
| IndicConformer (AI4Bharat) | 8,2 | 10,7 | 19,9 |
| OmniASR LLM 7B (Meta) | 13,7 | 22,8 | 43,1 |
| GPT-4o Transcribe | 34,0 | 44,8 | 64,2 |
Sarvam Audio, un producto de Sarvam, queda primero en los tres. GPT-4o Transcribe es un modelo de OpenAI de marzo de 2025. TechCrunch informó en su lanzamiento, citando la prueba interna de OpenAI, de una tasa de error de palabras cercana al 30% para el tamil, el telugu, el malayalam y el canarés. Es una prueba distinta de la de Voice of India.
El informe enumera sus propios límites. Las hipótesis detrás de los retículos de puntuación provienen de un conjunto interno de modelos de reconocimiento. Los nombres propios, los términos de dominio y los números aún no se evalúan. Los hablantes masculinos muestran una penalización relativa de error de entre un 19 y un 21% frente a las hablantes femeninas.
El lanzamiento de Bodhan en septiembre y cifras que no coinciden
En septiembre de 2026, Bodhan AI, un grupo incubado en el IIT Madras que trabaja con AI4Bharat y NVIDIA, lanzó Indic-Transcribe, modelos abiertos de reconocimiento de voz. La ficha del modelo Core reporta un OIWER medio de 8,7 en Voice of India, frente a 10,7 de Saaras V3, 17,8 de IndicConformer y 21,1 de Gemini 3 Pro. Cubre 25 lenguas: el inglés, las 22 lenguas de la lista oficial, el bhojpuri y el bhili. La ficha no dice quién ejecutó la evaluación.
La ficha enumera sus límites. Se entrenó con clips de hasta 30 segundos, produce solo escritura nativa y supone un único hablante. La identificación automática de lengua es irregular, y el bhojpuri, el maithili y el urdu a menudo quedan absorbidos por el hindi.
La ficha de Bodhan y la página de Josh Talks también discrepan sobre los mismos modelos. La ficha da a Gemini 3 Pro 9,3 para el hindi y a OmniASR LLM 7B 9,6, donde la tabla de Josh Talks tiene 6,0 y 13,7. Ninguna página explica la diferencia, así que las puntuaciones de ambas no se pueden juntar.
Google y OpenAI publican recuentos de lenguas
La documentación de Chirp 3 de Google, actualizada el 7 de octubre de 2026, lista el hindi y el inglés de la India como de disponibilidad general. Otras diez lenguas de la India están en vista previa, a saber: asamés, bengalí, guyaratí, canarés, malayalam, maratí, odia, panyabí, tamil y telugu. El urdu no aparece. La página no da tasas de error.
Gemini 3.5 Live Translate de Google, anunciado el 9 de junio de 2026, traduce habla de 70 o más lenguas y busca conservar el ritmo y el tono de voz del hablante. La traducción de voz de Google Meet pasa de cinco lenguas a 70 o más, y de pares solo con inglés a más de 2.000 combinaciones de lenguas en una misma reunión. La publicación dice que la traducción va unos segundos por detrás del hablante y no imprime cifras de pruebas ni nombres de lenguas de la India.
El gpt-realtime-translate de OpenAI, reportado en mayo de 2026, acepta habla en más de 70 lenguas, entre ellas el hindi, el bengalí, el guyaratí, el malayalam, el panyabí y el telugu en la lista de su cookbook. La salida de voz sale en 13 lenguas, y el hindi es la única india. El cookbook de OpenAI advierte de que el modelo puede sustituir nombres o entidades por otros erróneos, y no da cifras de latencia.
Bhashini, la plataforma del Gobierno tratada en el impulso de la India a la IA en sus propias lenguas, también ofrece servicios de voz. tuput no encontró tasas de error publicadas para sus modelos, así que no se puntúa aquí. El uso que hace el propio Tribunal Supremo de la IA para la transcripción y la traducción se expone en la IA en los tribunales indios.
El informe de Josh Talks enumera la evaluación de nombres propios, de dominios específicos y de cifras como trabajo futuro, así que ninguna puntuación de arriba cubre nombres, jerga ni dígitos.
Fuentes y lecturas adicionales
- Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
- arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
- GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
- arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
- Sarvam AI: Saaras V3 speech recognition (11 February 2026)
- Sarvam AI: Introducing Saaras V4 (25 September 2026)
- Sarvam AI: Sarvam Audio (3 February 2026)
- arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
- arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
- arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
- Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
- Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
- DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
- Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
- Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
- OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
- Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
- TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)
Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.
¿Te ha gustado? Recibe el siguiente.
Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.