Skip to content
Sarvam reporta cerca de un 19% de error de palabras en 22 lenguas de la India y Meta cubre 1.600, pero la mayoría de las puntuaciones de voz publicadas vienen de sus propios creadores
Inteligencia artificial

Sarvam reporta cerca de un 19% de error de palabras en 22 lenguas de la India y Meta cubre 1.600, pero la mayoría de las puntuaciones de voz publicadas vienen de sus propios creadores

Ilustración de tuput

Español

Saaras V3 de Sarvam obtuvo cerca de un 19% de error de palabras en la prueba IndicVoices en febrero de 2026, y el modelo abierto de Meta anota una tasa de error de caracteres de 3,6 para el hindi. La única prueba construida con llamadas telefónicas indias mantiene privado su conjunto de evaluación, y las páginas de Google y OpenAI sobre sus productos de voz más recientes dan el número de idiomas pero no tasas de error en lenguas de la India.

· · 8 min de lectura

El modelo de voz Saaras V3 de Sarvam AI obtuvo cerca de un 19% de error de palabras en la prueba IndicVoices, según la propia publicación de Sarvam del 11 de febrero de 2026. El modelo abierto Omnilingual ASR de Meta, lanzado el 10 de noviembre de 2025, anota una tasa de error de caracteres de 3,6 para el hindi en su tabla de resultados. Las dos cifras miden cosas distintas sobre audios distintos, y la mayoría de las demás puntuaciones publicadas es igual de difícil de alinear.

La tasa de error de palabras (WER) es la proporción de palabras que un sistema falla frente a una transcripción humana. La tasa de error de caracteres (CER) cuenta en cambio los caracteres erróneos. Las lenguas de la India añaden un problema más. Investigadores de AI4Bharat, el laboratorio de tecnología del lenguaje del IIT Madras, escribieron en un preprint del 1 de marzo de 2026 que la ortografía flexible y la separación o unión opcional de palabras hacen que el WER simple califique a los sistemas peor de lo que los califican los usuarios.

Los modelos de Sarvam para 22 lenguas

Saaras V3 maneja en un solo modelo las 22 lenguas oficiales de la India más el inglés. La publicación de Sarvam da cerca de un 19% de WER en IndicVoices para todas las lenguas y un 19,31% para las diez más habladas. Dice que el anterior Saaras V2.5, que cubría 11 lenguas, puntuó cerca de un 22% en el mismo conjunto.

IndicVoices es un conjunto de datos de AI4Bharat. Su artículo de 2024 describe 7.348 horas de habla de 16.237 hablantes en 145 distritos y 22 lenguas, de las cuales 1.639 horas estaban transcritas en ese momento. La publicación de Sarvam nombra a GPT-4o Transcribe, Gemini 3 Pro, Deepgram Nova3 y ElevenLabs Scribe v2 como rivales a los que supera, pero no imprime puntuaciones para ellos. No nombra a ningún evaluador externo.

Saaras V4 llegó el 25 de septiembre de 2026. Sarvam reporta un 16,03% de WER en IndicContextEval, una prueba de AI4Bharat en la que el usuario aporta términos clave, y un error de identificación de idioma del 5,22% en las 22 lenguas y del 2,9% en las diez principales. La mayoría de los resultados de precisión de V4 aparecen solo en gráficos. La API síncrona acepta audio de menos de 30 segundos, y los trabajos por lotes aceptan archivos de hasta dos horas.

Sarvam Audio, anunciado el 3 de febrero de 2026, es un modelo aparte, una extensión de audio del modelo de lenguaje de 3.000 millones de parámetros de Sarvam. La publicación lo compara con GPT-4o Transcribe y Gemini 3 Flash en IndicVoices sin dar cifras, y dice que aún no estaba disponible de forma general.

El preprint de AI4Bharat de marzo de 2026, que cuenta con personal investigador de Sarvam entre sus autores y no ha pasado revisión por pares, midió cuánto distorsionan las puntuaciones las variantes ortográficas. Su WER con información ortográfica (OIWER) acepta cualquier grafía listada de una palabra. Resultó 6,3 puntos más bajo en promedio para un modelo, y la brecha media fue de 14,4 puntos para el tamil y 13,9 para el malayalam, frente a cerca de 5,3 para el maratí y el guyaratí.

Las 1.600 lenguas de Meta

Omnilingual ASR cubre más de 1.600 lenguas, y Meta dice que más de 500 de ellas nunca habían sido transcritas por una IA. Los modelos van de 300 millones a 7.000 millones de parámetros. El código y los modelos tienen licencia Apache 2.0, y el decodificador del artículo toma ideas de los grandes modelos de lenguaje. El titular de la propia Meta es un CER por debajo de 10 en el 78% de las lenguas con su modelo de 7.000 millones de parámetros.

La tabla de resultados del proyecto en GitHub da el panorama indio. El hindi puntúa 3,6 de CER con 236,7 horas de audio de entrenamiento, el tamil 5,2 con 379,3 horas, el bengalí 2,8 y el odia 5,8 con 51,8 horas. El bhojpuri tiene 5,5 horas de entrenamiento y un CER de 16,5. El santali está en 4,9 con 0,4 horas. La tabla no tiene ninguna columna que nombre el audio de prueba.

Constan dos límites. Meta dice que enseñar al modelo una lengua nueva a partir de pocos ejemplos es menos preciso que un entrenamiento completo. Y la página de GitHub dice que la mayoría de los puntos de control rechazan clips de 40 segundos o más, aunque una actualización de diciembre de 2025 añadió variantes “Unlimited” para audio más largo.

En traducción, el artículo Omnilingual MT de Meta del 17 de marzo de 2026 describe lo que los autores llaman el primer sistema que admite más de 1.600 lenguas. Sus modelos de 1.000 a 8.000 millones de parámetros igualan o superan a una base de comparación de 70.000 millones de parámetros, dicen los autores. También reportan que los modelos de base a menudo entienden una lengua de pocos recursos pero la generan mal. tuput no encontró puntuaciones por lengua india en el resumen ni en las páginas que abrió.

La única prueba construida con llamadas telefónicas indias

Voice of India, dirigida por Josh Talks con AI4Bharat y aceptada en Interspeech 2026, usa 536 horas de habla telefónica espontánea de 36.691 hablantes en 15 lenguas. Puntúa con OI-WER, un retículo de grafías válidas. El conjunto de prueba principal es privado, así que los externos no pueden reproducir los resultados, y solo se prevé una pequeña muestra pública.

El informe de Josh Talks de abril de 2026 puntúa 15 sistemas en su tabla. Son porcentajes de OI-WER, y menor es mejor.

ModeloHindiBengalíTamil
Sarvam Audio5,06,014,2
Gemini 3 Pro6,08,515,7
ElevenLabs Scribe v27,710,020,4
IndicConformer (AI4Bharat)8,210,719,9
OmniASR LLM 7B (Meta)13,722,843,1
GPT-4o Transcribe34,044,864,2

Sarvam Audio, un producto de Sarvam, queda primero en los tres. GPT-4o Transcribe es un modelo de OpenAI de marzo de 2025. TechCrunch informó en su lanzamiento, citando la prueba interna de OpenAI, de una tasa de error de palabras cercana al 30% para el tamil, el telugu, el malayalam y el canarés. Es una prueba distinta de la de Voice of India.

El informe enumera sus propios límites. Las hipótesis detrás de los retículos de puntuación provienen de un conjunto interno de modelos de reconocimiento. Los nombres propios, los términos de dominio y los números aún no se evalúan. Los hablantes masculinos muestran una penalización relativa de error de entre un 19 y un 21% frente a las hablantes femeninas.

El lanzamiento de Bodhan en septiembre y cifras que no coinciden

En septiembre de 2026, Bodhan AI, un grupo incubado en el IIT Madras que trabaja con AI4Bharat y NVIDIA, lanzó Indic-Transcribe, modelos abiertos de reconocimiento de voz. La ficha del modelo Core reporta un OIWER medio de 8,7 en Voice of India, frente a 10,7 de Saaras V3, 17,8 de IndicConformer y 21,1 de Gemini 3 Pro. Cubre 25 lenguas: el inglés, las 22 lenguas de la lista oficial, el bhojpuri y el bhili. La ficha no dice quién ejecutó la evaluación.

La ficha enumera sus límites. Se entrenó con clips de hasta 30 segundos, produce solo escritura nativa y supone un único hablante. La identificación automática de lengua es irregular, y el bhojpuri, el maithili y el urdu a menudo quedan absorbidos por el hindi.

La ficha de Bodhan y la página de Josh Talks también discrepan sobre los mismos modelos. La ficha da a Gemini 3 Pro 9,3 para el hindi y a OmniASR LLM 7B 9,6, donde la tabla de Josh Talks tiene 6,0 y 13,7. Ninguna página explica la diferencia, así que las puntuaciones de ambas no se pueden juntar.

Google y OpenAI publican recuentos de lenguas

La documentación de Chirp 3 de Google, actualizada el 7 de octubre de 2026, lista el hindi y el inglés de la India como de disponibilidad general. Otras diez lenguas de la India están en vista previa, a saber: asamés, bengalí, guyaratí, canarés, malayalam, maratí, odia, panyabí, tamil y telugu. El urdu no aparece. La página no da tasas de error.

Gemini 3.5 Live Translate de Google, anunciado el 9 de junio de 2026, traduce habla de 70 o más lenguas y busca conservar el ritmo y el tono de voz del hablante. La traducción de voz de Google Meet pasa de cinco lenguas a 70 o más, y de pares solo con inglés a más de 2.000 combinaciones de lenguas en una misma reunión. La publicación dice que la traducción va unos segundos por detrás del hablante y no imprime cifras de pruebas ni nombres de lenguas de la India.

El gpt-realtime-translate de OpenAI, reportado en mayo de 2026, acepta habla en más de 70 lenguas, entre ellas el hindi, el bengalí, el guyaratí, el malayalam, el panyabí y el telugu en la lista de su cookbook. La salida de voz sale en 13 lenguas, y el hindi es la única india. El cookbook de OpenAI advierte de que el modelo puede sustituir nombres o entidades por otros erróneos, y no da cifras de latencia.

Bhashini, la plataforma del Gobierno tratada en el impulso de la India a la IA en sus propias lenguas, también ofrece servicios de voz. tuput no encontró tasas de error publicadas para sus modelos, así que no se puntúa aquí. El uso que hace el propio Tribunal Supremo de la IA para la transcripción y la traducción se expone en la IA en los tribunales indios.

El informe de Josh Talks enumera la evaluación de nombres propios, de dominios específicos y de cifras como trabajo futuro, así que ninguna puntuación de arriba cubre nombres, jerga ni dígitos.

Share
Copied!

Fuentes y lecturas adicionales

  1. Meta AI: Omnilingual ASR, advancing automatic speech recognition (10 November 2025)
  2. arXiv: Omnilingual ASR, Open-Source Multilingual Speech Recognition for 1600+ Languages (12 November 2025)
  3. GitHub: facebookresearch/omnilingual-asr, code, model list and 7B per-language results table
  4. arXiv: Omnilingual MT, Machine Translation for 1,600 Languages (17 March 2026)
  5. Sarvam AI: Saaras V3 speech recognition (11 February 2026)
  6. Sarvam AI: Introducing Saaras V4 (25 September 2026)
  7. Sarvam AI: Sarvam Audio (3 February 2026)
  8. arXiv: IndicVoices, Towards building an Inclusive Multilingual Speech Dataset for Indian Languages (4 March 2024)
  9. arXiv: Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages (1 March 2026)
  10. arXiv: Voice of India, A Large-Scale Benchmark for Real-World Speech Recognition in India (21 April 2026)
  11. Josh Talks AI: Voice of India, Building India's National ASR Benchmark (April 2026)
  12. Hugging Face: Bodhan AI Indic-Transcribe-core model card (September 2026)
  13. DT Next: IIT-M-incubated Bodhan AI unveils open models for Indian languages (12 September 2026)
  14. Google Cloud: Chirp 3 transcription model documentation (last updated 7 October 2026)
  15. Google: Fluid, natural voice translation with Gemini 3.5 Live Translate (9 June 2026)
  16. OpenAI Cookbook: Build Live Translation Apps with gpt-realtime-translate
  17. Quantum Zeitgeist: OpenAI's New Model Translates 70+ Languages in Realtime (11 May 2026)
  18. TechCrunch: OpenAI upgrades its transcription and voice-generating AI models (20 March 2025)

Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.

#speech recognition#machine translation#indic languages#sarvam ai#omnilingual asr#voice of india#ai4bharat#live translation

¿Te ha gustado? Recibe el siguiente.

Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.

Más en Inteligencia artificial
La Misión IndiaAI tiene más de 38.000 GPU a 65 rupias la hora y 12 desarrolladores de modelos financiados, pero su presupuesto de 2025-26 se revisó a la baja, de 2.000 a 800 crore de rupias
El cómputo es barato, los primeros modelos ya salieron y la partida presupuestaria es pequeña. Lo que dicen los propios documentos del gobierno sobre cada pilar de la misión, y dónde presionan Carnegie India, Takshashila y un director de investigación vinculado al IISc.
El mundo construyó la IA en inglés primero. India acaba de gastar 1.250 millones de dólares para construir una en sus propios idiomas
Un programa gubernamental está alquilando casi 60.000 GPU a startups indias a una fracción del precio de mercado, y una plataforma de traducción atiende decenas de millones de solicitudes al día en idiomas con los que ChatGPT todavía tropieza. No todas las apuestas han dado resultado todavía.
El ranking SWE-Bench Pro de Scale pone al mejor agente de programación en 61,5 %, los mantenedores rechazan muchas correcciones que superan las pruebas, y METR dice que su último ensayo no puede mostrar cuánto tiempo ahorran los agentes
Los benchmarks dicen que los agentes son fuertes. Los mantenedores, un ensayo aleatorizado y un montón de informes de incidentes dicen que el panorama es más estrecho. Esto es lo que mide realmente cada cifra.
← todos los artículos