Ilustración de tuput
Español
El modelo local de Apple tiene unos 3.000 millones de parámetros y una ventana de 4.096 tokens. Google indica 1,1 GB y 2,5 GB de memoria de teléfono para Gemma 4 E2B y E4B. Casi todas las puntuaciones de precisión las obtuvo la empresa que construyó el modelo, y el banco de pruebas independiente para teléfonos lanzado en agosto publicó tiempos para un solo iPhone.
La ficha del modelo Gemma 4 de Google indica 2.300 millones de parámetros efectivos para su modelo de teléfono más pequeño, el E2B, y la tabla de tamaños de Google da una cifra de memoria móvil de 1,1 GB para él y de 2,5 GB para el E4B, más grande. El modelo local de Apple es una red densa de 3.000 millones de parámetros que trabaja dentro de una ventana de 4.096 tokens por sesión. Son las cifras de los propios fabricantes al 8 de octubre de 2026, y la mayoría de las puntuaciones que las acompañan también las obtuvieron ellos.
Un parámetro es un número aprendido dentro de un modelo, y un token es un fragmento de palabra de unos tres a cuatro caracteres ingleses, según Apple.
Lo que publica Apple
Apple presentó sus modelos de fundación de tercera generación el 8 de junio de 2026. Dos de ellos corren en el teléfono. AFM 3 Core es un modelo denso de 3.000 millones de parámetros. AFM 3 Core Advanced guarda 20.000 millones de parámetros en el almacenamiento flash, activa de 1.000 a 4.000 millones por solicitud y lleva las partes elegidas a la memoria de trabajo. Apple dice que el mayor está pensado para sus chips más capaces y no nombra ningún dispositivo. No da cifra de memoria para ninguno de los dos modelos.
El límite con el que primero chocan los desarrolladores es la ventana. La nota técnica TN3193 de Apple, actualizada el 31 de marzo de 2026, dice que el modelo local tiene una ventana de contexto de 4.096 tokens por sesión. Las instrucciones, las consultas, las definiciones de herramientas y las propias respuestas del modelo cuentan contra ella. El texto en inglés rinde unos tres a cuatro caracteres por token, y el chino, el japonés o el coreano, alrededor de uno.
Lo que publica Google
La ficha de Gemma 4 da 2.300 millones de parámetros efectivos y 5.100 millones con las incrustaciones para el E2B, y 4.500 millones y 8.000 millones para el E4B. Efectivos significa el recuento que el modelo usa activamente, que es menor porque las grandes tablas de consulta quedan fuera. Ambos tamaños admiten un contexto de 128.000 tokens.
La tabla de memoria indica 2,9 GB y 4,5 GB para las versiones de 4 bits, y 1,1 GB y 2,5 GB en una fila móvil para su entorno de ejecución LiteRT-LM. El uso móvil solo con texto es de 0,84 GB y 2,2 GB. La tabla abarca la carga de los pesos y, según sus notas, deja fuera la caché KV, la memoria de trabajo que crece con la conversación.
Gemini Nano, la versión que los teléfonos Android ejecutan mediante el servicio de sistema AICore, se construye a partir de esta familia. La entrada de Google del 2 de abril de 2026 dice que Gemma 4 es la base de Gemini Nano 4, que describe como hasta 4 veces más rápido y hasta un 60% más ligero en batería que la versión anterior. La entrada no indica condiciones de prueba para ninguna de las dos afirmaciones. La página de ML Kit enumera Nano 4 en la serie Pixel 11 y en tres modelos Galaxy Z Flip8 y Fold8, mientras que los Pixel 9 y 10 aparecen bajo la versión 3. Esa página advierte además de que distintas versiones de Nano pueden responder de forma diferente a la misma consulta.
Meta y Microsoft
La ficha de Llama 3.2 1B de Meta indica 1.230 millones de parámetros, publicado el 25 de septiembre de 2024. En un OnePlus 12 con el entorno ExecuTorch de Meta, la versión cuantizada ocupa 1.083 MB en disco y 1.921 MB de memoria de trabajo y decodifica 50,2 tokens por segundo. La versión de precisión completa ocupa 2.358 MB y 3.185 MB y logra 19,2. Esas pruebas las hizo Meta. Tuput no encontró ningún modelo Llama pequeño más nuevo de Meta.
Phi-4-mini-instruct de Microsoft tiene 3.800 millones de parámetros y una ventana de 128.000 tokens, con lanzamiento en febrero de 2025. Su ficha indica 67,3 en MMLU, un examen de conocimientos generales, y 88,6 en GSM8K, un conjunto de problemas de matemáticas escolares. La ficha no da cifra de memoria ni de velocidad en teléfono.
Los chips, y afirmaciones que nadie más ha comprobado
MediaTek presentó el Dimensity 9600 Pro el 15 de septiembre de 2026. El comunicado dice que la NPU 1090 (una unidad de procesamiento neuronal, la parte del chip hecha para IA) tiene un rendimiento de prefill un 51% mayor, es decir, una lectura más rápida de una consulta, y un 55% más de tokens por vatio. Dice también que el chip admite modelos de hasta 30.000 millones de parámetros. La única nota al pie dice que las métricas provienen de “pruebas en dispositivo de demostración en los laboratorios de MediaTek”, sin nombrar chip ni modelo de referencia. Los primeros teléfonos llegan este trimestre.
Qualcomm lanzó el Snapdragon 8 Elite Extreme Gen 6 en septiembre de 2026. La nota de HotHardware del 22 de septiembre da las cifras de Qualcomm como una NPU hasta un 35% más rápida, una memoria compartida un 50% mayor que la de la generación anterior y hasta un 50% más de prefill INT4. El ejemplo de Qualcomm es un modelo de mezcla de expertos de más de 30.000 millones de parámetros con unos 3.000 millones activos por token, algo que HotHardware advierte que no es lo mismo que ejecutar un modelo denso de 30.000 millones. Nombra el Motorola Signature 27 como uno de los primeros teléfonos.
La prueba independiente
Artificial Analysis, junto con Liquid AI, lanzó pruebas para teléfonos el 24 de agosto de 2026. Puntuó 41 versiones cuantizadas y ejecutó 33 en un iPhone 17 Pro, y el artículo de lanzamiento publica tiempos en teléfono para ese único dispositivo. Las versiones debían caber en 8 GB con precisión de 4 bits o menos y corrían en el motor llama.cpp.
Dos modelos de 2.600 a 3.000 millones de parámetros empataron en 63 en su promedio de cinco pruebas. LFM2.5-2.6B tardó 8,0 segundos y 2,3 GB, y Nanbeige4.2-3B tardó 21,4 segundos y 4,0 GB. Los dos modelos de 9.000 millones tardaron más de 25 segundos y 6,9 GB. Gemma 4 E4B está entre los modelos que nombra. El modelo de Apple y Gemini Nano no.
En MMLU Pro, una versión más difícil de ese examen de conocimientos generales, la ficha de Gemma 4 de Google indica 69,4% para el E4B y 60,0% para el E2B, y dice solo que los modelos se evaluaron con muchos conjuntos de datos. La entrada de tercera generación de Apple no informa de pruebas estándar. Su AFM 3 Core fue preferido en el 45,6% de las consultas frente al 23,3% del modelo de 2025 en la propia evaluación humana comparativa de Apple, y Apple dijo que seguiría un informe técnico. Tuput no encontró ninguno al 8 de octubre.
Lo que los modelos no pueden hacer
La sesión WWDC25 de Apple dice que se evite usar el modelo local para matemáticas o código y que no se confíe en él para datos. No conocerá los hechos posteriores a su fecha de entrenamiento y puede inventar respuestas. El tamaño de Phi-4-mini limita los datos que puede almacenar, dice la ficha de Microsoft, y el modelo es más débil fuera del inglés. Gemma 4 puede afirmar datos incorrectos o desactualizados, según la ficha de Google. La página de Gemini Nano de Android enumera límites de tokens, límites de hardware y “límites de capacidad del modelo” sin dar los límites. Artificial Analysis dejó fuera las pruebas con agentes porque los modelos pequeños puntúan casi cero en ellas.
Lenguas de la India en el dispositivo
La página de soporte de Apple, publicada el 14 de septiembre de 2026, enumera 16 entradas de idioma para Apple Intelligence, entre ellas inglés, japonés y turco, y no nombra ninguna lengua india. La API de resumen de ML Kit en Android admite inglés, japonés y coreano. Gemma 4 está preentrenado en más de 140 lenguas, con soporte inmediato para más de 35, aunque la ficha no las enumera. Meta incluye el hindi entre ocho idiomas oficialmente admitidos para Llama 3.2 1B, y su ficha muestra al modelo base con 33,5 en MMLU multilingüe en hindi frente a 40,5 en francés.
La opción de origen indio es Sarvam Edge, presentada el 14 de febrero de 2026. La entrada de Sarvam enumera un reconocedor de voz de 74 millones de parámetros y unos 294 MB, un sintetizador de voz de 24 millones de parámetros y unos 60 MB y un modelo de traducción de unos 150 millones de parámetros y 334 MB. La voz cubre 10 lenguas indias y la traducción esas 10 más el inglés, lo que da 110 pares. El reconocimiento de voz arranca en menos de 300 milisegundos en un Snapdragon 8 Gen 3, informa Sarvam, aunque la entrada no publica tasas de error de palabras para su comparación con Google Cloud. La página del producto dice 22 lenguas, lo cual no coincide con las 10 de la entrada. Las puntuaciones de Sarvam para las versiones en la nube se tratan en modelos de voz y traducción, y el impulso más amplio está en el trabajo de la India con IA en sus propias lenguas.
Intel India y la división Bhashini del Gobierno anunciaron BHASHINI Vidyalekha el 2 de marzo de 2026, una herramienta sin conexión que transcribe clases en inglés y las traduce para estudiantes. Corre en portátiles Intel Core Ultra, no en teléfonos, y el anuncio no nombra sus lenguas. La página de producto de Sarvam dice que Edge es una oferta comercial, disponible contactando con la empresa, y no de código abierto.
Fuentes y lecturas adicionales
- Apple Machine Learning Research: Introducing the Third Generation of Apple's Foundation Models (8 June 2026)
- Apple Developer: TN3193, Managing the on-device foundation model's context window (updated 31 March 2026)
- Apple Developer: Explore prompt design and safety for on-device foundation models (WWDC25, session 248)
- Apple Support: Apple Intelligence supported languages and iPhone models (published 14 September 2026)
- Google AI for Developers: Gemma 4 model card
- Google AI for Developers: Gemma 4 model overview and memory requirements
- Android Developers Blog: Gemma 4, the new standard for local agentic intelligence on Android (2 April 2026)
- Google for Developers: Overview of the ML Kit GenAI APIs (updated 7 October 2026)
- Google for Developers: ML Kit GenAI Summarization API (updated 7 October 2026)
- Android Developers: Gemini Nano and AICore (updated 8 October 2026)
- Hugging Face: Meta Llama-3.2-1B model card
- Hugging Face: Microsoft Phi-4-mini-instruct model card
- MediaTek: Dimensity 9600 Pro press release (15 September 2026)
- HotHardware: Snapdragon 8 Elite Extreme Gen 6 release coverage (22 September 2026)
- Artificial Analysis: Mobile phone intelligence and inference benchmarks (24 August 2026)
- Sarvam AI: Announcing Sarvam Edge (14 February 2026)
- Sarvam AI: Sarvam Edge product page
- IANS: Intel and Digital India BHASHINI bring offline multilingual capabilities to AI PCs (2 March 2026)
Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.
¿Te ha gustado? Recibe el siguiente.
Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.