Una demostración con el iPhone 18 Pro muestra hasta dónde puede llegar la inteligencia artificial ejecutada directamente en un dispositivo Apple. El terminal, equipado con el nuevo chip A20 Pro, es capaz de ejecutar localmente Bonsai 27B, un modelo de lenguaje con 27.000 millones de parámetros, y la prueba difundida por el desarrollador Adrien Grondin apunta a una generación de tokens aproximadamente el doble de rápida que en el iPhone 17 Pro con A19 Pro.
Las claves del A20 Pro y la IA local en 30 segundos
- El iPhone 18 Pro puede ejecutar Bonsai 27B directamente en el dispositivo, sin depender de un servidor remoto.
- La prueba compara el rendimiento con un iPhone 17 Pro y apunta a una velocidad de generación de tokens aproximadamente dos veces superior.
- El A20 Pro incorpora una doble Neural Engine de 16 núcleos diseñada para acelerar las cargas de IA.
- Los 12 GB de memoria LPDDR5X y un ancho de banda de 115,2 GB/s ayudan a ejecutar modelos de mayor tamaño.
- La memoria sigue siendo el principal límite para utilizar modelos más grandes o con una cuantización menos agresiva.
Para un medio especializado en Apple, la parte más interesante de esta prueba no está únicamente en el número de parámetros. Bonsai 27B pertenece a una categoría de modelos que exige una cantidad considerable de memoria, por lo que verlo funcionar directamente en un iPhone muestra cómo el hardware de Apple está empezando a acercarse a cargas de IA que tradicionalmente se asociaban a ordenadores y servidores.
La clave está en la combinación del nuevo A20 Pro con una memoria más rápida y en la forma en la que está preparado el modelo. Bonsai 27B utilizado en la demostración emplea cuantización a 1 bit, una técnica que reduce de forma importante el espacio necesario para almacenar sus parámetros.
Eso cambia por completo lo que puede hacerse con la memoria disponible en un teléfono.
Un Neural Engine pensado para la IA en el propio iPhone
El A20 Pro incorpora una configuración de Neural Engine que supone uno de los cambios más relevantes de esta generación. El chip cuenta con dos bloques de Neural Engine de 16 núcleos, según la información incluida en las fuentes sobre el nuevo iPhone.
El objetivo es acelerar operaciones de inteligencia artificial sin tener que trasladar necesariamente el procesamiento a la CPU o a la GPU. Para aplicaciones que ejecutan modelos directamente en el dispositivo, disponer de un acelerador especializado puede reducir el tiempo necesario para generar cada token.
En la demostración de Bonsai 27B, esa capacidad se combina con una memoria LPDDR5X de 12 GB y un ancho de banda de memoria indicado en 115,2 GB/s. La memoria es especialmente importante en este tipo de aplicaciones porque los pesos del modelo tienen que permanecer disponibles mientras se genera la respuesta.
La comparación con el iPhone 17 Pro resulta especialmente relevante para entender el salto de generación. La prueba de Grondin apunta a una generación de tokens aproximadamente dos veces más rápida en el iPhone 18 Pro.
Conviene poner una precisión importante a ese dato: no es una cifra oficial de Apple. Se trata de una demostración de un desarrollador y la comparación depende del modelo, su configuración y las condiciones concretas de ejecución. Por tanto, no debería interpretarse como que todas las aplicaciones de IA funcionarán exactamente al doble de velocidad.
Pero sí muestra una posibilidad que hace unos años habría resultado mucho más difícil de plantear en un smartphone: ejecutar un modelo de decenas de miles de millones de parámetros sin enviar la petición a la nube.
Bonsai 27B cabe gracias a la cuantización
Aquí aparece uno de los detalles técnicos más importantes de la prueba.
Un modelo de 27.000 millones de parámetros no ocupa lo mismo dependiendo de cómo se representen sus pesos. Bonsai 27B puede utilizarse en una versión cuantizada a 1 bit, lo que reduce considerablemente los requisitos de memoria frente a representaciones con mayor precisión.
Esa reducción permite que el modelo pueda ejecutarse en dispositivos con cantidades de memoria relativamente contenidas. La demostración del iPhone 18 Pro aprovecha precisamente esa característica.
Por eso no sería correcto interpretar la prueba como que un iPhone con 12 GB puede ejecutar cualquier modelo de 27.000 millones de parámetros. El formato del modelo es determinante.
La propia demostración deja esto claro al poner sobre la mesa Bonsai 2, una versión con cuantización de 2 bits. Según la información difundida junto a la prueba, su tamaño resulta demasiado elevado para ejecutarse localmente en el iPhone 18 Pro con el mismo margen.
El problema tampoco consiste únicamente en conseguir que los pesos entren en la memoria. El sistema operativo, la aplicación, la caché y las estructuras utilizadas durante la inferencia también necesitan espacio. Cuando el modelo se acerca demasiado al límite disponible, el rendimiento puede caer o directamente impedir una ejecución eficiente.
El siguiente salto de la IA del iPhone pasa por la memoria
El experimento con Bonsai 27B permite ver dónde está ahora mismo una de las principales barreras para la IA local en el iPhone.
El A20 Pro puede aportar más capacidad de cálculo para estas tareas, pero el acelerador no puede compensar por sí solo la falta de memoria. Cuanto más grande sea el modelo y menos agresiva sea la cuantización, mayor será la cantidad de memoria necesaria.
Esto explica por qué un modelo de 27.000 millones de parámetros puede resultar viable en una versión de 1 bit y, al mismo tiempo, otro modelo de tamaño similar puede quedar fuera de las posibilidades prácticas del teléfono.
También plantea una cuestión interesante para futuras generaciones del iPhone. Si Apple aumenta la memoria disponible, los desarrolladores tendrán más margen para ejecutar modelos con mayor precisión o modelos más grandes sin depender de servicios externos.
Para el usuario, la IA local tiene además una característica distinta a la de los servicios en la nube: el procesamiento puede realizarse directamente en el teléfono. Eso puede resultar útil para determinadas funciones cuando no hay conexión, además de permitir que algunas tareas se mantengan dentro del dispositivo.
La demostración de Bonsai 27B no significa que el iPhone 18 Pro sustituya a una GPU dedicada para ejecutar grandes modelos. Su importancia está en otro punto: un smartphone puede ejecutar modelos de lenguaje que hasta hace poco quedaban claramente fuera de su alcance, siempre que el modelo esté preparado para las limitaciones de memoria y cálculo del dispositivo.
El A20 Pro aporta el hardware necesario para que este escenario sea más viable, pero la cuantización sigue siendo una pieza esencial. La evolución de la memoria será probablemente igual de importante que el aumento de potencia del Neural Engine para determinar qué modelos podrán ejecutarse de forma completamente local en las próximas generaciones del iPhone.
Preguntas frecuentes
¿Puede el iPhone 18 Pro ejecutar Bonsai 27B?
Sí. La demostración de Adrien Grondin muestra Bonsai 27B ejecutándose localmente en un iPhone 18 Pro. El modelo utilizado está cuantizado a 1 bit.
¿El A20 Pro duplica siempre el rendimiento de IA del iPhone 17 Pro?
No puede generalizarse así. La demostración apunta a una generación de tokens aproximadamente dos veces más rápida en esa prueba concreta, pero no es un benchmark oficial de Apple ni implica que todas las cargas de IA obtengan el mismo incremento.
¿Cuánta memoria tiene el iPhone 18 Pro?
La configuración citada en las fuentes es de 12 GB de memoria LPDDR5X, junto con un ancho de banda de memoria de 115,2 GB/s.
¿Por qué la cuantización es tan importante?
Porque reduce la cantidad de memoria necesaria para almacenar los parámetros de un modelo. En este caso permite ejecutar Bonsai 27B en una configuración de 1 bit, mientras que una versión de 2 bits como Bonsai 2 presenta mayores exigencias de memoria.







