¿Qué es la IA en el Dispositivo?

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Actualizado en julio de 2026
La IA en el dispositivo es inteligencia artificial que se ejecuta directamente en hardware local, un smartphone, una laptop o un chip integrado, en lugar de enviar solicitudes a un servidor remoto. El cómputo del modelo ocurre en el propio dispositivo, usando chips integrados como las NPU, de modo que el sistema puede responder sin conexión a internet, y los datos nunca tienen que salir del hardware en el que se originaron.
Esa única decisión de diseño, mantener el cómputo local en lugar de enviarlo a un centro de datos, cambia la economía, el perfil de privacidad y los modos de falla de una función de IA. También es la razón por la que su teléfono ahora puede transcribir una nota de voz, resumir un hilo de mensajes de texto o reescribir un correo electrónico mientras está en modo avión.
Cómo Funciona Realmente la IA en el Dispositivo
Ejecutar un modelo grande en un teléfono solía ser inviable. Un large language model de escala de frontera puede tener cientos de miles de millones de parámetros y necesita GPU de centro de datos solo para responder una sola consulta. El hardware de consumo tiene una fracción de esa memoria y de ese presupuesto de energía. Tres avances cerraron la brecha.

Unidades de Procesamiento Neuronal (NPU). Los chips modernos de teléfonos y laptops ahora vienen con un acelerador de IA dedicado junto a la CPU y la GPU. Una NPU está diseñada específicamente para las operaciones matriciales que las Neural Networks ejecutan constantemente, y realiza esas operaciones de forma mucho más eficiente, tanto en velocidad como en consumo de batería, de lo que lo haría un procesador de propósito general. El Snapdragon 8 Elite Gen 5 de Qualcomm, construido para los teléfonos de la generación 2026, incluye una NPU Hexagon que, según Qualcomm, funciona un 37 por ciento más rápido que la de la generación anterior, específicamente para permitir que modelos más grandes se ejecuten localmente sin agotar la batería.
Cuantización. Incluso con un chip dedicado, un modelo de precisión completa suele ser demasiado grande para caber en la memoria de un teléfono. La cuantización reduce el tamaño de un modelo disminuyendo la precisión numérica de sus pesos, a menudo de 32 bits a 8 bits o 4 bits, recortando la huella de memoria de 4 a 8 veces con solo una pequeña pérdida de precisión. Este es el paso que convierte un modelo construido para un rack de servidores en uno que cabe en un teléfono.
Modelos de Lenguaje Pequeños (SLM). Junto con la compresión, los creadores de modelos están entrenando modelos para que sean pequeños desde el principio. Los modelos de lenguaje pequeños, típicamente en el rango de 1 a 10 mil millones de parámetros, están diseñados para ser lo suficientemente capaces para un conjunto definido de tareas (resumir, reescribir, clasificar, responder preguntas sobre contenido en pantalla) mientras se mantienen lo bastante livianos para ejecutarse en la NPU de un teléfono. La destilación de conocimiento, donde un modelo "estudiante" pequeño aprende a imitar a un "maestro" más grande, es una de las principales técnicas usadas para construirlos.
En conjunto, estas tres piezas permiten que un teléfono o una laptop ejecute inferencia, el paso en el que un modelo entrenado realmente produce una respuesta, completamente en el silicio local, sin que ningún dato se envíe nunca a través de la red.
Por Qué las Empresas y los Usuarios la Quieren: Privacidad, Latencia, Uso sin Conexión y Costo
Privacidad. Cuando la inferencia se ejecuta en el dispositivo, la entrada nunca tiene que salir de él. Una nota de voz, una foto, un borrador de correo electrónico o una nota de un paciente pueden procesarse sin transmitir ese contenido a un servidor de terceros. Para las industrias reguladas o cualquier flujo de trabajo que toque datos sensibles, ese suele ser el factor decisivo por encima de la calidad real del modelo.

Latencia. Una solicitud en la nube tiene que viajar hasta un centro de datos y de regreso, incluso antes de que el modelo empiece a procesar. La inferencia en el dispositivo se salta por completo ese viaje de ida y vuelta, razón por la cual las funciones locales (autocompletado, transcripción en vivo, resumen en pantalla) se sienten instantáneas, mientras que las funciones enrutadas a la nube tienen un retraso visible.
Operación sin conexión. Un modelo que se ejecuta localmente funciona sin señal, en un avión, en un sótano, en la planta de una fábrica o en una zona rural con conectividad poco confiable. Cualquier cosa que dependa de una llamada API en vivo deja de funcionar en el momento en que se pierde la conexión.
Costo. La inferencia en la nube se factura por token o por llamada y escala directamente con el uso; una función que se vuelve popular se vuelve costosa. La inferencia en el dispositivo se ejecuta en hardware que el usuario o la empresa ya posee, así que no hay costo marginal por consulta una vez que el modelo está en el dispositivo.
Los Límites Reales: Tamaño del Modelo y Batería
La IA en el dispositivo no es una mejora gratuita sobre la IA en la nube, y fingir lo contrario genera expectativas internas equivocadas. Dos restricciones definen lo que realmente es posible hoy.

El tamaño del modelo limita la capacidad. La memoria de teléfonos y laptops se mide en gigabytes de un solo dígito o de doble dígito bajo, no en los cientos de gigabytes a los que tiene acceso un clúster de GPU de centro de datos. Ese techo significa que los modelos en el dispositivo son, por necesidad, más pequeños y menos capaces en general que los modelos de frontera en la nube. Son fuertes en tareas acotadas y bien definidas, y más débiles en razonamiento abierto, documentos largos o cualquier cosa que requiera conocimiento muy actual.
Límites de batería y térmicos. Incluso con una NPU eficiente, la inferencia de IA sostenida consume energía y genera calor, ambos recursos escasos en un dispositivo alimentado por batería. Esa es una restricción real sobre cuánto procesamiento en el dispositivo puede realizar un aparato de forma continua sin agotar visiblemente la batería o limitar el rendimiento, lo cual es parte de la razón por la que los fabricantes de teléfonos enrutan las solicitudes más pesadas a la nube en lugar de forzar todo a través del chip local.
La propia previsión de Deloitte para 2026 capta esta tensión directamente: a pesar del crecimiento de los aceleradores de IA integrados en teléfonos y PC, Deloitte predice que casi todo el cómputo de IA en 2026 seguirá ocurriendo en grandes centros de datos o en servidores empresariales de alta gama en lugar de en el dispositivo, porque las NPU actuales solo son lo bastante potentes para tareas de inferencia ligeras y de una sola vez, como resumir un correo electrónico corto, no para razonamiento sostenido y complejo.
Esa es la forma práctica que tiene hoy la IA en el dispositivo: real y en rápido crecimiento, pero un complemento de la IA en la nube y no un reemplazo total de ella.
Datos Clave
- Se prevé que los smartphones con capacidad de GenAI, teléfonos que ejecutan modelos de IA en el dispositivo, alcancen el 45 por ciento de los envíos globales de smartphones en 2026, frente al 36 por ciento en 2025, según Counterpoint Research.
- Los envíos globales acumulados de smartphones con capacidad de GenAI superaron los 500 millones de unidades para el tercer trimestre de 2025, según Counterpoint Research.
- La proporción de smartphones enviados con capacidad de IA generativa podría superar el 30 por ciento para fines de 2025, y cerca de la mitad de todas las PC vendidas en 2025 tendrán capacidad de procesamiento local de IA generativa, según las Predicciones TMT 2025 de Deloitte.
- Se proyectó que las PC con IA representarían el 31 por ciento del mercado mundial de PC para fines de 2025, según Gartner.
- A pesar del auge de los aceleradores de IA en el dispositivo, las Predicciones TMT 2026 de Deloitte pronostican que casi todo el cómputo de IA en 2026 seguirá ejecutándose en centros de datos o en servidores empresariales de alta gama en lugar de en PC y teléfonos, ya que las NPU actuales están construidas para inferencia ligera y de una sola vez, y no para cargas de trabajo pesadas y sostenidas.
- El costo de ejecutar inferencia al nivel de rendimiento de GPT-3.5 cayó de $20.00 a $0.07 por millón de tokens entre noviembre de 2022 y octubre de 2024, una caída de más de 280 veces impulsada en gran parte por modelos pequeños eficientes, según el informe Stanford AI Index 2025.
- El Snapdragon 8 Elite Gen 5 de Qualcomm, construido para los teléfonos de la generación 2026, incluye una NPU Hexagon que, según Qualcomm, funciona un 37 por ciento más rápido que su predecesora, específicamente para ejecutar modelos más grandes localmente.
La IA en el Dispositivo en 2026: Ejemplos Reales
La IA en el dispositivo pasó de ser una demo de investigación a ser una función estándar en las principales plataformas de consumo.
Apple Intelligence. Apple construyó su sistema de IA en torno al procesamiento en el dispositivo por defecto. Muchos de los modelos detrás de Apple Intelligence se ejecutan por completo en el iPhone, el iPad o la Mac; cuando una solicitud necesita un modelo más grande del que cabe en el dispositivo, se enruta a Private Cloud Compute de Apple, que, según Apple, se ejecuta en servidores de silicio Apple dedicados con el mismo modelo de seguridad que el propio dispositivo, en lugar de una nube de propósito general.
Gemini Nano. Gemini Nano de Google es una versión compacta de su familia de modelos Gemini, construida específicamente para ejecutarse en el dispositivo en los teléfonos Pixel a través del sistema AICore de Android, potenciando funciones como el resumen en el dispositivo y las respuestas inteligentes sin una llamada de red.
Copilot+ PC. La categoría Copilot+ PC de Microsoft, lanzada en 2024 y ahora un nivel convencional de laptop con Windows, requiere una NPU capaz de al menos 40 billones de operaciones por segundo (TOPS) para que el equipo pueda ejecutar funciones de IA en el dispositivo, como subtitulado en vivo y generación de imágenes, de forma local en lugar de a través de la nube.
Llama en el dispositivo. Meta construyó sus modelos Llama 3.2 1B y 3B específicamente para implementación en el borde y en el dispositivo, lo bastante pequeños para ejecutarse en teléfonos y laptops a través de socios como Qualcomm y MediaTek, dirigidos a desarrolladores que quieren resumen, reescritura o llamadas a herramientas locales sin un viaje de ida y vuelta al servidor.
IA en el Dispositivo vs. IA en la Nube
| Factor | IA en el Dispositivo | IA en la Nube |
|---|---|---|
| Dónde se ejecuta | Localmente, en el teléfono, la laptop o el chip del dispositivo | Servidores remotos a los que se accede por internet |
| Privacidad de los datos | Los datos permanecen en el dispositivo por defecto | Los datos se transmiten a un servidor de terceros |
| Latencia | Casi instantánea, sin viaje de ida y vuelta por la red | Agrega tiempo de red y de cola en cada llamada |
| Capacidad sin conexión | Funciona sin conexión a internet | Requiere una conexión activa |
| Tamaño/capacidad del modelo | Modelos más pequeños, enfocados en tareas específicas | Puede ejecutar modelos de propósito general y escala de frontera |
| Estructura de costos | Costo fijo del hardware, sin tarifa por consulta | Basado en el uso, escala con el volumen |
| Impacto en batería/térmico | Consume energía local, limita el uso pesado sostenido | Sin costo de cómputo local, pero depende de la red |
| Mejor para | Tareas sensibles a la privacidad, a la latencia y sin conexión | Razonamiento complejo, contexto amplio, conocimiento actualizado |
Ninguna columna gana por completo. La mayoría de los sistemas de IA en producción, y la mayoría de los dispositivos de consumo mencionados anteriormente, usan un enfoque híbrido: manejar solicitudes rutinarias y bien definidas en el dispositivo, y enrutar a la nube cualquier cosa que necesite más capacidad, más contexto o información más actual.
Implicaciones para las Empresas
Para una empresa que evalúa dónde ejecutar una función de IA, la decisión entre el dispositivo y la nube no se trata realmente de cuál es "mejor". Se trata de hacer coincidir el modelo de implementación con la restricción que más importa para ese caso de uso específico.
Si el flujo de trabajo toca datos regulados o sensibles, notas médicas, registros financieros, información de RR. HH., el procesamiento en el dispositivo elimina toda una categoría de riesgo de transmisión de datos antes de aplicar cualquier otro control de privacidad. Si el flujo de trabajo necesita funcionar en el campo con conectividad poco confiable, aplicaciones de inspección, conductores de reparto, sitios remotos, la IA en el dispositivo suele ser la única opción que realmente funciona. Y si una función se va a usar con muy alto volumen por una gran base de usuarios, el procesamiento en el dispositivo evita una factura de nube por consulta que escala con el éxito.
La ventaja se invierte cuando una tarea necesita razonamiento amplio, una ventana de contexto larga o conocimiento que cambia con la frecuencia suficiente como para que un modelo estático en el dispositivo no pueda mantenerse al día. Una ventana de contexto lo bastante grande para analizar un contrato completo o un hilo de soporte largo generalmente todavía necesita un modelo fundacional de escala de nube, no un modelo comprimido que se ejecuta en el chip de un teléfono.
La conclusión práctica para un líder que está definiendo una función de IA: primero defina los requisitos de latencia, privacidad y conectividad, y luego decida dónde debe ejecutarse la inferencia. El procesamiento en el dispositivo no es un sustituto más barato de la IA en la nube en todos los casos; es la respuesta correcta para un conjunto específico y creciente de casos de uso, y la respuesta incorrecta para otros.
Conceptos de IA Relacionados
- IA de Borde - La categoría más amplia de ejecutar IA en hardware local, desde teléfonos hasta sensores industriales
- Inferencia - El paso en el que un modelo entrenado realmente produce un resultado, ya sea en la nube o en el dispositivo
- Modelos de Lenguaje Pequeños - Los modelos compactos construidos específicamente para ejecutarse en hardware de consumo
- Cuantización - La técnica de compresión que reduce el tamaño de los modelos para que quepan en el dispositivo
- Destilación de Conocimiento - Cómo se entrenan modelos pequeños y listos para el dispositivo a partir de modelos más grandes
- Compresión de Modelos - El conjunto más amplio de técnicas para reducir modelos más allá de la cuantización por sí sola
- Large Language Models - Los modelos de escala de frontera que todavía suelen requerir infraestructura en la nube
- Neural Networks - La arquitectura subyacente que las NPU están construidas para acelerar
Recursos Externos
- Deloitte 2026 TMT Predictions: More Compute for AI, Not Less - Por qué la mayoría de la inferencia de IA todavía se ejecuta en centros de datos a pesar del crecimiento del dispositivo
- Stanford HAI AI Index Report 2025 - Datos sobre la caída de los costos de inferencia impulsada por modelos pequeños y eficientes
- Counterpoint Research: GenAI Smartphone Forecast - Datos de envíos y pronósticos para smartphones con capacidad de IA en el dispositivo
Preguntas Frecuentes sobre la IA en el Dispositivo
¿Qué es la IA en el dispositivo?
La IA en el dispositivo es inteligencia artificial que se ejecuta directamente en hardware local, como un smartphone, una laptop o un automóvil, en lugar de enviar solicitudes a un servidor remoto. El procesamiento ocurre usando chips integrados como las NPU, de modo que el sistema puede responder sin conexión a internet y los datos nunca salen del dispositivo.
¿Cuál es la diferencia entre la IA en el dispositivo y la IA de Borde?
La IA en el dispositivo es un tipo específico de IA de Borde. La IA de Borde es la categoría más amplia de ejecutar IA en cualquier lugar fuera de un centro de datos de nube centralizado, lo que incluye el procesamiento en el dispositivo de un teléfono, así como servidores de puerta de enlace, equipos de fábrica e infraestructura de telecomunicaciones. La IA en el dispositivo significa específicamente que el modelo se ejecuta en el hardware personal o de consumo que el usuario tiene frente a sí.
¿Qué hardware hace posible la IA en el dispositivo?
El componente clave es una Unidad de Procesamiento Neuronal (NPU), un chip construido específicamente para los cálculos matriciales que requieren las Neural Networks. Los procesadores modernos de teléfonos y laptops combinan una NPU junto con la CPU y la GPU, lo que permite que los modelos de IA comprimidos se ejecuten de manera eficiente sin agotar la batería como lo harían los procesadores de propósito general.
¿La IA en el dispositivo funciona sin conexión a internet?
Sí, esa es una de sus ventajas definitorias. Debido a que tanto el modelo como el cómputo residen en el dispositivo, las funciones de IA en el dispositivo siguen funcionando en modo avión, en zonas sin señal o en cualquier lugar donde la conectividad sea poco confiable.
¿Es la IA en el dispositivo más privada que la IA en la nube?
En general, sí. Debido a que la inferencia ocurre localmente, la entrada, como una foto, una nota de voz o un mensaje, no tiene que transmitirse a un servidor de terceros para obtener una respuesta. Esto importa más para datos regulados o sensibles, donde mantener la información en el dispositivo elimina toda una categoría de riesgo de transmisión.
¿Cuáles son los principales límites de la IA en el dispositivo?
Dos restricciones importan más: el tamaño del modelo y la duración de la batería. Los teléfonos y las laptops tienen mucha menos memoria que los clústeres de GPU de centro de datos, así que los modelos en el dispositivo son más pequeños y menos capaces en general que los modelos de frontera en la nube. El procesamiento de IA sostenido también consume energía y genera calor, lo que limita cuánta inferencia local puede manejar de forma continua un dispositivo alimentado por batería.
¿Cuáles son ejemplos de IA en el dispositivo en 2026?
Apple Intelligence ejecuta muchos de sus modelos directamente en el iPhone, el iPad y la Mac. Gemini Nano de Google se ejecuta en el dispositivo en los teléfonos Pixel. Las Copilot+ PC de Microsoft requieren una NPU calificada en 40+ TOPS específicamente para ejecutar funciones de IA de forma local. Los modelos Llama 3.2 1B y 3B de Meta se construyeron específicamente para implementación en el dispositivo en teléfonos y laptops.
¿Debería una empresa construir IA en el dispositivo o usar IA en la nube?
Depende del caso de uso, no de una preferencia general. La IA en el dispositivo se ajusta a flujos de trabajo sensibles a la privacidad, al uso sin conexión o en campo, y a funciones de alto volumen donde los costos de nube por consulta se acumularían. La IA en la nube se ajusta a tareas que necesitan razonamiento amplio, ventanas de contexto grandes o conocimiento que cambia con frecuencia. La mayoría de los sistemas en producción usan ambas, enrutando las solicitudes simples localmente y las complejas a la nube.
¿Reemplazará la IA en el dispositivo a la IA en la nube?
Es poco probable, al menos en el corto plazo. La previsión de Deloitte para 2026 proyecta que la mayor parte del cómputo de IA seguirá ejecutándose en centros de datos incluso a medida que mejoren los aceleradores en el dispositivo, porque las NPU actuales están orientadas a tareas ligeras y de una sola vez, no a un razonamiento sostenido y complejo. La IA en el dispositivo y la IA en la nube están convergiendo hacia un modelo híbrido, no hacia el reemplazo de una por la otra.

Co-Founder, Rework.com
On this page
- Cómo Funciona Realmente la IA en el Dispositivo
- Por Qué las Empresas y los Usuarios la Quieren: Privacidad, Latencia, Uso sin Conexión y Costo
- Los Límites Reales: Tamaño del Modelo y Batería
- Datos Clave
- La IA en el Dispositivo en 2026: Ejemplos Reales
- IA en el Dispositivo vs. IA en la Nube
- Implicaciones para las Empresas
- Conceptos de IA Relacionados
- Recursos Externos