Technical Audit · Infraestructura de IA

Hardware Local para IA: la Tabla Completa y el Nodo Edge que Nadie Te Cuenta

Al elegir GPU para IA local, la VRAM manda sobre los TFLOPs — un chip más rápido que no carga el modelo completo en memoria no sirve de nada. Y para tareas de latencia sub-segundo, un servidor GPU es la herramienta equivocada: un smartphone de gama media-alta, bien elegido, cuesta una fracción y sobra.

19 GPU comparadas · 1 hallazgo de arquitectura ARM
Portada Reportes Hardware Local para IA Tabla Completa El Sweet Spot Cuello de Botella ARM Nodo Edge División del Trabajo Resumen en Video Síntesis
Diagnóstico

La VRAM Manda, no los TFLOPs

Un chip más rápido que no puede cargar el modelo completo en memoria simplemente no corre. Antes de comparar velocidad, hay que filtrar por la métrica que decide si la tarjeta sirve para el caso de uso: la VRAM dedicada.

Modelo TFLOPs (FP32) Tensor TOPs VRAM (GB)
RTX 2080 Super11.2938
RTX 306012.710212
RTX 4060151208
RTX 3060 Ti16.21308
RTX 4060 Ti19.21548
RTX 5060201608
RTX 307020.31628
RTX 3070 Ti22.31788
RTX 407029.523612
RTX 5060 Ti3024012
RTX 3080 Ti34.127312
RTX 309035.628524
RTX 4070 Ti40.132112
RTX 50704536016
RTX 408048.739016
RTX 50806048020
RTX 409082.666124
RTX 5080 Ti9576024
RTX 5090130104032

Resaltadas: RTX 3080 Ti y RTX 3090, el punto de quiebre donde la VRAM cruza el umbral de 12GB/24GB sin pagar el precio de la generación más nueva — ver siguiente sección.

Por qué la VRAM decide antes que los TFLOPs

Un modelo que no cabe completo en memoria no "corre más lento" — directamente falla con error de Out of Memory o fuerza a partirlo en fragmentos con una penalización de rendimiento severa. Los TFLOPs y TOPs solo importan una vez que el modelo ya cabe.

El Sweet Spot

RTX 3080 Ti y RTX 3090: el Punto Óptimo VRAM/Costo

Entre las 19 tarjetas comparadas, estas dos marcan el quiebre: son las más baratas (mercado usado) que ya cruzan los umbrales reales de VRAM que exige correr modelos localmente sin recortar capacidad.

RTX 3080 Ti

12GB VRAM

Umbral mínimo para LLMs de tamaño medio cargados completos y para clasificadores/embeddings sin comprometer el batch.

RTX 3090

24GB VRAM

El mismo techo de VRAM que una RTX 4090 — el estándar de oro para ComfyUI/Flux con LoRAs — a una fracción del costo de mercado.

Las generaciones más nuevas, RTX 4080/4090 y RTX 5080/5090, ofrecen más TFLOPs y TOPs, y valen la pena si la carga es de inferencia intensiva con lotes grandes o generación de imagen/video en producción. Pero para levantar un modelo local, correr un clasificador o experimentar con embeddings, el techo de VRAM de la 3080 Ti/3090 ya es suficiente — pagar la generación nueva ahí es exceso de capacidad no usado.

El Otro Extremo

Por Qué un Raspberry Pi o un Server ARM Cloud No Sirve para Inferencia Rápida

No toda la IA necesita una GPU de 300W. Para tareas de tool-calling, parsing de interfaces o routing semántico, lo que importa es la latencia sub-segundo, no el tamaño del modelo. Ahí el cuello de botella no es la VRAM: es una instrucción de procesador específica.

El flag que decide todo: i8mm

Un motor de inferencia nativo en C++ compilado para ARM (como Cactus Needle) depende de i8mm (Int8 Matrix Multiply), una instrucción de ARMv8.6-A que solo traen los núcleos flagship de celular — Cortex-X2 en adelante, o equivalente Snapdragon 8 Gen 1+. Sin ella, el motor ni siquiera compila: hay que caer a un runtime genérico (JAX/Python) que corre en cualquier CPU pero a una fracción de la velocidad. Por qué un motor de solo 26 millones de parámetros como Needle alcanza para esta tarea es una pregunta de arquitectura aparte — la resolvemos en el reporte de tool-calling.

Raspberry Pi 5 / Orange Pi 5 — Cortex-A76 Sin i8mm
Oracle Ampere A1 / Hetzner Ampere Altra — Neoverse N1 Sin i8mm
AWS Graviton3 — Neoverse V1 Con i8mm
Snapdragon 8 Gen 1+ / Cortex-X2+ Con i8mm
Orange Pi 6 — Cortex-A720 (SoC CIX CD8180) Con i8mm

Graviton3 tiene el flag, pero rompe el presupuesto de un homelab, no es la ruta económica. Las placas con SoC Rockchip RK3588 (Orange Pi 5, Radxa Rock 5) comparten el mismo Cortex-A76 sin i8mm, pero integran una NPU dedicada de 6 TOPS INT8 aparte de la CPU — una ruta de aceleración distinta, vía el toolkit propio de Rockchip, no el motor nativo por CPU que describe esta sección. El Orange Pi 6, con núcleos Cortex-A720 (microarquitectura ARMv9.2-A), es la primera placa de este segmento con i8mm real en la CPU, aunque a un costo por encima de un smartphone reciclado.

Por qué no hay atajo desde un homelab x86

  • LXC comparte el kernel del host → siempre arquitectura del host, no existe "LXC ARM" sobre x86.
  • KVM solo acelera la arquitectura nativa x86, no fabrica ARM.
  • Emulación vía qemu-system-aarch64 TCG sería 10-30× más lento — peor que el runtime genérico.

Conclusión de arquitectura

Para el caso asíncrono actual, un runtime genérico sobre x86 alcanza. Para interactivo sub-segundo, la única ruta real es correr el motor nativo sobre silicio ARM con i8mm de verdad — ahí entra el nodo edge, siguiente sección.

El Nodo Edge Económico

El Hack de Hardware Más Barato: un Smartphone Snapdragon

Un teléfono de gama media-alta con el SoC correcto integra CPU, GPU y NPU con ancho de banda de memoria (LPDDR5) que ningún SBC económico ofrece — y en el mercado de segunda mano cuesta una fracción de un servidor ARM con soporte real de i8mm. Según pruebas internas, es viable como co-procesador de red para tareas puntuales; no reemplaza al motor asíncrono ya en producción.

Sweet spot recomendado

Snapdragon 7+ Gen 2

Un 8+ Gen 1 encubierto, núcleo Cortex-X2. Ejemplo de mercado: Poco F5. Memoria rápida, menos calor sostenido al no ser el chip flagship.

Fuerza bruta barata

Snapdragon 8 Gen 1 / 8+ Gen 1

Ejemplos: Motorola Edge 30 Pro, Poco F4 GT, Galaxy S22 versión Snapdragon, OnePlus 10 Pro. El 8 Gen 1 fabricado por Samsung sufre thermal throttling en uso 24/7 — requiere disipación activa.

Alternativa MediaTek

Dimensity 9000+

También trae núcleos Cortex-X2. Soporte de drivers y Termux/Linux menos maduro que en Snapdragon.

Implementación física de un nodo IoT

  • SO base: Android con Termux + PRoot sin root, o Linux Deploy/chroot con root y sin overhead de PRoot — ahí corre el motor de inferencia nativo.
  • Bypass de batería: equipos Samsung/Poco con "Pause USB Power Delivery" o similar alimentan la placa directo desde el cargador al 100%, sin ciclos constantes — mitiga el riesgo de hinchazón por uso 24/7.

Esto es una arquitectura de nodo experimental, no un electrodoméstico certificado para 24/7 — evaluar el riesgo térmico y de batería según el equipo elegido antes de dejarlo en producción sin supervisión. Cómo integrarlo a la red (VPN, proxy inverso, exposición del servicio) es un tema aparte, fuera de este reporte.

Cuándo Usar Cada Uno

GPU de VRAM vs. Nodo Edge: No Compiten, se Complementan

Dimensión Servidor GPU (RTX 3090/4090/5090) Nodo Edge (Snapdragon)
Caso de uso LLMs masivos, agentes complejos, batch Tool-calling, parsing de UI, routing semántico
Métrica que manda VRAM y ancho de banda de memoria Latencia sub-segundo
Consumo Picos de 300W+ ~5W a máxima carga
Costo de entrada Alto (tarjeta + PSU + chasis) Bajo (equipo reacondicionado)

El nodo móvil libera a la GPU de tareas de baja latencia que no necesitan su potencia, no migra la arquitectura x86 completa a ARM, ni reemplaza la inferencia pesada. Es un co-procesador de red específico, sumado al clúster existente.

Resumen en Video

Qué Hardware Necesita tu Proyecto de IA, en Menos de 2 Minutos

hardware-picker — VRAM vs. costo
RTX 3090 24GB VRAM
RTX 3080 Ti 12GB VRAM
RTX 4070 12GB VRAM
Snapdragon 7+ Gen 2 — nodo edge ~5W · sub-1s

Co-procesador de red para tool-calling, no reemplaza la GPU — la complementa.

Síntesis

Dos Decisiones de Hardware, no Una

Elegir GPU por VRAM, no por TFLOPs, resuelve la inferencia pesada. Elegir el SoC correcto, con i8mm, resuelve la interactividad sub-segundo. Confundir ambos problemas lleva a pagar de más en un servidor ARM genérico, o a subutilizar una GPU de 300W en tareas que un teléfono de $150 resuelve igual de bien.

Para inferencia pesada

RTX 3080 Ti / 3090

12-24GB VRAM al mejor costo de mercado usado

Para latencia sub-segundo

Snapdragon 7+ Gen 2

i8mm real, ~5W, co-procesador de red

¿Estás decidiendo el stack de hardware para un proyecto de IA local? Antes de comprar, conviene mapear la carga real contra la métrica correcta.

Contenido relacionado

Technical Audit

¿Dónde Vive tu IA? Self-Host vs. API Gestionada: el Costo Real

Antes de comprar el hardware de esta tabla, la primera decisión es si tu modelo vive en tu propio servidor o en una API gestionada — con costo real de cada ruta.

Ver la comparativa - Más Barato que API Realtime
Technical Audit

Consumo de IA en Producción: Las 6 Palancas de Optimización

Una vez que el hardware ya está corriendo, seis decisiones arquitectónicas reducen el gasto 60–90% sin cambiar el modelo.

Leer diagnóstico - Costo por Conversación
Síntesis de Mercado

Adopción de IA y Datos en Empresas Chilenas: Síntesis 2026

La brecha real entre probar IA y tenerla en producción con retorno medible — antes de invertir en hardware, define si ya cruzaste esa brecha.

Leer síntesis - Escaló IA con Retorno Medible
Solución

Modelo de Lenguaje Propio para tu Empresa

El servicio que aterriza esta comparativa de hardware: diseño e implementación de tu modelo de lenguaje propio, self-hosted o vía API.

Ver la solución - Modelo de Lenguaje Propio
Technical Audit

Tool-Calling: Cuándo un Modelo Chico Gana al LLM Grande

Por qué el motor de este nodo edge, con solo 26 millones de parámetros, resuelve tool-calling sin necesitar un LLM completo — la arquitectura completa detrás del router.

Leer arquitectura - Parámetros, no Miles de Millones