Hardware Local para IA: la Tabla Completa y el Nodo Edge que Nadie Te Cuenta
Al elegir GPU para IA local, la VRAM manda sobre los TFLOPs — un chip más rápido que no carga el modelo completo en memoria no sirve de nada. Y para tareas de latencia sub-segundo, un servidor GPU es la herramienta equivocada: un smartphone de gama media-alta, bien elegido, cuesta una fracción y sobra.
La VRAM Manda, no los TFLOPs
Un chip más rápido que no puede cargar el modelo completo en memoria simplemente no corre. Antes de comparar velocidad, hay que filtrar por la métrica que decide si la tarjeta sirve para el caso de uso: la VRAM dedicada.
| Modelo | TFLOPs (FP32) | Tensor TOPs | VRAM (GB) |
|---|---|---|---|
| RTX 2080 Super | 11.2 | 93 | 8 |
| RTX 3060 | 12.7 | 102 | 12 |
| RTX 4060 | 15 | 120 | 8 |
| RTX 3060 Ti | 16.2 | 130 | 8 |
| RTX 4060 Ti | 19.2 | 154 | 8 |
| RTX 5060 | 20 | 160 | 8 |
| RTX 3070 | 20.3 | 162 | 8 |
| RTX 3070 Ti | 22.3 | 178 | 8 |
| RTX 4070 | 29.5 | 236 | 12 |
| RTX 5060 Ti | 30 | 240 | 12 |
| RTX 3080 Ti | 34.1 | 273 | 12 |
| RTX 3090 | 35.6 | 285 | 24 |
| RTX 4070 Ti | 40.1 | 321 | 12 |
| RTX 5070 | 45 | 360 | 16 |
| RTX 4080 | 48.7 | 390 | 16 |
| RTX 5080 | 60 | 480 | 20 |
| RTX 4090 | 82.6 | 661 | 24 |
| RTX 5080 Ti | 95 | 760 | 24 |
| RTX 5090 | 130 | 1040 | 32 |
Resaltadas: RTX 3080 Ti y RTX 3090, el punto de quiebre donde la VRAM cruza el umbral de 12GB/24GB sin pagar el precio de la generación más nueva — ver siguiente sección.
Por qué la VRAM decide antes que los TFLOPs
Un modelo que no cabe completo en memoria no "corre más lento" — directamente falla con error de Out of Memory o fuerza a partirlo en fragmentos con una penalización de rendimiento severa. Los TFLOPs y TOPs solo importan una vez que el modelo ya cabe.
RTX 3080 Ti y RTX 3090: el Punto Óptimo VRAM/Costo
Entre las 19 tarjetas comparadas, estas dos marcan el quiebre: son las más baratas (mercado usado) que ya cruzan los umbrales reales de VRAM que exige correr modelos localmente sin recortar capacidad.
RTX 3080 Ti
Umbral mínimo para LLMs de tamaño medio cargados completos y para clasificadores/embeddings sin comprometer el batch.
RTX 3090
El mismo techo de VRAM que una RTX 4090 — el estándar de oro para ComfyUI/Flux con LoRAs — a una fracción del costo de mercado.
Las generaciones más nuevas, RTX 4080/4090 y RTX 5080/5090, ofrecen más TFLOPs y TOPs, y valen la pena si la carga es de inferencia intensiva con lotes grandes o generación de imagen/video en producción. Pero para levantar un modelo local, correr un clasificador o experimentar con embeddings, el techo de VRAM de la 3080 Ti/3090 ya es suficiente — pagar la generación nueva ahí es exceso de capacidad no usado.
Por Qué un Raspberry Pi o un Server ARM Cloud No Sirve para Inferencia Rápida
No toda la IA necesita una GPU de 300W. Para tareas de tool-calling, parsing de interfaces o routing semántico, lo que importa es la latencia sub-segundo, no el tamaño del modelo. Ahí el cuello de botella no es la VRAM: es una instrucción de procesador específica.
El flag que decide todo: i8mm
Un motor de inferencia nativo en C++ compilado para ARM (como Cactus Needle) depende de i8mm (Int8 Matrix Multiply), una instrucción de ARMv8.6-A que solo traen los núcleos flagship de celular — Cortex-X2 en adelante, o equivalente Snapdragon 8 Gen 1+. Sin ella, el motor ni siquiera compila: hay que caer a un runtime genérico (JAX/Python) que corre en cualquier CPU pero a una fracción de la velocidad. Por qué un motor de solo 26 millones de parámetros como Needle alcanza para esta tarea es una pregunta de arquitectura aparte — la resolvemos en el reporte de tool-calling.
Graviton3 tiene el flag, pero rompe el presupuesto de un homelab, no es la ruta económica. Las placas con SoC Rockchip RK3588 (Orange Pi 5, Radxa Rock 5) comparten el mismo Cortex-A76 sin i8mm, pero integran una NPU dedicada de 6 TOPS INT8 aparte de la CPU — una ruta de aceleración distinta, vía el toolkit propio de Rockchip, no el motor nativo por CPU que describe esta sección. El Orange Pi 6, con núcleos Cortex-A720 (microarquitectura ARMv9.2-A), es la primera placa de este segmento con i8mm real en la CPU, aunque a un costo por encima de un smartphone reciclado.
Por qué no hay atajo desde un homelab x86
- LXC comparte el kernel del host → siempre arquitectura del host, no existe "LXC ARM" sobre x86.
- KVM solo acelera la arquitectura nativa x86, no fabrica ARM.
- Emulación vía qemu-system-aarch64 TCG sería 10-30× más lento — peor que el runtime genérico.
Conclusión de arquitectura
Para el caso asíncrono actual, un runtime genérico sobre x86 alcanza. Para interactivo sub-segundo, la única ruta real es correr el motor nativo sobre silicio ARM con i8mm de verdad — ahí entra el nodo edge, siguiente sección.
El Hack de Hardware Más Barato: un Smartphone Snapdragon
Un teléfono de gama media-alta con el SoC correcto integra CPU, GPU y NPU con ancho de banda de memoria (LPDDR5) que ningún SBC económico ofrece — y en el mercado de segunda mano cuesta una fracción de un servidor ARM con soporte real de i8mm. Según pruebas internas, es viable como co-procesador de red para tareas puntuales; no reemplaza al motor asíncrono ya en producción.
Sweet spot recomendado
Snapdragon 7+ Gen 2
Un 8+ Gen 1 encubierto, núcleo Cortex-X2. Ejemplo de mercado: Poco F5. Memoria rápida, menos calor sostenido al no ser el chip flagship.
Fuerza bruta barata
Snapdragon 8 Gen 1 / 8+ Gen 1
Ejemplos: Motorola Edge 30 Pro, Poco F4 GT, Galaxy S22 versión Snapdragon, OnePlus 10 Pro. El 8 Gen 1 fabricado por Samsung sufre thermal throttling en uso 24/7 — requiere disipación activa.
Alternativa MediaTek
Dimensity 9000+
También trae núcleos Cortex-X2. Soporte de drivers y Termux/Linux menos maduro que en Snapdragon.
Implementación física de un nodo IoT
- SO base: Android con Termux + PRoot sin root, o Linux Deploy/chroot con root y sin overhead de PRoot — ahí corre el motor de inferencia nativo.
- Bypass de batería: equipos Samsung/Poco con "Pause USB Power Delivery" o similar alimentan la placa directo desde el cargador al 100%, sin ciclos constantes — mitiga el riesgo de hinchazón por uso 24/7.
Esto es una arquitectura de nodo experimental, no un electrodoméstico certificado para 24/7 — evaluar el riesgo térmico y de batería según el equipo elegido antes de dejarlo en producción sin supervisión. Cómo integrarlo a la red (VPN, proxy inverso, exposición del servicio) es un tema aparte, fuera de este reporte.
GPU de VRAM vs. Nodo Edge: No Compiten, se Complementan
| Dimensión | Servidor GPU (RTX 3090/4090/5090) | Nodo Edge (Snapdragon) |
|---|---|---|
| Caso de uso | LLMs masivos, agentes complejos, batch | Tool-calling, parsing de UI, routing semántico |
| Métrica que manda | VRAM y ancho de banda de memoria | Latencia sub-segundo |
| Consumo | Picos de 300W+ | ~5W a máxima carga |
| Costo de entrada | Alto (tarjeta + PSU + chasis) | Bajo (equipo reacondicionado) |
El nodo móvil libera a la GPU de tareas de baja latencia que no necesitan su potencia, no migra la arquitectura x86 completa a ARM, ni reemplaza la inferencia pesada. Es un co-procesador de red específico, sumado al clúster existente.
Qué Hardware Necesita tu Proyecto de IA, en Menos de 2 Minutos
Co-procesador de red para tool-calling, no reemplaza la GPU — la complementa.
Dos Decisiones de Hardware, no Una
Elegir GPU por VRAM, no por TFLOPs, resuelve la inferencia pesada. Elegir el SoC correcto, con i8mm, resuelve la interactividad sub-segundo. Confundir ambos problemas lleva a pagar de más en un servidor ARM genérico, o a subutilizar una GPU de 300W en tareas que un teléfono de $150 resuelve igual de bien.
Para inferencia pesada
RTX 3080 Ti / 3090
12-24GB VRAM al mejor costo de mercado usado
Para latencia sub-segundo
Snapdragon 7+ Gen 2
i8mm real, ~5W, co-procesador de red
¿Estás decidiendo el stack de hardware para un proyecto de IA local? Antes de comprar, conviene mapear la carga real contra la métrica correcta.
Contenido relacionado
¿Dónde Vive tu IA? Self-Host vs. API Gestionada: el Costo Real
Antes de comprar el hardware de esta tabla, la primera decisión es si tu modelo vive en tu propio servidor o en una API gestionada — con costo real de cada ruta.
Ver la comparativa - Más Barato que API RealtimeConsumo de IA en Producción: Las 6 Palancas de Optimización
Una vez que el hardware ya está corriendo, seis decisiones arquitectónicas reducen el gasto 60–90% sin cambiar el modelo.
Leer diagnóstico - Costo por ConversaciónAdopción de IA y Datos en Empresas Chilenas: Síntesis 2026
La brecha real entre probar IA y tenerla en producción con retorno medible — antes de invertir en hardware, define si ya cruzaste esa brecha.
Leer síntesis - Escaló IA con Retorno MedibleModelo de Lenguaje Propio para tu Empresa
El servicio que aterriza esta comparativa de hardware: diseño e implementación de tu modelo de lenguaje propio, self-hosted o vía API.
Ver la solución - Modelo de Lenguaje PropioTool-Calling: Cuándo un Modelo Chico Gana al LLM Grande
Por qué el motor de este nodo edge, con solo 26 millones de parámetros, resuelve tool-calling sin necesitar un LLM completo — la arquitectura completa detrás del router.
Leer arquitectura - Parámetros, no Miles de Millones