Technical Audit · Infraestructura de IA

¿Dónde Vive tu IA? Self-Host vs. API Gestionada, sin el Mito del Precio de Lista

No existe "el mejor servidor" ni "la mejor API" en abstracto. La decisión correcta depende de una sola variable que casi nadie mide primero: si tu carga es constante o intermitente. Esa respuesta descarta la mitad de las opciones antes de comparar precios.

4 rutas de self-host · 3 APIs gestionadas con precio real
Portada Reportes ¿Dónde Vive tu IA? 4 Rutas de Self-Host Privacidad de Datos Ley 21.719 Precio Real Matriz de Decisión Resumen en Video Síntesis
Self-Host

Las 4 Rutas para Alojar tu Propio Modelo

De más gratuita a más cara, cada ruta resuelve un problema distinto — ninguna es universalmente mejor, cada una descarta un caso de uso específico.

1 · El cebo gratuito

Hugging Face ZeroGPU

Hardware A100/H200 compartido por turnos.

Veredicto: excelente para prototipar y validar; inviable para un servicio garantizado — rate limits si tu app se vuelve viral.

2 · La ilusión del ahorro

Mac Mini en la nube

Apple Silicon, ~$3/día.

Veredicto: la memoria unificada es una trampa — 16GB compartidos no alcanzan para audio + imagen a la vez, y se pierde CUDA.

3 · La vieja confiable

GPU Dedicada

100% tuya, 24/7. ~$1,80/hora.

Veredicto: la más estable, pero se paga aunque nadie la use — ~$1.300/mes fijos aunque el uso real sea 2 horas al día.

4 · El ganador 2025

Serverless GPU

RunPod / Modal, por segundo.

Veredicto: hardware potente (RTX 4090, A10G) sin usuarios = factura $0. Mejor costo-beneficio para producción real.

Cuando el stack es multimodal (audio + imagen), la VRAM decide

Whisper (ASR) pide poca VRAM pero latencia baja; ComfyUI/Flux exige 24GB+ dedicados solo para arrancar con calidad. La arquitectura que rinde mejor separa ambas cargas: imagen en Serverless con RTX 4090 (más rápida y más barata que A10G/A100 para este caso), audio en Serverless con GPU chica — pagar una 4090 para transcribir es matar moscas a cañonazos. La comparativa completa de GPU por VRAM (no TFLOPs) y el nodo edge más barato para latencia sub-segundo están en Hardware Local para IA →

El Miedo #1

¿Entrenan con mis Datos? Web y API no son lo Mismo

Antes de comparar precios de API gestionada, hay una confusión que hay que resolver primero — y que decide si esta ruta es viable para tu sector.

Versión Web (ChatGPT/Gemini gratis o Plus)

Sí entrena con tus conversaciones por defecto. Es la versión pensada para uso personal, no la que se integra a un producto.

Versión API (Enterprise/Developers)

OpenAI, Google Vertex AI y Deepgram no entrenan con los datos enviados por API — lo prohíben explícito en sus términos comerciales. Google Vertex además mantiene los datos dentro de tu propio proyecto de Google Cloud, con controles de residencia más granulares por defecto.

Para sectores regulados (salud, banca): si necesitas Zero Data Retention (borrado inmediato tras procesar, sin logs de 30 días para monitoreo de abuso), eso requiere contactar ventas y firmar un addendum específico con el proveedor, no viene activado por defecto ni en la API.

Cumplimiento Legal

La Nueva Ley de Protección de Datos También Decide Dónde Vive tu IA

No es solo una pregunta de costo. Desde el 1 de diciembre de 2026 rige en Chile la Ley 21.719 de Protección de Datos Personales (a veces buscada como "Ley 21.791" o "Ley 21.799" — el número no es lo memorable, el contenido sí), y aplica a toda empresa que trate datos de clientes, empleados o proveedores — exactamente lo que hace un sistema de IA conversacional. La ruta que elijas en esta página (self-host o API gestionada) hereda esta responsabilidad, no la evita.

1 · Mapa de Datos

Registro de Actividades de Tratamiento (RAT): qué datos procesa tu sistema, con qué finalidad, bajo qué base legal y por cuánto tiempo se conservan.

2 · Permiso + Transparencia

Consentimiento libre, informado y revocable (sin casillas premarcadas) más una política de privacidad pública que explique qué se hace con los datos.

3 · Evaluación de Impacto

Si el tratamiento implica riesgo alto (datos sensibles a escala, decisiones automatizadas), documentar los riesgos y las medidas que los mitigan.

4 · Seguridad Apropiada

Medidas técnicas y organizativas proporcionales al riesgo real — la ley no exige una certificación específica como ISO 27001, exige que la seguridad sea demostrable.

5 · Plan de Brechas

Protocolo de incidentes y notificación a la Agencia de Protección de Datos Personales dentro de 72 horas desde que se detecta la brecha.

6 · Derechos de tus Clientes

Canal para ejercer los derechos ARCO+ (acceso, rectificación, supresión, oposición, portabilidad), con respuesta en 30 días — 2 días hábiles si es bloqueo.

En la práctica: el punto 4 (seguridad) cambia según elijas self-host o API gestionada — en self-host, la responsabilidad de la infraestructura es 100% tuya; en API gestionada, el proveedor cubre parte de la capa técnica pero el resto (consentimiento, RAT, brechas, derechos ARCO+) sigue siendo tuyo en ambos casos.

Preguntas Frecuentes

¿Qué pasa si mi empresa no cumple la nueva ley de protección de datos?

Multas administrativas de hasta 20.000 UTM (más de $1.300 millones de pesos) en el caso más grave, fiscalización de la Agencia de Protección de Datos Personales, y posibles demandas civiles por daños. Las infracciones se gradúan: las leves (fallas administrativas menores, retrasos en responder solicitudes) llegan hasta 500 UTM; las gravísimas — como omitir intencionalmente una brecha de seguridad — son las que alcanzan el techo de 20.000 UTM.

¿Qué organismo fiscaliza el cumplimiento en Chile?

La Agencia de Protección de Datos Personales, un órgano público autónomo y descentralizado creado por la misma ley, con facultades para fiscalizar, sancionar y exigir evidencia de cumplimiento a cualquier empresa que trate datos personales.

¿Cuánto tiempo tengo para responder si un cliente pide ver, corregir o borrar sus datos?

30 días corridos para la generalidad de los derechos ARCO+ (acceso, rectificación, supresión, oposición, portabilidad), prorrogables +30 días si está justificado. La excepción es el bloqueo de datos, que debe resolverse en solo 2 días hábiles.

¿Tengo que notificar si ocurre una brecha de seguridad?

Sí — la ley exige notificar a la Agencia de Protección de Datos Personales dentro de 72 horas desde que se toma conocimiento de la brecha, por el medio más expedito disponible. No reportarla a tiempo, o hacerlo intencionalmente tarde, es justamente la infracción que la ley trata como gravísima.

¿Necesito certificarme en ISO 27001 para cumplir la Ley 21.719?

No — la ley exige "medidas de seguridad técnicas y organizativas apropiadas al riesgo", sin mandar una certificación específica. ISO 27001 es una forma reconocida de demostrarlo, pero no la única ni la exigida por ley; una infraestructura bien documentada y auditable también cumple.

Precio Real, no de Lista

Dos Escenarios, Calculados Dígito por Dígito

El precio por token o por minuto no dice nada solo. Lo que importa es el costo total de la tarea real — y ahí el orden de los proveedores cambia según el escenario.

Escenario A · Entrevista grabada (45 min)

Audio ya grabado → transcripción → resumen.

OpenAI (Whisper + GPT-4o)$0,32
Deepgram + LLM rápido$0,20
Google Gemini 1.5 Flash$0,10–0,15

Gemini Flash escucha el audio directo, sin ASR intermedio — imbatible en volumen para este caso.

Escenario B · Llamada en vivo (15 min)

Conversación fluida, streaming ida y vuelta.

OpenAI Realtime API$2,00–4,00
Deepgram + LLM + TTS (pipeline propio)~$0,23

10× más barato armando el pipeline propio, con latencia igual de aceptable (~500ms) — la API Realtime se justifica solo cuando el margen por conversación ya lo cubre (ventas de alto valor, no soporte básico).

Cuándo Usar Cada Uno

Self-Host vs. API: la Matriz de Decisión

++ Prototipar gratis con ZeroGPU

→ -- no lo uses para producción, falla bajo carga real.

++ Serverless para tráfico variable

→ -- si el tráfico es constante 24/7, una GPU dedicada sale más barata a partir de cierto volumen.

++ API gestionada para no operar infraestructura

→ -- a escala alta y sostenida, self-host termina más barato — la API cobra por uso indefinidamente, el hardware propio se amortiza.

++ Deepgram + LLM rápido para llamadas en vivo

→ -- OpenAI Realtime solo si el margen por conversación ya lo justifica (ventas de alto valor, no soporte estándar).

Resumen en Video

¿Dónde Vive tu IA? en 77 Segundos

infra-picker — costo real por ruta
Hugging Face ZeroGPU $0/mes
Mac Mini en la nube ~$90/mes
GPU Dedicada 24/7 ~$1.300/mes
Serverless GPU $0 sin uso

Se paga por segundo de cómputo real, no por hora reservada.

Síntesis

No es Una Decisión, son Dos

Dónde vive el modelo (self-host vs. API) y qué hardware necesita cada carga de trabajo son preguntas separadas. Resolver solo una y asumir la otra es la causa más común de pagar de más — o de quedarse corto justo en la pieza que sí importaba.

Para prototipar o validar

ZeroGPU / Serverless

Costo cero o casi cero mientras no hay tráfico

Para producción con volumen real

Pipeline propio + GPU dedicada

El costo por unidad baja a escala, no a la inversa

¿Estás decidiendo dónde va a vivir tu modelo de IA? Antes de comprometerte con un proveedor, conviene mapear tu carga real contra estas cuatro rutas.

Contenido relacionado

Technical Audit

Hardware Local para IA: la Tabla Completa de GPU y el Nodo Edge Económico

Una vez decidido el self-host, qué GPU comprar según VRAM (no TFLOPs), y por qué un smartphone Snapdragon es el nodo edge más barato.

Ver la comparativa - Sweet Spot RTX 3090
Technical Audit

Consumo de IA en Producción: Las 6 Palancas de Optimización

Ya elegiste dónde vive tu IA y con qué hardware — el siguiente paso es bajar el costo por conversación sin cambiar de modelo.

Leer diagnóstico - Costo por Conversación
Solución

Modelo de Lenguaje Propio (SLM)

El servicio que aterriza esta decisión: diseño e implementación de tu modelo de lenguaje propio, self-hosted o vía API gestionada.

Ver la solución - Modelo de Lenguaje Propio
Solución

Servidores VPS

Si self-host gana la decisión de esta comparativa, acá corre: VPS con acceso root, recursos dedicados y jurisdicción a elección para tu modelo o tus agentes de IA.

Ver la solución - Root Total, Recursos Dedicados