El Error Más Caro de un Proyecto de IA no Es la API que Eliges. Es Usar un Modelo 100 Veces Más Grande del que Necesitas
La mayoría de los proyectos pagan de más por default. Conectan el modelo más grande a todo, incluso a tareas simples que un modelo mil veces más chico resuelve igual de bien: validar un formulario, decidir qué función llamar. Además, uno de los cinco proveedores que comparamos usa tu contenido para entrenar sus modelos sin que lo sepas. Diseñamos la arquitectura correcta antes de escribir la primera línea de código: qué modelo para cada proceso, qué proveedor, qué contrato.
Precios verificados agosto 2026 · Fuente: página oficial de cada proveedor
El Problema Real
Se Elige el Modelo Más Grande por Default, no Porque el Proceso lo Necesite
Casi todo proyecto de IA arranca igual. Se conecta el modelo más conocido a todo: al chat, al formulario, a la función que solo decide qué botón apretar. Se paga precio de flagship por procesos que un modelo cien o mil veces más chico resuelve igual de bien, y más rápido.
El otro error es no leer la letra chica. "Es la versión de pago, no debe entrenar con mis datos" es cierto para la mayoría de los proveedores, pero no para todos. Sin auditar cada política, es una apuesta, no una decisión informada.
Esto es lo que resolvemos antes de escribir la primera línea de código: qué tamaño de modelo corresponde a cada proceso de tu producto, y qué proveedor no te expone legalmente.
Así lo Resolvemos
No Todo Proceso Necesita un LLM de $15 el Millón de Tokens
Una arquitectura de tool-calling, donde el sistema decide qué función ejecutar en vez de redactar prosa, no necesita el mismo modelo que un chatbot conversacional. Evaluamos en banco propio Needle (Cactus), un modelo de solo 26 millones de parámetros especializado en tool-calling on-device, que resuelve en milisegundos la decisión de qué función llamar y con qué argumento. La precisión de un modelo así de chico no viene del tamaño: depende de que el espacio de decisión esté acotado y el esquema de la función bien definido. Es la herramienta correcta para ese tipo de decisión puntual, no un reemplazo universal de un modelo grande en tareas abiertas.
Un formulario con un catálogo acotado de funciones es un buen candidato: tool-calling conectado a funciones que corren desde el propio navegador. El modelo grande se reserva para lo que realmente lo justifica, como digerir información compleja o razonar sobre casos ambiguos. Para decidir el tamaño correcto miramos cuatro variables de cada proceso: qué precisión exige, cuánto volumen tiene que soportar, qué latencia tolera el usuario, y qué tan grave es un error si el modelo falla — el detalle completo de este criterio está en nuestro reporte de arquitectura de tool-calling.
Right-Sizing, no "el Modelo Más Grande Posible"
- Tool-calling simple: latencia crítica, error tolerable, volumen alto. Modelo pequeño on-device, casi sin costo
- Contexto grande: precisión media, documentos extensos. Familia Gemini/Gemma, ventana amplia
- Conocimiento específico y razonamiento: precisión alta, error costoso. Modelo +25B (Claude, GPT, Gemini flagship)
- Auditamos qué necesita cada proceso. No vendemos el modelo más caro por default
Precio de Lista Oficial
Precio por Millón de Tokens, Modelo de Gama Media
Comparamos el modelo de gama media de cada proveedor: el punto de equilibrio entre costo y capacidad, ni el más barato ni el flagship más caro. Estos precios importan de verdad solo cuando el proceso justifica ese tamaño de modelo, algo que la sección anterior ayuda a decidir. Deepgram no cobra por token, cobra por minuto de audio, así que va aparte.
| Proveedor · Modelo | Input / MTok | Output / MTok | Nota |
|---|---|---|---|
| Google Gemini (Flash) | $0,30 | $2,50 | La más barata del grupo · $1,00/MTok en modo audio |
| Claude Sonnet 5 (Anthropic) | $2,00 | $10,00 | Precio introductorio hasta 31-ago-2026, luego $3/$15 |
| OpenAI (gpt-5.6-terra) | $2,00 | $12,00 | Cache hit: $0,20/MTok input |
| Kimi K3 (Moonshot AI) | $3,00 | $15,00 | La más cara del grupo · cache hit: $0,30/MTok · contexto 1M tokens |
| Deepgram (audio) | ~$0,0043–0,0125 / minuto según modelo | No es LLM: se combina con uno de los anteriores para texto | |
Fuente: claude.com/pricing, developers.openai.com/api/docs/pricing, ai.google.dev/gemini-api/docs/pricing, platform.kimi.ai/docs/pricing/chat-k3 — verificado agosto 2026, precios de lista oficiales.
Lo que el Precio de Lista no Muestra
El Precio por Token no Es lo que Termina Pagando un Proyecto Real
Un CLI de desarrollo asistido por IA, como Claude Code o Codex CLI, factura por token consumido, no por asiento fijo. Los datos de despliegues reales lo muestran: el desarrollador promedio gasta cerca de $13 al día, el 90% se mantiene bajo $30 al día, y un power user en automatización pesada llega a $500 a $2.000 al mes. Un caso documentado: 10.000 millones de tokens en 8 meses costaron más de $15.000 pagando por token vía API. El mismo trabajo, en un plan de tarifa fija de $100 al mes, costó cerca de $800: 93% más barato.
Como regla de bolsillo para presupuestar un proyecto, un minuto de cómputo activo de IA agencial cuesta cerca de un dólar. No es exacto, varía según el modelo y cuántos reintentos hace el agente sobre una tarea difícil. Pero calza con los rangos reales: un profesional consume entre $300 y $400 cada 3 épicas de desarrollo, y un proyecto con procesamiento intensivo de datos, entre $400 y $700. Un proyecto completo toma de 1 día a 2,5 meses. Mientras más crece, más le cuesta a la IA sostener la lógica de negocio completa, y más tiempo humano de supervisión se necesita.
Parte de por qué estos números se disparan es la misma causa de siempre: el agente usa su modelo más grande incluso para las tareas triviales del proyecto. El right-sizing aplica también a las herramientas de desarrollo, no solo al producto final.
El Plan Consumer Subsidia a Cambio de tus Datos
Los planes de tarifa fija orientados a personas, como Claude Code Pro/Max o ChatGPT Plus/Pro, son el mismo producto consumer que entrena con tus conversaciones por defecto. La API pura cobra el precio completo por token y excluye tu contenido del entrenamiento. Pero el eje real no es tarifa fija versus API: es consumer versus empresa. Los planes Business/Enterprise de los mismos proveedores (ChatGPT Business, Claude Team/Enterprise) también cobran tarifa fija por asiento, y también excluyen el entrenamiento por contrato, con un DPA firmado. Es la tercera opción que casi nadie compara.
Tres niveles reales, no dos:
Consumer: tarifa fija, tus datos entrenan el modelo
Business/Enterprise: tarifa fija por asiento, DPA firmado, sin entrenamiento
API pura: pagas por token, sin entrenamiento, sin DPA por default
4 de 5 Excluyen tu Contenido del Entrenamiento. Uno No
Verificado leyendo la política de privacidad oficial de cada proveedor, no un resumen de terceros.
OpenAI (API)
No entrena con datos enviados por API por defecto. Está excluido explícito en los términos comerciales.
Google Gemini / Vertex AI
No entrena con datos de API por defecto. Vertex AI además mantiene los datos dentro de tu propio proyecto de Google Cloud.
Claude (Anthropic)
La API comercial (Team, Enterprise, Bedrock) queda excluida del entrenamiento. Es distinto de la versión consumer, que sí entrena desde agosto de 2025 salvo que optes por no compartir tus datos.
Deepgram
No entrena con audio de clientes empresariales por defecto en sus términos comerciales.
Kimi (Moonshot AI) — la excepción
Su propia Política de Privacidad dice que el "User Content" se usa para "training and refining our underlying technology, such as machine learning models and algorithms." No hay opción de exclusión visible en el plan estándar de la API.
No es un defecto necesariamente descalificante. Si tu proceso no involucra datos personales o sensibles, el precio de Kimi puede compensar igual. Lo importante es decidirlo sabiendo, no por accidente. Un proceso que corre en un modelo pequeño on-device, como el tool-calling que resuelve Needle, ni siquiera envía datos a un tercero: la pregunta de quién entrena con qué desaparece por diseño. Auditar esto proceso por proceso es parte del trabajo de diseñar la arquitectura, no un detalle que se revisa después de lanzar.
El Framework que Aplicamos
Por Proceso, no por Proveedor
Elegir proveedor viene después de esta pregunta, no antes. Un flagship caro en el proceso equivocado sale más caro y no rinde mejor que el modelo correcto. Para cada proceso miramos cuatro cosas: qué precisión exige, cuánto volumen tiene que soportar, qué latencia tolera el usuario, y qué tan grave es un error.
| Tipo de Proceso | Qué Importa Más | Tamaño de Modelo | Ejemplo |
|---|---|---|---|
| Decidir qué función ejecutar | Latencia y volumen. El error es tolerable porque el espacio de decisión es acotado | ~26M, on-device | Formulario, enrutar la intención del usuario |
| Digerir un documento largo | Contexto amplio, precisión media | Contexto grande | Resumir un contrato de 50 páginas |
| Conversación abierta con el cliente | Precisión alta, el error cuesta caro porque hay marca en juego | Flagship +25B | Chatbot de atención, ventas |
| Razonamiento complejo o código | Precisión muy alta, error muy costoso, volumen bajo | Flagship +25B | Agente de desarrollo, análisis legal |
| Pipeline de audio en vivo | Latencia crítica, volumen medio | Audio + LLM liviano | Llamadas, transcripción en tiempo real |
Preguntas Frecuentes
Lo que Realmente Preguntan al Elegir Proveedor
¿Qué API de IA entrena con mis datos por defecto?
De las cinco comparadas, solo Kimi (Moonshot AI) lo hace por defecto: su propia Política de Privacidad declara que el "User Content" —tus prompts y archivos enviados— se usa para "training and refining" sus modelos, sin opción de exclusión visible en el plan estándar. OpenAI, Google Gemini/Vertex AI, Claude (Anthropic) y Deepgram excluyen explícitamente el tráfico de API del entrenamiento por defecto en sus términos comerciales.
¿Cuál es la API de IA más barata en 2026?
Depende del modelo comparado, no solo del proveedor: en el tier medio, Google Gemini Flash es la más barata ($0,30 input / $2,50 output por millón de tokens), seguida por Claude Sonnet 5 ($2 / $10, precio introductorio hasta el 31 de agosto de 2026) y OpenAI ($2 / $12). Kimi K3 es la más cara del grupo en output ($15 por millón de tokens) pese a no excluir tu contenido del entrenamiento.
¿La versión API de ChatGPT o Claude entrena igual que la versión web gratuita?
No. La versión consumer (chat web, plan gratis o Plus) sí entrena con tus conversaciones por defecto en la mayoría de los proveedores. La API pura y los planes Business/Enterprise de esos mismos proveedores (ChatGPT Business, Claude Team/Enterprise) excluyen el tráfico del entrenamiento por contrato, con un DPA firmado en el caso de Business/Enterprise. Son tres productos distintos, no dos: consumer, empresa con tarifa fija, y API pagada por token.
¿Puedo usar varias APIs de IA a la vez en el mismo producto?
Sí, es lo más común en producción: un pipeline típico usa un proveedor especializado en audio (Deepgram) junto a un LLM de texto (Claude, OpenAI o Gemini) en vez de depender de un solo proveedor todo-en-uno. Combinar proveedores según su fortaleza —no elegir "el mejor" en abstracto— suele salir más barato que una API todo-en-uno como la Realtime de OpenAI.
¿Necesito un contrato DPA si uso una de estas APIs con datos de mis clientes?
Sí. Si tu producto envía datos personales de clientes o usuarios a cualquiera de estos proveedores, la Ley 21.719 exige un contrato DPA (Data Processing Agreement) que fije por escrito qué hace el proveedor con esos datos, sus medidas de seguridad, y qué pasa si hay una brecha — independiente de si el proveedor entrena o no con tu contenido.
¿Todo proyecto de IA necesita un modelo grande como GPT o Claude?
No. Depende de la tarea: decidir qué función ejecutar (tool-calling) lo resuelve un modelo de decenas de millones de parámetros —órdenes de magnitud más chico y más barato que un flagship de +25B—, mientras que digerir documentos extensos o razonar sobre conocimiento específico sí justifica un modelo grande. Conectar el modelo más caro a cada parte del producto por default es la forma más común de pagar de más en un proyecto de IA.
Diseñamos tu Arquitectura de IA Capa por Capa, no un Modelo Único para Todo
Auditamos qué necesita cada proceso de tu producto, ya sea tool-calling liviano, contexto grande o conocimiento específico, qué proveedor no expone los datos de tus clientes, y qué contrato DPA firmar con cada uno. El resultado: pagas por la capacidad que tu proyecto realmente usa, no por el modelo más caro conectado a todo por default.
Contenido relacionado
¿Dónde Vive tu IA? Self-Host vs. API Gestionada: el Costo Real
Antes de elegir entre estas 5 APIs, la pregunta previa: te conviene alojar el modelo por tu cuenta o pagar por uso.
Ver la comparativa - Más Barato que API RealtimeLey 21.719: Protección de Datos Personales para Empresas
Si tu proveedor de IA procesa datos de tus clientes, necesitas un contrato DPA. Acá está el checklist completo de qué exige la ley.
Ver el checklist real - Multa Máxima desde Dic. 2026Consumo de IA en Producción: Las 6 Palancas de Optimización
Ya elegiste proveedor: estas son las 6 palancas para bajar el costo por conversación sin cambiar de modelo.
Leer diagnóstico - Costo por ConversaciónTool-Calling: Cuándo un Modelo Chico Gana al LLM Grande
El criterio completo detrás del router de tool-calling que evaluamos acá: cuándo un modelo de pocos millones de parámetros reemplaza al LLM grande, y cuándo no.
Leer arquitectura - Parámetros, no Miles de Millones