Precios de IA Privada: Tarifa Plana vs Cobro por Token
Precios de IA privada explicados: tarifa plana vs cobro por token, qué determina el coste y cómo Tessera factura la inferencia dedicada en UE y LATAM.
Precios de IA Privada: Tarifa Plana vs Cobro por Token (2026)
Los precios de IA privada adoptan dos formas: cobro por token, donde pagas por cada token de entrada y salida, y tarifa plana de inferencia gestionada, donde una cuota mensual fija compra capacidad dedicada. Para las cargas de trabajo estables y de alto volumen que la mayoría de los equipos ejecutan en producción, la tarifa plana es más fácil de presupuestar y suele ser más económica. Tessera factura la inferencia privada como tarifa plana mensual en GPUs dedicadas en la UE y LATAM, ejecutando modelos de pesos abiertos como Qwen3.6-35B-A3B detrás de una API compatible con OpenAI, sin excedentes por token y sin entrenamiento con tus datos.
Dos Formas de Pagar la Inferencia
El cobro por token escala tu factura directamente con el uso. Pagas una tarifa por millón de tokens de entrada y una tarifa más alta por millón de tokens de salida, por lo que los costes suben y bajan con cada prompt, reintento y ventana de contexto larga.
Las tarifas publicadas por token varían ampliamente según el modelo. GPT-5.4 Nano de OpenAI cuesta $0,20 por millón de tokens de entrada y $1,25 por millón de tokens de salida (OpenAI). DeepSeek V4-Flash lista $0,14 por millón de entrada y $0,28 por millón de salida, con aciertos de caché que reducen la entrada cacheada a unos $0,0028 por millón (DeepSeek). Las tarifas parecen pequeñas por token, pero son impredecibles en conjunto: un mes intenso de tickets de soporte o procesamiento de documentos puede duplicar la factura del mes anterior.
La inferencia gestionada de tarifa plana invierte eso. Reservas capacidad dedicada por una cuota mensual fija, y tu coste permanece igual tanto si el tráfico es bajo como si hay picos. Para cargas de trabajo en producción con patrones de solicitudes estables, esa previsibilidad suele valer más que ahorrar fracciones de céntimo en cada token.
Un Ejemplo Práctico: Cómo Oscila una Factura por Token
Supongamos que un flujo de trabajo de atención al cliente procesa 50 millones de tokens de entrada y 10 millones de tokens de salida en un mes. Con GPT-5.4 Nano a $0,20 y $1,25 por millón (OpenAI), eso es $10,00 por entrada más $12,50 por salida, o $22,50 al mes. Modesto, hasta que el lanzamiento de un producto duplica el volumen de tickets y el mismo flujo de trabajo cuesta $45,00. Cambia a un modelo con razonamiento intensivo para tickets más complejos y la tarifa por token vuelve a subir.
Ese es el problema central del cobro por uso: tu factura sigue la demanda, y la demanda es exactamente lo que no puedes predecir. Los proveedores ofrecen mecanismos para suavizarlo. La Batch API de OpenAI descuenta los trabajos asíncronos un 50% y los tokens de entrada cacheados cuestan hasta un 90% menos que los nuevos (OpenAI); los aciertos de caché de DeepSeek reducen la entrada cacheada a aproximadamente una cincuentava parte de la tarifa sin caché (DeepSeek). Esos descuentos son reales, pero requieren trabajo de ingeniería para aprovecharlos y aun así dejan tu coste principal moviéndose con el tráfico.
Una tarifa mensual plana elimina esa varianza por completo. Dimensionas la capacidad una vez, y un pico durante la semana de lanzamiento cuesta lo mismo que una semana tranquila.
Los Costes Ocultos del Cobro por Token
La tarifa por token es solo la parte visible de una factura por uso. Los límites de velocidad y la limitación durante las horas pico te empujan hacia niveles de precio más altos. Las solicitudes fallidas y los reintentos siguen consumiendo tokens. Los prompts de sistema largos y las definiciones de herramientas inflan cada llamada, por lo que el exceso de contexto eleva silenciosamente el recuento de entrada en cargas de trabajo que creías pequeñas.
Capturar los descuentos publicados añade su propio coste: el caché de prompts, el procesamiento por lotes y la lógica de enrutamiento son proyectos de ingeniería, no simples ajustes de configuración. Los equipos que no tienen tiempo para construirlos pagan la tarifa completa por uso. Con un plan de tarifa plana, ese trabajo de optimización es responsabilidad del proveedor, y los ahorros ya están incluidos en el precio.
Qué Incluye la Inferencia Gestionada
Una cuota de inferencia gestionada de tarifa plana agrupa lo que una tarifa por token oculta: cómputo GPU dedicado, red, enrutamiento de API, planificación de capacidad y soporte. No contratas ingenieros de ML ni pronosticas la demanda de GPU, y no absorbes el coste del hardware reservado inactivo en un mes tranquilo.
Por eso la inferencia gestionada se ha vuelto accesible para equipos reducidos. En lugar de un desembolso de capital para GPUs y el personal para gestionarlas, pagas una cuota única y predecible por infraestructura de nivel empresarial desde el primer día. El proveedor amortiza el hardware costoso entre muchos clientes, por lo que accedes a GPUs de nivel empresarial a una fracción del coste de comprarlas y mantenerlas tú mismo.
Qué Determina el Coste de la IA Privada
Tres factores fijan tu factura:
- Cómputo. Las GPUs dedicadas cuestan más que la capacidad serverless compartida, pero eliminan los picos de latencia por vecinos ruidosos y te ofrecen un rendimiento constante.
- Tamaño del modelo. Los modelos más grandes necesitan más memoria GPU, lo que eleva el coste. Los modelos de pesos abiertos como Qwen3.6-35B-A3B funcionan eficientemente en GPUs de gama media, por lo que obtienes alta calidad sin pagar por hardware sobredimensionado.
- Residencia de datos. Mantener la inferencia dentro de la UE o LATAM evita el riesgo de transferencia transfronteriza y la carga de cumplimiento normativo que conlleva.
Como Qwen3.6-35B-A3B se distribuye con pesos abiertos, no hay licencia de modelo por token añadida sobre el cómputo, a diferencia de las APIs propietarias como GPT-5.4 Nano a $0,20 de entrada y $1,25 de salida por millón de tokens (OpenAI). Pagas por el tiempo de GPU que reservas, no por el acceso al modelo, y puedes ajustar el modelo con tu propio vocabulario en lugar de trabajar alrededor de una caja negra fija.
Autoalojamiento vs Gestionado: Capex vs Opex
Ejecutar tus propias GPUs convierte la inferencia en un proyecto de capital: compra de hardware, refrigeración de instalaciones, mantenimiento de controladores, refuerzo de seguridad y al menos un ingeniero que entienda la pila. Puede ser rentable para cargas de trabajo que funcionan a pleno rendimiento 24/7 a gran escala, donde poseer el hardware supera al alquiler.
Para la mayoría de los equipos, la inferencia gestionada es la mejor opción económica. Conviertes ese gasto de capital en un gasto operativo predecible, y el proveedor absorbe el riesgo de una GPU fallida o una actualización de controlador defectuosa. El intercambio es sencillo: un coste unitario ligeramente mayor a cambio de cero sobrecarga de infraestructura y una factura que puedes prever. Para una visión más amplia del comprador, consulta IA privada para pequeñas empresas.
Cuándo Gana la Tarifa Plana
La tarifa plana resulta rentable cuando el uso es estable y de alto volumen. La cuota fija absorbe los picos de tráfico que de otro modo dispararían una factura por token, por lo que el número que presupuestas es el número que pagas. No hay líneas de excedente que conciliar ni facturas sorpresa tras un trimestre intenso. Para un equipo pequeño, esa previsibilidad suele importar más que la tarifa por token nominal: una línea de coste estable que puedes planificar supera a una tarifa más barata que oscila con la demanda.
El cobro por token sigue teniendo sentido para experimentos esporádicos y de bajo volumen donde puedes pasar días sin una sola solicitud. El punto de cruce depende de tu propio tráfico, por lo que modelar tu volumen real importa más que cualquier regla general.
Precios y Residencia de Datos
Para los equipos regulados, precio y cumplimiento normativo están vinculados. Un plan de tarifa plana en GPUs dedicadas en la UE o LATAM mantiene los datos de los clientes dentro de tu jurisdicción, respaldado por un acuerdo de procesamiento de datos. El Artículo 28 del RGPD exige ese acuerdo y obliga al encargado del tratamiento a actuar únicamente según tus instrucciones documentadas, por lo que un proveedor conforme no puede reutilizar tus prompts, incluido para entrenamiento, sin autorización explícita. Tessera ejecuta toda la inferencia en nodos de la UE y LATAM y no entrena con ninguno de tus datos, por lo que el trabajo de cumplimiento que de otro modo pagarías en esfuerzo de auditoría está integrado en el precio.
Cómo Estimar Tu Coste
Comienza con tu volumen real de tokens. Extrae un mes de uso de tu proveedor actual, divídelo en tokens de entrada y salida, y compara el total por token con una tarifa mensual plana para la misma carga de trabajo. Luego añade la varianza: mira tu mes más intenso, no el promedio, porque esa es la factura de la que te protege un plan de tarifa plana.
Modela ambas opciones con nuestra calculadora de precios, y si estás migrando desde una API pública, la guía de alternativas a la API de OpenAI y migración cubre el cambio directo para que puedas cambiar la URL base y las claves sin rediseñar tu aplicación.
Preguntas Frecuentes
¿Es la IA privada más barata que las APIs de nube pública?
Para cargas de trabajo estables y de alto volumen, generalmente sí. La inferencia gestionada de tarifa plana limita tu gasto mensual, mientras que las APIs públicas por token escalan con cada solicitud y se disparan en períodos de alta demanda. Las tarifas públicas por token comienzan siendo bajas por millón de tokens, pero el agregado impredecible es lo que infla la factura.
¿Cómo se factura la IA privada?
De dos formas: cobro por token, una tarifa por millón de tokens de entrada y salida, o una cuota mensual plana por capacidad dedicada. Tessera utiliza precios de tarifa plana en GPUs dedicadas en la UE y LATAM ejecutando modelos de pesos abiertos detrás de una API compatible con OpenAI.
¿Cuál es la diferencia entre el cobro por token y la tarifa plana?
El cobro por token escala los costes directamente con el volumen de uso y es impredecible de mes a mes. La tarifa plana limita el gasto independientemente del consumo de tokens, lo que se adapta a las cargas de trabajo en producción con tráfico estable.
¿La elección del modelo cambia el precio?
Sí. Los modelos más grandes necesitan más memoria GPU y son más costosos de servir. Los modelos de pesos abiertos como Qwen3.6-35B-A3B funcionan en GPUs de gama media y no tienen tarifa de licencia de modelo, por lo que mantienen la inferencia privada asequible sin sacrificar calidad.
¿Los descuentos por procesamiento por lotes y caché hacen más barato el cobro por token?
Ayudan. OpenAI descuenta los trabajos de la Batch API un 50% y la entrada cacheada hasta un 90%, y los aciertos de caché de DeepSeek reducen la entrada cacheada considerablemente (OpenAI). Pero aprovecharlos requiere trabajo de ingeniería, y tu coste principal sigue moviéndose con el tráfico.
¿Puedo ejecutar IA privada sin gestionar hardware?
Sí. La inferencia gestionada se encarga del aprovisionamiento y escalado de GPUs, por lo que accedes a un endpoint compatible con OpenAI sin poseer hardware. La facturación mensual plana cubre cómputo, red y enrutamiento de API.