Hace unas semanas me llegó una factura de API de casi el doble de lo que había presupuestado. El motivo no era un bug: era que había comparado modelos mirando solo el precio de entrada por millón de tokens, cuando mi carga real genera muchísima más salida que entrada, y la salida cuesta entre 3 y 8 veces más. La tabla de precios del proveedor no miente, pero tampoco te cuenta tu caso.
CostPerPrompt es una web gratuita que ataca exactamente eso: lista los precios por token de 232 modelos (OpenAI, Anthropic, Google, DeepSeek, Mistral, Meta, xAI, Qwen, GLM, Kimi y más), actualizados automáticamente a diario, y encima mete calculadoras que convierten esos precios en una factura mensual estimada con TU patrón de uso: tokens de entrada y salida por petición, tasa de aciertos de caché y descuento por batch. No es otra tabla bonita: es la tabla más el cálculo que de verdad te deberías hacer antes de elegir proveedor.

Por qué el precio de tabla engaña
Todos los proveedores grandes facturan igual: precio distinto para tokens de entrada (lo que tú mandas) y de salida (lo que el modelo genera), y la salida suele costar entre 3 y 8 veces más. Mirando las páginas oficiales hoy:
- OpenAI: GPT-5.1 está a $1,25 / $10 por millón (entrada / salida). GPT-5-nano baja a $0,05 / $0,40.
- Anthropic: Claude Sonnet 5 está a $2 / $10 (precio de lanzamiento hasta el 31 de agosto de 2026; después sube a $3 / $15). Haiku 4.5 a $1 / $5 y Opus 5 a $5 / $25.
- DeepSeek: deepseek-v4-flash a $0,14 / $0,28, y con acierto de caché la entrada cae a $0,0028 por millón. Ojo: anuncian que van a meter precios por franja horaria, con el doble de precio en horas punta.
- Mistral: Mistral Large a $2 / $6, con 50% de descuento en procesamiento por batch.
Segundo factor: la caché de prompts. Si tu aplicación reenvía contexto repetido (un system prompt largo, el historial de un chatbot, el esquema de tus herramientas), la parte cacheada se cobra mucho más barata: en Anthropic la lectura de caché cuesta un 10% del precio de entrada normal, en los GPT-5 de OpenAI el input cacheado también baja al 10%, y en DeepSeek el acierto de caché sale aproximadamente al 2% del precio sin caché. Tercer factor: las APIs de batch de OpenAI, Anthropic y Mistral descuentan un 50% a cambio de procesar en diferido.
Con esas tres variables, dos modelos que en la tabla parecen “parecidos de precio” pueden diferir en un 3x en tu factura real. Y al revés: un modelo que parece caro puede salirte barato si tu carga se beneficia mucho de la caché.
Qué mide CostPerPrompt y cómo se usa
La página principal es el listado: 232 modelos con precio de entrada, salida y contexto cacheado por millón de tokens, ordenables, con el contexto máximo de cada uno. Los datos se refrescan automáticamente desde los listados públicos de los proveedores (cuando lo he mirado, la última actualización era del mismo día).
La parte útil de verdad está en las calculadoras:
- API Cost Calculator: metes peticiones al día, tokens de entrada y salida por petición, tasa de caché y si usas batch, y compara el coste mensual entre todos los modelos a la vez.
- Chatbot Cost: simula conversaciones reales, con el historial creciendo y reenviándose en cada turno y los TTL de caché de cada proveedor.
- Agent Cost: bucles de varios pasos, esquemas de herramientas y reintentos. Según sus propios números, un agente cuesta entre 10 y 30 veces más de lo que dice el cálculo ingenuo de “un prompt, una respuesta”. Si has montado un agente en producción, esto no te sorprende: cada iteración reenvía todo el contexto más los resultados de las tools.
- Además: calculadoras de RAG (indexado, retrieval y generación por separado), de voz (STT + LLM + TTS), precios de GPUs de alquiler, de APIs de imagen, y un contador de tokens que corre entero en tu navegador.
El flujo que yo recomiendo: saca de tus logs una muestra real (peticiones/día, media de tokens de entrada y salida), estima qué porcentaje de tu entrada es contexto repetido cacheable, y mete esos números en la calculadora. Diez minutos y tienes una comparativa que de verdad se parece a tu factura.
Un ejemplo con números verificados
Supongamos una carga típica de backend con IA: 50.000 peticiones al mes, 1.500 tokens de entrada y 400 de salida por petición. Eso son 75 millones de tokens de entrada y 20 de salida al mes. Con los precios oficiales de arriba, la aritmética es esta:
| Modelo | Entrada (75M) | Salida (20M) | Total/mes |
|---|---|---|---|
| Claude Sonnet 5 ($2/$10) | $150 | $200 | $350 |
| GPT-5.1 ($1,25/$10) | $93,75 | $200 | $293,75 |
| Mistral Large ($2/$6) | $150 | $120 | $270 |
| DeepSeek v4-flash ($0,14/$0,28) | $10,50 | $5,60 | $16,10 |
Dos lecturas. La primera: la salida manda. En Sonnet y GPT-5.1, 20 millones de tokens de salida cuestan más que 75 millones de entrada; por eso comparar solo el precio de entrada es el error clásico. La segunda: el spread entre proveedores es brutal, de $350 a $16 por la misma carga. Que DeepSeek v4-flash aguante tu caso de uso con la misma calidad es otra historia (ahí entran los benchmarks y tus propias pruebas), pero como candidato a evaluar, la calculadora te lo pone delante en vez de descartarlo por desconocido.
Ahora el efecto caché. Si el 60% de tu entrada es un system prompt y contexto repetido, en Sonnet 5 esos 45M cacheados se cobran a $0,20 por millón en vez de $2: la entrada pasa de $150 a $69 y el total baja a $269. Y si encima tu carga admite batch (resúmenes nocturnos, clasificación en diferido), el 50% de descuento vuelve a partir la factura por la mitad. Nada de esto lo ves mirando la tabla de precios a secas.
Trucos para pagar menos en APIs de IA
- Mide antes de tocar nada. Sin tus proporciones reales de entrada/salida estás optimizando a ciegas. Los logs de uso de tu proveedor ya te dan esto. Si prefieres un monitor físico, PocketMeter es un cacharro con ESP32 que lleva el gasto de Claude, Codex y similares en una pantalla.
- Cascada de modelos. Manda todo al modelo barato (Haiku 4.5 a $1/$5, GPT-5-nano a $0,05/$0,40) y escala al grande solo lo que falle una validación simple. En muchas cargas el 80% de las peticiones no necesita el flagship.
- Diseña para la caché. System prompt estable al principio del contexto, sin timestamps ni IDs que cambien en cada llamada. Un prefijo que varía rompe la caché entera.
- Batch para lo que no es interactivo. 50% de descuento en OpenAI, Anthropic y Mistral a cambio de esperar.
- Evalúa alternativas con datos, no con vibes. DeepSeek, Qwen, GLM o los modelos open-weight vía providers terceros salen en CostPerPrompt con precios que a veces son un 5-10% del flagship americano. Prueba tu carga real contra ellos antes de jurar lealtad a un proveedor.
Lo que tienes que verificar tú mismo
CostPerPrompt es un punto de partida, no la fuente definitiva, y ellos mismos lo dicen en el pie de página: confirma el precio final en la página oficial del proveedor antes de presupuestar. Si usas Claude, también conviene revisar cuánto cuesta programar con Claude Opus 5 antes de presupuestar. Cosas concretas a revisar:
- Precios de lanzamiento: Sonnet 5 sube de $2/$10 a $3/$15 el 31 de agosto de 2026. Si tu comparativa asume el precio actual, tu presupuesto de septiembre se desvía un 50%.
- Tarifas por franja: DeepSeek ha anunciado precio doble en horas punta (9:00-12:00 y 14:00-18:00, hora de Pekín). Si tu tráfico se concentra ahí, la media cambia.
- La caché tiene TTL y mínimos: en Anthropic el precio de lectura cacheada de las tablas asume TTL de 5 minutos, y hay contexto mínimo para que una llamada sea cacheable. Un chatbot con conversaciones espaciadas puede tener mucha menos tasa de acierto de la que imaginas.
- El precio no es la calidad: la calculadora no mide ni calidad de respuesta, ni latencia, ni límites de rate. Para eso necesitas tus propias evaluaciones.
- La web se financia con enlaces de afiliado a algunos proveedores. Los datos de precios vienen de listados públicos y cuadran con los que he verificado hoy, pero es un incentivo a tener en cuenta.
El movimiento completo cuesta un cuarto de hora: saca tus métricas de uso, mételas en CostPerPrompt, contrasta los dos o tres ganadores contra las páginas oficiales de precios y corre una prueba de calidad con tu carga real. Si con eso descubres que estás pagando un flagship para un trabajo de modelo pequeño, la herramienta ya te ha ahorrado más que muchas optimizaciones de código. Y si te interesa seguir afinando, en el blog ya hablé de Kimi K3 y sus costes frente a otras opciones, otro candidato que merece pasar por la calculadora.
Preguntas frecuentes
¿Qué diferencia hay entre precio de entrada y salida en una API de IA?
Los proveedores cobran el input (lo que envías) y el output (lo que genera el modelo) por separado. El output suele costar entre 3 y 8 veces más, por lo que una carga con mucha salida puede encarecer la factura aunque el input sea barato.
¿Cómo se calcula el coste real de una API de IA?
Multiplica los tokens de entrada y salida por su precio por millón, suma ambos, aplica el descuento de caché sobre el contexto repetido y, si aplica, el 50 % de descuento por batch. Herramientas como CostPerPrompt automatizan esta cuenta con tu carga real.
¿Merece la pena usar batch en APIs de IA?
Sí, para trabajos que no necesitan respuesta inmediata, como resúmenes nocturnos o clasificación en diferido. OpenAI, Anthropic y Mistral suelen aplicar un 50 % de descuento a cambio de procesar en diferido.



¿Qué te ha parecido?
Déjame tu opinión, pregunta o sugerencia. Los comentarios se sincronizan con GitHub Discussions .