Los proveedores de LLM facturan por token, y la matemática es simple una vez que conoces las cuatro palancas: qué modelo usas, cuántos tokens de entrada y salida necesita cada solicitud, cuánto de tu entrada puedes cachear, y si el trabajo puede ejecutarse por lotes. Esta calculadora convierte esas palancas en una cifra mensual y anual real y te permite comparar modelos con la misma carga de trabajo. Esta guía explica cómo funciona cada palanca y dónde se esconden los ahorros.
Cómo funciona el precio por token
Cada solicitud se cotiza en tokens — fragmentos de subpalabras de aproximadamente cuatro caracteres. Los proveedores publican dos tarifas principales por modelo: un precio por millón de tokens de entrada (todo lo que envías) y un precio por millón de tokens de salida (todo lo que el modelo genera). El costo de una solicitud es simplemente cada conteo de tokens dividido entre un millón, multiplicado por su tarifa, y sumado.
Lo más importante que debes interiorizar es que la salida es mucho más cara que la entrada — típicamente de 3 a 6 veces la tarifa. En Claude Sonnet 4.6, la entrada cuesta $3/1M y la salida $15/1M; en GPT-5.5 son $5 frente a $30. Eso significa que un modelo parlanchín que rellena sus respuestas puede costar más que un modelo más caro que responde de forma concisa. Cuando una factura te sorprenda, mira primero la longitud de la salida.
Costo de entrada vs salida — y por qué importa la elección del modelo
Como las dos tarifas difieren tanto, el modelo más barato no siempre es el más barato para tu carga de trabajo. Una carga que envía prompts enormes pero espera respuestas cortas está dominada por el costo de entrada, donde un modelo de gama media puede ser una ganga. Una carga que genera documentos largos está dominada por el costo de salida, donde un modelo más pequeño y rápido puede ahorrar mucho más que recortar la entrada.
Para eso existe la pestaña Comparar Modelos: mantiene fijos tus conteos de tokens y tu volumen, y los recalcula en tres modelos a la vez, dividiendo cada barra en entrada, entrada en caché y salida para que veas exactamente a dónde va el dinero. A menudo un modelo un nivel más abajo resuelve la tarea a una fracción del costo — la única forma de saberlo es comparar con tus números reales.
Caché de prompts y descuentos por lotes
Dos funciones del proveedor reducen el costo sin cambiar tu modelo ni tus prompts. El caché de prompts almacena el prefijo estable de una solicitud — un prompt de sistema, un bloque largo de instrucciones, contexto recuperado — para que las solicitudes repetidas no lo reprocesen. Los tokens en caché se leen a aproximadamente el 10% del precio de entrada. El detalle es una prima única de escritura de caché (alrededor de 1.25× la entrada en Anthropic) en la primera solicitud, así que el caché rinde cuando el mismo prefijo se reutiliza muchas veces dentro de la ventana de caché.
La Batch API ejecuta solicitudes de forma asíncrona al 50% del precio estándar. Si tu trabajo tolera una latencia de minutos a horas — resúmenes masivos, clasificación, evaluaciones, enriquecimiento de datos — los lotes son dinero gratis. Ambos se acumulan: una carga de trabajo cacheada, por lotes y con el modelo del tamaño correcto puede costar una pequeña fracción de la estimación ingenua.
Estimar tokens y evitar sorpresas
Para presupuestar antes de construir, necesitas una estimación de tokens. El texto en inglés promedia unos cuatro caracteres o 0.75 palabras por token, así que un documento de 2,000 palabras son aproximadamente 2,700 tokens. La pestaña Estimador de Tokens hace esta conversión a partir de texto pegado o un conteo directo. Trátala como una guía aproximada — el código, el JSON, el texto en otros idiomas y el vocabulario inusual se tokenizan de forma distinta, y para cifras exactas debes usar el tokenizador del proveedor o su endpoint de conteo de tokens.
Dos sorpresas comunes: el historial de conversación se reenvía (y se vuelve a facturar) en cada turno a menos que lo cachees o lo recortes, así que los chats de múltiples turnos se encarecen a medida que se alargan; y el contexto recuperado cuenta como entrada cada vez, aunque la pregunta del usuario sea diminuta. Los modelos y precios de esta herramienta se capturaron a mediados de 2026 y están aislados en una sola tabla fechada en el código — confirma siempre contra la página de precios del propio proveedor antes de comprometer un presupuesto, porque las tarifas cambian.