Saltar al contenido
Volver al Glosario
◉ ai

Costo de Inferencia

El costo de correr modelos de IA en producción

¿Qué es Costo de Inferencia?

El precio que pagas cada vez que un modelo de IA genera una respuesta — medido por token, por request o por hora de cómputo. El costo de inferencia es el asesino silencioso de productos de IA: un demo es barato, pero servir 10,000 usuarios 24/7 se acumula rápido. Los builders inteligentes optimizan la selección de modelo (no todo necesita GPT-4), cachean agresivamente y rastrean costo-por-tarea como rastrean unit economics.

Siguiente paso útil

💡

En palabras simples

"Es como el taxímetro — cada token generado suma a la tarifa, así que elige bien la ruta."

Cómo funciona

Optimiza: cache + modelos del tamaño justo

Claves para recordar

  • Se mide en costo por millón de tokens

  • Cachea, elige el modelo correcto y comprime prompts

  • La variable oculta en la unit economics de cualquier producto AI

En la práctica

Procesar 1M de tokens en GPT-4 cuesta ~$30. Una app activa que genera 10M tokens/día acumula $300/día. Cachear consultas frecuentes, usar modelos más pequeños para tareas fáciles y compresión de prompts puede reducir esto un 80%.

Copied