¿Qué es Inferencia?
El proceso de pasar nuevos inputs a través de un modelo de IA entrenado para generar predicciones, texto, clasificaciones u otros outputs. El entrenamiento construye el modelo; la inferencia lo usa. Cada vez que envías un prompt a ChatGPT, eso es inferencia. Entender la inferencia importa porque es donde se acumulan los costos, optimizar la velocidad y eficiencia de inferencia es crítico para aplicaciones de IA en producción, especialmente a escala.
Siguiente paso útil
En palabras simples
"Es como pedirle a un chef entrenado que cocine — el entrenamiento ya pasó, ahora es actuación en vivo."
Cómo funciona
Claves para recordar
-
Ejecutar el modelo con inputs nuevos = inferencia
-
Aquí está tu costo por consulta
-
Latencia y throughput son métricas clave
En la práctica
Cada vez que ChatGPT genera una respuesta, eso es inferencia. Los pesos del modelo están congelados — ejecuta un forward pass con tu input. La inferencia es lo que cuesta dinero por consulta, y optimizarla es toda una disciplina.