Saltar al contenido
Volver al Glosario
◉ ai

Inferencia

Usar un modelo de IA entrenado para generar outputs

¿Qué es Inferencia?

El proceso de pasar nuevos inputs a través de un modelo de IA entrenado para generar predicciones, texto, clasificaciones u otros outputs. El entrenamiento construye el modelo; la inferencia lo usa. Cada vez que envías un prompt a ChatGPT, eso es inferencia. Entender la inferencia importa porque es donde se acumulan los costos, optimizar la velocidad y eficiencia de inferencia es crítico para aplicaciones de IA en producción, especialmente a escala.

Siguiente paso útil

💡

En palabras simples

"Es como pedirle a un chef entrenado que cocine — el entrenamiento ya pasó, ahora es actuación en vivo."

Cómo funciona

Claves para recordar

  • Ejecutar el modelo con inputs nuevos = inferencia

  • Aquí está tu costo por consulta

  • Latencia y throughput son métricas clave

En la práctica

Cada vez que ChatGPT genera una respuesta, eso es inferencia. Los pesos del modelo están congelados — ejecuta un forward pass con tu input. La inferencia es lo que cuesta dinero por consulta, y optimizarla es toda una disciplina.

Copied