Curso completo
Testing de Aplicaciones de IA
Prueba lo que no puedes verificar: construye suites de eval para aplicaciones con LLMs y agentes, califica salidas no deterministas y haz red teaming en tus funcionalidades de IA antes que tus usuarios.
~4 horas de contenido
Contenido del curso
10 lecciones completas que cubren todo lo que necesitas saber
Introducción
Introducción
Visión general del curso
Conoce qué cubre este curso, para quién es y en qué se diferencia probar la IA de usar la IA para probar.
Introducción
Por qué las aplicaciones de IA rompen el QA tradicional
Por qué las aserciones de igualdad exacta, las pruebas de snapshot y el grabar-y-reproducir fallan aquí, y qué las reemplaza.
Entendiendo el sistema bajo prueba
Lección
Lección 1LLMs, agentes y RAG en lenguaje sencillo
El vocabulario que necesita quien prueba: prompts, ventanas de contexto, temperatura, embeddings, recuperación, llamadas a herramientas y bucles de agente. Sin matemáticas.
Lección
Lección 2El no determinismo y qué le hace a las aserciones
De pasa o falla en una ejecución a un puntaje en muchas, además de umbrales, varianza y reportes de error que lo sobreviven.
Lección
Lección 3Los modos de falla de las funcionalidades de IA
Alucinación, rechazo equivocado, inyección de prompt, uso indebido de herramientas, fuga de contexto, deriva de costo y regresión silenciosa tras una actualización de modelo.
Construyendo una suite de evaluación
Lección
Lección 4Conjuntos de datos de referencia
Curar casos, por qué 30 buenos superan a 300 generados, registrar comportamiento esperado en vez de strings, y versionar el conjunto.
Lección
Lección 5Primero las verificaciones deterministas
Todo lo que aún puedes verificar exactamente: esquema, citas, llamadas a herramientas, strings prohibidos, rechazos y presupuestos de latencia y costo.
Lección
Lección 6LLM como juez
Escribir una rúbrica, puntuar en una escala, calibrar al juez contra etiquetas humanas y la trampa de un juez tan equivocado como el sistema que califica.
Lección
Lección 7Las métricas que importan
Métricas de RAG, métricas de agentes y costo y latencia como números de primera clase, con una regla: una métrica se gana su lugar cambiando una decisión.
Publicar y mantenerlo seguro
Lección
Lección 8Evals en CI
Convertir los puntajes en una compuerta: dos carriles, muestreo honesto, umbrales derivados del ruido medido y qué hacer cuando se pone roja.
Lección
Lección 9Red teaming y pruebas adversarias
Inyección de prompt, jailbreaks, exfiltración de datos, fuga de datos personales y una suite adversaria que se reejecuta ante cada cambio de modelo.
Lección
Lección 10Observabilidad y retroalimentación de producción
Trazar llamadas en producción, detectar fallas que los usuarios nunca reportan y devolverlas al conjunto de datos de referencia.
Bonus y conclusión
Bonus
Bonus: el panorama de herramientas de testing de IA
Cada concepto del curso mapeado a DeepEval, RAGAS, Promptfoo, LangSmith, Braintrust y construir la tuya.
Conclusión
¡Felicitaciones!
¡Has completado el curso Testing de Aplicaciones de IA!