Cuando el pipeline falla,
el agente investiga.
Respuesta a incidentes con agentes de IA: investigar el fallo, proponer una corrección y acompañar la recuperación. Una POC hacia el self-healing, con revisión humana.
El pipeline correAirflow orquesta las tareas.
- Una tarea fallaSe envía el incidente al agente.
El agente investigaConsulta logs, contexto y código.
Propone una PRUn fix revisable y una notificación.
Revisión humanaMerge + despliegue
Reejecución + validación
Del pipeline a la propuesta de corrección.
Seleccioná un componente.
Explorá su función en el sistema.
Si transform falla, investigate_failure envía el incidente a AgentCore. La respuesta accepted confirma recepción; el DAG sigue fallado.
Ver cómo funciona el agente por dentro ↓Un agente. Un modelo. Sus herramientas.
El modelo decide qué consultar.
Las tools interactúan con los sistemas.
El modelo decide qué consultar. El agente ejecuta la tool y le devuelve el resultado para continuar la investigación.
Qué puede hacer el agente
Dónde corre y con qué se conecta
El ciclo se repite hasta obtener una respuesta o alcanzar un límite. La investigación corre en segundo plano; el resultado completo queda en los logs de AgentCore.
El código de esta POC.
Qué implementa
Un pipeline en Amazon MWAA con una falla intencional. Cuando falla transform, Airflow envía el incidente a un agente de Strands en AgentCore para investigar, proponer una draft PR y notificar por Slack.
- airflow-agent/
- Agente, tools, configuración y contenedor.
- dags/
- ETL de ejemplo e invocación del agente.
- infra/
- Módulos Terraform y guía de despliegue.
Cómo se ejecuta
El agente responde accepted y continúa el triage en un hilo separado. Airflow espera la recepción HTTP, no el diagnóstico. La investigación queda registrada en los logs de AgentCore.
Estado de la POCLa invocación está implementada. El flujo completo todavía requiere validación en AWS. La recepción en segundo plano no es una cola durable; no hay merge ni rerun automático.