Goatify IA

Noticias, guías y análisis

Un buen agente de revisión necesita memoria de la hipótesis, no solo memoria de la conversación

Análisis sobre cómo construir agentes que administren el ciclo de vida de sus observaciones mediante hipótesis verificables y no simples mensajes persistentes.

Un buen agente de revisión necesita memoria de la hipótesis, no solo memoria de la conversación

Recordar el texto no alcanza. Cuando un agente señala un problema, conservar el comentario original ayuda a entender qué dijo, pero no necesariamente qué condición observó. «Este campo puede quedar vacío» es una frase; la hipótesis detrás podría ser «existe una ruta de ejecución donde la validación no corre antes de guardar». Si después cambia el código, el sistema necesita volver a evaluar esa hipótesis. Una memoria centrada en mensajes tiende a comparar lenguaje. Una memoria centrada en condiciones permite decidir si la causa desapareció, persiste o cambió de forma.

La observación debe tener identidad. Cada hallazgo puede representarse con un identificador, una condición, evidencia inicial, severidad y estado. Ese pequeño esquema permite que una ejecución posterior no trate el mismo problema como un descubrimiento nuevo. También facilita distinguir una corrección parcial de una solución real. Si cambia la línea mencionada pero el camino vulnerable sigue existiendo en otra función, el hallazgo no debería cerrarse. La identidad ayuda a seguir el problema a través de refactors, archivos y revisiones sucesivas sin depender de coincidencias literales en el diff.

Revalidar exige una prueba adecuada. Algunas hipótesis pueden comprobarse con una regla estática; otras necesitan tests, ejecución o revisión semántica. El agente debería registrar qué evidencia sería suficiente para cambiar de estado. Un comentario de estilo puede cerrarse al modificar una construcción. Un riesgo funcional quizá necesite ejecutar un caso específico. Un supuesto de negocio puede requerir leer otra fuente. Esta relación entre hipótesis y prueba reduce cierres prematuros. También permite explicar por qué una alerta sigue abierta aunque el usuario haya modificado el lugar que originalmente la generó.

Los estados evitan ruido acumulado. Un sistema útil puede usar estados como abierto, atendido pendiente de revalidación, resuelto, reaparecido o descartado. No todos deben mostrarse con el mismo peso. El usuario necesita principalmente lo que aún exige acción, mientras el historial conserva cómo cambió la evaluación. Este patrón mejora la confianza porque el agente reconoce que su conocimiento puede quedar obsoleto. En lugar de mantener un comentario eternamente visible por precaución, lo retira cuando tiene evidencia y puede reabrirlo si una regresión demuestra que la condición volvió.

Las correcciones humanas son datos de evaluación. Cuando una persona rechaza un hallazgo, conviene capturar el motivo: falso positivo, contexto faltante, riesgo aceptado o regla mal interpretada. Esa distinción alimenta mejores pruebas y métricas. Un sistema que solo ve «cerrado» puede aprender la lección equivocada. Si el usuario aceptó el riesgo deliberadamente, la condición técnica puede seguir existiendo pero ya no requiere intervención. Separar verdad técnica de decisión de negocio permite que el agente sea preciso sin convertirse en una autoridad que reabre discusiones ya resueltas por política.

La métrica debe seguir el ciclo completo. Contar hallazgos favorece agentes que comentan mucho. Una métrica mejor observa precisión confirmada, tiempo hasta resolución, porcentaje de revalidaciones correctas y reincidencia. También importa cuántas alertas debieron reabrirse porque se cerraron demasiado pronto. Este conjunto premia calidad y mantenimiento del estado. Con el tiempo, un equipo puede identificar qué tipos de hipótesis el agente verifica bien y cuáles necesitan revisión humana antes de cambiar de estado, creando una frontera de autonomía basada en evidencia.

Lectura para Goatify. Podemos aplicar este patrón a cualquier habilidad que diagnostique. Si un agente detecta que una campaña perdió conversión, un enlace está roto o un formulario dejó de enviar, debería guardar la condición que justificó la alerta y la prueba que confirmará la recuperación. Después de una corrección, revalida y cierra. Eso evita que el usuario administre manualmente listas de problemas que ya no existen. La memoria útil no es una transcripción infinita; es una colección pequeña de hipótesis activas, pruebas asociadas y estados que reflejan el mundo actual.

Abrir artículo en Goatify

Abriendo Goatify...