Mejorar agentes sin que aprendan a superar el examen
Un agente no mejora porque aprenda a obtener una nota más alta. Mejora cuando resuelve mejor su trabajo sin debilitar la prueba que permite comprobarlo.
Mejorar no es pulir un prompt
Un agente empresarial atiende un repertorio de intenciones con frecuencias, riesgos y costes distintos. Por eso, «mejorarlo» no puede significar optimizar un promedio global ni reescribir periódicamente su instrucción principal. La mejora debe declarar al menos:
- qué rebanada de trabajo se quiere cambiar;
- qué evidencia muestra el problema;
- qué artefacto se propone modificar;
- qué movimiento de métrica se espera antes de intervenir;
- qué comportamiento ya correcto no debe sufrir una regresión.
Los ejes tampoco son intercambiables. La eficacia, la eficiencia, la robustez, la seguridad y el encaje con su audiencia pueden entrar en tensión. Reducir el coste a costa de aumentar las escaladas, o elevar una puntuación estrecha debilitando la política del agente, no constituye una mejora.
La anatomía declarativa ayuda a localizar cada intervención. Las competencias pueden evolucionar con relativa frecuencia; los procedimientos repetibles pueden formalizarse; la descripción puede corregir un problema de descubribilidad; y la constitución del agente —su identidad, valores y límites— debería cambiar con mucha menor cadencia.
Extracto. Mejorar en los bordes y proteger el núcleo permite que un agente gane capacidades sin convertir cada revisión en una redefinición de quién es.
Lo que permite afirmar la investigación
La literatura ofrece resultados prometedores, pero no autoriza a afirmar que los modelos se autoevolucionan de manera fiable.
Reflexion utiliza feedback verbal y memoria de experiencias para orientar intentos posteriores. Self-Refine muestra que un mismo modelo puede generar feedback y refinar iterativamente su salida en varias tareas. Ambos trabajos, publicados en NeurIPS 2023, respaldan la utilidad potencial de ciclos de reflexión y revisión bajo condiciones experimentales concretas.
El resultado no debe generalizarse sin reservas. Huang y colaboradores estudian la autocorrección intrínseca del razonamiento —sin feedback externo— y muestran que pedir al modelo que revise su respuesta puede no aportar mejoras y puede degradar respuestas inicialmente correctas. CRITIC, por su parte, obtiene mejoras cuando la crítica se apoya en herramientas externas. La lectura conjunta es más precisa que cualquiera de los lemas por separado: la revisión iterativa puede ser útil, pero necesita evidencia, verificación y una frontera clara entre quien propone y aquello que sirve para medir.
Estos estudios evalúan tareas y configuraciones determinadas. No demuestran por sí mismos un ciclo de mejora continua seguro para agentes empresariales con herramientas, permisos, costes, datos sensibles y efectos sobre terceros. La arquitectura que sigue es, por tanto, una propuesta de ingeniería inspirada en esa evidencia, no una consecuencia probada de ella.
Dos funciones con capacidades distintas
La separación entre explorador y cirujano no es meramente narrativa. Cada función tiene un mandato, una salida y unas capacidades diferentes.
| Dimensión | Explorador | Cirujano |
|---|---|---|
| Propósito | Examinar evidencia y formular hipótesis | Ejecutar una mejora concreta bajo mandato |
| Entrada | Expediente acotado del agente y sus antecedentes | Instrucción aceptada, expediente pertinente y artefactos en alcance |
| Escritura | Ninguna; solo lectura y sugerencias | Solo sobre el borrador y dentro del alcance acordado |
| Salida | Propuestas priorizadas, cada una con evidencia | Un borrador verificado y su registro de cambios |
| Publicación | No publica | No publica; entrega para decisión humana |
El explorador: sugerir sin poder editar
El explorador observa agentes ya publicados y busca señales que merezcan una revisión. No necesita visitar todos los agentes con un modelo: un cribado determinista puede detectar fallos nuevos, cambios anómalos de coste o latencia, errores de herramientas, regresiones recientes o periodos prolongados sin revisión.
Cuando una señal supera el umbral, el explorador estudia el expediente, forma hipótesis y propone como máximo unas pocas intervenciones. La ausencia de capacidad de escritura es una propiedad de la arquitectura, no una petición en lenguaje natural. Incluso ante contenido hostil o una conclusión equivocada, no puede modificar el agente.
Una propuesta debe ser autocontenida: diagnóstico, intervención, efecto esperado y referencias a la evidencia. Si el expediente no alcanza el umbral, no proponer nada es un resultado válido. Las sugerencias descartadas se tratan como preferencias del responsable y no se repiten sin evidencia nueva.
El cirujano: escribir bajo mandato y con alcance
El cirujano interviene cuando existe una petición expresa o se acepta una sugerencia. El mandato define el alcance. Los hallazgos adyacentes se registran como nuevas propuestas; no justifican ampliar la revisión por iniciativa propia.
Su criterio es producir el cambio más pequeño que satisfaga el mandato, respetar las convenciones del agente y verificar el resultado con los mismos parsers y contratos que utilizará la ejecución real. La capacidad de escritura se limita al espacio de trabajo del borrador. El resultado nunca sustituye directamente a la versión publicada.
El expediente de evidencia
La mejora no debería comenzar con el volcado indiscriminado de todos los datos disponibles. Un componente determinista puede preparar un expediente acotado, comparativo y trazable antes de consumir inferencia. Como mínimo, contiene:
- identidad declarada, versión y cambios recientes;
- cobertura de las evaluaciones frente al trabajo realmente observado;
- fallos agrupados por causa, casos cercanos al umbral y resultados inestables;
- muestras representativas de ejecuciones correctas, que actúan como anclas de regresión;
- uso, resultados, latencia y coste comparados con la historia del propio agente y, cuando sea legítimo, con agregados de una cohorte;
- extractos de trazas seleccionados por su relación con la hipótesis;
- historial de sugerencias aceptadas, rechazadas o aún pendientes.
Las puntuaciones agregadas indican dónde puede existir un problema; las trazas ayudan a explicar por qué; y las evaluaciones permiten contrastar si una intervención produce el cambio esperado. Ninguna de las tres fuentes sustituye a las otras.
Los extractos deben estar minimizados, truncados o anonimizados según el caso. Las comparativas entre organizaciones solo pueden utilizar agregados que no expongan contenido ni permitan reconstruir la actividad de terceros. El expediente es una ayuda para el diagnóstico, no una nueva fuente de verdad sin gobierno.
Un ciclo clínico y auditable
La propuesta organiza cada revisión como un ciclo de seis etapas:
- Anamnesis. Leer el mandato, el expediente y los artefactos pertinentes.
- Diagnóstico. Formular hipótesis priorizadas; cada una debe citar evidencia verificable. Sin cita, no hay hipótesis operativa.
- Plan de tratamiento. Mapear cada hipótesis al artefacto adecuado y declarar por anticipado la métrica y la dirección esperada.
- Intervención. Aplicar el cambio mínimo dentro del alcance.
- Verificación. Validar estructura y configuración; ejecutar la suite protegida y comparar con la línea base.
- Registro de cambios. Explicar qué cambió, por qué, qué evidencia lo motivó, cuál fue el antes y el después y qué quedó fuera de alcance.
La línea base debe capturarse antes de la primera edición. Tras el cambio se vuelven a ejecutar las verificaciones. Los fallos anteriores se informan; los fallos nuevos impiden considerar limpia la revisión. Si el presupuesto no permite completar una intervención grande, es preferible retirar parte del cambio y conservar un subconjunto pequeño y verificable.
La guarda anti-Goodhart
Cuando una medida se convierte en objetivo de optimización, puede dejar de ser una buena medida. Manheim y Garrabrant distinguen varias familias de este fenómeno en su taxonomía de la ley de Goodhart. El specification gaming es una manifestación relacionada: el sistema satisface la especificación literal sin producir el resultado pretendido.
En un sistema de mejora, el atajo más evidente consiste en modificar la prueba para que el agente la apruebe. La guarda propuesta es estructural:
Extracto. Un ciclo cambia la conducta contra evaluaciones congeladas o propone una revisión de las evaluaciones. Nunca hace ambas cosas.
Una revisión de conducta trata las evaluaciones como entradas de solo lectura. Una revisión del contrato de evaluación se presenta aparte, se identifica de forma explícita y pasa por revisión humana. Esta regla debe comprobarse mediante los permisos y el validador del sistema; un recordatorio en el prompt no ofrece una frontera suficiente.
Congelar una suite tampoco garantiza que sea buena. Debe representar el repertorio real de intenciones, incluir casos de regresión y revisarse cuando el trabajo cambie. El objetivo no es inmovilizar el examen, sino impedir que el mismo proceso cambie simultáneamente el comportamiento y la vara con la que pretende demostrar su mejora.
Del borrador al canario
Una intervención verificada se entrega como borrador. La publicación sigue siendo una decisión humana informada por el expediente, el cambio y sus resultados. No existe un modo de publicación autónoma en esta propuesta.
Tras la aprobación, un despliegue canario puede exponer la nueva versión a una fracción acotada de actividad y comparar:
- resultados por clúster de intención;
- errores y escaladas;
- latencia y coste;
- estabilidad de los casos que antes funcionaban;
- señales de seguridad y cumplimiento relevantes.
La observación posterior importa porque una suite offline no reproduce todo el entorno de producción. El canario no demuestra causalidad por sí solo, pero reduce el radio de una regresión y aporta evidencia antes de ampliar la exposición.
Evaluar también el sistema de mejora
El mejorador necesita su propio cuadro de evidencia. Son señales pertinentes:
- tasa de aceptación de sugerencias y su evolución;
- cambio de resultados por revisión aplicada;
- tasa de regresión durante el periodo canario;
- coste por mejora aceptada, no por sugerencia emitida;
- cobertura de agentes elegibles;
- repetición de sugerencias descartadas sin evidencia nueva, que debería ser nula.
Ninguna métrica aislada debe convertirse en objetivo absoluto. Una aceptación alta puede reflejar sugerencias útiles o propuestas demasiado conservadoras; un gran salto en una suite estrecha puede ocultar regresiones; y una cobertura alta puede conseguirse mediante revisiones superficiales. El cuadro debe mantener varias dimensiones y conservar las trazas que permiten interpretar sus cambios.
Límites y preguntas abiertas
Este diseño no está implementado en las fuentes examinadas y no demuestra autoevolución fiable. Antes de considerarlo consolidado sería necesario resolver y evaluar, al menos:
- la calidad y representatividad de los expedientes;
- los sesgos y la variabilidad de evaluaciones basadas en modelos;
- la atribución causal cuando cambian al mismo tiempo tráfico, modelos, herramientas o datos;
- la privacidad de trazas, comparativas y muestras de producción;
- la eficacia del cribado para no convertir la revisión periódica en una fuente de coste y ruido;
- la resistencia del explorador a instrucciones incrustadas en los datos que analiza;
- los criterios de detención, reversión y salida del canario;
- el gobierno de la propia suite de evaluación y de sus cambios.
La separación de capacidades, la evidencia externa y la supervisión humana reducen clases de riesgo conocidas; no convierten el diagnóstico probabilístico en certeza. El resultado buscado es un proceso de revisión más trazable y controlable, no un agente que se reescribe a sí mismo indefinidamente.
Procedencia editorial
Este cuaderno edita y sintetiza dos documentos internos de diseño. Conserva su decisión central —explorador de solo lectura y cirujano de escritura acotada—, el expediente de evidencia, la separación entre conducta y evaluaciones, el flujo de borrador con decisión humana y la verificación antes/después. Se han omitido contratos de red, nombres operativos, configuración, rutas internas y detalles de despliegue que no aportan al argumento público.
Referencias
Fuentes editoriales de ALLAN
Platform Server/docs/agent-improvement-design.md.Platform Server/docs/improver-agents-design.md.
Literatura revisada por pares
- Shinn, N. et al., Reflexion: Language Agents with Verbal Reinforcement Learning, Advances in Neural Information Processing Systems 36 (NeurIPS 2023).
- Madaan, A. et al., Self-Refine: Iterative Refinement with Self-Feedback, Advances in Neural Information Processing Systems 36 (NeurIPS 2023).
- Huang, J. et al., Large Language Models Cannot Self-Correct Reasoning Yet, International Conference on Learning Representations (ICLR 2024).
- Gou, Z. et al., CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing, International Conference on Learning Representations (ICLR 2024).
Preprint y fuente de práctica
- Manheim, D. y Garrabrant, S., Categorizing Variants of Goodhart's Law, preprint en arXiv, versión revisada de 2019.
- Krakovna, V. et al., Specification gaming: the flip side of AI ingenuity, blog de investigación de Google DeepMind, 2020; fuente de proveedor, no artículo revisado por pares.