Volver al blog
Cuadernos de investigaciónInvestigación

Mejorar agentes sin que aprendan a superar el examen

Un agente no mejora porque aprenda a obtener una nota más alta. Mejora cuando resuelve mejor su trabajo sin debilitar la prueba que permite comprobarlo.

Publicado el 20 de julio de 2026

Mejorar no es pulir un prompt

Un agente empresarial atiende un repertorio de intenciones con frecuencias, riesgos y costes distintos. Por eso, «mejorarlo» no puede significar optimizar un promedio global ni reescribir periódicamente su instrucción principal. La mejora debe declarar al menos:

  • qué rebanada de trabajo se quiere cambiar;
  • qué evidencia muestra el problema;
  • qué artefacto se propone modificar;
  • qué movimiento de métrica se espera antes de intervenir;
  • qué comportamiento ya correcto no debe sufrir una regresión.

Los ejes tampoco son intercambiables. La eficacia, la eficiencia, la robustez, la seguridad y el encaje con su audiencia pueden entrar en tensión. Reducir el coste a costa de aumentar las escaladas, o elevar una puntuación estrecha debilitando la política del agente, no constituye una mejora.

La anatomía declarativa ayuda a localizar cada intervención. Las competencias pueden evolucionar con relativa frecuencia; los procedimientos repetibles pueden formalizarse; la descripción puede corregir un problema de descubribilidad; y la constitución del agente —su identidad, valores y límites— debería cambiar con mucha menor cadencia.

Extracto. Mejorar en los bordes y proteger el núcleo permite que un agente gane capacidades sin convertir cada revisión en una redefinición de quién es.

Lo que permite afirmar la investigación

La literatura ofrece resultados prometedores, pero no autoriza a afirmar que los modelos se autoevolucionan de manera fiable.

Reflexion utiliza feedback verbal y memoria de experiencias para orientar intentos posteriores. Self-Refine muestra que un mismo modelo puede generar feedback y refinar iterativamente su salida en varias tareas. Ambos trabajos, publicados en NeurIPS 2023, respaldan la utilidad potencial de ciclos de reflexión y revisión bajo condiciones experimentales concretas.

El resultado no debe generalizarse sin reservas. Huang y colaboradores estudian la autocorrección intrínseca del razonamiento —sin feedback externo— y muestran que pedir al modelo que revise su respuesta puede no aportar mejoras y puede degradar respuestas inicialmente correctas. CRITIC, por su parte, obtiene mejoras cuando la crítica se apoya en herramientas externas. La lectura conjunta es más precisa que cualquiera de los lemas por separado: la revisión iterativa puede ser útil, pero necesita evidencia, verificación y una frontera clara entre quien propone y aquello que sirve para medir.

Estos estudios evalúan tareas y configuraciones determinadas. No demuestran por sí mismos un ciclo de mejora continua seguro para agentes empresariales con herramientas, permisos, costes, datos sensibles y efectos sobre terceros. La arquitectura que sigue es, por tanto, una propuesta de ingeniería inspirada en esa evidencia, no una consecuencia probada de ella.

Dos funciones con capacidades distintas

La separación entre explorador y cirujano no es meramente narrativa. Cada función tiene un mandato, una salida y unas capacidades diferentes.

DimensiónExploradorCirujano
PropósitoExaminar evidencia y formular hipótesisEjecutar una mejora concreta bajo mandato
EntradaExpediente acotado del agente y sus antecedentesInstrucción aceptada, expediente pertinente y artefactos en alcance
EscrituraNinguna; solo lectura y sugerenciasSolo sobre el borrador y dentro del alcance acordado
SalidaPropuestas priorizadas, cada una con evidenciaUn borrador verificado y su registro de cambios
PublicaciónNo publicaNo publica; entrega para decisión humana

El explorador: sugerir sin poder editar

El explorador observa agentes ya publicados y busca señales que merezcan una revisión. No necesita visitar todos los agentes con un modelo: un cribado determinista puede detectar fallos nuevos, cambios anómalos de coste o latencia, errores de herramientas, regresiones recientes o periodos prolongados sin revisión.

Cuando una señal supera el umbral, el explorador estudia el expediente, forma hipótesis y propone como máximo unas pocas intervenciones. La ausencia de capacidad de escritura es una propiedad de la arquitectura, no una petición en lenguaje natural. Incluso ante contenido hostil o una conclusión equivocada, no puede modificar el agente.

Una propuesta debe ser autocontenida: diagnóstico, intervención, efecto esperado y referencias a la evidencia. Si el expediente no alcanza el umbral, no proponer nada es un resultado válido. Las sugerencias descartadas se tratan como preferencias del responsable y no se repiten sin evidencia nueva.

El cirujano: escribir bajo mandato y con alcance

El cirujano interviene cuando existe una petición expresa o se acepta una sugerencia. El mandato define el alcance. Los hallazgos adyacentes se registran como nuevas propuestas; no justifican ampliar la revisión por iniciativa propia.

Su criterio es producir el cambio más pequeño que satisfaga el mandato, respetar las convenciones del agente y verificar el resultado con los mismos parsers y contratos que utilizará la ejecución real. La capacidad de escritura se limita al espacio de trabajo del borrador. El resultado nunca sustituye directamente a la versión publicada.

El expediente de evidencia

La mejora no debería comenzar con el volcado indiscriminado de todos los datos disponibles. Un componente determinista puede preparar un expediente acotado, comparativo y trazable antes de consumir inferencia. Como mínimo, contiene:

  • identidad declarada, versión y cambios recientes;
  • cobertura de las evaluaciones frente al trabajo realmente observado;
  • fallos agrupados por causa, casos cercanos al umbral y resultados inestables;
  • muestras representativas de ejecuciones correctas, que actúan como anclas de regresión;
  • uso, resultados, latencia y coste comparados con la historia del propio agente y, cuando sea legítimo, con agregados de una cohorte;
  • extractos de trazas seleccionados por su relación con la hipótesis;
  • historial de sugerencias aceptadas, rechazadas o aún pendientes.

Las puntuaciones agregadas indican dónde puede existir un problema; las trazas ayudan a explicar por qué; y las evaluaciones permiten contrastar si una intervención produce el cambio esperado. Ninguna de las tres fuentes sustituye a las otras.

Los extractos deben estar minimizados, truncados o anonimizados según el caso. Las comparativas entre organizaciones solo pueden utilizar agregados que no expongan contenido ni permitan reconstruir la actividad de terceros. El expediente es una ayuda para el diagnóstico, no una nueva fuente de verdad sin gobierno.

Un ciclo clínico y auditable

La propuesta organiza cada revisión como un ciclo de seis etapas:

  1. Anamnesis. Leer el mandato, el expediente y los artefactos pertinentes.
  2. Diagnóstico. Formular hipótesis priorizadas; cada una debe citar evidencia verificable. Sin cita, no hay hipótesis operativa.
  3. Plan de tratamiento. Mapear cada hipótesis al artefacto adecuado y declarar por anticipado la métrica y la dirección esperada.
  4. Intervención. Aplicar el cambio mínimo dentro del alcance.
  5. Verificación. Validar estructura y configuración; ejecutar la suite protegida y comparar con la línea base.
  6. Registro de cambios. Explicar qué cambió, por qué, qué evidencia lo motivó, cuál fue el antes y el después y qué quedó fuera de alcance.

La línea base debe capturarse antes de la primera edición. Tras el cambio se vuelven a ejecutar las verificaciones. Los fallos anteriores se informan; los fallos nuevos impiden considerar limpia la revisión. Si el presupuesto no permite completar una intervención grande, es preferible retirar parte del cambio y conservar un subconjunto pequeño y verificable.

La guarda anti-Goodhart

Cuando una medida se convierte en objetivo de optimización, puede dejar de ser una buena medida. Manheim y Garrabrant distinguen varias familias de este fenómeno en su taxonomía de la ley de Goodhart. El specification gaming es una manifestación relacionada: el sistema satisface la especificación literal sin producir el resultado pretendido.

En un sistema de mejora, el atajo más evidente consiste en modificar la prueba para que el agente la apruebe. La guarda propuesta es estructural:

Extracto. Un ciclo cambia la conducta contra evaluaciones congeladas o propone una revisión de las evaluaciones. Nunca hace ambas cosas.

Una revisión de conducta trata las evaluaciones como entradas de solo lectura. Una revisión del contrato de evaluación se presenta aparte, se identifica de forma explícita y pasa por revisión humana. Esta regla debe comprobarse mediante los permisos y el validador del sistema; un recordatorio en el prompt no ofrece una frontera suficiente.

Congelar una suite tampoco garantiza que sea buena. Debe representar el repertorio real de intenciones, incluir casos de regresión y revisarse cuando el trabajo cambie. El objetivo no es inmovilizar el examen, sino impedir que el mismo proceso cambie simultáneamente el comportamiento y la vara con la que pretende demostrar su mejora.

Del borrador al canario

Una intervención verificada se entrega como borrador. La publicación sigue siendo una decisión humana informada por el expediente, el cambio y sus resultados. No existe un modo de publicación autónoma en esta propuesta.

Tras la aprobación, un despliegue canario puede exponer la nueva versión a una fracción acotada de actividad y comparar:

  • resultados por clúster de intención;
  • errores y escaladas;
  • latencia y coste;
  • estabilidad de los casos que antes funcionaban;
  • señales de seguridad y cumplimiento relevantes.

La observación posterior importa porque una suite offline no reproduce todo el entorno de producción. El canario no demuestra causalidad por sí solo, pero reduce el radio de una regresión y aporta evidencia antes de ampliar la exposición.

Evaluar también el sistema de mejora

El mejorador necesita su propio cuadro de evidencia. Son señales pertinentes:

  • tasa de aceptación de sugerencias y su evolución;
  • cambio de resultados por revisión aplicada;
  • tasa de regresión durante el periodo canario;
  • coste por mejora aceptada, no por sugerencia emitida;
  • cobertura de agentes elegibles;
  • repetición de sugerencias descartadas sin evidencia nueva, que debería ser nula.

Ninguna métrica aislada debe convertirse en objetivo absoluto. Una aceptación alta puede reflejar sugerencias útiles o propuestas demasiado conservadoras; un gran salto en una suite estrecha puede ocultar regresiones; y una cobertura alta puede conseguirse mediante revisiones superficiales. El cuadro debe mantener varias dimensiones y conservar las trazas que permiten interpretar sus cambios.

Límites y preguntas abiertas

Este diseño no está implementado en las fuentes examinadas y no demuestra autoevolución fiable. Antes de considerarlo consolidado sería necesario resolver y evaluar, al menos:

  • la calidad y representatividad de los expedientes;
  • los sesgos y la variabilidad de evaluaciones basadas en modelos;
  • la atribución causal cuando cambian al mismo tiempo tráfico, modelos, herramientas o datos;
  • la privacidad de trazas, comparativas y muestras de producción;
  • la eficacia del cribado para no convertir la revisión periódica en una fuente de coste y ruido;
  • la resistencia del explorador a instrucciones incrustadas en los datos que analiza;
  • los criterios de detención, reversión y salida del canario;
  • el gobierno de la propia suite de evaluación y de sus cambios.

La separación de capacidades, la evidencia externa y la supervisión humana reducen clases de riesgo conocidas; no convierten el diagnóstico probabilístico en certeza. El resultado buscado es un proceso de revisión más trazable y controlable, no un agente que se reescribe a sí mismo indefinidamente.

Procedencia editorial

Este cuaderno edita y sintetiza dos documentos internos de diseño. Conserva su decisión central —explorador de solo lectura y cirujano de escritura acotada—, el expediente de evidencia, la separación entre conducta y evaluaciones, el flujo de borrador con decisión humana y la verificación antes/después. Se han omitido contratos de red, nombres operativos, configuración, rutas internas y detalles de despliegue que no aportan al argumento público.

Referencias

Fuentes editoriales de ALLAN

  • Platform Server/docs/agent-improvement-design.md.
  • Platform Server/docs/improver-agents-design.md.

Literatura revisada por pares

Preprint y fuente de práctica