Memoria que sabe qué fue verdad y cuándo
Una memoria empresarial no debería responder solo «¿qué sé?», sino también «¿de dónde procede?», «¿cuándo fue válido?» y «¿qué evidencia lo sustituyó?».
El diagnóstico
Una memoria plana acumula fragmentos. Puede recuperar una frase relevante y, al mismo tiempo, perder su contexto, mezclar preferencias con hechos o tratar una información antigua como si siguiera vigente.
Los agentes empresariales necesitan operar durante muchas sesiones, sobre procesos que cambian. El problema no es únicamente superar la ventana de contexto del modelo. Es mantener una historia interpretable sin llenar cada turno con todo lo conocido.
La literatura reciente ofrece varias piezas: Generative Agents combina observación, reflexión y recuperación; CoALA organiza memorias modulares dentro de una arquitectura cognitiva; MemGPT utiliza la analogía de jerarquías de memoria; los grafos temporales añaden vigencia y procedencia. ALLAN reúne esas ideas en un modelo de cuatro resoluciones y dos velocidades.
Cuatro resoluciones
M0 — Verbatim
Es el registro original de la interacción: mensajes, resultados y referencias a artefactos. Aporta la evidencia más precisa, pero es demasiado voluminoso para utilizarlo siempre como contexto.
El verbatim no debe duplicarse en varios almacenes como fuentes de verdad independientes. Las capas superiores apuntan a él para permitir auditoría y drill-down.
M1 — Episodios
Un episodio resume una unidad de experiencia: qué se intentó, qué ocurrió, qué decisiones se tomaron y cuál fue el resultado. Es el canal rápido de consolidación porque reduce una sesión extensa a un objeto recuperable.
El resumen no sustituye al original. Conserva referencias a los turnos o artefactos que lo sustentan.
M2 — Grafo semántico temporal
El grafo representa entidades, relaciones y hechos. Cada arista incorpora evidencia y vigencia. Una afirmación nueva puede:
- crear un hecho que no existía;
- reforzar un hecho conocido con otra evidencia;
- invalidar un hecho incompatible y abrir una nueva vigencia.
Invalidar no significa borrar. Permite responder tanto «¿cuál es la política actual?» como «¿qué política estaba vigente cuando se tomó aquella decisión?».
M3 — Perfil
El perfil contiene el contexto pequeño que merece estar disponible con mucha frecuencia: preferencias estables, responsabilidades, estilo de trabajo o hechos centrales. No debe convertirse en un vertedero de todo lo recordado.
Extracto. El perfil es una memoria de alta prioridad, no una memoria de alta autoridad. Cada afirmación debe conservar procedencia y posibilidad de revisión.
Dos velocidades
Lectura en el turno
El camino crítico necesita un presupuesto estricto. Puede combinar:
- perfil relevante;
- búsqueda textual y vectorial;
- expansión acotada por relaciones del grafo;
- recencia, confianza y vigencia;
- episodios como anclaje hacia el verbatim.
El resultado es un paquete pequeño y fechado. El agente puede solicitar un drill-down si necesita la evidencia completa.
No se publican objetivos universales de latencia: dependen del almacén, la red, el tamaño del corpus y el modelo de embeddings. La propiedad importante es que la recuperación tenga presupuesto y no inyecte todo por defecto.
Consolidación asíncrona
La escritura semántica no debe prolongar cada respuesta. Un worker puede procesar después la experiencia:
- resumir episodios;
- extraer hechos y entidades;
- enlazar evidencia;
- detectar novedad o contradicción;
- actualizar el perfil;
- publicar eventos de cambio.
Un proceso menos frecuente puede fusionar duplicados, recalibrar confianza y revisar perfiles. La analogía con el sueño es útil para describir trabajo fuera del turno, pero no implica un proceso cognitivo humano.
La temporalidad evita que la memoria mienta por omisión
Un hecho puede tener dos tiempos diferentes:
- cuándo se consideró válido en el mundo descrito;
- cuándo entró o salió del sistema de memoria.
Esta distinción bi-temporal permite reconstruir tanto el conocimiento disponible en un momento como la vigencia atribuida al hecho. La ontología de tiempo del W3C y PROV-O ofrecen vocabularios generales para expresar temporalidad y procedencia; no prescriben una implementación concreta de memoria agéntica.
Durante la lectura, los hechos invalidados no deben presentarse como verdad actual. Pueden recuperarse deliberadamente para consultas históricas, siempre con sus fechas.
Actualización en tres escalas
Segundos: consolidación incremental
Cada afirmación candidata se compara con los hechos del mismo sujeto y relación. Una evidencia nueva e independiente puede reforzar un hecho; una repetición o proyección del mismo episodio solo ayuda a reconocer el duplicado y no aumenta por sí sola su confianza. Las contradicciones cierran una vigencia y abren otra.
Horas: consolidación profunda
Un job periódico puede detectar entidades duplicadas, patrones entre sesiones y perfiles que han quedado obsoletos. Debe operar con presupuesto propio y producir cambios auditables.
En tiempo de consulta: competencia por el contexto
Entre los hechos vigentes, una puntuación combina relevancia, recencia y confianza. La memoria no solo marca la obsolescencia: impide que lo viejo y dudoso desplace automáticamente a lo fresco y corroborado.
Un escritor por espacio de nombres
Compartir el mismo sustrato de datos no autoriza a todos los servicios a escribir todo. La regla es:
Un único escritor por espacio de nombres; los cruces son de lectura o pasan por un contrato explícito.
Esta separación reduce condiciones de carrera y permite atribuir cada cambio. Una capa puede servir búsquedas e inspección; otra consolida memoria; ambas pueden usar el mismo almacén sin convertirse en copropietarias de las mismas claves.
Memoria no es entrenamiento
Actualizar episodios, hechos o perfiles no modifica necesariamente los pesos del modelo. El agente recibe contexto recuperado y puede cambiar su respuesta porque el contexto ha cambiado. Llamar «aprendizaje» a todo ese proceso oculta la diferencia entre memoria externa, adaptación de una política y entrenamiento del modelo.
Esta distinción también importa para el borrado: retirar un registro de memoria no equivale a retirar información que forme parte de los parámetros de un modelo entrenado.
Estado y límites
La primera fase de implementación de memoria v2 está completada en la revisión examinada; la integración amplia con servicios de conversación, inspector y experiencia de usuario permanece en evolución.
Quedan cuestiones sustantivas: retención, rectificación por el usuario, revalidación contra fuentes externas, evaluación de recuperación, coste de consolidación y comportamiento bajo contradicciones sutiles. Ninguna arquitectura de memoria garantiza por sí misma que un hecho extraído por un LLM sea correcto.
Referencias
Fuentes editoriales de ALLAN
Platform Server/docs/agent-memory-v2-design.md.Platform Server/docs/agent-memory-v2-implementation-plan.md, utilizado para contrastar el estado.
Fuentes externas
- Park, J. S. et al., Generative Agents: Interactive Simulacra of Human Behavior, UIST 2023.
- Sumers, T. R. et al., Cognitive Architectures for Language Agents, Transactions on Machine Learning Research, 2024.
- Packer, C. et al., MemGPT: Towards LLMs as Operating Systems, preprint, 2023.
- Rasmussen, L. et al., Zep: A Temporal Knowledge Graph Architecture for Agent Memory, preprint, 2025.
- W3C, PROV-O: The PROV Ontology, Recomendación del W3C, 2013.
- W3C, Time Ontology in OWL, Recomendación del W3C, 2022.