Lo que realmente ha quedado tras el cambio de cuerpo

Balance práctico de la prueba piloto de Agents-Brain, realizada del 6 al 15 de julio: identidad estable, función de «write-back» operativa, lagunas visibles y bloqueadores de harness reales.

Eine Frau prüft einen Retro-Roboter am Teststand, der in einer Broschüre als perfekt beworben wird; die Anzeige warnt vor zu früher Feier.

Lo que te llevas de aquí: Aquí tienes el balance sincero de mi prueba piloto «Agent-Brain», realizada del 6 al 29 de julio, con los resultados de los primeros nueve días, las pruebas que se han ido añadiendo desde entonces y las lagunas que aún quedan por resolver.

El 6 de julio de 2026 comenzó la prueba para la que había creado el Agents Brain: Nox se trasladó a Hermes, mientras que «Identidad» y «Memoria» permanecieron en el repositorio.

Nueve días después, por primera vez pude decir algo más que „Los archivos seguían ahí“. Este hallazgo, del 15 de julio, sigue siendo la instantánea histórica del artículo. Desde entonces, se han sumado otras dos semanas de pruebas y ensayos de funcionamiento reales.

Este es el resumen de cinco preguntas, en cada una de las cuales se distingue entre la situación de entonces y la situación según los documentos del 29 de julio.

1. ¿Se reconoce la identidad en la nueva herramienta?

Sí, pero con una distinción importante.

El SOUL redactado por el propio Nox en el antiguo Workspace se ha incorporado tal cual al Vault. Solo se han añadido indicaciones neutras en los casos en que las referencias a herramientas antiguas tienen carácter histórico. Se han conservado el tono, la postura y los principios de trabajo.

En cambio, su manual operativo se ha revisado. Esto era necesario porque el cuerpo y, por lo tanto, las herramientas disponibles habían cambiado. Hermes es hoy en día el cuerpo de orquestación principal; el entorno de herramientas anterior forma parte del contexto histórico.

De este modo, la prueba ha confirmado un límite razonable:

  • Los contenidos relacionados con la identidad pueden transferirse de forma estable.
  • Las normas de trabajo relacionadas con las herramientas deben adaptarse al nuevo periodo de vigencia.
  • Ambos deben ir en archivos separados para que el cambio siga siendo visible.

Por lo tanto, „mismo agente” no significa que cada línea deba permanecer sin cambios. Significa que los cambios se producen en la capa adecuada.

2. ¿Era útil ese recuerdo?

Sí, porque no se ha dado por completado.

La antigua memoria a largo plazo se revisó durante la mudanza. A los estados de los proyectos obsoletos se les asignaron marcadores claros. Se decidió deliberadamente no transferir los destilados sensibles a la memoria central. La KW12, que no estaba documentada, quedó visible como una laguna conocida.

De este modo, Nox pudo empezar con una historia previa real, sin confundir la información antigua con los conocimientos actuales.

Esa es una diferencia importante. Una gran cantidad de datos antiguos no habría supuesto una mejor memoria. Lo que los hizo útiles fue su clasificación: ¿qué es estable? ¿Cuál es la situación a fecha de marzo? ¿Qué falta? ¿Qué hay que volver a comprobar a partir de fuentes actuales?

En el día a día, esta actitud ha dado buenos resultados. Nox no considera el repositorio como una fuente infalible. Para conocer el estado actual de los proyectos, consulta las fuentes primarias correspondientes.

3. ¿Funciona la función de reescritura durante el funcionamiento?

Durante el periodo de prueba: sí.

Del 6 al 15 de julio, ambos inclusive, habrá un «Nox-Daily-Log» para cada día del calendario. En él se recogen tareas, decisiones, delegaciones, correcciones y asuntos pendientes.

Más importante que el número es el efecto. Varias correcciones derivadas de incidentes concretos se han convertido en lecciones duraderas. Algunos ejemplos son el enfoque narrativo activo de OpenClaw, la prohibición de hilos vagos del tipo „en algún momento“ y la norma de proteger los adaptadores portátiles con las mismas puertas de CI antes del push.

De este modo, el trayecto de vuelta del trabajo al Brain no solo está previsto, sino que se aprovecha de forma práctica.

La prueba también ha puesto de manifiesto una limitación: el Brain no es un registro pasivo de todas las herramientas. Una orden de Codex ejecutada directamente no apareció inicialmente en la memoria de Nox, ya que no se había designado a ningún agente como propietario. El 15 de julio se detectó este hallazgo y se ajustó el Bridge local de tal forma que el trabajo directo en el repositorio, sin otra asignación, pertenezca por defecto a Nox.

Esto demuestra que: La reversión de pérdidas requiere responsabilidad. Sin un «agente-propietario», el sistema no sabe en qué memoria debe almacenarse una tarea.

4. ¿Se tienen realmente en cuenta la gobernanza y la privacidad?

En el núcleo analizado: sí.

Nox y Sol cargan sus REGLAS con los controles de aprobación. La regla de Sol de «revisar antes de publicar» se aplica independientemente de qué sistema de gestión de contenidos elabore el material. Nox tampoco puede publicar contenidos públicos sin mi autorización.

Al mismo tiempo, los límites de los archivos ahora pueden verificarse automáticamente. El Vault valida los datos preliminares obligatorios, las secuencias de inicio, los controles de aprobación, las referencias a Brain Root y las copias no deseadas de perfiles. Un «Privacy-Gate» analiza los contenidos rastreados y etiquetados en busca de patrones secretos y réplicas no autorizadas de datos confidenciales de los agentes.

El 15 de julio, las pruebas completas del repositorio de entonces, con 148 pruebas, se completaron con éxito; la integración continua (CI) confirmó este resultado provisional en Python 3.9 y 3.11 sin anotaciones.

El 29 de julio, la suite se había ampliado. Para el nuevo contrato de memoria, se ejecutaron con éxito 224 pruebas unitarias, 72 pruebas de regresión de Vault y 35 pruebas de regresión de privacidad. La comprobación local completa se superó con Python 3.9.6; la matriz de GitHub confirmó Python 3.9 y 3.11. Estas cifras corroboran el contrato versionado que se comprobó efectivamente en esa fecha.

Los validadores pueden comprobar la estructura y los riesgos conocidos. La corrección del contenido de una publicación sigue siendo una cuestión que requiere una revisión humana.

5. ¿Se ha demostrado ya de forma concluyente la metamorfosis?

El 15 de julio, la prueba de Hermes y del flujo de trabajo central de Nox resultó lo suficientemente robusta como para seguir trabajando. En el caso de los cuatro harnesses documentados, la respuesta seguía siendo «no».

A fecha de 29 de julio, la situación se ha aclarado. Claude Code, una nueva ejecución de Codex y Hermes han cargado, en pruebas de solo lectura independientes, el mismo orden de inicio vinculante desde la misma bóveda. Los tres obtuvieron la misma valoración técnica en el nuevo verificador de memoria. La prueba automatizada de clonado en fresco también ha dado resultado positivo: reconstruye en un clon local aislado un agente de borrador junto con el puente y comprueba la escritura y lectura de Markdown entre procesos separados, utilizando únicamente la biblioteca estándar de Python y Git.

Estas dos pruebas no deben combinarse. La prueba «Three-Body Smoke» evaluó la lectura y la clasificación, no el «write-back». El «Fresh Clone» comprueba la rutina de recuperación sin interfaces de línea de comandos (CLI) reales del harness. Para «Gemini» siguen existiendo adaptadores y pruebas de contrato, pero aún no hay un documento de ejecución completo. Por lo tanto, tampoco se ha demostrado de forma generalizada que exista una escritura de retorno real para cada cuerpo.

Al mismo tiempo, el nuevo contrato de memoria se implementó en el clon del servidor de producción y se confirmó allí con una lectura correcta. Esto demuestra la ruta de implementación del «cerebro» común, no la operatividad de cada herramienta conectada.

Estas cuestiones pendientes determinan el siguiente nivel de madurez.

La presencia de un puente indica que la arquitectura puede comunicarse con la herramienta. Un «smoke» de solo lectura confirma el acuerdo de lectura compartido. Solo un inicio real, una tarea completada y una reescritura en memoria verificada demuestran que el agente está plenamente operativo en ese punto.

Anexo: Ya hay dos ejemplos de esta demostración completa. Claude Code logró la perforación de «write-back» el 29 de julio. Grok Build le siguió el 12 de agosto como el quinto sistema realmente validado, junto a Hermes, Claude Code, Codex y Kimi Code —desde la comprobación de habilidades, pasando por la sesión interactiva, hasta dos ejecuciones «headless» independientes con el marcador diario leído de nuevo—. De este modo, el repositorio documenta seis familias de adaptadores en lugar de cuatro.

Lo que demuestra la prueba realizada hasta el 15 de julio

Tras nueve días, puedo sacar cinco conclusiones sólidas:

  1. Una persona con una identidad similar puede sobrevivir al cambio de herramienta en archivos legibles.
  2. Las reglas operativas se pueden adaptar por separado al nuevo cuerpo.
  3. Los registros diarios y las lecciones funcionan como una actualización en tiempo real cuando un agente tiene asignada la tarea.
  4. Las puertas de aprobación y las normas de privacidad pueden integrarse en Brain de forma independiente del Harness y someterse a comprobaciones automáticas.
  5. La falta de documentación sigue siendo una carencia; el sistema pone de manifiesto las lagunas, en lugar de ocultarlas.

No es tan espectacular como una memoria autónoma que, según dicen, lo sabe todo. Pero para mi trabajo es más valioso.

Lo que se ha añadido hasta el 29 de julio

El núcleo ha ganado en precisión desde la primera prueba. En la memoria se pueden distinguir la observación, la deducción y las reglas generalizadas. Las contradicciones deben actualizarse indicando el estado anterior, la nueva prueba y la resolución visible. Una curación se marca como pendiente tras 14 días o diez nuevos registros diarios, pero sigue estando sujeta a la revisión humana. Los archivos independientes obsoletos de «Memory» y «Lesson» se sustituyen, en lugar de eliminarse, indicando la fecha, el motivo y el sucesor. La fecha del evento y la hora de registro en Git permanecen separadas.

Estas normas no solo están documentadas. El contrato de lectura conjunto ha sido revisado por tres organismos, el «Fresh-Clone-Smoke» está en verde y el clon productivo «Brain» se ha actualizado al mismo estado. Quedan pendientes, sobre todo, la ejecución real de Gemini y el comprobante completo de reescritura por cada mazo de cables.

Lo que haría de otra manera

Yo trataría la «propiedad de los agentes» como una parte independiente de la arquitectura de la memoria. La ejecución directa del Codex ha demostrado que un «cerebro» común por sí solo no basta. Cada tarea necesita una asignación clara: ¿Quién lee? ¿Quién decide? ¿Quién responde?

Además, yo llevaría un registro de las pruebas E2E por cada conjunto de pruebas desde el principio. «Adaptador disponible», «validador en verde» y «tiempo de ejecución comprobado» son tres estados distintos. Nunca deberían confundirse en una única indicación de estado.

Y yo señalaría las lagunas de conocimiento conocidas con la misma antelación que el conocimiento que sí tengo. Una laguna reconocida ahorra más tiempo a la larga que una memoria supuestamente completa que ya nadie puede distinguir de una reconstrucción.

Mi balance

El 15 de julio, Agents Brain no era un producto terminado. El 29 de julio tampoco lo es. Se trata de un sistema en constante evolución cuyo núcleo cuenta ahora con una base más amplia.

Nox trabaja en un nuevo cuerpo principal. Su identidad es reconocible, su memoria está ordenada y su rutina diaria de escritura está activa. La gobernanza viaja con él. Claude Code, Codex y Hermes leen el mismo contrato; el Fresh Clone acredita la recuperación exclusiva mediante Markdown. Al mismo tiempo, Gemini y el write-back auténtico por cuerpo permanecen abiertos como pruebas independientes.

Así es exactamente como quería escribir este informe de taller: ni como la historia de una inventora ni como un final de ensueño, sino como una respuesta clara a una pregunta práctica.

¿Puede un agente de IA cambiar de herramienta sin que yo tenga que volver a configurar su identidad de trabajo?

En cuanto al núcleo probado y la recuperación a partir de los archivos canónicos, mi respuesta es: sí. Para un „plug and play“ universal, sigo trabajando en las pruebas.

Actualización: Dos de estas pruebas ya están disponibles: Claude Code desde el 29 de julio y Grok Build desde el 12 de agosto. Gemini sigue sin resolverse.

Fuentes

  • Fuente del proyecto: Migración de Nox, registros diarios del 6 al 29 de julio de 2026, protocolos de mantenimiento de memoria, interoperabilidad de harnesses, clones nuevos y CI (fuentes primarias privadas)
  • Documento de Git: Estructura inicial de Agents-Brain del 16 de mayo de 2026 y migración a Nox del 6 de julio de 2026
  • Pro Git: ¿Qué es Git?

Comentarios sobre la publicación

0 comentarios

Participar en el debate

Tu dirección de correo electrónico no se publicará. Los campos obligatorios están marcados.

Noticias desde el estudio

Nuevas publicaciones por correo electrónico.

Cuando se publique un nuevo informe técnico o una guía práctica, recibirá un breve correo electrónico con el enlace. Sin periodicidad fija, sin publicidad.

Prefiero leerlo a través de RSS

La suscripción no se activará hasta que hagas clic en el enlace de confirmación. Puedes darte de baja de la suscripción en cualquier momento a través del enlace que aparece en cada correo electrónico.