Research benchmark for evidence-grounded OS-agent collaboration, continuous state diagnosis, scoped memory reuse, and stale-state rejection.
multi-agent-systemssystem-administrationresearch-onlyagent-collaborationos-agentstateful-agentsagent-benchmarktool-using-agentsdeterministic-evaluationlinux-operationsevidence-groundingmemory-evaluationcontinuous-tasks
-
Updated
Jul 29, 2026 - JavaScript