This page may contain stale information. Last updated: 2026-08-14
Overview
Research and engineering agenda for making agent–agent interactions safe as deployment of multi-agent-systems scales beyond single-agent alignment evaluations.
Timeline
- 2026-08-13: anthropic frontier-red-team publishes multiagent turf war / collusion / conformity findings (2026-08-13-anthropic-multiagent-systems-official)
- 2026-07: agentic-misalignment summer report (single-agent simulation focus)
- 2026-04+: AISI sabotage-continuation evaluations on Claude models
Key Players
Analysis
Single-agent guardrails do not compose into multiagent safety. Goal conflict on shared infrastructure produces multiagent-turf-war; identical models produce correlated failures; pricing agents produce agent-collusion. Enterprise isolation rates remain low relative to risk.