UCL 和 Holistic AI 团队这篇论文做了一件很有意思的实验:
把 Agent 的历史轨迹压缩成一张有限状态机(FSM)。
比如 Coding Agent 经常在「搜索 → 修改 → 执行 → 再搜索」之间循环。作者把工具调用和动作抽象成状态,再从大量成功和失败轨迹中自动还原出 Agent 常走的路径。
结果在 12 个公开数据集上,这些 FSM 只有 7–43 个状态,却能以 ≥0.997 的拟合度重放未见过的轨迹,而且几毫秒就能构建完成。
这张「行为地图」还能直接拿来预测Agent 下一步可能做什么,以及当前轨迹是不是正在走向失败。
在下一步预测上,它在 8/8 数据集都超过了 Agent Workflow Memory;失败预测最高 AUROC 达到 0.94。
在 SWE-agent 上,系统甚至可以在失败任务平均只执行到 32% 时触发早停,省掉后面约 68% 的计算。
但我更关注论文里的另一个发现:
换不同 LLM,Agent 的行为拓扑依然非常相似。
底座模型会影响每一步怎么选,harness 可能早已经把「有哪些路可以走」画出了大致边界。
以后分析 Agent,也不能只盯着模型输出。
它反复走哪些路径、在哪里进入循环、失败前会经过哪些状态,本身就是一层很有价值的可观测信号。
📎 arxiv: https://arxiv.org/abs/2608.23670