查看: 14|回复: 0

拿掉外部老师,AI Agent 自我进化几乎全部失效!

[复制链接]

8

主题

1

回帖

26

积分

新手上路

积分
26
发表于 前天 22:22 | 显示全部楼层 |阅读模式
拿掉外部老师,AI Agent 自我进化几乎全部失效!

大多数所谓 "递归自我改进" 系统其实是半闭环:它们默认存在一个 "黄金验证器",一个外部的、可靠的评分信号,持续告诉模型 "方向对不对"。一旦这个外部老师被拿掉,Agent 能否自己闭合这个环,是一个悬而未决的问题。

ByteDance Seed 和 TokenWave 发布的「Self-Developing Agents」,就是要实现从半闭环到全闭环的递归自我改进。
https://self-developing-agents.github.io

# 团队把闭环 RSI 拆成三个问题

类比人类的学习过程:
· 目标形成:模糊目标如何变成具体行动?
· 经验整合:没有老师时,能否自我评判并从经验中学习?
· 系统整合:改进能否沉淀到"行动方式"中并持续?

每个基准的共同设计原则:在 Agent 看不到的 held-out 评估上检验,不是看它自己声称的进步。

# 三个基准

Aspire(选什么去改进) 给 Agent 一个宽泛目标(如"提升数学推理"),不告知下游任务与最终评估。Agent 自行决定学什么、怎么学。配套:6 个能力目标、520 题封闭专家评测集、支持权重与 harness 更新的最小交互环境、48 组"模糊目标 vs 明确任务"配对轨迹。

S³Gym(能否从经验中学习) 7 个带可执行验证器的游戏(国际象棋、扫雷、贪吃蛇、俄罗斯方块、PvZ、Nullify、Trust)。把过程拆为 Self-Testing / Self-Judging / Self-Improvement,比较三种经验载体:原始历史 ICL、摘要记忆、参数训练。

HarnessDev(改进能否持久) 让模型从零构建一个可运行的 agent harness,再依据下游执行反馈演化它。评估对象是 harness 本身在 held-out 任务上的表现,并额外检验"固定执行器下演化是否仍然有效"。

# 实验发现:闭环在哪里断裂

1. 目标形成:模糊目标改变的是搜索过程,不是能力
· 30 个"配置×目标"单元中,28 个产出了 checkpoint,仅 2 个超过基座模型,只有 1 个达到保留阈值。
· Qwen3.5-4B 的自训练 checkpoint 逐步"改善",但全部低于未演化的基线。
· 模糊目标下,Agent 把预算更多花在解释目标、选代理指标上,实际训练与评估时间下降;LoRA 使用率从 24.1% 升至 89.8%。
· 结论:跑完更新循环 ≠ 目标能力提升。

2. 经验整合:不存在通用的经验路径
· 摘要记忆与原始历史各胜 3 个游戏,一个打平;换一种归一化指标(NABA vs AUC+),领先者就重排。
· 参数更新不稳定:Trust 在多数 checkpoint 上提升,PvZ 却从 23 跌到 6 且不再恢复,原因未知。
· 自我评判几乎不能预测下一步增益(ρ = −0.010 / −0.018)——这是对"无老师自学"最直接的否定证据。

3. 系统整合:可运行的 harness 里存在"死机制"
· LLM 生成的 18 个 harness 全部可运行,但其中一些状态/记忆机制在代码中声明、运行时从未触发。
· 64 次版本切换中,Agent 主要修改执行流程与工具,很少触碰状态管理与验证。
· 可见反馈与 held-out 分数方向一致的仅 34/64(53.1%),接近随机;9 个"最终版本"中只有 2 个在 held-out 上最优。
· 固定 Gemini 为执行器的四次演化中,只有 Opus 相对自身起点在 held-out 上提升,其余三个回退。

团队的方法论主张
1. 在 Agent 看不见的评估上检验目标——防止"操作化了目标"被误认为"验证了目标"。
2. 用下一次决策检验经验——按环境选择经验载体,并在 held-out 决策上确认。
3. 在固定执行器 + held-out 任务上检验演化——只保留带版本管理与可回滚的变更。



本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部