Google 这篇新发布的论文简直就是一篇神文,如果要给你的Agent建一个skill库,请务必收藏!
Google 这篇新发布的论文简直就是一篇神文,如果要给你的Agent建一个skill库,请务必收藏!感觉这篇论文把 99% 做 Agent 和个人知识库的人全骂了一遍哈哈,你以为越记越多是在进步,其实把执行记录、复盘认知和操作手册混在一坨,根本不可能产生复利,好手册能让 9B 小模型直接干翻 27B 裸跑,但弱者写的一身笨补丁,能把顶级大模型活活毒死Google 团队在 WikiSkill 里给出了极其残酷的几组真相: 战术可以失败回滚,但对失败的理解必须永久焊死:真正厉害的系统必须物理拆成三层: 原始轨迹只读归档、复盘认知只增不减、执行手册随时修补回滚,前人把探索教训散落在对话框里,每次遇到问题都像失忆一样重新踩坑,打法验证变差可以撤回,但踩坑认知必须留下,复利才会真正爆发; 小模型靠手册逆袭,大模型吃手册更狠:9B 模型配上进化出的结构化手册,表现直接干翻 27B 裸跑,而在复杂表格任务上,27B 模型加上手册更是直接从 40% 狂飙到 81%,程序性知识的差距,早就超越了单纯堆参数的裸智力差距; 弱者的妥协是强者的毒药:小模型为了防止自己翻车写的一堆单行脚本和保守补丁,直接把顶级 Gemini Flash 从 50% 砸到了 18%,你在低水平阶段摸索出的避坑套路,强行套给高手往往是一副要命的枷锁; 开卷小抄练不出真本事:实验证明,模型在实战练习时如果直接偷看全套知识库,最后进化出来的手册反而大退步,因为靠小抄蒙混过关的过程,会把最致命的逻辑漏洞给彻底掩盖掉别再把所有笔记和日志混在一堆乱炖了,原始记录、提炼认知、可执行手册是三码事,把失败变成资产,学习的飞轮才会真正转起来啊