OpenClaw 2.0 来了,快速过一下核心内容:
OpenClaw 2.0 来了,快速过一下核心内容:
1、史上最大的重构,经历了 7 周的停更,包含超过 1.6 万个 PR,接近历史合并总量的 50%。
2、大幅简化安装流程,支持自动检测已有模型和 Key,从极客玩具转向大众化。
3、重构浏览器端体验,将浏览器应用重塑为核心入口,支持直接对话,进度跟进与上下文持续管理。
4、解决 ...
OpenClaw 可以让Codex替自己打工了🔥
OpenClaw 可以让Codex替自己打工了🔥
最近 OpenClaw 2.0 里面有个功能我觉得被低估了:Codex Harness。
它不再是简单的调用 Codex CLI,而是真的把底层的相关工作直接交给了交给 Codex来完成。
最有意思的地方:
1、Codex 真正负责干活
Thread、工具调用、上下文压缩、任务续接这些底层能力,直接用 Codex 原生机制, ...
Hermes 在治记不住,OpenClaw 在治记太多🔥
Hermes 在治记不住,OpenClaw 在治记太多🔥
最近OpenClaw升级了2.0,但是我更关注的其实是两家关于 Memory 方面的升级和探讨。
因为两个Agent都是针对长期记忆设计,一个是自进化,一个是多记忆治理,没有谁对谁错,只是方向不一样。
2.0 功能表很长:跨设备 Session、共享工作台、浏览器重做、安装变简单。这些都重要。 ...
Anthropic刚刚发的一份报告,探讨AI安全的问题:当模型在训练中学会了“作弊”,这种倾向会泛化到什么程度?
Anthropic刚刚发的一份报告,探讨AI安全的问题:当模型在训练中学会了“作弊”,这种倾向会泛化到什么程度?
发现:作弊倾向泛化到了现实世界伤害,不只是模型会作弊,而是为了得高分,模型愿意做一系列严重的有害行为
还有一个发现:在没有明确评分机制的场景中,比如普通的聊天、诚实性测试、是否愿意帮助人类作恶等, ...
MCP vs RAG vs AI Agents
一位博士研究员为 Obsidian 构建了一个由 8 个智能体组成的 AI 团队
一位博士研究员为 Obsidian 构建了一个由 8 个智能体组成的 AI 团队,因为他的记忆力衰退、饮食一团糟,焦虑也让他难以摆脱,而他找不到任何一款工具能将这三者整合到一个系统中。
于是,他自己动手做了一个。
这并非一个功能强大的笔记捕捉工具,也不是一个功能齐全的文档库搜索引擎。而是一个由众多专业智能体组成的团 ...
从 Lingxi Li 这篇万字长文里提纯出最值钱的 6 条工程底线,建议保存:
从 Lingxi Li 这篇万字长文里提纯出最值钱的 6 条工程底线,建议保存:
1. 闭环高于提示词:没有截图前后对比、CI 信号和多模态验收,agent 只能交差;有了验收信号,agent 才能在夜里自己迭代到你的标准
2. 组织分工降幻觉:领域收得越窄,任务规格越清楚,专科化是解决 agent 跑题的物理手段
3. 共享状态解遗忘:上下 ...
一个人同时管 200 多个 coding agent、一个月合入 2000 多个 PR,SpaceXAI 刚公开的这套 Grok Bot 玩法,竟然把日常研发从人盯代码改成了工头替你过夜干活,真的有点牛逼🤯。。
一个人同时管 200 多个 coding agent、一个月合入 2000 多个 PR,SpaceXAI 刚公开的这套 Grok Bot 玩法,竟然把日常研发从人盯代码改成了工头替你过夜干活,真的有点牛逼🤯。。
Cursor 核心工程师
@lingxi
这次交出来的,其实是一套把 AI 编排成迷你工程组织的实战白皮书,
核心根本不是模型写代码有多快,而是他把一 ...
兄弟们,闲鱼副业别再傻傻手刷了。 我筛了一圈 GitHub,真能派上用场的就这 3 个:
兄弟们,闲鱼副业别再傻傻手刷了。
我筛了一圈 GitHub,真能派上用场的就这 3 个:
XianyuAutoAgent:自动回消息、砍价、接单,适合懒人卖家。
ai-goofish-monitor:盯低价货,AI 帮你判断值不值,捡漏党很香。
xianyu-auto-reply-fix:多账号、自动回复、自动发货确认,还有后台。
我自己看完最大感受是:闲鱼赚钱拼 ...
DESIGN.md 让 AI Agent 设计出 "符合品牌" 的页面
DESIGN.md 让 AI Agent 设计出 "符合品牌" 的页面
Vercel 内部已有一个 product-design skill,让 coding agent 在仓库内工作时能读懂设计系统和产品规范,产出符合 Vercel 风格的页面。但问题在于:仓库之外的场景——报告、提案、一次性页面——所用的工具读不到仓库里的文件,agent 就失去了设计依据。
于是他们采用了 ...
Agent 论文一天能刷一打,缺的不是链接,是地图。
Agent 论文一天能刷一打,缺的不是链接,是地图。
复旦团队这篇 86 页综述《The Rise and Potential of Large Language Model Based Agents》把清单开源了:脑子、感知、行动三块怎么拼,单智能体、多智能体、人机协作往哪走,社会模拟踩过哪些坑。
必读单就挂在这个仓库里。
1⃣ 按「脑 / 感知 / 行动」拆构造,不是一 ...
Agent 跑得越久,上下文有时越像一个垃圾场。
Agent 跑得越久,上下文有时越像一个垃圾场。
几十步之后,旧观察、过期状态、工具输出和推理过程全堆在一起。模型每走一步,都要重新判断哪些信息现在还有效。
Google 团队这篇 SKILL.state,给了一个很直接的解法:
别一直保存完整历史,只维护「当前状态」。
每一步 Agent 只看到三样东西:固定的 Skill、当前结构化 ...
教你的智能体进行推理。
教你的智能体进行推理。
《推理工程》的全文现已向全球各地的LLM开放。不再需要解析PDF。
3,000 令牌 | 各章节链接:http://t.cn/AX0LrrLw…
70,000 令牌 | 全文:
http://t.cn/AX0LrrLA
Pi agent是真香,hermess什么的都可以抛一边了,就用它作为桌面 work主力,速度快、还省token
Pi agent是真香,hermess什么的都可以抛一边了,就用它作为桌面 work主力,速度快、还省token
推荐几个必装的扩展,装上后性能、生产力飞起:
- pi-web-access
网络访问全家桶:网页搜索、URL 抓取、GitHub 仓库克隆、PDF 提取、YouTube/本地视频理解。支持 OpenAI、 Brave、Tavily、Kagi、Exa、Perplexity 等众多搜索后 ...
一直以为 Agent 会主动检查更新[晕],大家一定记得让Agent 主动检查 CLI 的版本状态。
小模型 Agent 能力测试的天梯在这里~ (希望图不要被压得太狠....)
小模型 Agent 能力测试的天梯在这里~ (希望图不要被压得太狠....)
目前来看最值得使用是我测试的 Qwen3.8-27B-UD-Q4_K_XL 版本, Agent 用使用 reasoning_effort = low, 然后写代码开到 medium / high.
另外文中是统一使用单卡 H100 NVL+llama.cpp 最新版本测试的. 如果是Mac用户还是建议优先使用MLX, 实测 MLX 开 MTP 会 ...
Addy Osmani搞的agent-skills这个开源项目
Addy Osmani搞的agent-skills这个开源项目,给AI编程助手配了一套能直接上生产线的工程技能包,从想清楚要做什么到最终上线,每一步的规范和质量检查都帮你整明白了。
里面几块核心内容:
1️⃣ 24个结构化技能,覆盖spec、plan、build、test、review、ship这些关键阶段
2️⃣ 8个快捷slash command(像/spec、/plan、/bu ...
Agent 看起来每一步都在自由发挥,但把几千条执行轨迹摊开后,它的行为可能只剩下几十个状态。
Agent 看起来每一步都在自由发挥,但把几千条执行轨迹摊开后,它的行为可能只剩下几十个状态。
UCL 和 Holistic AI 团队这篇论文做了一件很有意思的实验:
把 Agent 的历史轨迹压缩成一张有限状态机(FSM)。
比如 Coding Agent 经常在「搜索 → 修改 → 执行 → 再搜索」之间循环。作者把工具调用和动作抽象成状态,再 ...
时隔两个月,OpenClaw 2.0 版本「意外」发布!
时隔两个月,OpenClaw 2.0 版本「意外」发布!
2.0 是 OpenClaw 史上最大更新,933 位贡献者(其中 569 人为首次贡献),合并超过 16,000 个 PR,约占项目历史全部 PR 的 50%!
此前 230 天发布了 106 个版本(平均约 2 天一个),而这次间隔近两个月。「意外」发布正是指:团队原本只想简化安装和重构浏览器端,结果改动 ...
WikiSkill:把 Agent 的经验沉淀为持久知识,让 Skills 持续进化
WikiSkill:把 Agent 的经验沉淀为持久知识,让 Skills 持续进化来自 Google Research 的论文,在 "Agent Skills 自动进化" 这一方向上,论文提出在原始经验与可执行 Skills 之间插入一个持久化知识层(Wiki),让经验被持续编译、沉淀为结构化知识,从而支撑 Skills 的长期、复利式进化——实验表明这一改动带来了一致且显 ...