查看: 2|回复: 0

今天第一次把一个很大的项目交给 Pi Agent + Qwen3.8-27B:开发基于 Omarchy 的 Omabot。Agent 从早上一直干到现在,已经初步完成了整个项目。

[复制链接]

10

主题

1

回帖

32

积分

新手上路

积分
32
发表于 昨天 23:38 | 显示全部楼层 |阅读模式
今天第一次把一个很大的项目交给 Pi Agent + Qwen3.8-27B:开发基于 Omarchy 的 Omabot。Agent 从早上一直干到现在,已经初步完成了整个项目。

Qwen3.8 跑在我的 MacBook Pro 上,Pi Agent 跑在 Omarchy 上。同时,我把 Pi Agent 和 Codex 都放进 Herdr,这样 Codex 可以指导和审阅 Qwen3.8 的工作。

我让 Codex 给 Qwen3.8 写的代码打分,1 到 10 分,10 分满分。Codex 最后给了 5 分,并认为如果 Qwen3.8 按照代码审阅的反馈修改,可以提高到 7-8 分。

给 5/10 的主要理由:
- 测试看起来很多,但没有真正抓住实现里的关键违规。
- 52 个测试全部通过,仍然存在明显问题。
- 几个安全关键逻辑实现错误,包括已保存参数重新进入执行流程、即时审批状态无法恢复。
- Schema 校验发生得太晚,有些数据已经被修改之后才进行验证。
- 执行状态和审计记录不是原子操作,可能出现状态与记录不一致。
- UI 声称是 “deny-only”,但代码实际上并没有强制执行。
- 部分 audit record 存在错误标注,甚至有一些是人为构造出来的记录。

整体来说,并不是代码写得差,而是对于一个安全敏感的 approval gate,实现精度还不够,所以只能给 5/10。



本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部