今天第一次把一个很大的项目交给 Pi Agent + Qwen3.8-27B:开发基于 Omarchy 的 Omabot。Agent 从早上一直干到现在,已经初步完成了整个项目。

今天第一次把一个很大的项目交给 Pi Agent + Qwen3.8-27B:开发基于 Omarchy 的 Omabot。Agent 从早上一直干到现在,已经初步完成了整个项目。

Qwen3.8 跑在我的 MacBook Pro 上,Pi Agent 跑在 Omarchy 上。同时,我把 Pi Agent 和 Codex 都放进 Herdr,这样 Codex 可以指导和审阅 Qwen3.8 的工作。

我让 Codex 给 Qwen3.8 写的代码打分,1 到 10 分,10 分满分。Codex 最后给了 5 分,并认为如果 Qwen3.8 按照代码审阅的反馈修改,可以提高到 7-8 分。

给 5/10 的主要理由:
- 测试看起来很多,但没有真正抓住实现里的关键违规。
- 52 个测试全部通过,仍然存在明显问题。
- 几个安全关键逻辑实现错误,包括已保存参数重新进入执行流程、即时审批状态无法恢复。
- Schema 校验发生得太晚,有些数据已经被修改之后才进行验证。
- 执行状态和审计记录不是原子操作,可能出现状态与记录不一致。
- UI 声称是 “deny-only”,但代码实际上并没有强制执行。
- 部分 audit record 存在错误标注,甚至有一些是人为构造出来的记录。

整体来说,并不是代码写得差,而是对于一个安全敏感的 approval gate,实现精度还不够,所以只能给 5/10。



分类