Qwen 团队的一篇重磅论文。

Qwen 团队的一篇重磅论文。


如果你在超过单次会话的任何时长上评估代理,这个值得你花时间。

(收藏它)

E-Commerce Bench 通过模拟一个 365 天运营多个在线商店的年份来运行代理。

18 个前沿模型在七个维度上得分,没有单一模型占据主导。

GPT-5.6 Sol 赚得最多,将 100,000 开盘赌注增长到 1,431,425,然后在欺诈避免上排名 18 个中的第 16 位,并在运营效率上落后于 Fable 5。

在开源权重模型中,Qwen3.8-Max-Preview 以 416,252 领先,比 GLM 5.2(高)高出 38%,并通过在重复订单中逐步压低供应商价格,展示了最强的跨周期学习能力。

论文:http://t.cn/AX0GQ0qk

与论文聊天:

http://t.cn/AX0GQ0qD


分类