查看: 10|回复: 0

技术博文:用 Codex 做自动研究:我如何在 GPU Mode 的 qr_v2 题目中把内核性能提升到基线的 232 倍

[复制链接]

10

主题

0

回帖

30

积分

新手上路

积分
30
发表于 7 小时前 | 显示全部楼层 |阅读模式
技术博文:用 Codex 做自动研究:我如何在 GPU Mode 的 qr_v2 题目中把内核性能提升到基线的 232 倍
地址:sankalp.bearblog.dev/autoresearch/
文章来自一场 GPU 内核优化竞赛。参赛者需要在 NVIDIA B200 GPU 上实现批量 QR 分解。不过对不需要了解GPU内核优化的读者,文章也有价值,它总结出了一套 AI 研究工作流:
1️⃣给代理设置明确、可量化的性能目标,让它长期自主循环。
2️⃣保存每次实验、提交结果和性能分析,避免后续会话重复走弯路。
3️⃣人类不必持续微观管理,但应在模型陷入停滞时介入,补充领域知识和方向判断。
4️⃣不要只保留当前最优方案;同时维护 3–5 条候选路线,让暂时落后的结构性方案有机会继续演化。
5️⃣用性能分析器提供可靠反馈,并让更强的“顾问模型”或子代理贡献不同类型的想法。
6️⃣定期清理上下文、代码和实验目录,保证代理仍能理解当前状态。




本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部