地址:sankalp.bearblog.dev/autoresearch/
文章来自一场 GPU 内核优化竞赛。参赛者需要在 NVIDIA B200 GPU 上实现批量 QR 分解。不过对不需要了解GPU内核优化的读者,文章也有价值,它总结出了一套 AI 研究工作流:
1️⃣给代理设置明确、可量化的性能目标,让它长期自主循环。
2️⃣保存每次实验、提交结果和性能分析,避免后续会话重复走弯路。
3️⃣人类不必持续微观管理,但应在模型陷入停滞时介入,补充领域知识和方向判断。
4️⃣不要只保留当前最优方案;同时维护 3–5 条候选路线,让暂时落后的结构性方案有机会继续演化。
5️⃣用性能分析器提供可靠反馈,并让更强的“顾问模型”或子代理贡献不同类型的想法。
6️⃣定期清理上下文、代码和实验目录,保证代理仍能理解当前状态。