@shiposcant: 完成阅读这篇:"你越了解某件事,就越能更好地提示LLM,因为你可以将未知的未知..."
摘要
一篇博客文章描述了使用Codex自动迭代和优化GPU内核,相较于基线实现了212倍加速。文章强调了专业知识如何放大AI的效用,通过循环实验工作流将未知的未知转化为已知的未知。
查看缓存全文
缓存时间: 2026/07/09 11:43
已阅读完毕: “你对某件事了解得越好,就越能更好地对LLM进行提示,因为你能把未知的未知转化为已知的未知。”
有趣的地方不在于“LLM能快速写出GPU内核”,而在于作者构建了一个循环:Codex可以生成实验、提交内核、检查形状反馈、保存日志,并持续迭代(14天内提交了超过1500次)。
如果你不理解问题,模型就会给你更多代码和更多变体。如果你理解该领域,同样的模型就变成了一种施压的方式。Codex在这里之所以有用,是因为它获得了问题陈述、AGENTS.md、提交日志、性能分析权限、量化目标、记录管理以及候选历史。它可以运行长循环,而且这个循环拥有记忆。
人工智能正在增加专业知识的回报,同时也让缺乏专业知识的代价变得更加高昂。
sankalp (@dejavucoder):
我的最新博客文章《用Codex自动研究:在GPU Mode的qr_v2问题上,我将内核速度较基线提升了212倍》现已发布。在这篇文章中,我讨论了在QR分解问题上实现自动内核化的方法。
相似文章
@dejavucoder: 我最新的一篇博客文章 "auto-research with codex: 我如何在使用Codex的GPU Mode中实现比基线快212倍的内核…"
Sankalp的博客文章,详细描述了他如何使用Codex在GPU Mode的竞赛中为QR分解实现快232倍的GPU内核,并概述了他的自动研究方法论。
Codex 最大化
Jason Liu 分享了他如何使用 OpenAI 的 Codex 进行编码之外的知识工作,利用持久化线程、语音输入和引导将编码代理整合到他更广泛的工作流程中。
@reach_vb: 用于自主优化工作的 Codex:
Charlie Marsh 分享称,OpenAI 的 Codex 在他忙于其他任务时,自主发现了一个格式化工具可以提速 5-10%。
NVIDIA 工程师与研究人员如何利用 Codex 进行构建
NVIDIA 的工程师和研究人员正在使用由 GPT-5.5 驱动的 OpenAI Codex,作为处理复杂工程任务和端到端机器学习工作流的默认工具。本文重点介绍了通过在该 NVIDIA 基础设施上集成 Codex 所取得的显著生产力提升、自主系统构建以及研究自动化成果。
AccelOpt:一种用于AI加速器内核优化的自我改进LLM智能体系统
AccelOpt是一种自我改进的LLM智能体系统,通过迭代生成和优化记忆自主优化AI加速器内核,在AWS Trainium上实现了49%至61%的峰值吞吐量提升,同时比Claude Sonnet 4便宜26倍。