标签
CUDA-Harness是一个利用智能体技术从自然语言描述生成和优化CUDA内核的框架,通过连接高级语义与低级实现和验证来解决Text2CUDA中的挑战。
工具 'ponytail' 旨在解决 AI 辅助编码中的过度工程化问题,特别是针对 GPT 5.6,通过优化代码使其更简洁高效。
本文介绍了通过将类型依赖代码提取到辅助对象中或使用基于span的方法来减少C++模板膨胀的技术,以提高代码效率和可维护性。
Meta 的一篇论文分析了标准 RL 方法为何在代码优化上失败,并通过校准后的计时、问题相对排名以及 GRPO 改动重建了整个反馈流水线,将 Qwen 2.5 7B 的速度阈值从 18.0% 提升至 31.3%。
本文针对使用强化学习进行代码优化时面临的挑战,提出了三个阶段:通过DMC-Optim改进测试方法;通过正确性与速度组合以及离线模拟器将执行时间转化为奖励;以及调整GRPO以适应含噪时序奖励。该方法在代码优化基准测试中取得了显著提升。
Anthropic首席执行官注意到,一个免费的GitHub技能将Claude Code的令牌使用量减少了90%,而用户仍为Max付费。Ponytail工具优化生成的代码以降低成本。
Google工程师提出Loop Engineering方法,利用LLM生成代码变换方案,以编译器反馈作为自动奖励信号,实现无需人类标注的代码优化迭代循环。
本文提出使用LangGraph中的有状态ReAct智能体取代无状态自动研究模式,将每次迭代的令牌成本从O(n)降低至O(1),在超参数调优和代码优化基准测试中实现了52-90%的令牌减少。
本文描述了一个脚手架(scaffold),它通过在 Qwen-3.6-27B 和 Gemma-4-31B 上使用迭代修正和分支探索来扩展测试时计算,从而在代码优化方面超越 Claude Mythos。文中附有论文链接和 GitHub 仓库地址。
LEVI 是一个开源的类 AlphaEvolve 系统,可在本地 Qwen3-30B 上运行,提供代码和提示优化,成本降低高达 35 倍,性能优于现有框架。
Anthropic 分享了内部基准测试结果,展示了AI编码能力的显著提升:2024年5月,Claude Opus 4 在机器学习代码优化任务上平均加速约3倍;而今年4月发布的新模型 Mythos Preview 达到了约52倍加速,相比之下,一位熟练人类工程师需要4-8小时才能实现4倍加速。
MIT HAN Lab 提出了一种利用AI agent流程自动设计和优化CUDA kernel的方法,通过任务合约、agent循环和小步验证的工作流,使agent能在专业工具链中自主迭代优化,替代手工调优。
Evo是一个开源工具,提供半自主代理通过并行实验优化代码库,利用树搜索和多个子代理自主发现并改进指标。
来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。
Anthropic 推出了 Claude Fable 5.1,这是一款升级的 AI 模型,旨在擅长处理复杂的多步骤任务,例如金融建模和代码优化,并在整个长时间运行过程中具有更高的稳定性和准确性。
Ponytail 是一款开发者工具,可与AI代理集成,在保持安全性的同时显著减少代码输出、成本和执行时间,正如与 Claude Code 进行的基准测试所展示的那样。