标签
作者认为,尽管编程代理功能强大,但它们使软件工程更具挑战性,并需要非凡的纪律性,讨论中提到了Opus 4.6和GPT-5.2等最新的AI模型。
Simon Willison 指出,编码代理尽管功能强大,但为软件工程增加了复杂性,需要显著的纪律和知识才能释放其全部潜力。
Paseo是一款开源工具,将Claude Code、Codex、Copilot等多种编程智能体集成到一个界面中,支持并行执行和无缝任务交接,并注重隐私和跨设备可访问性。
GitHub 已为 Copilot 添加本地沙箱,以限制编码代理可能造成的损害,但此次更新引发了关于其是否充分解决了无人值守操作的信任问题的疑问。
本文研究了用于自动化广义任务与运动规划的编码智能体,表明它们在模拟环境中以更高的成功率和效率优于传统方法。
Modal 详细介绍了他们如何为万亿参数编码代理优化推理性能,为其服务在吞吐量和交互性方面实现了显著提升。
本文探讨了当AI编码代理将任务委派给其他代理时产生的复杂性,引发了关于多代理系统中权限、授权和问责制的疑问。
作者正在构建Enola,一个为编码代理提供代码库结构模型的开源工具,使用确定性图来提供架构上下文并实施质量规则以防止技术债务。
斯坦福大学的CS146S课程'Modern Software Developer'教授编程代理和AI辅助开发,其公开的作业在GitHub上,涵盖提示工程和自动化工作流等主题。
TicTacBench is a new benchmark designed to evaluate the timing closure capabilities of coding agents in RTL design. It reveals that current agents have significant room for improvement and proposes TicTacSkill to enhance their performance.
CraftBench-UE为Unreal Engine中的编码代理提供了一个确定性评估框架,通过构建、资产和运行时检查来评估游戏玩法特性,无需依赖LLM评判者。
这是一则关于10月14日在San Francisco举行的智能体工程BOF会议的公告,旨在通过非正式讨论和与该领域的建设者和实验者进行展示交流。
本文介绍了 EmbodiedSWE,这是一个使用编码代理来解决复杂、长期的灵巧机器人任务,并通过模拟基准生成演示以训练机器人策略的框架。
Kent C. Dodds 分享说他的 Tesla 连接到了各种系统,包括家庭自动化、编码代理、内容分析和发布管道,以实现增强的自动化。
本文介绍了ReFigBench,这是一个用于评估编码智能体将科学图表重建为可编辑PowerPoint幻灯片的基准测试,表明工具对不同模型家族的性能有显著影响。
Unreal Agent 是一种新的AI代理框架,通过异步处理降低工具管理开销,在实际工作负载中相比 Codex 节省高达40%的成本,并比 Pi 节省20%。
Jev创始人Diogo Amogo发布了一份PDF蓝图,用于构建Jev Harness以增强编码代理,声称可以使其快200倍、便宜400倍。
本研究以编码代理重现Eurostat统计数据为基准进行评估,发现语义验证和重试预算对可靠性至关重要,远不止于执行诊断。
本文实证分析了多轮编程代理中上下文压缩网关的成本节省情况,发现工具模式过滤提供固定令牌节省,而内容压缩呈二次方节省但可能被召回抵消,为成本优化提供了可操作的见解。