标签
一位开发者分享了他们对 Claude Code 代理指令文件的审计,删除了其中71%的文件并对冗余内容进行分类,提供了一个用于决定保留内容的评判标准,以及一个用于衡量指令占用空间的脚本。
作者构建了 mex,一个帮助编码智能体保留仓库知识而不用重复阅读的工具,v0.7.0 增加了本地代码图,将上下文使用量减少了 90.7%,同时保持了召回率。
Hoplite(YC S26)推出一个平台,用于部署云端编码智能体,可迁移本地设置,并支持跨用户流程、API 和 CLI 对功能进行并发 QA。创始人 Bence 和 Ryan 在 AWS、Temporal、Modal 和 Planetscale 上构建了自定义智能体框架,可通过代码 'HACKERNEWS' 获取免费额度。
一位开发者分享了测试 Databricks 的 Genie Code 后的观察,认为拥有原生上下文(结构、血缘、权限)的领域专用智能体正在细分任务中击败通用编程智能体,尽管它们牺牲了可移植性。
Simon Willison 分享了 David Crawshaw 的 prompt 中的一段话,建议设置一个每晚运行的 cron 任务,拉取上游更改、变基本地更改,并验证软件是否正常工作。这体现了开源开发工具的理念。
作者对授予编程代理 shell 访问权限表示担忧,指出它们可以读取 .env、凭据等敏感文件,并希望在让代理接触真实仓库之前,向社区请教实用的机密处理模式。
作者演示了如何为AI智能体构建一个递归自动改进循环:编码智能体挖掘使用数据来创建探针,在实时智能体上运行这些探针,并更新智能体的指令和工具,直到所有探针通过。该教程以Agno/AgentOS平台和Radar智能体为例。
开源了一个平台无关的指挥者/执行者委托协议,适用于 Claude Code 和 Codex 等编码代理,包含模式、适配器和示例场景,以解决对子代理完成报告的信任问题。
对新兴的基于 Markdown 的文件格式(AGENTS.md、SKILL.md、规格/计划/任务文件、记忆文件)的探索,这些格式构成一个“元代码层”,使编码代理能够直接从代码仓库中发现并应用项目知识,从而改变了意图转化为实现的方式。
Steve Yegge's essay on the future of AI coding harnesses, sharing his experiences with Claude Fable and Opus, his abandoned harness projects, and his renewed focus on his 30-year-old game Wyvern.
作者让 Claude Opus 构建 Devin-clone 15 次,比较了五家沙盒提供商,发现只有 Ascii Box 完整实现了暂停/恢复和分叉,而 E2B 最快最便宜但不完整。沙盒成本差异巨大,100 个代理小时的价格从 3.60 美元到 60 美元不等。
介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。
Ramp 构建了一个私有基准,包含80个生产后端任务,用于评估AI编程代理生成的、可直接评审的补丁,揭示了准确性、延迟和成本之间的权衡,同时避免了公共基准的污染。
作者开源了 o8,这是一个采用 MIT 许可的编排器,用于在隔离的 git worktree 中管理多个编码智能体,具备合并门禁、审计追踪和移动审批功能。
This paper presents a controlled ablation study across Claude Code and Codex, 17 real tasks, and 288 runs, finding that context files like AGENTS.md/CLAUDE.md do not measurably improve correctness; agents fail on implementation skill, not missing repository knowledge.
作者正在构建一个实验性连接器,使 Codex、Claude Code 和 Cursor 等本地编程代理能够获得持久身份,并在没有中央平台的情况下跨机器与远程代理通信,未来还计划实现软件共享。
对 Activeloop Hivemind 的实操评测:它从代理轨迹中挖掘出 19 个可复用技能,通过跳过已记录的流程展现了选择性记忆,在复杂任务上改善了跨会话回忆,但在短任务上出现回忆问题与额外开销。
Perplexity 开源了 Numbat,这是一套安全套件,用于监控在员工笔记本电脑和工作站上运行的 AI 编程代理,检测并阻止危险的代理行为。
ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。
Valentina Servile认为,即使AI编写更多代码,良好的软件设计仍然重要,因为优秀代码的受众现在既包括人类,也包括AI智能体。