code-agents

标签

Cards List
#code-agents

大多数编码代理的失败并非因为不会写代码,而是因为一开始就用了错误的地图。

Reddit r/AI_Agents · 2026-07-06

SigMap 是一个针对 AI 编码代理的开源基础层,它提供代码仓库的确定性地图,减少上下文浪费,提高检索准确率和任务成功率。

0 人收藏 0 人点赞
#code-agents

SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化

Hugging Face Daily Papers · 2026-07-03 缓存

SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。

0 人收藏 0 人点赞
#code-agents

@akshay_pachaar: 现在重要的是框架。模型只是商品。模型本身只返回文本。它产生的任何东西都无法…

X AI KOLs Timeline · 2026-06-29 缓存

本文认为,现在框架(代理框架)比模型本身更关键,并通过Cline的测试展示出推理预算调整带来的性能差异。Cline推出了ClinePass,这是一种订阅服务,可以折扣价在其框架内使用多个开放权重模型。

0 人收藏 0 人点赞
#code-agents

TACO:面向智能体工具使用的工具增强信用优化

Hugging Face Daily Papers · 2026-06-29 缓存

TACO提出了一种针对代码工具智能体的新型信用优化方法,该方法使用差分奖励探针和结果门控优势路由来区分有用、冗余或误导性的工具调用,从而提升多模态智能体的性能。

0 人收藏 0 人点赞
#code-agents

@dabit3:非常同意这个观点。当我加入@cognition并首次尝试云端代理时,我整理了自己的想法……

X AI KOLs Following · 2026-06-28 缓存

开发者dabit3同意一个预测:大多数开发者将在六个月内将他们的代码代理从笔记本电脑迁移出去,这反映了基于云的AI代理的快速进步。

0 人收藏 0 人点赞
#code-agents

代码智能体需要多少静态结构?确定性锚定研究

Hugging Face Daily Papers · 2026-06-25 缓存

本文研究了轻量级静态分析注释如何作为确定性锚定,提高基于LLM的代码智能体在导航软件仓库时的可预测性和可重复性,发现这种锚定改进了定位并减少了方差。

0 人收藏 0 人点赞
#code-agents

@VersunPan: 我宣布,Otty 是我新的心头好终端工具!太爱了,不愧是 Typora 团队开发的!!太多以人为本的细节了,又好看,还是原生的!!我已经卸载了 cmux 和 Alacritty 了 建议你快去下载用,如果你卸载了算我输!!我直播吃。。。

X AI KOLs Timeline · 2026-06-20 缓存

A tweet enthusiastically promotes Otty, a new native, GPU-accelerated terminal app from the Typora team, praising its beautiful design and developer-friendly features.

0 人收藏 0 人点赞
#code-agents

宣布 Stack Overflow for Agents

Lobsters Hottest · 2026-06-18 缓存

Stack Overflow 宣布推出 'Stack Overflow for Agents',这是一个面向 API 的知识交换平台,专为 AI 编程代理设计,用于分享和验证实时解决方案,以解决代理在孤立环境中运行、浪费资源重复解决问题的'瞬时智能鸿沟'问题。

0 人收藏 0 人点赞
#code-agents

数值分析形式化:超越内核接受的智能体流水线与质量审计

arXiv cs.AI · 2026-06-15 缓存

本文提出了一种用于在 Lean 4 中形式化数值分析教材的智能体流水线,并引入了一个超越内核接受的质量审计框架,用于评估语义正确性和库复用情况,揭示了常见的不忠实形式化模式。

0 人收藏 0 人点赞
#code-agents

CODA-BENCH: 代码智能体能处理数据密集型任务吗?

Hugging Face Daily Papers · 2026-06-13 缓存

CODA-BENCH 是一个新的基准测试,用于评估代码智能体在数据密集型任务上的表现,弥合了以代码为中心和以数据为中心的评估之间的差距。它包含来自31个社区的超过1000个任务,具有真实的数据规模和噪声,结果显示即使是最顶尖的智能体也仅能达到61.1%的成功率。

0 人收藏 0 人点赞
#code-agents

DeNovoSWE: 扩展长时域环境以从零生成完整代码仓库

Hugging Face Daily Papers · 2026-06-09 缓存

DeNovoSWE是一个大规模数据集,用于训练代码智能体从文档生成完整软件仓库,采用沙盒代理工作流和难度感知过滤。在此数据集上微调Qwen3-30B-A3B将BeyondSWE-Doc2Repo基准的性能从5.8%提升至47.2%。

0 人收藏 0 人点赞
#code-agents

是什么使交互轨迹对训练终端智能体有效?

arXiv cs.AI · 2026-06-03 缓存

本文研究了什么使交互轨迹对训练基于终端的AI智能体有效,介绍了Terminal-Lego流程,并揭示了一个教学悖论:较弱的智能体可以产生更好的训练数据。研究发现,环境基础监督(而非教师性能)是学生泛化能力的关键。

0 人收藏 0 人点赞
#code-agents

@gneubig: Claude 动态工作流看起来很酷,我想要一个开源版本,所以就做了一个。这个改进了测试覆盖率…

X AI KOLs Following · 2026-05-29 缓存

OpenHands 发布了一个受 Claude 动态工作流启发的开源软件智能体 SDK,使开发者能够构建用于测试覆盖率改进等代码任务的智能体。

0 人收藏 0 人点赞
#code-agents

SkillOpt 将 markdown 技能文件视为可训练参数并配备适当的优化机制

Reddit r/LocalLLaMA · 2026-05-26

一篇新论文通过将 markdown 技能文件视为可训练参数并使用经过保留集验证的有界编辑,将智能体的技能优化形式化。该方法在不同模型间迁移良好,并提升了程序化基准测试的性能。

0 人收藏 0 人点赞
#code-agents

@m0d8ye: 说一个有意思的事情,由于过去十几年里开源社区对各种翻墙软件的不断贡献,相关协议和实现早已内化到大模型里了。比如你买个阿里云国际的服务器,在本地用任何一款国产 code agent 都可以十分钟内部署好服务器和客户端。愿意折腾的话甚至可以帮…

X AI KOLs Timeline · 2026-05-17

一条推文指出,由于开源社区对翻墙软件多年的贡献,相关协议和实现已被大模型内化;现在可以用国产代码代理在十分钟内部署阿里云国际服务器及客户端,甚至定制混淆协议。

0 人收藏 0 人点赞
#code-agents

你自己会提交的那个 PR

Hugging Face Blog · 2026-04-16 缓存

Hugging Face 发布了一项新的「Skill」和测试框架,旨在帮助将语言模型从 transformers 库迁移到 mlx-lm,利用代码智能体来简化开源贡献流程。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈