DeepCode:开放式智能体编程

Papers with Code Trending 论文

摘要

DeepCode 是一个完全自主的框架,用于从文档到代码库的合成,通过原则性的信息流管理将科学论文转化为生产级代码,在 PaperBench 上取得了最先进的结果,并超越了博士级人类专家。

近期大型语言模型(LLM)的进步催生了强大的编码智能体,使得代码助手能够进化为代码工程师。然而,现有方法在实现高保真度的文档到代码库合成(例如从科学论文到代码)方面仍面临重大挑战,这主要是由于信息过载与LLM上下文瓶颈之间的根本冲突。在这项工作中,我们引入了 DeepCode,一个完全自主的框架,通过原则性的信息流管理从根本上解决了这一挑战。通过将仓库合成视为通道优化问题,DeepCode 无缝协调四种信息操作,以在有限的上下文预算下最大化任务相关信号:通过蓝图蒸馏进行源压缩、使用有状态代码记忆的结构化索引、通过检索增强生成进行条件知识注入,以及闭环纠错。在 PaperBench 基准上的广泛评估表明,DeepCode 取得了最先进的性能,显著优于 Cursor 和 Claude Code 等领先商业智能体,并且至关重要的是,在关键再现性指标上超越了来自顶级机构的博士级人类专家。通过系统地将论文规范转化为与人类专家质量相当的生产级实现,这项工作为自主科学再现建立了新的基础,从而加速研究评估与发现。
查看原文
查看缓存全文

缓存时间: 2026/05/08 12:27

论文页面 - DeepCode: 开放式智能编码

来源:https://huggingface.co/papers/2512.07921 发表于 2025年12月8日

·

taesiri (https://huggingface.co/taesiri) 于 2025年12月10日提交

摘要

DeepCode 是一个完全自主的框架,通过源代码压缩、结构化索引、知识注入和错误校正来优化信息流,从而解决文档到代码库合成的挑战,达到了最先进的性能,并超越了人类专家。

大型语言模型 (https://huggingface.co/papers?q=large%20language%20models) (LLMs) 的最新进展催生了强大的编码智能体 (https://huggingface.co/papers?q=coding%20agents),使得代码助手有可能演变为代码工程师。然而,现有方法在实现高保真度的文档到代码库合成 (https://huggingface.co/papers?q=document-to-codebase%20synthesis)(例如从科学论文到代码)方面仍面临重大挑战,这主要是因为信息过载 (https://huggingface.co/papers?q=information%20overload) 与 LLMs 的上下文瓶颈 (https://huggingface.co/papers?q=context%20bottlenecks) 之间存在根本性冲突。在这项工作中,我们提出了 DeepCode (https://huggingface.co/papers?q=DeepCode),这是一个完全自主的框架,通过原则性的信息流管理从根本上解决了这一挑战。通过将代码库合成视为信道优化 (https://huggingface.co/papers?q=channel%20optimization) 问题,DeepCode (https://huggingface.co/papers?q=DeepCode) 无缝协调了四种信息操作,以在有限的上下文预算下最大化任务相关信号:通过蓝图蒸馏 (https://huggingface.co/papers?q=blueprint%20distillation) 进行源代码压缩,使用有状态代码记忆 (https://huggingface.co/papers?q=stateful%20code%20memory) 进行结构化索引,通过检索增强生成 (https://huggingface.co/papers?q=retrieval-augmented%20generation) 进行条件知识注入,以及闭环错误校正 (https://huggingface.co/papers?q=closed-loop%20error%20correction)。在 PaperBench (https://huggingface.co/papers?q=PaperBench) 基准上的广泛评估表明,DeepCode (https://huggingface.co/papers?q=DeepCode) 达到了最先进的性能,显著优于 Cursor 和 Claude Code 等领先的商业智能体,并且关键是,在关键复现指标上超越了来自顶级机构的博士级人类专家。通过系统地将论文规范转化为与人类专家质量相当的生产级实现,这项工作为自主科学复现 (https://huggingface.co/papers?q=autonomous%20scientific%20reproduction) 奠定了新的基础,能够加速研究评估和发现。

查看 arXiv 页面 (https://arxiv.org/abs/2512.07921) 查看 PDF (https://arxiv.org/pdf/2512.07921) GitHub 15.4k (https://github.com/HKUDS/DeepCode) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2512.07921)

在你的智能体中获取这篇论文:

hf papers read 2512.07921

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2512.07921 即可从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2512.07921 即可从此页面链接。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2512.07921 即可从此页面链接。

包含此论文的收藏集 18

浏览包含此论文的 18 个收藏集 (https://huggingface.co/collections?paper=2512.07921)

相似文章

CodeAlchemy:大规模合成代码重写

arXiv cs.CL

CodeAlchemy 是一个合成数据生成框架,通过五种策略将公开可用的代码转换为语义丰富的训练数据,生成超过5000亿个 token,使得小型模型在代码基准测试上超越大得多的模型。