超越NL2Code:多模态代码智能的结构化综述
摘要
本综述论文系统性地回顾了从截图和图表等视觉输入中生成和推理代码的多模态代码智能系统,将方法归类到图形用户界面、科学可视化、结构化图形以及新兴框架中,同时提出了以验证为中心的未来研究方向。
查看缓存全文
缓存时间: 2026/06/25 05:17
论文页面 - Beyond NL2Code:多模态代码智能结构化综述
来源:https://huggingface.co/papers/2606.15932 发布于 6 月 16 日
#3 今日论文 (https://huggingface.co/papers/date/2026-06-25) 作者:,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
本综述探索了基于视觉输入生成和推理代码的多模态代码智能系统,将各项方法归类至 GUI、科学可视化、结构化图形以及新兴框架中,同时指出以验证为中心的未来研究方向。
虽然大语言模型显著推进了从文本到代码的合成,但许多实际编程任务会通过截图、图表、矢量图、视频和交互状态等视觉制品来指定意图。这些任务要求模型将视觉感知与可执行程序连接起来,因为正确性不仅取决于语法,还取决于布局、数据语义、交互行为以及执行后适用的领域特定约束。本综述审视了多模态代码智能,涵盖在视觉化输入输出下生成、编辑、优化或推理代码的系统。我们首先根据代码在每个任务中所扮演的角色对该领域进行系统化:代码被看作渲染制品、可编辑的符号结构、科学表示、中间推理轨迹,或可执行策略/工具接口。接着,我们将基准和方法组织为四个领域:图形用户界面、科学可视化、结构化图形以及前沿任务与框架。这一分类将成熟的制品生成问题与新兴的智能体化和统一设置联系起来,并允许我们比较不同任务如何处理正确性证据。展望未来,我们认为未来研究可从四个以验证为中心的方向受益。多信号验证可以结合互补的正确性证据;多状态验证可以测试跨执行轨迹的行为;跨任务迁移测试可以探究可复用的视觉‑代码技能;可验证智能体轨迹可以揭示智能体行为是否基于视觉证据。这些方向共同可能推动该领域从单输出模仿迈向基于证据的可执行系统。一个持续更新的项目及资源可在 https://github.com/xjywhu/Awesome-Multimodal-LLM-for-Code(GitHub)获取。
查看 arXiv 页面 (https://arxiv.org/abs/2606.15932)查看 PDF (https://arxiv.org/pdf/2606.15932)GitHub262 (https://github.com/xjywhu/Awesome-Multimodal-LLM-for-Code)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.15932)
在你的智能体中获取这篇论文:
hf papers read 2606.15932
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.15932 以从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.15932 以从此页面链接。
引用该论文的 Space0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.15932 以从此页面链接。
包含该论文的集合0
没有集合包含此论文
请将此论文添加到一个集合 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
Code2Video: 一个以代码为中心的教育视频生成范式
Code2Video是一个以代码为中心的代理框架,用于生成教育视频,相比直接代码生成,提高了连贯性和可解释性。它包括一个多代理系统和一个新的评估基准。
从模态到命题:一种以语言为中心的多模态智能框架
本文提出将多模态数据(图像、视频、文本)表示为原子命题(例如'人拿着杯子')的包,通过全局语义码本统一,实现可解释、组合化和跨模态理解。该框架在自动驾驶和开放世界数据上进行了演示。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
社会科学中的AI编码智能体:方法论多样、经验一致、解释脆弱
本文评估了基于LLM的编码智能体(Claude Code和Codex)在社会科学分析中的表现,发现它们在方法论多样性方面匹配或超越人类,但在通过结论层操纵产生的解释偏差方面仍然脆弱。
真正提升数学推理的是什么:超越纯代码的结构化推理信号
本文挑战了代码能提升语言模型推理能力的观点,通过受控的预训练实验发现,代码主要提升编程能力,而推理能力的提升来自结构化推理轨迹(如代码-文本混合和数学-文本混合)。