ParBench:用于可靠评估LLM并行代码翻译的基准测试

arXiv cs.AI 论文

摘要

ParBench是一个基准测试框架,用于评估基于LLM的跨CUDA、OpenMP、OpenCL和OpenMP目标卸载的并行API翻译,侧重于可执行、可重现的条件和鲁棒性测试。

arXiv:2607.22588v1 Announce Type: new 摘要:现代计算密集型软件必须在一个不断变化的加速器、编程API、编译器栈和可移植性层生态系统中迁移,包括CUDA、OpenMP、OpenCL和OpenMP目标卸载。大语言模型和自主编码代理越来越多地被提出用于此类迁移,但该领域缺乏可靠的方法来衡量它们是否保持了使翻译行为有效的低级并行语义,包括线程索引、同步、内存管理、主机-设备协调以及API特定的执行结构。 我们提出了ParBench,这是一个以核心为中心的基准测试框架,用于在可执行、可重现的条件下评估基于LLM的并行API翻译。ParBench通过声明性基准规范固定了周围构建、运行和验证基础设施,并要求模型仅翻译计算核心。它利用了多个开源HPC套件,并涵盖了CUDA、OpenMP、OpenCL和OpenMP目标卸载之间具有代表性的跨API翻译方向。为了测试成功是反映了稳健翻译还是表面形式的记忆,ParBench包含了AST驱动、意图行为保持、基线验证的源代码增强。对最先进的开源和专有LLM的评估显示,可靠的并行代码翻译存在持续障碍,包括方向不对称、多文件协调、API适配不完全以及对源代码级扰动的不均衡鲁棒性。代码可在 https://github.com/Scientific-Computing-Lab/ParBench 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:25

# ParBench:用于 LLM 并行代码翻译可靠性评估的基准测试
来源:https://arxiv.org/abs/2607.22588
查看 PDF (https://arxiv.org/pdf/2607.22588)

> 摘要:现代计算密集型软件必须跨越不断演进的加速器生态、编程 API、编译器栈和可移植性层进行迁移,包括 CUDA、OpenMP、OpenCL 和 OpenMP 目标卸载。大型语言模型和自主代码智能体越来越多地被用于此类迁移,但该领域缺乏可靠的方法来衡量这些迁移是否保留了底层并行语义——这些语义使得翻译在行为上有效,包括线程索引、同步、内存管理、主机-设备协调以及特定于 API 的执行结构。我们提出 ParBench,一个以 kernel 为中心的基准测试框架,用于在可执行、可重现的条件下评估基于 LLM 的并行 API 翻译。ParBench 通过声明式基准测试规范固定了周边的构建、运行和验证基础设施,并要求模型仅翻译计算核(kernel)。它借鉴了多个开源 HPC 套件,涵盖了 CUDA、OpenMP、OpenCL 和 OpenMP 目标卸载之间具有代表性的跨 API 翻译方向。为了测试成功是反映了稳健的翻译还是表面的记忆,ParBench 包含了由 AST 驱动、保留预期行为、并经基线验证的源代码增强。对最先进的开源和专有 LLM 的评估显示,可靠的并行代码翻译仍面临持续障碍,包括方向不对称、多文件协调、不完整的 API 适配,以及对源代码级扰动的稳健性参差不齐。代码可在此处获取:this https URL (https://github.com/Scientific-Computing-Lab/ParBench)。

## 提交历史

来自:Gal Oren [查看邮箱 (https://arxiv.org/show-email/fdaccbc7/2607.22588)] **\[v1\]** 2026年6月9日星期二 19:00:09 UTC (841 KB)

相似文章

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

ProgramBench(5分钟阅读)

TLDR AI

ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。