Surface Evolver Bench: 要求大型语言模型以自定义数据格式编写复杂物理模拟的基准测试
摘要
介绍Surface Evolver Bench,这是一个评估大型语言模型以自定义数据格式编写复杂物理模拟的基准测试。
暂无内容
相似文章
EnvSimBench:用于评估和改善基于大语言模型的环境模拟的基准
本文介绍了 EnvSimBench,这是一个用于评估大语言模型在智能体训练中模拟环境能力的基准。它指出了当前大语言模型中存在的“状态变化悬崖”问题,并提出了一种约束驱动的流水线以减少幻觉和降低成本。
BenchEvolver: 基于解决方案进化的前沿任务合成
BenchEvolver 是一个进化框架,能够自动从现有编程问题中生成更难的题目,创建保持有效性和多样性的挑战性基准,同时支持模型自我改进和提升训练性能。
PRL-Bench:评估大语言模型在尖端物理研究中能力的全面基准
PRL-Bench是一个全面基准,用于评估大语言模型在尖端物理研究中的能力,基于从五个物理子领域精选的100篇《物理评论快报》论文构建。该基准揭示了当前大语言模型性能的重大差距(最佳得分低于50%),旨在测试端到端研究流程、复杂推理和自主探索。
可能需要为前沿模型设置数学+代码基准(大语言模型悄然取代数学)[D]
该文章报告称,前沿大语言模型在单个提示中同时包含数学和代码时,会默默用更简单的计算替代品替换困难的数学组件(如亚黎曼几何和隐空间潜向量),并建议建立专门针对数学+代码的基准测试。
StabilityBench:大语言模型不稳定性基准测试
StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。