标签
本文介绍了一个用于在法律文件中分类解释准则的句子层面基准,评估了 LLMs 在 German Federal Constitutional Court 数据集上的表现。
本文介绍了一种生成基准,用于评测大型语言模型在Hindi、Tamil和Korean文化特异性亲属称谓上的表现,揭示了识别与生成能力间的显著差距。
Google 的 Gemini 4 Pro AI 模型即将发布预览版,早期后训练版本预计能超越竞争对手 Astra,可能在十月公开发布。
该推文讨论了利用AI模型Opus 5.5通过ShellPerfBench工具来发现shell启动时间的优化,并建议用户优化他们的.zshrc文件。
本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。
本文介绍了RLCDAlignBench,一个用于评估Jev的基准测试。Jev是一个通过强化学习训练的校准决策模型,作为零样本检测器,针对十种AI对齐故障,具有高性能和成本效率。
本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。
WanPE是一个拥有3970亿参数的提示增强模型,用于提升文本到视频生成中的电影规划能力,显著提高了人类对原始提示的偏好,并与商业产品性能相竞争。
FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。
OpenAI 宣布,MentalHealthBench 旨在覆盖 AI 心理健康对话的完整范围,从日常支持到急性危机场景。
VoiceArena 推出了 Diarization Bench,这是一个在真实音频上比较 12 个说话人分离系统的基准测试,突出了准确性如何随重叠下降以及领口效应对错误率的影响。
DrivingBench 评估前沿AI模型(如GPT-6 Astra)能否通过控制一辆丰田卡罗拉在预定义路线上驾驶真实汽车,并追踪诸如进度、距离和token成本等指标。
OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。
Open-Jev-27B-v1.1 是一个开源 AI 模型,配备 LoRA 适配器,在 JevBench 上达到 85.28% 的准确率,并具有各种任务的交互式演示。
SambaGraph 引入了一个时空图数据集和基准测试,用于建模足球战术响应,该数据集从2022年FIFA世界杯数据中整理,旨在分类动作和检索防守实例。
TicTacBench is a new benchmark designed to evaluate the timing closure capabilities of coding agents in RTL design. It reveals that current agents have significant room for improvement and proposes TicTacSkill to enhance their performance.
CraftBench-UE为Unreal Engine中的编码代理提供了一个确定性评估框架,通过构建、资产和运行时检查来评估游戏玩法特性,无需依赖LLM评判者。
ISA-Bench 引入了一个使用具有受限指令集的编程游戏的基准测试,以评估大型语言模型中的计算推理能力,并揭示了模型能力的洞察以及推理与执行之间的差距。