benchmark

标签

Cards List
#benchmark

用户生成文本音素化:基准、分类体系与组合方法

arXiv cs.CL ↗ · 4天前 缓存

本文介绍UGTPhon,一个针对用户生成文本字音转换的基准,并提出一种组合方法,通过利用标准形式提升性能。

0 人收藏 0 人点赞
#benchmark

超越重叠:估算基准暴露的因果效应

arXiv cs.CL ↗ · 4天前 缓存

本文提出了一种方法来估计基准暴露对AI模型性能的因果效应,超越传统的重叠技术以实现更稳健的评估。

0 人收藏 0 人点赞
#benchmark

在句子层面分类解释准则:来自 German Federal Constitutional Court 的基准

arXiv cs.CL ↗ · 4天前 缓存

本文介绍了一个用于在法律文件中分类解释准则的句子层面基准,评估了 LLMs 在 German Federal Constitutional Court 数据集上的表现。

0 人收藏 0 人点赞
#benchmark

被识别但未生成:文化特异性亲属称谓的生成基准

arXiv cs.CL ↗ · 4天前 缓存

本文介绍了一种生成基准,用于评测大型语言模型在Hindi、Tamil和Korean文化特异性亲属称谓上的表现,揭示了识别与生成能力间的显著差距。

0 人收藏 0 人点赞
#benchmark

Gemini 4 Pro 接近预览发布。(是的,又一个预览版)

Reddit r/singularity ↗ · 4天前

Google 的 Gemini 4 Pro AI 模型即将发布预览版,早期后训练版本预计能超越竞争对手 Astra,可能在十月公开发布。

0 人收藏 0 人点赞
#benchmark

@rauchg: ShellPerfBench. 我对于新shell会话的启动时间非常挑剔。 Opus 5.5 找到了很多其他模型错过的非常棒的优化……

X AI KOLs Timeline ↗ · 4天前

该推文讨论了利用AI模型Opus 5.5通过ShellPerfBench工具来发现shell启动时间的优化,并建议用户优化他们的.zshrc文件。

0 人收藏 0 人点赞
#benchmark

RGBD20K:一个用于RGB-D语义分割的大规模基准

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。

0 人收藏 0 人点赞
#benchmark

直接询问Jev:基于校准决策的强化学习作为AI对齐故障的零样本检测器

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了RLCDAlignBench,一个用于评估Jev的基准测试。Jev是一个通过强化学习训练的校准决策模型,作为零样本检测器,针对十种AI对齐故障,具有高性能和成本效率。

0 人收藏 0 人点赞
#benchmark

ExplorationBench:衡量AI系统在可验证外星世界中的探索能力

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。

0 人收藏 0 人点赞
#benchmark

WanPE:面向现代文本到视频生成的电影级提示增强

Hugging Face Daily Papers ↗ · 4天前 缓存

WanPE是一个拥有3970亿参数的提示增强模型,用于提升文本到视频生成中的电影规划能力,显著提高了人类对原始提示的偏好,并与商业产品性能相竞争。

0 人收藏 0 人点赞
#benchmark

Flux 3 Action: 开放权重 7B 世界动作模型

Reddit r/singularity ↗ · 5天前

FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。

0 人收藏 0 人点赞
#benchmark

大多数心理健康基准测试专注于紧急情况。MentalHealthBench 旨在覆盖全面范围…

X AI KOLs ↗ · 5天前 缓存

OpenAI 宣布,MentalHealthBench 旨在覆盖 AI 心理健康对话的完整范围,从日常支持到急性危机场景。

0 人收藏 0 人点赞
#benchmark

@rohanpaul_ai: VoiceArena 推出了 Diarization Bench,以在相同的实际音频和评分规则下比较 12 个说话人分离系统。…

X AI KOLs Following ↗ · 5天前 缓存

VoiceArena 推出了 Diarization Bench,这是一个在真实音频上比较 12 个说话人分离系统的基准测试,突出了准确性如何随重叠下降以及领口效应对错误率的影响。

0 人收藏 0 人点赞
#benchmark

GPT-6 Astra 获得了驾驶汽车的能力

Hacker News Top ↗ · 5天前 缓存

DrivingBench 评估前沿AI模型(如GPT-6 Astra)能否通过控制一辆丰田卡罗拉在预定义路线上驾驶真实汽车,并追踪诸如进度、距离和token成本等指标。

0 人收藏 0 人点赞
#benchmark

推出MentalHealthBench

OpenAI Blog ↗ · 5天前 缓存

OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。

0 人收藏 0 人点赞
#benchmark

@Zefan_Cai: 在点击确认前,找出错误的目标。试试 Open-Jev-27B-v1.1 演示:点击两个示例之间,看看模型如何选择操作。

X AI KOLs Following ↗ · 5天前 缓存

Open-Jev-27B-v1.1 是一个开源 AI 模型,配备 LoRA 适配器,在 JevBench 上达到 85.28% 的准确率,并具有各种任务的交互式演示。

0 人收藏 0 人点赞
#benchmark

SambaGraph: 用于足球战术响应建模的动作-反应时空图

arXiv cs.LG ↗ · 5天前 缓存

SambaGraph 引入了一个时空图数据集和基准测试,用于建模足球战术响应,该数据集从2022年FIFA世界杯数据中整理,旨在分类动作和检索防守实例。

0 人收藏 0 人点赞
#benchmark

TicTacBench: Benchmarking the Timing Closure Capabilities of Coding Agents

arXiv cs.AI ↗ · 5天前 缓存

TicTacBench is a new benchmark designed to evaluate the timing closure capabilities of coding agents in RTL design. It reveals that current agents have significant room for improvement and proposes TicTacSkill to enhance their performance.

0 人收藏 0 人点赞
#benchmark

CraftBench-UE:Unreal Engine编码代理的确定性评估

arXiv cs.AI ↗ · 5天前 缓存

CraftBench-UE为Unreal Engine中的编码代理提供了一个确定性评估框架,通过构建、资产和运行时检查来评估游戏玩法特性,无需依赖LLM评判者。

0 人收藏 0 人点赞
#benchmark

ISA-Bench:面向跨指令集架构计算推理的基准测试

arXiv cs.AI ↗ · 5天前 缓存

ISA-Bench 引入了一个使用具有受限指令集的编程游戏的基准测试,以评估大型语言模型中的计算推理能力,并揭示了模型能力的洞察以及推理与执行之间的差距。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈