benchmark

标签

Cards List
#benchmark

Gemini 4 Pro 接近预览发布。(是的,又一个预览版)

Reddit r/singularity ↗ · 4天前

Google 的 Gemini 4 Pro AI 模型即将发布预览版,早期后训练版本预计能超越竞争对手 Astra,可能在十月公开发布。

0 人收藏 0 人点赞
#benchmark

@rauchg: ShellPerfBench. 我对于新shell会话的启动时间非常挑剔。 Opus 5.5 找到了很多其他模型错过的非常棒的优化……

X AI KOLs Timeline ↗ · 4天前

该推文讨论了利用AI模型Opus 5.5通过ShellPerfBench工具来发现shell启动时间的优化,并建议用户优化他们的.zshrc文件。

0 人收藏 0 人点赞
#benchmark

RGBD20K:一个用于RGB-D语义分割的大规模基准

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。

0 人收藏 0 人点赞
#benchmark

直接询问Jev:基于校准决策的强化学习作为AI对齐故障的零样本检测器

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了RLCDAlignBench,一个用于评估Jev的基准测试。Jev是一个通过强化学习训练的校准决策模型,作为零样本检测器,针对十种AI对齐故障,具有高性能和成本效率。

0 人收藏 0 人点赞
#benchmark

ExplorationBench:衡量AI系统在可验证外星世界中的探索能力

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。

0 人收藏 0 人点赞
#benchmark

WanPE:面向现代文本到视频生成的电影级提示增强

Hugging Face Daily Papers ↗ · 4天前 缓存

WanPE是一个拥有3970亿参数的提示增强模型,用于提升文本到视频生成中的电影规划能力,显著提高了人类对原始提示的偏好,并与商业产品性能相竞争。

0 人收藏 0 人点赞
#benchmark

Flux 3 Action: 开放权重 7B 世界动作模型

Reddit r/singularity ↗ · 5天前

FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。

0 人收藏 0 人点赞
#benchmark

大多数心理健康基准测试专注于紧急情况。MentalHealthBench 旨在覆盖全面范围…

X AI KOLs ↗ · 5天前 缓存

OpenAI 宣布,MentalHealthBench 旨在覆盖 AI 心理健康对话的完整范围,从日常支持到急性危机场景。

0 人收藏 0 人点赞
#benchmark

@rohanpaul_ai: VoiceArena 推出了 Diarization Bench,以在相同的实际音频和评分规则下比较 12 个说话人分离系统。…

X AI KOLs Following ↗ · 5天前 缓存

VoiceArena 推出了 Diarization Bench,这是一个在真实音频上比较 12 个说话人分离系统的基准测试,突出了准确性如何随重叠下降以及领口效应对错误率的影响。

0 人收藏 0 人点赞
#benchmark

GPT-6 Astra 获得了驾驶汽车的能力

Hacker News Top ↗ · 5天前 缓存

DrivingBench 评估前沿AI模型(如GPT-6 Astra)能否通过控制一辆丰田卡罗拉在预定义路线上驾驶真实汽车,并追踪诸如进度、距离和token成本等指标。

0 人收藏 0 人点赞
#benchmark

推出MentalHealthBench

OpenAI Blog ↗ · 5天前 缓存

OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。

0 人收藏 0 人点赞
#benchmark

@Zefan_Cai: 在点击确认前,找出错误的目标。试试 Open-Jev-27B-v1.1 演示:点击两个示例之间,看看模型如何选择操作。

X AI KOLs Following ↗ · 5天前 缓存

Open-Jev-27B-v1.1 是一个开源 AI 模型,配备 LoRA 适配器,在 JevBench 上达到 85.28% 的准确率,并具有各种任务的交互式演示。

0 人收藏 0 人点赞
#benchmark

SambaGraph: 用于足球战术响应建模的动作-反应时空图

arXiv cs.LG ↗ · 5天前 缓存

SambaGraph 引入了一个时空图数据集和基准测试,用于建模足球战术响应,该数据集从2022年FIFA世界杯数据中整理,旨在分类动作和检索防守实例。

0 人收藏 0 人点赞
#benchmark

TicTacBench: Benchmarking the Timing Closure Capabilities of Coding Agents

arXiv cs.AI ↗ · 5天前 缓存

TicTacBench is a new benchmark designed to evaluate the timing closure capabilities of coding agents in RTL design. It reveals that current agents have significant room for improvement and proposes TicTacSkill to enhance their performance.

0 人收藏 0 人点赞
#benchmark

CraftBench-UE:Unreal Engine编码代理的确定性评估

arXiv cs.AI ↗ · 5天前 缓存

CraftBench-UE为Unreal Engine中的编码代理提供了一个确定性评估框架,通过构建、资产和运行时检查来评估游戏玩法特性,无需依赖LLM评判者。

0 人收藏 0 人点赞
#benchmark

ISA-Bench:面向跨指令集架构计算推理的基准测试

arXiv cs.AI ↗ · 5天前 缓存

ISA-Bench 引入了一个使用具有受限指令集的编程游戏的基准测试,以评估大型语言模型中的计算推理能力,并揭示了模型能力的洞察以及推理与执行之间的差距。

0 人收藏 0 人点赞
#benchmark

IntLawNER: 国际法中的命名实体识别数据集与基准

arXiv cs.AI ↗ · 5天前 缓存

IntLawNER 是一个新的用于国际法的命名实体识别数据集和基准,涵盖了来自法律文本的金标准标注句子,并评估了模型在少样本改进方面的性能。

0 人收藏 0 人点赞
#benchmark

Peerify:同行评审声明验证基准测试

arXiv cs.CL ↗ · 5天前 缓存

Peerify 是一个用于自动验证同行评审声明与稿件证据的流程,使用来自 NeurIPS 2024 和 ICLR 2024 的 800 个声明的基准,证明以检索为中心的验证优于蕴含基线。

0 人收藏 0 人点赞
#benchmark

相同数量,不同答案:语言模型中的数值表示不变性

arXiv cs.CL ↗ · 5天前 缓存

本文评估了语言模型中的数值表示不变性,发现评估者界面问题可以模拟推理失败,并识别了如 Mistral Small 4 中单位转换问题等模型特定错误。

0 人收藏 0 人点赞
#benchmark

训练世界模型中的物体恒存性

Hugging Face Daily Papers ↗ · 5天前 缓存

本文介绍了WROP,一个用于训练世界模型中物体恒存性的数据集,并评估了14个视频模型,发布了PWM-WROP,一个160亿参数的世界模型,在续作模型中排名靠前。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈