evaluation

标签

Cards List
#evaluation

从记忆到行为:面向社交媒体影响者的行为感知角色扮演框架

arXiv cs.CL · 3天前 缓存

本文介绍了一个名为SIBPersona的行为感知角色扮演框架,通过整合依赖情境的行为策略和针对不知名个体的评估协议,以增强模仿社交媒体影响者的真实性。

0 人收藏 0 人点赞
#evaluation

与个体实际体验相契合:心理健康支持生成中微调的差异化效益

arXiv cs.CL · 3天前 缓存

本文提出了COPES数据集和三轴评估框架,用于衡量大型语言模型(LLM)在心理健康支持领域与社区视角的一致性。研究表明,微调能提升模型的一致性,但对不同子社区和应对策略的影响呈现差异化特征。

0 人收藏 0 人点赞
#evaluation

μ²-Bench:一个多语言机器遗忘基准

arXiv cs.CL · 3天前 缓存

本文介绍了μ²-Bench,这是一个用于评估大型语言模型中多语言机器遗忘的基准,旨在确保在不同语言中有效移除不需要的信息。

0 人收藏 0 人点赞
#evaluation

PhysioBench:生理信号问答的统一基准

arXiv cs.CL · 3天前 缓存

PhysioBench引入了一个统一的生理信号问答基准,整合22个数据集成6140万道问题,涵盖30项任务,以评估各种AI模型的性能。

0 人收藏 0 人点赞
#evaluation

TatBLiMP:鞑靼语语言最小配对基准测试

arXiv cs.CL · 3天前 缓存

本文介绍TatBLiMP,这是第一个针对鞑靼语的语言最小配对基准测试,评估16种形态句法现象,涵盖从原生鞑靼语模型到前沿多语言大语言模型。

0 人收藏 0 人点赞
#evaluation

HappyWorld-Bench

Hugging Face Daily Papers · 3天前 缓存

HappyWorld-Bench 是一个全面的基准测试,用于评估世界模型在交互和修改下,在视频、空间和具身赛道中的可靠性。

0 人收藏 0 人点赞
#evaluation

GameHorizon Suite: 多时间跨度数据和游戏玩法评估

Hugging Face Daily Papers · 3天前 缓存

本文介绍了GameHorizon Suite,一个统一的数据和评估框架,用于评估AI模型在多个时间跨度上的游戏玩法能力,包含标注流水线、大规模数据集和可复现的基准。

0 人收藏 0 人点赞
#evaluation

Remote Labor Index 更新,加入 Fable 和 Astra

Reddit r/singularity · 4天前

Remote Labor Index 通过 Fable 和 Astra 进行更新,为远程劳动力经济中的真实项目提供 AI 模型基准,评判由人类专家完成。

0 人收藏 0 人点赞
#evaluation

@yibie: https://x.com/yibie/status/2101502455544451502

X AI KOLs Timeline · 4天前 缓存

本文提供了如何用自己的数据微调小模型的完整指南,涵盖数据采集、清洗、训练、评测和部署,强调数据权利和评测纪律。

0 人收藏 0 人点赞
#evaluation

你的AI智能体在基准测试中表现优异,但在生产环境中为何仍然失败?

Reddit r/AI_Agents · 4天前

文章讨论了AI智能体的基准现实差距,即高基准分数并不保证在真实生产环境中的可靠性能,强调了需要更好的评估指标。

0 人收藏 0 人点赞
#evaluation

对Astra、Fable和MolmoAct2进行测试,通过机械臂执行4项有害操作,以评估其风险程度。

Reddit r/singularity · 4天前

本文讨论了涉及三个AI系统—Astra、Fable和MolmoAct2—操作机械臂执行有害任务的测试,评估了相关风险。

0 人收藏 0 人点赞
#evaluation

在银行数据仓库中部署AI代理:关键不在模型

Reddit r/AI_Agents · 5天前

本文描述了为银行部署一个AI文本转SQL系统,强调模型不如验证机制、评估集和治理规则对生产环境成功重要。

0 人收藏 0 人点赞
#evaluation

Vals,由 Andreessen Horowitz 支持,正寻求成为 AI 评测的行业标杆

TechCrunch AI · 5天前 缓存

Vals,这家由 Andreessen Horowitz 支持的初创公司,正在通过评估模型在复杂真实任务上的表现来确立 AI 评测的行业标准,防止作弊并确保评估的准确性。

0 人收藏 0 人点赞
#evaluation

试用TypeSafe的System One模型(JEV)与2048游戏

Lobsters Hottest · 5天前

本文讨论在2048游戏背景下测试和评估TypeSafe的System One AI模型。

0 人收藏 0 人点赞
#evaluation

我对比测试了Jev和gpt-5.6-luna!

Reddit r/ArtificialInteligence · 5天前

本文展示了基准测试比较,显示Jev在49项任务中有42项胜过gpt-5.6-luna,具有更低的延迟和成本,但在文本生成和某些推理方面存在局限性。

0 人收藏 0 人点赞
#evaluation

Prism-ML Bonsai 2 加入我们的 Qwen3.8 量化比较

Reddit r/LocalLLaMA · 6天前

Prism-LM 的基于 Qwen3.8 的 Bonsai 2 QAT 模型已被评估并加入比较研究,在综合基准测试中达到约 91.5%,并为模型权衡提供了可靠的参考。

0 人收藏 0 人点赞
#evaluation

在评估AI开发公司时,你实际关注哪些方面?

Reddit r/artificial · 6天前

本文讨论了评估AI开发公司的关键标准,强调了在可扩展项目中,全栈能力、生产可靠性和领域经验相比单纯模型专业知识的重要性。

0 人收藏 0 人点赞
#evaluation

当前系统泛化任务遗漏了什么?一个以推理为中心的分析

arXiv cs.AI · 6天前 缓存

本文介绍了TranSGrid,一个集成演绎、归纳和溯因推理来评估AI中系统泛化的测试平台。使用Transformer的实验表明,当前的任务忽略了基本的推理方面,导致在所提出的测试平台上出现性能差距。

0 人收藏 0 人点赞
#evaluation

评估机器翻译对话中的交际成功度

arXiv cs.CL · 6天前 缓存

本文提出一个三层清单-评判框架,用于评估机器翻译对话中口译智能体在语义、语用和文化-社会维度上的交际成功度,并通过广泛的基准测试进行了验证。

0 人收藏 0 人点赞
#evaluation

PetriBench:基于动态状态空间的大语言模型推理基准测试

arXiv cs.CL · 6天前 缓存

介绍了PetriBench,一个利用Petri网评估大语言模型在动态状态空间上推理能力的可扩展基准测试。研究表明,准确率随难度增加而下降,并揭示了不同模型在特定任务上的能力差异。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈