标签
本文介绍了一个名为SIBPersona的行为感知角色扮演框架,通过整合依赖情境的行为策略和针对不知名个体的评估协议,以增强模仿社交媒体影响者的真实性。
本文提出了COPES数据集和三轴评估框架,用于衡量大型语言模型(LLM)在心理健康支持领域与社区视角的一致性。研究表明,微调能提升模型的一致性,但对不同子社区和应对策略的影响呈现差异化特征。
本文介绍了μ²-Bench,这是一个用于评估大型语言模型中多语言机器遗忘的基准,旨在确保在不同语言中有效移除不需要的信息。
PhysioBench引入了一个统一的生理信号问答基准,整合22个数据集成6140万道问题,涵盖30项任务,以评估各种AI模型的性能。
本文介绍TatBLiMP,这是第一个针对鞑靼语的语言最小配对基准测试,评估16种形态句法现象,涵盖从原生鞑靼语模型到前沿多语言大语言模型。
HappyWorld-Bench 是一个全面的基准测试,用于评估世界模型在交互和修改下,在视频、空间和具身赛道中的可靠性。
本文介绍了GameHorizon Suite,一个统一的数据和评估框架,用于评估AI模型在多个时间跨度上的游戏玩法能力,包含标注流水线、大规模数据集和可复现的基准。
Remote Labor Index 通过 Fable 和 Astra 进行更新,为远程劳动力经济中的真实项目提供 AI 模型基准,评判由人类专家完成。
本文提供了如何用自己的数据微调小模型的完整指南,涵盖数据采集、清洗、训练、评测和部署,强调数据权利和评测纪律。
文章讨论了AI智能体的基准现实差距,即高基准分数并不保证在真实生产环境中的可靠性能,强调了需要更好的评估指标。
本文讨论了涉及三个AI系统—Astra、Fable和MolmoAct2—操作机械臂执行有害任务的测试,评估了相关风险。
Vals,这家由 Andreessen Horowitz 支持的初创公司,正在通过评估模型在复杂真实任务上的表现来确立 AI 评测的行业标准,防止作弊并确保评估的准确性。
本文讨论在2048游戏背景下测试和评估TypeSafe的System One AI模型。
本文展示了基准测试比较,显示Jev在49项任务中有42项胜过gpt-5.6-luna,具有更低的延迟和成本,但在文本生成和某些推理方面存在局限性。
Prism-LM 的基于 Qwen3.8 的 Bonsai 2 QAT 模型已被评估并加入比较研究,在综合基准测试中达到约 91.5%,并为模型权衡提供了可靠的参考。
本文讨论了评估AI开发公司的关键标准,强调了在可扩展项目中,全栈能力、生产可靠性和领域经验相比单纯模型专业知识的重要性。
本文介绍了TranSGrid,一个集成演绎、归纳和溯因推理来评估AI中系统泛化的测试平台。使用Transformer的实验表明,当前的任务忽略了基本的推理方面,导致在所提出的测试平台上出现性能差距。
本文提出一个三层清单-评判框架,用于评估机器翻译对话中口译智能体在语义、语用和文化-社会维度上的交际成功度,并通过广泛的基准测试进行了验证。
介绍了PetriBench,一个利用Petri网评估大语言模型在动态状态空间上推理能力的可扩展基准测试。研究表明,准确率随难度增加而下降,并揭示了不同模型在特定任务上的能力差异。