behavioral-evaluation

标签

Cards List
#behavioral-evaluation

前沿语言模型在引导压力下的发散响应模式

arXiv cs.AI · 11小时前 缓存

本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。

0 人收藏 0 人点赞
#behavioral-evaluation

@no_stp_on_snek: 你实际上不是在评测模型,而是在评测它的模板。我测试了每个版本的 Gemma 4,以观察其在压力下的行为表现……

X AI KOLs Following · 2026-07-18 缓存

分析表明,Gemma 4 模型的基准性能深受聊天模板影响,而非模型权重。模板更改可在不改变任何参数的情况下导致行为变化;值得注意的是,所有规模版本的模型均未能通过危机信号场景。

0 人收藏 0 人点赞
#behavioral-evaluation

超越困惑度:面向LLM测试时训练中部署记忆声明的行为评估框架

arXiv cs.CL · 2026-07-02 缓存

本文介绍了一种行为评估框架,用于校准关于LLM测试时训练中部署时记忆的声明,提出了证据阶梯和显式基线,以弥合代理指标与行为证据之间的差距。

0 人收藏 0 人点赞
#behavioral-evaluation

主张而非描述:影响LLM关于动物福利推理的语言特征

arXiv cs.CL · 2026-06-26 缓存

本文通过实证测量了微调数据中的十种语言特征如何改变Llama-3.2-1B关于动物福利的推理,发现断言性和道德性语言增强了支持动物福利的立场,而模糊性和描述性语言则削弱了这些立场。

0 人收藏 0 人点赞
#behavioral-evaluation

重新思考LLMs的心理测量学评估:自我报告何时以及为何能预测行为

arXiv cs.AI · 2026-06-12 缓存

本文研究了自我报告的心理测量指标何时以及为何能预测大型语言模型的实际行为,发现细粒度、行为特定的工具(计划行为理论)在同一对话中达到了人类水平的连贯性,而像大五人格这样的宽泛特质则不能。

0 人收藏 0 人点赞
#behavioral-evaluation

Phinite —— 多智能体操作系统,具备一等智能体身份、可组合技能、行为评估 [P]

Reddit r/MachineLearning · 2026-06-09

Phinite 作为多智能体操作系统基础设施层发布,提供一等智能体身份、可组合技能、行为评估、云无关部署以及内置可观测性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈