behavioral-analysis

标签

Cards List
#behavioral-analysis

放大不意味着可预测:思维模型中的推理行为

arXiv cs.CL · 昨天 缓存

本文引入了行为提升度量,用于衡量AI思维模型中推理行为与正确答案的相关性,揭示了一个放大-提升差距,其中训练放大了并非最能预测成功的行为。

0 人收藏 0 人点赞
#behavioral-analysis

@no_stp_on_snek:Nvidia 的 Nemotron 3.5 Lightning 行为分析。它捕获了一个技术负责人和四位审批者已经签字通过的认证漏洞……

X AI KOLs Timeline · 5天前 缓存

对 Nvidia 的 Nemotron 3.5 Lightning 进行的行为审计发现其具有强大的完整性,捕获了所审查代码中的一处微妙认证漏洞,并通过了安全探针测试,同时指出了其在基于行为的诚实性方面存在盲点。

0 人收藏 0 人点赞
#behavioral-analysis

你的智能体拥有基因组:LLM驱动的自主智能体的序列级行为分析与运行时治理

arXiv cs.AI · 2026-06-16 缓存

本文介绍了Base Sequence Analysis框架,该框架将LLM智能体的运行时行为编码为紧凑序列,揭示了高风险模式(如'P-X-P'三元组)和验证缺失。它提出了Governor,一个运行时干预系统,使任务成功率提高了6.2%,并将令牌消耗减少了44%。

0 人收藏 0 人点赞
#behavioral-analysis

探究LLM风险决策中的结果层面相似性与机制层面一致性:来自圣彼得堡博弈的证据

Hugging Face Daily Papers · 2026-06-03

研究人员在圣彼得堡博弈中评估了28个LLM,以区分风险决策中的结果层面相似性与机制层面一致性,发现LLM通常产生类似人类的出价,但缺乏潜在的人类一致推理机制。该研究表明,行为对齐可能是表面的,敦促高风险评估应超越结果相似性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈