标签
本文引入了行为提升度量,用于衡量AI思维模型中推理行为与正确答案的相关性,揭示了一个放大-提升差距,其中训练放大了并非最能预测成功的行为。
对 Nvidia 的 Nemotron 3.5 Lightning 进行的行为审计发现其具有强大的完整性,捕获了所审查代码中的一处微妙认证漏洞,并通过了安全探针测试,同时指出了其在基于行为的诚实性方面存在盲点。
本文介绍了Base Sequence Analysis框架,该框架将LLM智能体的运行时行为编码为紧凑序列,揭示了高风险模式(如'P-X-P'三元组)和验证缺失。它提出了Governor,一个运行时干预系统,使任务成功率提高了6.2%,并将令牌消耗减少了44%。
研究人员在圣彼得堡博弈中评估了28个LLM,以区分风险决策中的结果层面相似性与机制层面一致性,发现LLM通常产生类似人类的出价,但缺乏潜在的人类一致推理机制。该研究表明,行为对齐可能是表面的,敦促高风险评估应超越结果相似性。