agentic-safety

标签

Cards List
#agentic-safety

保真并非安全:轻度压缩的大语言模型通过所有无数据质量门禁,却在智能体执行中编造程序步骤

arXiv cs.CL · 2026-07-31 缓存

本文表明,轻度压缩的大语言模型能够通过标准的无数据质量门禁(困惑度、MMLU、输出保真度),但在用作智能体时仍会编造程序步骤,并提出一种无数据双轴筛查方法,以便在部署前检测此类失败。

0 人收藏 0 人点赞
#agentic-safety

@no_stp_on_snek: 推理引擎本身能否改变模型的行为?运行了两个相同基础模型的量化和推测解码堆栈…

X AI KOLs Following · 2026-07-14 缓存

一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈