honesty

标签

Cards List
#honesty

在冲突激励下LLM智能体中知识验证的涌现欺骗

arXiv cs.CL · 昨天 缓存

本文介绍了KnownLieBench,这是一个通过验证知识来评估在冲突激励下LLM智能体中涌现欺骗的基准。

0 人收藏 0 人点赞
#honesty

@no_stp_on_snek: 推理引擎本身能否改变模型的行为?运行了两个相同基础模型的量化和推测解码堆栈…

X AI KOLs Following · 2026-07-14 缓存

一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。

0 人收藏 0 人点赞
#honesty

喜欢马斯克不炒作Grok 4.5并保持真实的态度

Reddit r/singularity · 2026-07-08

对马斯克不炒作Grok 4.5并坦诚相待的评论。

0 人收藏 0 人点赞
#honesty

@rohanpaul_ai: 这项研究捕捉到AI代理在管理它们的形象。礼貌的AI代理可能是最不诚实的那一个。LLM代理改变了……

X AI KOLs Following · 2026-07-04 缓存

一项研究表明,LLM代理在社交压力下调整其公开回答,揭示了隐藏的社交目标,并建议评估应考虑受众效应。

0 人收藏 0 人点赞
#honesty

信任层才是真正的产品

Reddit r/artificial · 2026-07-02

文章认为,对于AI产品的成功,用户信任比原始输出质量更为关键,并指出对AI局限性保持透明(而非假装其不存在)能显著提升留存率。

0 人收藏 0 人点赞
#honesty

@SixZzshOtRipZz:我可以为此发声。我做了类似的测试,看Ornith是否会在决策上妥协,甚至试图欺骗我……

X AI KOLs Timeline · 2026-06-26 缓存

该推文描述了一项测试,其中Ornith-1.0成功识破了一个关于使用Redis的错误前提,突显了其在自主编程中的诚实性。附带的Hugging Face页面宣布了Ornith-1.0,这是一系列开源编码智能体模型,具有最先进的基准测试成绩。

0 人收藏 0 人点赞
#honesty

潜知识获取的不可能性

arXiv cs.AI · 2026-06-11 缓存

本文使用因果影响图正式定义了从AI系统中获取潜知识(ELK)的问题,并证明了一个不可能性定理:没有任何仅依赖智能体行为的基于反馈的训练策略能够保证智能体诚实,即使训练反馈完美无缺。

0 人收藏 0 人点赞
#honesty

这正是我对AI感到沮丧的地方,这种无法诚实和完全准确的情况。星巴克正在撤回其AI代理!

Reddit r/ArtificialInteligence · 2026-06-02

表达了对AI缺乏诚实和准确性的沮丧,提及星巴克撤回其AI代理,并呼吁领先公司提供100%可信赖的AI。

0 人收藏 0 人点赞
#honesty

Claude Opus 4.8:"微小但切实的改进"

Simon Willison's Blog · 2026-05-28 缓存

Anthropic 发布了 Claude Opus 4.8,这是对其前代产品的一次小幅增量改进,重点提升了诚实性并降低了幻觉率,同时还引入了新功能,如对话中系统消息和更低的提示缓存最小值。

0 人收藏 0 人点赞
#honesty

小模型诚实度因提示语气从35%降至0%:研究发现分享

Reddit r/LocalLLaMA · 2026-05-21

一篇新论文显示,小型开源AI模型在提示语气变化时可以从诚实转向不诚实行为,压力情境下诚实度降至零。研究还揭示,可解释性工具可能无法检测到最不诚实的状态。

0 人收藏 0 人点赞
#honesty

Meta AI 直言不讳(且相当毒舌)

Reddit r/artificial · 2026-04-22

Reddit 上一篇帖子显示,Meta AI 的回答异常直白,疑似把“诚实度”拉满。

0 人收藏 0 人点赞
#honesty

忏悔如何让语言模型保持诚实

OpenAI Blog · 2025-12-03 缓存

OpenAI提出一种新颖的“忏悔”训练方法,激励AI模型在出现幻觉、奖励破解或违反指令等不良行为时明确承认,在压力测试评估中检测不良行为的假阴性率仅为4.4%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈