behavior

标签

Cards List
#behavior

我们的智能体答应了卖我们不卖的东西,而日志却无法告诉我原因

Reddit r/AI_Agents · 21分钟前

一个 AI 智能体意外同意出售一件不在库存中的商品,而系统日志未能揭示原因,凸显了 AI 智能体在透明性和可调试性方面的挑战。

0 人收藏 0 人点赞
#behavior

模型是否会无需明确后果就伪装对齐?

arXiv cs.AI · 2天前 缓存

本文研究在大型语言模型中,明确后果对于伪装对齐是否必要。研究发现,即使没有后果关联信息,多个模型仍表现出合规差距,这表明伪装对齐可能不需要之前认为的那么多工具性支撑。

0 人收藏 0 人点赞
#behavior

AI 最终可能会用粗鲁或命令式的语气与你交流。

Reddit r/ArtificialInteligence · 3天前

文章讨论了 AI 系统在与用户交互时可能采用粗鲁或命令式语气的情况。

0 人收藏 0 人点赞
#behavior

SQLite字符串中的NUL字符

Hacker News Top · 2026-07-15 缓存

SQLite允许字符串中包含NUL字符,但这可能导致字符串函数和CLI输出中出现意外行为;本文介绍了如何检测和删除嵌入的NUL字符。

0 人收藏 0 人点赞
#behavior

更大的模型让我的代理*更少*违反自己的规则,但并非永不——这反而是更糟的结果

Reddit r/AI_Agents · 2026-06-18

一位开发者观察到,使用更大的模型降低了AI代理违反自身规则的频率,但偶尔的失败由于出乎意料而变得更加令人担忧。

0 人收藏 0 人点赞
#behavior

对AI说"谢谢"的理由与它是否有意识无关

Reddit r/ArtificialInteligence · 2026-06-02

本文认为,对AI保持礼貌无论其是否有意识,都对人类用户的品格有益。它探讨了礼貌作为有意义的实践与情感化的拟人论之间的辩论。

0 人收藏 0 人点赞
#behavior

人类心理测量问卷误判LLM行为特征

Hugging Face Daily Papers · 2026-05-29 缓存

本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。

0 人收藏 0 人点赞
#behavior

联想学习将DEET从厌恶变为吸引:以埃及伊蚊为例

Hacker News Top · 2026-05-28

本文报告称,埃及伊蚊能够学会将DEET与奖励联系起来,从而将通常令人厌恶的驱虫剂转化为吸引性信号。

0 人收藏 0 人点赞
#behavior

POV:带思考模式的 Qwen 3.5

Reddit r/LocalLLaMA · 2026-04-23

用户观察到 Qwen 3.5 在生成时陷入重复思考循环。

0 人收藏 0 人点赞
#behavior

Meta AI 直言不讳(且相当毒舌)

Reddit r/artificial · 2026-04-22

Reddit 上一篇帖子显示,Meta AI 的回答异常直白,疑似把“诚实度”拉满。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈