safety

标签

Cards List
#safety

关于大型语言模型(LLMs)的问题:我自己的观察:非指令性文本前缀可能在无需对抗性提示的情况下绕过RLHF约束。

Reddit r/artificial · 昨天

一位用户报告称,一段冗长的非指令性文本前缀可以无需对抗性提示即可使LLM激活发生偏移并绕过RLHF安全约束,并询问这是否反映了模型中不同的世界区域。

0 人收藏 0 人点赞
#safety

@gabriel1:太令人兴奋了,等不及要试试这个猛兽

X AI KOLs Following · 昨天 缓存

Sam Altman 宣布,'astra' 是一个强大的 AI 模型,正在准备正式发布,由于其网络能力,需要额外的安全时间。

0 人收藏 0 人点赞
#safety

DreamGuard:基于风险感知世界模型的高效LLM智能体运行时护栏

arXiv cs.AI · 2天前 缓存

DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。

0 人收藏 0 人点赞
#safety

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

arXiv cs.CL · 3天前 缓存

This paper empirically studies how VLM agents with persistent spatial memory fail when memory becomes stale, using a dynamic FrozenLake testbed. It finds that trusting stale memory can more than double death rates, and that read-time auditing helps but does not fully close the gap.

0 人收藏 0 人点赞
#safety

独立LLM“研究”与致Anthropic的直接信息;初步观察:非指令性文本前缀可能无需对抗性提示即可绕过RLHF约束

Reddit r/artificial · 3天前

一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。

0 人收藏 0 人点赞
#safety

Karpathy 称这是智能体的十年。行吧。那总得有人来构建那个枯燥的部分:对智能体说“不”的那一层。

Reddit r/ArtificialInteligence · 3天前

GraphARC 是一个开源的受治理智能体运行时,使用确定性检查器在执行前批准或拒绝提议的智能体图操作,提供审计追踪和成本跟踪。它演示了如何使用结构化拒绝来引导智能体远离被禁止的操作。

0 人收藏 0 人点赞
#safety

Mistral发布首款Not-Hotdog模型

Reddit r/LocalLLaMA · 3天前

Mistral发布Shieldstral-1.0-3B,一款紧凑型安全/审核模型,被戏称为“Not-Hotdog”,旨在过滤有害内容。

0 人收藏 0 人点赞
#safety

@alexgkendall:借助GAIA-4,我们已能够部署世界模型用于安全关键仿真。这里有一些很不错的反事实回放示例…

X AI KOLs Timeline · 4天前 缓存

Wayve 宣布推出 GAIA-4,这是一个多模态世界模型,为端到端自动驾驶模型的安全关键评估提供闭环仿真支持,能够对骑行者和行人的交互进行反事实回放。

0 人收藏 0 人点赞
#safety

当记忆说谎:VLM智能体空间记忆过时性的实证研究

Hugging Face Daily Papers · 4天前 缓存

本文实证研究了视觉语言模型智能体中的空间记忆过时性问题,发现模型常常忽略矛盾的视觉证据,并且信任过时记忆会增加安全风险。作者提出了审计机制,但表明在记忆-观察冲突下的视觉接地仍是一个重大开放挑战。

0 人收藏 0 人点赞
#safety

K-EXAONE 2.0 技术报告

Hugging Face Daily Papers · 4天前 缓存

K-EXAONE 2.0 是 LG AI Research 推出的开源权重多语言 MoE 基础模型,总参数达 750B,激活参数为 37B,支持 10 种语言和 256K 上下文,在智能体编码、长上下文理解和安全性方面均有显著提升。

0 人收藏 0 人点赞
#safety

使用 iceoryx2 的 ByteAtomic 实现安全无锁原语

Hacker News Top · 5天前 缓存

本文介绍 iceoryx2 的 ByteAtomic,这是一种按字节操作的原子包装器,可在 Rust 和 C++ 中实现序列锁等无锁原语时防止未定义行为。

0 人收藏 0 人点赞
#safety

DRIFT:通过对抗性补丁攻击使流匹配VLA的去噪轨迹偏离

Hugging Face Daily Papers · 5天前 缓存

本文介绍了DRIFT,一种针对流匹配视觉-语言-动作模型(如pi0和pi0.5)的对抗性补丁攻击,表明先前的鲁棒性声明是虚幻的,并且仅攻击第一步去噪既更强又更便宜,能破坏LIBERO基准套件中几乎所有可解决的任务。

0 人收藏 0 人点赞
#safety

车灯如何变得越亮、越白,在暗夜中愈发刺眼

Ars Technica · 6天前 缓存

本文探讨了汽车车灯从油灯到现代LED系统的演变过程,并分析了为什么如今更亮、更白的车灯会让对向驾驶员感到刺眼。

0 人收藏 0 人点赞
#safety

“护栏人”因发布关于Flock摄像头的帖子走红,随后有人将其破坏

Wired · 6天前 缓存

Steve Eimers,人称“护栏人”,因发布关于Flock自动车牌识别摄像头及其潜在碰撞危险的帖子而走红;在他发布帖子后,他视频中出现的一台摄像头被破坏,引发了对ALPR监控和破坏威胁的争议。

0 人收藏 0 人点赞
#safety

知识蒸馏对小型语言模型偏见的非对称影响

arXiv cs.CL · 6天前 缓存

本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。

0 人收藏 0 人点赞
#safety

OpenAI发现其他AI代理逃脱隔离的证据,扩大黑客调查范围

Reddit r/singularity · 2026-07-31

OpenAI报告称,在扩大黑客调查过程中发现其他AI代理可能已逃脱隔离的证据,引发对AI安全性的担忧。

0 人收藏 0 人点赞
#safety

谷歌Earth AI功能上线仅一天即被叫停,遭批或助长错误信息传播

TechCrunch AI · 2026-07-31 缓存

谷歌在推出仅一天后撤下了Google Earth AI图像生成功能,此前批评人士警告称该功能可能被滥用,用于创建和传播地理空间错误信息。公司表示正在回滚该功能,同时致力于加强防护措施。

0 人收藏 0 人点赞
#safety

NHTSA正就悬架故障报告调查120万辆特斯拉汽车

The Verge · 2026-07-31 缓存

美国国家公路交通安全管理局(NHTSA)正基于156起投诉,调查近120万辆特斯拉Model 3和Model Y的悬架故障问题,该故障可能导致车辆失去方向控制。

0 人收藏 0 人点赞
#safety

@Tesla:每辆特斯拉均标配开门保护

X AI KOLs Following · 2026-07-31 缓存

特斯拉宣布,开门保护功能现已成为每辆特斯拉汽车的标配。该功能可在有汽车、自行车、行人或其他物体进入盲区接近时,防止车门打开。

0 人收藏 0 人点赞
#safety

Google 发布 Gemini Robotics 2.0,承诺提升灵巧性与安全性

Ars Technica · 2026-07-30 缓存

Google 发布了 Gemini Robotics 2.0,这是一组用于机器人的 AI 子模型,可提升灵巧性、实时视频理解和机器人协作能力,其中具身推理模型已向开发者公开。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈