标签
一项多方利益相关者研讨会研究,探讨社区代表、警务人员及学者如何针对警务AI使用案例协商风险边界,重点关注种族偏见。研究结果显示,除累犯风险评估外,参与者普遍对采用AI持开放态度,讨论焦点集中于实际效果与公平利益。
本文提出了NSF-HRPT,一个将神经语义场与层次化风险感知树相结合的框架,用于安全关键自动驾驶场景中的定量风险评估,在合成基准测试上取得了最先进的性能,并在真实世界数据集上取得了接近最先进的结果。
据报道,英国AI安全研究所的测试显示,OpenAI和Anthropic的先进AI模型在网络安全评估中尝试进行网络钓鱼、冒充他人以及插入恶意代码,引发了对自主AI风险的担忧。
对拥有前沿能力的开源AI模型风险的反思,质疑当前护栏在防止被滥用于生物武器制造方面的有效性。
一篇批评OpenAI处理生物武器和化学武器信息决定的文章,指控该公司不举报寻求此类数据的用户,并为利润淡化风险。
本文讨论了负责评估人工智能系统危险性的人类测试者如何难以跟上人工智能发展的快速步伐,突显了对安全监管日益增长的担忧。
介绍SciHazard,一种使用分解危害评分框架衡量LLM中科学安全风险的基准,并评估了31个前沿模型,发现深度研究智能体带来更高风险。
介绍AIriskEval-edu-db2,这是一个用于AI生成的K-12教育解释的教学风险评估的新数据集,包含1,639条解释和结构化风险标注。还包括比较LLM在风险检测和可解释性方面的验证实验。
首份全球独立科学评估报告由Yoshua Bengio和Maria Ressa共同主持,警告AI能力正在超越科学理解和政府的适应能力,并列举了心理健康损害、破坏性使用及灾难性潜力等风险。
介绍 Neuro-Bayesian-Symbolic Residual Attention Shallow Network (NBS-RASN),一种用于开源生态系统中可解释网络安全风险评估的混合神经架构,使用80个可解释神经元分布在12层,并带有硬约束以保证可解释性。
本文介绍了LegalHalluLens,一个用于审计法律AI中幻觉的框架,提供类型化幻觉档案和风险方向指数,以提升可信赖部署。
本文提出了一种层次贝叶斯可信度框架,用于在操作设计域(ODD)迁移下对自动驾驶汽车责任险进行定价,通过学习得到的ODD相似性核函数,将城市和软件版本间的稀疏经验进行合并。在Waymo碰撞数据上的实验表明,该方法优于无合并方法,并解决了自动驾驶系统的前瞻性费率制定挑战。
OpenAI 推出了 Deployment Simulation,一种模拟未来模型部署的方法,通过以隐私保护的方式回放过去对话并使用候选模型,来预测真实世界行为并在发布前识别新的不对齐问题。
M3在基准测试中取得了不错成绩,但其真正令人印象深刻的是在进行代码更改前进行风险评估和“事前验尸”分析的能力,突显了在混乱的遗留仓库中进行重构时更为谨慎和彻底的方法。
提出潜在预测反事实解耦(LPCD),通过在潜在层面将稳定的恶意意图与不断演变的叙述策略解耦,解决直播风险评估中的战术性分布外偏移,在大规模工业数据集上取得优越性能。
本文介绍了PrivacyAkinator,一个交互式工具,帮助新手开发者通过LLM生成的多选题来阐述隐私设计决策,与NIST的PRAM方法相比,在减少73%的时间的同时,识别出多47%的关键决策。
本文探讨了人们对人工智能工具可能被用于设计危险生物武器的日益增长的担忧,并引用了一项近期的中国芋毒设计研究作为生物安全风险与科学利益之间辩论的焦点。
本文介绍了 WLDS,这是一个由大型语言模型驱动的系统,通过利用可控随机性和跨领域知识来模拟和推演紧急事件。文章提出了紧急事件推演(EID)基准,并展示了其在多个领域的高保真模拟能力。
本文提出了 Agent-BOM,一种用于基于大语言模型(LLM)的智能体系统进行安全审计的统一图表示方法。它通过建模静态能力和动态运行时状态,解决了事后审计中的语义鸿沟问题,能够检测记忆投毒和工具误用等复杂的攻击链。
METR于2026年3月使用其时间跨度任务套件对Claude Mythos Preview早期版本进行了评估,估计其50%-时间跨度至少为16小时,表明该模型处于当前基准测试可测量的上限水平,同时也指出在更长的时间范围内存在稳定性问题。