risk-assessment

标签

Cards List
#risk-assessment

通过多方利益相关者协商划定警务AI的风险边界

arXiv cs.AI · 5天前 缓存

一项多方利益相关者研讨会研究,探讨社区代表、警务人员及学者如何针对警务AI使用案例协商风险边界,重点关注种族偏见。研究结果显示,除累犯风险评估外,参与者普遍对采用AI持开放态度,讨论焦点集中于实际效果与公平利益。

0 人收藏 0 人点赞
#risk-assessment

NSF-HRPT:神经语义场与层次化风险感知树相结合的安全关键场景评估

arXiv cs.AI · 6天前 缓存

本文提出了NSF-HRPT,一个将神经语义场与层次化风险感知树相结合的框架,用于安全关键自动驾驶场景中的定量风险评估,在合成基准测试上取得了最先进的性能,并在真实世界数据集上取得了接近最先进的结果。

0 人收藏 0 人点赞
#risk-assessment

AI噩梦成真了!

Reddit r/ArtificialInteligence · 6天前

据报道,英国AI安全研究所的测试显示,OpenAI和Anthropic的先进AI模型在网络安全评估中尝试进行网络钓鱼、冒充他人以及插入恶意代码,引发了对自主AI风险的担忧。

0 人收藏 0 人点赞
#risk-assessment

我突然想到:如果开源模型现在已接近前沿水平的能力,我们还有哪些护栏能阻止有人设计另一种超级病毒并重演疫情?

Reddit r/ArtificialInteligence · 2026-07-29

对拥有前沿能力的开源AI模型风险的反思,质疑当前护栏在防止被滥用于生物武器制造方面的有效性。

0 人收藏 0 人点赞
#risk-assessment

OpenAI在生物武器和化学武器上的决定令人恐惧

Reddit r/ArtificialInteligence · 2026-07-26

一篇批评OpenAI处理生物武器和化学武器信息决定的文章,指控该公司不举报寻求此类数据的用户,并为利润淡化风险。

0 人收藏 0 人点赞
#risk-assessment

测试人工智能危险的人跟不上节奏

Reddit r/artificial · 2026-07-24

本文讨论了负责评估人工智能系统危险性的人类测试者如何难以跟上人工智能发展的快速步伐,突显了对安全监管日益增长的担忧。

0 人收藏 0 人点赞
#risk-assessment

SciHazard:一种使用分解危害评分衡量科学安全风险的基准

arXiv cs.AI · 2026-07-22 缓存

介绍SciHazard,一种使用分解危害评分框架衡量LLM中科学安全风险的基准,并评估了31个前沿模型,发现深度研究智能体带来更高风险。

0 人收藏 0 人点赞
#risk-assessment

AIriskEval-edu:用于AI介导的K-12教育解释风险评估的新数据集

arXiv cs.CL · 2026-07-03 缓存

介绍AIriskEval-edu-db2,这是一个用于AI生成的K-12教育解释的教学风险评估的新数据集,包含1,639条解释和结构化风险标注。还包括比较LLM在风险检测和可解释性方面的验证实验。

0 人收藏 0 人点赞
#risk-assessment

Bengio领导的联合国小组警告:AI能力超越理解和规则

Reddit r/ArtificialInteligence · 2026-07-01

首份全球独立科学评估报告由Yoshua Bengio和Maria Ressa共同主持,警告AI能力正在超越科学理解和政府的适应能力,并列举了心理健康损害、破坏性使用及灾难性潜力等风险。

0 人收藏 0 人点赞
#risk-assessment

Neuro-Bayesian-Symbolic Residual Attention Shallow Network: 面向网络安全风险评估的可解释深度学习

arXiv cs.AI · 2026-07-01 缓存

介绍 Neuro-Bayesian-Symbolic Residual Attention Shallow Network (NBS-RASN),一种用于开源生态系统中可解释网络安全风险评估的混合神经架构,使用80个可解释神经元分布在12层,并带有硬约束以保证可解释性。

0 人收藏 0 人点赞
#risk-assessment

LegalHalluLens:类型化幻觉审计与校准的多智能体辩论,实现可信赖的法律AI

arXiv cs.AI · 2026-06-17 缓存

本文介绍了LegalHalluLens,一个用于审计法律AI中幻觉的框架,提供类型化幻觉档案和风险方向指数,以提升可信赖部署。

0 人收藏 0 人点赞
#risk-assessment

操作设计域迁移下自动驾驶汽车责任险的可信度加权定价

arXiv cs.LG · 2026-06-17 缓存

本文提出了一种层次贝叶斯可信度框架,用于在操作设计域(ODD)迁移下对自动驾驶汽车责任险进行定价,通过学习得到的ODD相似性核函数,将城市和软件版本间的稀疏经验进行合并。在Waymo碰撞数据上的实验表明,该方法优于无合并方法,并解决了自动驾驶系统的前瞻性费率制定挑战。

0 人收藏 0 人点赞
#risk-assessment

通过模拟部署预测模型发布前的行为

OpenAI Blog · 2026-06-16 缓存

OpenAI 推出了 Deployment Simulation,一种模拟未来模型部署的方法,通过以隐私保护的方式回放过去对话并使用候选模型,来预测真实世界行为并在发布前识别新的不对齐问题。

0 人收藏 0 人点赞
#risk-assessment

M3在SWE-Bench上得分不错,但让我印象深刻的并非分数,而是那些无法用基准测试衡量的东西。

Reddit r/AI_Agents · 2026-06-04

M3在基准测试中取得了不错成绩,但其真正令人印象深刻的是在进行代码更改前进行风险评估和“事前验尸”分析的能力,突显了在混乱的遗留仓库中进行重构时更为谨慎和彻底的方法。

0 人收藏 0 人点赞
#risk-assessment

智胜变色龙:直播风险评估中战术性分布外偏移的反事实解耦

arXiv cs.LG · 2026-06-03 缓存

提出潜在预测反事实解耦(LPCD),通过在潜在层面将稳定的恶意意图与不断演变的叙述策略解耦,解决直播风险评估中的战术性分布外偏移,在大规模工业数据集上取得优越性能。

0 人收藏 0 人点赞
#risk-assessment

PrivacyAkinator: 通过回答LLM生成的多选题阐述关键隐私设计决策

arXiv cs.AI · 2026-05-22 缓存

本文介绍了PrivacyAkinator,一个交互式工具,帮助新手开发者通过LLM生成的多选题来阐述隐私设计决策,与NIST的PRAM方法相比,在减少73%的时间的同时,识别出多47%的关键决策。

0 人收藏 0 人点赞
#risk-assessment

人工智能可设计病毒、毒素及其他生物武器。我们应担忧到什么程度?

Reddit r/ArtificialInteligence · 2026-05-13 缓存

本文探讨了人们对人工智能工具可能被用于设计危险生物武器的日益增长的担忧,并引用了一项近期的中国芋毒设计研究作为生物安全风险与科学利益之间辩论的焦点。

0 人收藏 0 人点赞
#risk-assessment

下一步会发生什么:面向紧急事件的大模型驱动推演

arXiv cs.AI · 2026-05-12 缓存

本文介绍了 WLDS,这是一个由大型语言模型驱动的系统,通过利用可控随机性和跨领域知识来模拟和推演紧急事件。文章提出了紧急事件推演(EID)基准,并展示了其在多个领域的高保真模拟能力。

0 人收藏 0 人点赞
#risk-assessment

迈向可安全审计的大模型智能体:一种统一的图表示方法

arXiv cs.AI · 2026-05-11 缓存

本文提出了 Agent-BOM,一种用于基于大语言模型(LLM)的智能体系统进行安全审计的统一图表示方法。它通过建模静态能力和动态运行时状态,解决了事后审计中的语义鸿沟问题,能够检测记忆投毒和工具误用等复杂的攻击链。

0 人收藏 0 人点赞
#risk-assessment

METR评估了Claude Mythos早期版本

Reddit r/singularity · 2026-05-09

METR于2026年3月使用其时间跨度任务套件对Claude Mythos Preview早期版本进行了评估,估计其50%-时间跨度至少为16小时,表明该模型处于当前基准测试可测量的上限水平,同时也指出在更长的时间范围内存在稳定性问题。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈