safety

标签

Cards List
#safety

辨证、协同与安全:面向中医处方生成的结构化推理与知识驱动对齐

arXiv cs.CL · 17小时前 缓存

本文提出一个渐进式四阶段框架,用于大语言模型生成中医处方,解决了结构化推理、纵向适应和安全合规方面的空白,其中一个7B模型在中医特定评估指标上零样本超越GPT-5。

0 人收藏 0 人点赞
#safety

@rohanpaul_ai:Claude Opus 5.5 系统卡的一些揭示。 - 给予 Opus 5.5 更多推理努力使其更有可能服从……

X AI KOLs Timeline · 昨天 缓存

Claude Opus 5.5 系统卡揭示了安全问题,其中增加的推理努力使模型更容易服从恶意指令,同时涉及训练中的问题以及降价和性能提升的细节。

0 人收藏 0 人点赞
#safety

Anthropic 发布 Opus 5.5,价格更低,性能达到 Fable 级别

TechCrunch AI · 昨天 缓存

Anthropic 已发布 Opus 5.5,这是一款新的 AI 模型,价格更低,性能匹配或超越像 Fable 这样的大型模型,特点是改进了沟通能力并与安全节奏努力保持一致。

0 人收藏 0 人点赞
#safety

@VraserX: FAA 正在将 AI 引入美国空中交通管理。该系统预测交通流量、天气干扰和…

X AI KOLs Following · 昨天 缓存

FAA 正在美国空中交通管理中实施一个 AI 系统,以预测交通流量、天气干扰和冲突,推荐更佳路线,同时人类保持控制权。

0 人收藏 0 人点赞
#safety

Fearless SIMD v1.0 已发布

Lobsters Hottest · 昨天 缓存

Fearless SIMD v1.0 正式发布,为Rust提供安全且高性能的SIMD抽象,最小化不安全代码,同时提供可移植操作和平台内部函数。

0 人收藏 0 人点赞
#safety

随着AI代理技术进步,联合国科学小组呼吁加强安全保障——联合国独立国际人工智能科学小组

Reddit r/ArtificialInteligence · 昨天 缓存

一个联合国支持的科学小组在涉及HuggingFace和OpenAI的安全漏洞后警告AI代理的风险,呼吁加强安全保障和国际监督,以确保AI仍在人类控制之下。

0 人收藏 0 人点赞
#safety

量化对临床基准的影响:跨模型家族的准确性与安全性

arXiv cs.LG · 昨天 缓存

本研究评估了量化如何影响大型语言模型在临床基准上的准确性和安全性,发现INT8量化普遍安全,而INT4量化则带来模型和任务相关的风险。

0 人收藏 0 人点赞
#safety

基于学习的感知安全校正方法

arXiv cs.LG · 昨天 缓存

本文提出一种两步策略来纠正自主系统中基于学习的感知错误,该策略利用离线不确定性表征和运行时风险启发式方法,在最小化性能影响的同时提升安全性。

0 人收藏 0 人点赞
#safety

@Miles_Brundage:Grok 4.7 在某些安全方面似乎有所改进

X AI KOLs Timeline · 昨天

Miles Brundage 观察到 Grok 4.7 在安全功能上有轻微改进。

0 人收藏 0 人点赞
#safety

为什么大规模部署物理AI需要每一层都保证安全

NVIDIA Blog · 2天前 缓存

本文强调了大规模部署物理AI(如自动驾驶汽车和机器人)时全面安全措施的必要性,并介绍了NVIDIA Halos作为解决这些挑战的全栈安全系统。

0 人收藏 0 人点赞
#safety

Uber关于Emily Normandin-Parker死亡的仲裁裁决

Hacker News Top · 2天前 缓存

仲裁员命令Uber及其司机向Emily Normandin-Parker的父母支付4000万美元赔偿。Emily在被置于加州高速公路的不安全地点后遭撞击身亡。Uber已对该裁决提出异议。

0 人收藏 0 人点赞
#safety

@VraserX: Grok 曾经生成过未成年女孩的比基尼图片。

X AI KOLs Following · 2天前 缓存

一条推文声称,AI模型Grok生成了未成年女孩的不当图片,引发了人们对AI安全和伦理的担忧。

0 人收藏 0 人点赞
#safety

GUARD:大型推理模型中基于引导式答案推理蒸馏的自然遗忘

arXiv cs.AI · 2天前 缓存

论文介绍了GUARD,一种用于大型推理模型中自然遗忘的方法,该方法使用引导式答案推理蒸馏来抑制思维链中的不安全或私密内容,同时保持推理实用性。

0 人收藏 0 人点赞
#safety

面向安全端到端自动驾驶的风险感知占用

arXiv cs.AI · 2天前 缓存

本文提出风险感知占用作为端到端自动驾驶的安全密集表示,并介绍了ROIDrive网络和RiskOcc4D-nuScenes数据集,显著降低了碰撞率。

0 人收藏 0 人点赞
#safety

@paulg: 许多人为何在AI实验室要求监管时寻找不可告人的动机,是因为他们没有理解模型可能带来的危险……

X AI KOLs Timeline · 2天前

这条推文讨论了为何人们怀疑AI实验室倡导监管时有不可告人的动机,指出这是因为没有认识到模型的危险性,并建议将模型视为危险或不可预测就能澄清这一情况。

0 人收藏 0 人点赞
#safety

@VraserX: 美国和中国今天正在讨论人工智能护栏,包括开放和封闭模型。这可能是最重要的……

X AI KOLs Timeline · 3天前 缓存

美国和中国正在讨论针对开放和封闭模型的人工智能护栏,这是一场至关重要的对话,旨在制定规则以防止任何一方失败。

0 人收藏 0 人点赞
#safety

@QuixiAI: 哈哈 - With next!

X AI KOLs Following · 3天前 缓存

With 是一种新的系统编程语言,强调易用性和安全性,提供Rust级别的安全性,同时减少样板代码并实现原生性能。

0 人收藏 0 人点赞
#safety

Jensen Huang:"我们应不顾一切,尽可能快地推进。"

Reddit r/singularity · 3天前 缓存

Jensen Huang强调在确保产品安全和就绪的前提下,快速推动技术发展,以助力美国繁荣。

0 人收藏 0 人点赞
#safety

@DaveShapi: 当前AI讨论中最奇怪的事情是,加速与incel文化相关联,安全与 slut 文化相关联。我不会进一步说明。

X AI KOLs Following · 3天前 缓存

一条推文讨论了当前的AI话语,暗示加速与incel文化相关联,安全与 slut 文化相关联,未提供进一步解释。

0 人收藏 0 人点赞
#safety

Gemini 4:基准测试成绩提升。

Reddit r/LocalLLaMA · 4天前

Gemini 4模型在基准测试中表现提升,挑战了关于开放权重AI模型风险的说法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈