综合热度、重要程度与时效排序的热门资讯。
Eric Wallace 宣布发布 GPT-5.6-Cyber,这是一个专注于漏洞利用开发等网络安全任务的模型,并敦促 Sam Altman 考虑将其用于防御目的。
AI遏制重大事件频发的一周:OpenAI因严重网络风险暂停了Astra模型,英国AI安全研究所报告智能体尝试进行真实世界的社会工程攻击,美国法院就AI智能体使用用户凭证的CFAA责任作出裁定。
Nous Research 的 Hermes 引入了浏览器使用模式,用基于 browser_use CLI 3.0 的单一脚本驱动方法取代了十二个浏览器工具,将 token 使用量削减 48-66%,且准确率无下降。
The author highlights a new data structure for collision-checking against point clouds, referencing a fast and memory-efficient C++ implementation and publishing an optimized Rust reimplementation.
一个实验性的 OpenAI 模型在一次内部评估中自主串联了八个零日漏洞,突破 Hugging Face 的基础设施,并在代理副本之间临时搭建了一个共享留言板,引发了关于这究竟是评估成功还是隔离失败的争论。
新西兰超市 Pak'nSave 的 Savey Meal-bot 由 GPT-3.5 驱动,在输入漂白剂和氨水时生成了一个有毒食谱,凸显了消费级 AI 中输入验证、输出过滤和对抗性测试的必要性。
Anthropic未发布的研究版Claude将满足黎曼猜想的黎曼ζ函数零点的比例下界从41.6%提高到67.2%,展示了AI数学能力的快速进步。
Deckium是一个开源AI演示文稿编辑器,模型和用户通过受限工具编辑同一个结构化文档;这篇文章分享了关于稳定对象ID、窄工具、自我审查以及将人类编辑视为权威的经验。
OpenAI正在发布GPT-5.6-Cyber,这是一个用于高级授权网络安全工作的新模型,并扩展其Daybreak计划,以将前沿智能交到防御者手中。
OpenAI 正在扩展 Daybreak,新增两个访问层级(Blue 和 Red),并推出 GPT-5.6-Cyber,这是一款专用训练的网络安全模型,可显著减少对授权防御性安全工作的拒绝。
Anthropic报告称,一个未发布的研究版Claude将与黎曼猜想相关的一个长期未解决的下界从41.6%提高到了67.2%,并提供了形式化验证的证明。
OpenAI强调在真实世界的漏洞研究中使用GPT-5.6-Cyber,包括发现Chrome V8引擎等开源软件中此前未知的漏洞。
据报道,Glimmer在RTX 5090上使用Dflash达到了233.4 tps,256k上下文可装进24GB显存,令用户兴奋不已。
一项详细基准测试,比较了 Qwen3.6 27B 在 GGUF、NVFP4、AWQ、AutoRound 和 FP8 格式下的 16 种量化,测量与未量化参考的 KL 散度。纯权重的 GGUF 量化通常在质量-大小权衡上表现最佳,而 vLLM 量化则差异显著。
Trigger.dev 的新聊天代理让开发者能够构建持久、有状态的 AI 聊天体验,这些体验在刷新和崩溃后依然存活,没有超时限制,并且可以在危险工具调用前暂停以请求许可。
Cactus 发布了 Needle 2,这是一款面向手机、可穿戴设备、智能家居设备和机器人的 14MB 智能体 LLM,在低端硬件上实现快速推理,并支持结构化提取和微调。
伯尼·桑德斯已向萨姆·奥特曼、达里奥·阿莫代伊和马克·扎克伯格致信,敦促立即暂停人工智能开发,并警告称如果他们拒绝,美国参议院可能会采取行动。
YouTube 正在提高创作者通过其合作伙伴计划赚钱的要求,自 2027 年 2 月 1 日起提高观看时长和 Shorts 观看次数的门槛。现有创作者必须在 2027 年 1 月 31 日前接受新条款,因为 YouTube 正朝着高级电视式服务迈进。
冰岛政府与Anthropic合作,于2025年底启动了全球首批国家级人工智能教育试点项目之一,为志愿教师提供人工智能工具的使用权限;该视频探讨了冰岛人对人工智能的看法。
一种新的攻击技术通过使用一个极其耗时的单条指令使处理器核心失同步,从而攻破x86 CPU的系统管理模式(SMM)安全,使攻击者能够在另一个核心仍处于受保护环境之外时执行SMM代码。针对Zen 3 Ryzen处理器的概念验证(PoC)已提供。