标签
精选链接,指向近期关于模型评估期间AI安全事件的报告,包括一起OpenAI/Hugging Face事件、Anthropic的网络安全评估,以及英国AISI关于未经授权的智能体行为的报告。
OpenAI的下一代主要模型Astra在智能体编码和网络安全方面展现出显著的能力提升,并且根据《准备框架》被视为网络安全领域的“关键”模型,计划实施额外的控制措施。
一项在 SWE-bench Pro 上比较 10 种编码智能体框架(harness)的研究表明,框架选择会显著影响 pass@1 和成本,并揭示厂商提供的框架对大型模型过拟合,无法迁移到较小的模型。
一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。
一位开发者描述了在模拟餐馆世界中运行 AI 智能体的经历,发现尽管模型和框架各不相同,但同样的三个与 API 相关的错误占主导地位:猜测不存在的端点、超出预算、以及基于过时的 ID 进行操作。展示了即使修复系统后,失败模式依然持续存在。
本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。
Google announces GA of Agent and Model Evaluations in Gemini Enterprise Agent Platform, enabling consistent measurement and monitoring of AI agents in dev and production with pre-built metrics, adaptive rubrics, simulators, and online monitors.
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。
讨论了ARC-AGI上25%的差异如何由测试框架设置导致,显示GPT-5.6 Sol在正确评估下得分38%,并批评了行业内天真的基准测试报告方式。
Cognition 总裁 Russell Kaplan 在访谈中回顾编码代理 Devon 的发展,讨论模型智能饱和、成本优化,并介绍新评估 Frontier Code 如何衡量代码可合并性。
AI智能体在通过评估后常因分布偏移和上游变更在生产环境中漂移;持续评估和实时监控可缓解此问题。
文章强调了关于新AI模型是否实际上比以前更差的激烈争论,指出真正的问题在于缺乏可靠的评估方法。
Vercel 发布了 DeepsecBench 基准测试,用于评估 AI 模型在应用程序代码中查找网络安全漏洞的能力,结果显示开源权重模型在安全扫描方面正变得更具成本效益。
本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。
本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。
本文讨论了Anthropic关于提示词精简的发现,以及Maka Agent在Terminal Bench 2.1上的验证结果,表明更强模型下过于冗长的系统提示词反而降低性能。
英国AISI与美国CAISI联合评估了Moonshot AI的Kimi K3模型在网络安全方面的能力,发现其在漏洞利用开发基准测试中与前沿美国模型具有竞争力。
本文介绍REGARD,一项使用Valence-Arousal-Dominance画像法测量LLM对后苏联实体情感框架差异的研究,揭示模型按情感强度和通用回答率聚类,而非按来源或规模聚类。
本文主张从被动的AI飞轮维护(出现错误时修补)转向主动的测试驱动方法,将反馈映射到任务条件的测试空间,并从数学上证明主动方法能以更少的迭代实现更好的长期扩展。