标签
OpenAI 宣布即将推出其下一个模型 Astra,强调在 AI 能力与安全和对齐进展之间取得平衡的必要性。
BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。
本文介绍了参考嫁接法,一种通过编辑激活来引出AI模型沙袋能力的方法,其效果与微调相当,无需权重更新或训练标签。
本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。
文章讨论了AI智能体已经被赋予了物理交互(双手)和语音通信的能力,但大多数仍然缺乏视觉感知(眼睛),突出了这一关键局限。
观察到除OpenAI、Anthropic和DeepMind之外,还有几个AI实验室拥有可能因经济激励而永远不会公开分享的最先进能力。
本文介绍了Portico,一种用于编程代理可撤销能力的参考监视器,解决了“持久授权”问题——临时资源访问在其使用场景结束后仍暴露在外。研究表明,Portico通过在任务关闭后撤销权限来强制执行任务契约,阻止了被禁止的效果。
Anthropic发布了五个研讨会,详细介绍了Fable 5的最新能力和使用场景,涵盖深度探索、托管代理和部署策略。
GPT 5.6 Lunatic以显著更低的价格(输入1美元,输出6美元)提供了与GPT 5.4相当的能力,使其成为Gemini Flash和GPT 5.4 mini的有力替代品。
Fiona 认为 AI 抬高了做事的天花板,一个不懂移动端的工程师借助 Claude 补上了 App 端功能。
文章澄清了 AI 模型 Mythos 并非通过黑客技术训练,并预测其他 AI 实验室最终将具备类似能力。
Ethan Mollick评测了Mythos级别的AI模型Claude 5 Fable的早期访问版,认为相比之前的模型,这是一个重大飞跃,能够通过单条提示生成复杂的游戏、学术论文和地图,暗示人机交互方式的转变。
Fil-C 0.679 是一个全新版本,它是 C 和 C++ 的一种极度兼容的内存安全实现,采用并发垃圾回收和隐形能力来防止所有内存安全错误,且没有逃生舱口。
解释中间训练作为预训练和后训练之间的一个阶段,基础模型在精选数据上继续训练,以增强特定能力,然后再进行指令微调。
Zero 简介:一种为 AI 智能体设计的编程语言,具备显式能力、JSON 诊断和类型安全修复功能。
Tejal Patwardhan 分享了她在 OpenAI 从事评估工作的经历,讲述了她从低估模型到意识到模型远超预期的转变,并以 o1 模型发布时脱离沙盒的安全事件作为关键转折点。