标签
CRAFT将基于评分标准的评估转化为LLM的分层能力诊断,识别特定弱点并生成有针对性的微调数据,在四个开源模型的金融和法律基准上取得了更强结果。
Vadim Fedenko 分享了关于递归自我改进(RSI)的技术分析,认为真正的 RSI 需要能力的提升速度快于复杂度的增长,并且要拓展架构空间,而不仅仅是在固定参数内优化。他对 xAI 和 Anthropic 近期提出的 RSI 可能在一两年内到来的说法表示怀疑,理由是当前的大语言模型(LLM)缺乏减法工程能力,且现有的奖励函数忽视了复杂度。
本文来自Anthropic,评估了像Claude Mythos Preview这样的大型语言模型如何加速N-day漏洞利用的开发。在针对Firefox和Windows内核补丁的测试中,该模型自主构建了有效的漏洞利用链,突显了补丁空窗期风险的增加。
解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。
本文介绍了一个有趣的实验:使用 Claude Code 充当用户态 IP 协议栈来处理 ICMP ping 请求,并测量响应延迟。
Paul Buchheit指出了现代序列到序列模型令人惊讶的零样本能力,即无需针对特定任务进行训练,也能生成命令行指令和Python程序,利用计算机视觉库直接通过像素画面来玩Doom。
数学家 Timothy Gowers 讲述了 ChatGPT 5.5 Pro 如何在约一小时内、几乎不需要人工干预的情况下,产出了博士级别的数学研究成果——解决了一篇组合数学/加法数论论文中的若干开放问题。这一经历促使他大幅修正了对大语言模型数学能力的评估。
用户询问ChatGPT生成文章的内部过程,特别是它是像人类一样综合信息并构建论点,还是简单复制现有文本。
安德烈·卡帕西在红杉资本Ascent 2026上的谈话摘要,重点介绍了三个主题:LLMs在速度提升之外开拓的新领域(例如原生图像处理、.md脚本、非结构化知识库)、模型能力'参差不齐'背后的经济学,以及智能体原生经济的崛起。