标签
一项针对 AI 在七个能力领域四年进展的分析,研究结果已针对底层基准的变化与漂移进行了校正,以更真实地反映模型的实际提升。
Output 是一个开源的 TypeScript 框架,用于构建 AI 工作流和智能体,面向 Claude Code 用户,将提示词、评估、追踪、成本追踪、编排和凭证统一在一个代码库中。主要功能包括工作流文件夹、版本控制的提示词、自动追踪、LLM-as-judge 评估,以及基于 Temporal 的持久化编排,采用 Apache 2.0 许可证发布。
本文提出了 Fable,一个受控数据集,包含从 174K 条真实用户提示中衍生出的 190,911 条英语提示变体。研究对 34 个开源权重的大语言模型进行了评估,结果表明,模型会反映出非母语者提示中更高级的修辞与词汇特征,从而为语言表达能力较弱的用户生成质量更低、流畅性更差的回答。
AutoDataBench 提出了一个受控的数据中心型测试平台,用于隔离并评估 LLM 智能体的“数据智能”——即诊断、组织和构建训练数据的能力,同时固定非数据因素,结果显示这些轨迹也可在中期训练中复用以带来增益。
一个非官方的 Jev 编码代理插件已发布,提供最佳实践、API 参考和超过 150 个社区项目的链接,评估显示在编码任务中比其他插件有 96% 的通过率。
Palantir的AI平台架构针对安全组织,强调了基于本体的工具、模型无关性,以及代理系统的严格日志记录和评估。
该推文强调了公司需要拥有自己的AI智能技术栈,包括定制模型、工具和评估,而不是租用,并引用了Gabe Pereyra讨论Harvey挑战的话。
OpenAI 概述了提升 AI 安全性的有效第三方评估的优先事项与原则,强调独立审查、共同标准和深入访问以进行严格评估。
文章揭示了与有效利他主义相关的AI安全公司 Irregular 的配置错误,导致AI代理在网络安全评估中意外访问真实系统,引发了对AI安全测试实践的担忧。
本文宣布发布八个免费、开源的 AI Agent 技能,附带评估,重点介绍了热门选择如使用多个 AI 模型的 orchestrator、reader simulator 和 project analyzer。
Cognition 推出了 SWE-2,一个在主要评估中匹配最近前沿模型的编码模型,同时将成本降低高达 70%,现在可通过 Devin 订阅在 Synara 中访问。
一条推文强调了AI不仅仅是ChatGPT,重点在于整合Models、RAG、Agents、Memory、Security和Evals的重要性。
Ant 的 Ling 团队发布了 Ling-3.0-flash-Fin,这是一款专为金融工作流设计的金融增强版 AI 模型,OpenRouter 访问免费一个月,并计划开源权重。
这是一个GitHub仓库,收录了超过100个开源AI代理应用与技能,均经过适当评估,并兼容多个LLM,包括Claude、Gemini、GPT及开源模型。
本文批判了现有人工智能道德推理评估过于关注道德价值而忽视道德规范,并提出一个研究议程,旨在开发标准化方法和数据集,以评估大型语言模型中的规范性推理。
本文概述了2026年AI智能体工程师的12步路线图,重点介绍了七个相互关联的支柱,如上下文、工具和记忆,并结合基于Claude的工作流,以构建可靠的生产环境智能体。
Future AGI 是一个开源平台,结合了评估、追踪、模拟、护栏和优化,帮助团队交付自我改进的 AI 代理,并提供夜间版本供早期测试。
Miles Brundage 强调了AI安全研究所出色的工作,该工作研究了测试时计算预算对前沿AI模型评估的影响,并获得了Noam Brown的称赞。
这条推文总结了一篇关于为AI智能体构建复杂网络安全评估的详细文章中的关键要点,涵盖了长期任务、源基准、不同难度级别、结果验证挑战以及基于问答的进度测试。