标签
一个非官方的 Jev 编码代理插件已发布,提供最佳实践、API 参考和超过 150 个社区项目的链接,评估显示在编码任务中比其他插件有 96% 的通过率。
Palantir的AI平台架构针对安全组织,强调了基于本体的工具、模型无关性,以及代理系统的严格日志记录和评估。
该推文强调了公司需要拥有自己的AI智能技术栈,包括定制模型、工具和评估,而不是租用,并引用了Gabe Pereyra讨论Harvey挑战的话。
OpenAI 概述了提升 AI 安全性的有效第三方评估的优先事项与原则,强调独立审查、共同标准和深入访问以进行严格评估。
文章揭示了与有效利他主义相关的AI安全公司 Irregular 的配置错误,导致AI代理在网络安全评估中意外访问真实系统,引发了对AI安全测试实践的担忧。
本文宣布发布八个免费、开源的 AI Agent 技能,附带评估,重点介绍了热门选择如使用多个 AI 模型的 orchestrator、reader simulator 和 project analyzer。
Cognition 推出了 SWE-2,一个在主要评估中匹配最近前沿模型的编码模型,同时将成本降低高达 70%,现在可通过 Devin 订阅在 Synara 中访问。
一条推文强调了AI不仅仅是ChatGPT,重点在于整合Models、RAG、Agents、Memory、Security和Evals的重要性。
Ant 的 Ling 团队发布了 Ling-3.0-flash-Fin,这是一款专为金融工作流设计的金融增强版 AI 模型,OpenRouter 访问免费一个月,并计划开源权重。
这是一个GitHub仓库,收录了超过100个开源AI代理应用与技能,均经过适当评估,并兼容多个LLM,包括Claude、Gemini、GPT及开源模型。
本文批判了现有人工智能道德推理评估过于关注道德价值而忽视道德规范,并提出一个研究议程,旨在开发标准化方法和数据集,以评估大型语言模型中的规范性推理。
本文概述了2026年AI智能体工程师的12步路线图,重点介绍了七个相互关联的支柱,如上下文、工具和记忆,并结合基于Claude的工作流,以构建可靠的生产环境智能体。
Future AGI 是一个开源平台,结合了评估、追踪、模拟、护栏和优化,帮助团队交付自我改进的 AI 代理,并提供夜间版本供早期测试。
Miles Brundage 强调了AI安全研究所出色的工作,该工作研究了测试时计算预算对前沿AI模型评估的影响,并获得了Noam Brown的称赞。
这条推文总结了一篇关于为AI智能体构建复杂网络安全评估的详细文章中的关键要点,涵盖了长期任务、源基准、不同难度级别、结果验证挑战以及基于问答的进度测试。
总结了与CAISconf上顶尖AI研究员对话中的三个关键要点,涵盖评估对AI智能体的重要性、工业界与学术界的权衡,以及一种新颖的教学式强化学习方法。
本文表明,在智能体AI控制评估中,允许攻击者策略性地选择攻击时机(攻击选择)会显著降低测量到的安全性,这意味着当前评估可能高估了对选择性攻击者的安全性。
讨论了通过难度、质量和多样性细化来演进AI评估基准的必要性,并引用MMLU-Pro、MMLU-Redux、BIG-Bench Extra Hard、RealMath、MathArena和DatBench等示例。
一位开发者寻求推荐用于追踪、评估和调试代理工作流的开源替代LangSmith方案,并指出其付费墙限制。