标签
本文介绍了Granite.Trust Policy Tools,该工具包含可操作策略模式和合成数据生成管道,旨在让组织在整个生成式AI应用生命周期内定义和执行可定制的安全策略。这些工具已开源,以促进更广泛的采用和贡献。
IBM Research将其ALTK-Evolve方法与ACE进行比较,两者都是智能体记忆系统,允许LLM智能体从过去的轨迹中学习可复用的经验。ALTK-Evolve提供可单独检索的指导准则,而非单一的演进式操作手册,在减少Token使用的同时,保留带有支持计数的未压缩经验。
IBM Research 解释了为什么智能体系统中的模型路由比简单的分类问题更复杂,指出缓存和隐藏因素(如实际工作负载成本和任务难度评估)使路由成为一个系统优化挑战。
IBM Research 推出 ScarfBench,这是一个用于评估AI智能体在跨框架Java迁移任务中表现的开放基准测试,重点关注 Spring、Jakarta EE 和 Quarkus。与传统的代码生成基准不同,该基准主要评估迁移后的应用程序是否能够构建、部署并保持原有行为。
IBM Research探索了Agent逻辑——诸如知识图谱和程序分析等软件原语——如何引导基于LLM的Agent高效处理复杂的企业工作流,减少幻觉和成本,同时改善结果。
IBM Research 发布了开放智能体排行榜,这是一个开放的基准测试和评估框架,用于基于质量和成本比较完整的 AI 智能体系统,旨在衡量跨多样化任务的通用性。