ibm-research

标签

Cards List
#ibm-research

Granite.Trust Policy Tools: 面向生成式AI应用的可共享、可操作策略

arXiv cs.AI · 2026-08-26 缓存

本文介绍了Granite.Trust Policy Tools,该工具包含可操作策略模式和合成数据生成管道,旨在让组织在整个生成式AI应用生命周期内定义和执行可定制的安全策略。这些工具已开源,以促进更广泛的采用和贡献。

0 人收藏 0 人点赞
#ibm-research

考虑使用ACE?我们可以用更少的Token实现

Hugging Face Blog · 2026-08-11 缓存

IBM Research将其ALTK-Evolve方法与ACE进行比较,两者都是智能体记忆系统,允许LLM智能体从过去的轨迹中学习可复用的经验。ALTK-Evolve提供可单独检索的指导准则,而非单一的演进式操作手册,在减少Token使用的同时,保留带有支持计数的未压缩经验。

0 人收藏 0 人点赞
#ibm-research

模型路由很简单,直到它变得复杂。

Hugging Face Blog · 2026-07-15 缓存

IBM Research 解释了为什么智能体系统中的模型路由比简单的分类问题更复杂,指出缓存和隐藏因素(如实际工作负载成本和任务难度评估)使路由成为一个系统优化挑战。

0 人收藏 0 人点赞
#ibm-research

ScarfBench: 面向企业级Java框架迁移的AI智能体基准测试

Hugging Face Blog · 2026-06-30 缓存

IBM Research 推出 ScarfBench,这是一个用于评估AI智能体在跨框架Java迁移任务中表现的开放基准测试,重点关注 Spring、Jakarta EE 和 Quarkus。与传统的代码生成基准不同,该基准主要评估迁移后的应用程序是否能够构建、部署并保持原有行为。

0 人收藏 0 人点赞
#ibm-research

超越LLM:为何可扩展的企业AI落地依赖于Agent逻辑

Hugging Face Blog · 2026-06-01 缓存

IBM Research探索了Agent逻辑——诸如知识图谱和程序分析等软件原语——如何引导基于LLM的Agent高效处理复杂的企业工作流,减少幻觉和成本,同时改善结果。

0 人收藏 0 人点赞
#ibm-research

开放智能体排行榜

Hugging Face Blog · 2026-05-18 缓存

IBM Research 发布了开放智能体排行榜,这是一个开放的基准测试和评估框架,用于基于质量和成本比较完整的 AI 智能体系统,旨在衡量跨多样化任务的通用性。

1 人收藏 1 人点赞
← 返回首页

提交意见反馈