ibm-research

标签

Cards List
#ibm-research

模型路由很简单,直到它变得复杂。

Hugging Face Blog · 2026-07-15 缓存

IBM Research 解释了为什么智能体系统中的模型路由比简单的分类问题更复杂,指出缓存和隐藏因素(如实际工作负载成本和任务难度评估)使路由成为一个系统优化挑战。

0 人收藏 0 人点赞
#ibm-research

ScarfBench: 面向企业级Java框架迁移的AI智能体基准测试

Hugging Face Blog · 2026-06-30 缓存

IBM Research 推出 ScarfBench,这是一个用于评估AI智能体在跨框架Java迁移任务中表现的开放基准测试,重点关注 Spring、Jakarta EE 和 Quarkus。与传统的代码生成基准不同,该基准主要评估迁移后的应用程序是否能够构建、部署并保持原有行为。

0 人收藏 0 人点赞
#ibm-research

超越LLM:为何可扩展的企业AI落地依赖于Agent逻辑

Hugging Face Blog · 2026-06-01 缓存

IBM Research探索了Agent逻辑——诸如知识图谱和程序分析等软件原语——如何引导基于LLM的Agent高效处理复杂的企业工作流,减少幻觉和成本,同时改善结果。

0 人收藏 0 人点赞
#ibm-research

开放智能体排行榜

Hugging Face Blog · 2026-05-18 缓存

IBM Research 发布了开放智能体排行榜,这是一个开放的基准测试和评估框架,用于基于质量和成本比较完整的 AI 智能体系统,旨在衡量跨多样化任务的通用性。

1 人收藏 1 人点赞
← 返回首页

提交意见反馈