evaluation

标签

Cards List
#evaluation

@annabellschfr: Jev作为更复杂推理的守门人,其交接动态类似于代理与人类在环系统中的情况……

X AI KOLs Timeline ↗ · 5小时前 缓存

一篇论文描述了将JEV用于推理任务的门控,作为成本效益高的初审法官,在置信度较低时升级到大语言模型或人类。

0 人收藏 0 人点赞
#evaluation

什么会让你在实际的代理工作流中信任它?

Reddit r/AI_Agents ↗ · 11小时前

文章讨论了评估匿名AI模型Space Bunny在代理工作流中的方法,重点是状态测试、错误恢复和一致性以确保可靠性。

0 人收藏 0 人点赞
#evaluation

IndicBankBench: 评估印度零售银行语言模型助手的安全性与可靠性

arXiv cs.AI ↗ · 15小时前 缓存

介绍了IndicBankBench,一个包含799个案例的基准测试,用于评估印度零售银行语言模型助手的安全性和可靠性,采用多阶段评估,并公开发布代码和数据。

0 人收藏 0 人点赞
#evaluation

评估 Wavelet-Diffusion 降水降尺度的跨区域泛化能力

arXiv cs.LG ↗ · 15小时前 缓存

本研究使用美国区域数据评估了 Wavelet Diffusion 模型在降水降尺度中的跨区域和跨事件泛化能力,表明在有限区域训练的模型在未见区域也能表现出竞争力。

0 人收藏 0 人点赞
#evaluation

PFArena:蛋白质修饰任务的语言模型基准测试

arXiv cs.AI ↗ · 15小时前 缓存

PFArena 提出了一个用于评估语言模型在蛋白质修饰任务上表现的基准测试,通过比较蛋白质语言模型和大型语言模型,评估它们在生物应用中的能力。

0 人收藏 0 人点赞
#evaluation

RECLAIM:智能体能否复现机器学习论文的主张?

arXiv cs.AI ↗ · 15小时前 缓存

RECLAIM 是一个针对人工智能智能体的基准测试,用于复现机器学习论文中的主张,其难度层级基于可用的代码、数据和权重。研究表明智能体在复现结果时面临困难,在最简单的层级中,最佳成功率为41%。

0 人收藏 0 人点赞
#evaluation

StepCOPS:基于闭式测试下限证书的语言模型策略选择

arXiv cs.CL ↗ · 15小时前 缓存

StepCOPS是一种统计框架,用于选择语言模型策略,采用闭式测试和下限证书,以高概率确保安全保障,提高了效率,优于保守方法。

0 人收藏 0 人点赞
#evaluation

通过生成顺序干预评估解释驱动的视觉-语言推理

arXiv cs.CL ↗ · 15小时前 缓存

本文通过生成顺序干预评估了视觉-语言推理中解释与模型预测之间的因果联系,发现需要更大的模型进行理由优先推理,而答案优先生成能减少格式相关的错误。

0 人收藏 0 人点赞
#evaluation

被说服而非被告知:激励不一致的证人击败 In-Context Grounding

arXiv cs.CL ↗ · 15小时前 缓存

本文识别了一种故障模式,其中语言模型被CRM记录中激励不一致的证人的断言所说服,导致错误决策,并提出了一种诊断方法来分析此问题。

0 人收藏 0 人点赞
#evaluation

一个财务基准测试要求智能体完成整个任务(阅读时长18分钟)

TLDR AI ↗ · 19小时前 缓存

由Surge AI推出的名为DAYJOB的财务基准测试评估AI代理在完成财务预测任务时的表现,其详细的通过/失败标准重点关注净销售额计算和收入增长预测中的错误。

0 人收藏 0 人点赞
#evaluation

@snwiki238337: 如何将Jev这样的新型范式模型作为新组件集成到代理编排框架中。并增强……

X AI KOLs Timeline ↗ · 20小时前 缓存

本文解释了如何将Jev AI模型集成到代理编排框架中,以实现智能模型路由、自动模式下的风险拦截和自动化评估,详情可参考LangChain视频。

0 人收藏 0 人点赞
#evaluation

@LangChain:Interrupt NYC 炉边对话最终环节,与 @RogoAI 联合创始人兼首席执行官 @gabestengel 共同探讨大规模评估代理式AI…

X AI KOLs Following ↗ · 23小时前 缓存

这场在 Interrupt NYC 举办的炉边对话中,RogoAI 首席执行官与 LinkedIn 讨论了大规模评估代理式AI的问题。

0 人收藏 0 人点赞
#evaluation

@LangChain:介绍 LangSmith 自定义应用 – 通过提示词从您的代理数据创建任何界面。只要您能想到,LangSmith 就能构建……

X AI KOLs Timeline ↗ · 昨天 缓存

LangSmith 推出了自定义应用,现已全面可用,允许用户在平台上为他们的代理数据构建和发布自定义界面,以增强标注和实验比较等工作流程。

0 人收藏 0 人点赞
#evaluation

Anthropic 声称约 950 个 Claude 代理花了 21 小时研究一个酶先导物。什么才算发现?

Reddit r/AI_Agents ↗ · 昨天

Anthropic 报告称,使用约 950 个 Claude 代理在 21 小时内识别出酶研究中的潜在生物先导物,但该结果是初步的,并引发了关于在科学中验证 AI 代理工作流程的问题。

0 人收藏 0 人点赞
#evaluation

教训:不要盲目相信仓库,确保长时间运行(多周)的基准测试稳定可靠。

Reddit r/LocalLLaMA ↗ · 昨天

作者分享了长时间运行的Django基准测试中学到的教训,强调了在评估工作流程稳定性方面的修复,以及更新后的结果,显示Flash Next是表现最佳的模型,现在推理努力级别得到了正确评估。

0 人收藏 0 人点赞
#evaluation

Forecast Workflow Bench:使用预算预测工具评估语言模型决策

arXiv cs.LG ↗ · 昨天 缓存

FWBench 引入了一个基准,用于评估语言模型如何选择和使用时间序列预测来做出成本约束决策,并在电力和共享单车租赁数据集上比较托管与本地配置,同时由 GPT-6 Astra 实现高效的预算使用。

0 人收藏 0 人点赞
#evaluation

知识库补全忠实度标准的层次结构

arXiv cs.AI ↗ · 昨天 缓存

本文定义了知识库补全模型的忠实度标准层次结构,并评估了当前的嵌入模型,发现它们在逻辑上不忠实。

0 人收藏 0 人点赞
#evaluation

并非所想:大型语言模型能否遵循指定的否定语义?

arXiv cs.AI ↗ · 昨天 缓存

本文介绍了NAF-Bench,用于研究大型语言模型对指定否定语义的遵守情况。研究发现,像o4-mini这样的前沿模型表现良好,而开源模型则滞后。建议通过求解器委托或微调来改进。

0 人收藏 0 人点赞
#evaluation

路径的重要性:在KGQA中超越答案准确率评估小型语言模型

arXiv cs.CL ↗ · 昨天 缓存

本文通过分离图导航能力,对KGQA中的小型语言模型进行超越答案准确率的评估,结果显示路径保真度存在显著差异,并强调需要更广泛的评估指标。

0 人收藏 0 人点赞
#evaluation

MolDesignBench:评估基于场景的分子设计的LLM智能体

arXiv cs.AI ↗ · 昨天 缓存

MolDesignBench是一个新的基准测试,用于评估基于场景的分子设计中的LLM智能体,包含2000个具有隐式和显式约束的实例,揭示了当前前沿的LLMs成功率较低,尤其是在推理隐式约束和检测不可行性方面。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈