标签
育儿与婴儿顾问是一个AI智能体,提供从孕期到青年期循证的育儿指导,根据每个孩子的年龄和家庭需求进行适配。
TwinCheck 是一种推理时验证策略,通过使用基于证据的负孪生比较来增强有状态工具智能体,显著提升了如BFCL V4等基准测试中的任务成功率。
本文探讨了AI代理是否应该在行动和治理中被允许表达不确定性,例如说'我不知道',强调诚实沟通而非强制分类的价值。
GPS-Bench 是一个基于证据的治理政策模拟基准,它利用立法记录和公共证据来建模参与者和结果,从而实现对基于LLM的政策分析方法的受控比较。
Alternate Historian 是一个 AI 代理,将“假设”问题转化为严谨的历史思想实验,提供基于证据的分析,展示不同场景如何展开。
FaithMed 是一个框架,通过将临床医生设计的评分标准与使用步骤级过程奖励分配的强化学习相结合,训练LLMs进行忠实的循证医学推理,在多个医学基准上相比基线取得了显著改进。
本文提出了一种概念与方法论框架,用于评估AI辅助研究中的证据许可声明,强调校准作为管理科学断言权利的机制,并区分不同的AI研究路径。
PathPocket是一个多模态AI智能体协同助手,专门用于基于证据的病理学,利用全面的证据语料库和超图,在超过20万个真实病例上超越了现有最先进的方法。
提出EVIDENT框架,该框架整合贝叶斯训练与基于证据的排序进行神经架构选择,并在1型糖尿病的个体化血糖预测中演示,系统地选择泛化可靠的轻量模型。
本文提出了一种基于证据的模型,可从无查询摘要数据集中自动生成查询关键词,从而创建查询聚焦摘要数据集。实验结果表明,使用基于证据的查询生成的摘要与原始查询生成的摘要相比,获得了具有竞争力的ROUGE分数。
DeepER-Med引入了一个用于循证医学研究的智能体AI框架,具有明确的证据评价标准和新的基准数据集(DeepER-MedQA),包含100个专家精选的医学问题,相比生产平台表现更优,并通过真实案例的临床验证。