标签
本文讨论了AI代理在诊断CI故障时应跟踪的隐藏状态,如不稳定的测试、实际错误和配置错误,并征求关于弱点和缺失状态的反馈。
SymDiag 是一种神经符号框架,将思维链推理转化为符号约束,并执行步骤级可满足性检查,以定位 LLM 推理中的失败,从而区分翻译错误与推理错误。
CRAFT将基于评分标准的评估转化为LLM的分层能力诊断,识别特定弱点并生成有针对性的微调数据,在四个开源模型的金融和法律基准上取得了更强结果。
G-SHARE 是一种基于指南的结构化推理框架,用于核电站人因事件诊断。它将九步诊断指南操作化为一个多阶段流水线,包括证据提取、逐步推理和一致性修复,性能优于一次性大语言模型提示和传统基线方法。
本文诊断了世界模型中的长时程失败,并将其归因于运动学而非动力学想象。作者引入了一个度量(iKCE),并表明即使策略奖励崩溃,想象展开也无法捕捉动态状态变化。
介绍RareDxR1,一种端到端的以推理为中心的大语言模型,用于从非结构化临床笔记中进行开放域罕见病诊断,采用渐进式训练框架和反思增强推理采样,实现了最先进的准确率。
本文介绍了RaDaR,一个320亿参数的开源推理型大语言模型,基于公开和合成的罕见病病例进行训练。在诊断基准测试中,其表现优于DeepSeek-R1等更大模型,并在随机试验中将医生诊断准确率提升了21.44个百分点。
本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。
EBench 是一个用于通用移动操作策略的诊断基准,提供跨越26个任务和4个泛化维度的多维度概况,揭示超出总体成功率的架构性优缺点。
OpenAI 强调 o3 Deep Research 如何通过整合临床特征、遗传模式、变异证据和科学文献,为专家提供可操作的假设,从而帮助罕见病诊断。
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
波士顿儿童医院已将人工智能整合到其临床和运营基础设施中,使用安全的ChatGPT环境诊断了40多种罕见疾病,降低了运营成本,并改善了护理服务。
本文提出了VBFDD-Agent,一种车辆电池故障检测与诊断代理,它利用电池信号的描述性文本建模、大语言模型和历史案例,为电动汽车电池生成可解释的诊断结果和维护建议。
本文在可解释人工智能(XAI)的框架下,建立了基于一致性的诊断(Consistency-Based Diagnosis)与实际因果关系(Actual Causality)之间的联系。其目标是将这两个领域融合,以提升人工智能及可解释数据管理中的解释能力。
MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。
OpenAI与波士顿儿童医院及哈佛大学Manton中心合作,在覆盖376病例的研究中利用AI工作流程辅助罕见病诊断,共促成18例确诊。核心方法是让AI进行文献检索、假设排序和证据汇总,再由人类遗传学家审查,而非直接给出结论。