diagnosis

标签

Cards List
#diagnosis

在诊断CI故障时,AI代理应该跟踪哪些隐藏状态?

Reddit r/AI_Agents · 2026-08-14

本文讨论了AI代理在诊断CI故障时应跟踪的隐藏状态,如不稳定的测试、实际错误和配置错误,并征求关于弱点和缺失状态的反馈。

0 人收藏 0 人点赞
#diagnosis

SymDiag:基于神经符号验证的LLM推理可解释诊断

Hugging Face Daily Papers · 2026-08-09 缓存

SymDiag 是一种神经符号框架,将思维链推理转化为符号约束,并执行步骤级可满足性检查,以定位 LLM 推理中的失败,从而区分翻译错误与推理错误。

0 人收藏 0 人点赞
#diagnosis

未来几年,哪个医疗领域将从人工智能中受益最多?

Reddit r/AI_Agents · 2026-07-27

讨论未来几年哪个医疗领域将因人工智能发生最大变革,包括诊断、药物研发、患者监测和医学影像等领域。

0 人收藏 0 人点赞
#diagnosis

CRAFT:聚类评分标准以诊断弱项LLM能力并生成有针对性的微调数据

arXiv cs.AI · 2026-07-20 缓存

CRAFT将基于评分标准的评估转化为LLM的分层能力诊断,识别特定弱点并生成有针对性的微调数据,在四个开源模型的金融和法律基准上取得了更强结果。

0 人收藏 0 人点赞
#diagnosis

G-SHARE:一种基于指南的结构化推理框架,用于人因事件诊断

arXiv cs.CL · 2026-07-15 缓存

G-SHARE 是一种基于指南的结构化推理框架,用于核电站人因事件诊断。它将九步诊断指南操作化为一个多阶段流水线,包括证据提取、逐步推理和一致性修复,性能优于一次性大语言模型提示和传统基线方法。

0 人收藏 0 人点赞
#diagnosis

想象展开是运动学的,而非动力学的:长时程世界模型失败的诊断

Hugging Face Daily Papers · 2026-07-07 缓存

本文诊断了世界模型中的长时程失败,并将其归因于运动学而非动力学想象。作者引入了一个度量(iKCE),并表明即使策略奖励崩溃,想象展开也无法捕捉动态状态变化。

0 人收藏 0 人点赞
#diagnosis

诊断是生产代理中缺失的技能

Reddit r/AI_Agents · 2026-07-03

文章认为,诊断——用操作术语解释代理为何失败以及接下来安全做什么——是生产代理栈中缺失的一等技能,比让代理听起来聪明更重要。

0 人收藏 0 人点赞
#diagnosis

RareDxR1:超越人类标注的罕见病诊断自主医疗推理

arXiv cs.AI · 2026-07-02 缓存

介绍RareDxR1,一种端到端的以推理为中心的大语言模型,用于从非结构化临床笔记中进行开放域罕见病诊断,采用渐进式训练框架和反思增强推理采样,实现了最先进的准确率。

0 人收藏 0 人点赞
#diagnosis

一种专门用于加速罕见病诊断的推理型大型语言模型:一项随机AI医生辅助试验

arXiv cs.AI · 2026-06-24 缓存

本文介绍了RaDaR,一个320亿参数的开源推理型大语言模型,基于公开和合成的罕见病病例进行训练。在诊断基准测试中,其表现优于DeepSeek-R1等更大模型,并在随机试验中将医生诊断准确率提升了21.44个百分点。

0 人收藏 0 人点赞
#diagnosis

当代理过早承诺:诊断LLM代理的过早承诺

Hugging Face Daily Papers · 2026-06-22 缓存

本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。

0 人收藏 0 人点赞
#diagnosis

EBench:通用移动操作策略的基础诊断

Hugging Face Daily Papers · 2026-06-20 缓存

EBench 是一个用于通用移动操作策略的诊断基准,提供跨越26个任务和4个泛化维度的多维度概况,揭示超出总体成功率的架构性优缺点。

0 人收藏 0 人点赞
#diagnosis

@OpenAI: 罕见病诊断充满挑战,因为测序可能揭示数百万种变异,而医学知识不断变化……

X AI KOLs · 2026-06-18 缓存

OpenAI 强调 o3 Deep Research 如何通过整合临床特征、遗传模式、变异证据和科学文献,为专家提供可操作的假设,从而帮助罕见病诊断。

0 人收藏 0 人点赞
#diagnosis

EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准

arXiv cs.AI · 2026-06-01 缓存

EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。

0 人收藏 0 人点赞
#diagnosis

波士顿儿童医院利用AI解锁新诊断

OpenAI Blog · 2026-05-29 缓存

波士顿儿童医院已将人工智能整合到其临床和运营基础设施中,使用安全的ChatGPT环境诊断了40多种罕见疾病,降低了运营成本,并改善了护理服务。

0 人收藏 0 人点赞
#diagnosis

VBFDD-Agent:电动汽车电池故障检测与诊断——电池数字信号的描述性文本建模

arXiv cs.AI · 2026-05-22 缓存

本文提出了VBFDD-Agent,一种车辆电池故障检测与诊断代理,它利用电池信号的描述性文本建模、大语言模型和历史案例,为电动汽车电池生成可解释的诊断结果和维护建议。

0 人收藏 0 人点赞
#diagnosis

Elentaria

Product Hunt · 2026-05-18

Elentaria 是一款在 ProductHunt 上推出的产品,旨在帮助用户从诊断到执行的全流程市场进入策略。

0 人收藏 0 人点赞
#diagnosis

协调基于一致性的诊断与基于实际因果关系的解释

arXiv cs.AI · 2026-05-12 缓存

本文在可解释人工智能(XAI)的框架下,建立了基于一致性的诊断(Consistency-Based Diagnosis)与实际因果关系(Actual Causality)之间的联系。其目标是将这两个领域融合,以提升人工智能及可解释数据管理中的解释能力。

0 人收藏 0 人点赞
#diagnosis

MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试

arXiv cs.CL · 2026-04-20 缓存

MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。

0 人收藏 0 人点赞
#diagnosis

How AI Helps Solve Medical Mysteries at Boston Children’s Hospital | OpenAI Forum

YouTube AI Channels · 2026-08-05 缓存

OpenAI与波士顿儿童医院及哈佛大学Manton中心合作,在覆盖376病例的研究中利用AI工作流程辅助罕见病诊断,共促成18例确诊。核心方法是让AI进行文献检索、假设排序和证据汇总,再由人类遗传学家审查,而非直接给出结论。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈