标签
本文发现,基于API和聊天机器人界面等访问模式,大型语言模型在健康建议输出上存在系统性差异,这削弱了评估的有效性。它呼吁模型提供商启用对消费者体验的忠实复制,以进行严格审计。
WearableQA 是一个基准数据集,包含 4,084 道多选题,用于基于真实世界可穿戴数据的健康推理,旨在评估 AI 模型在纵向健康数据分析方面的性能。
WearableQA 是一个用于评估大型语言模型在真实世界可穿戴健康数据上推理能力的基准,它使用从纵向测量中衍生的多选题。
本文介绍了一个知识引导的代理框架,该框架识别健康查询中缺失的患者上下文,并提出针对性的后续问题,以提高下游语言模型响应的准确性和一致性。
Google Research 推出 PhotoScan,这是一个深度学习框架,能从标准智能手机照片中估算身体成分指标,以预测胰岛素抵抗和心血管代谢风险,达到接近DXA的准确度。
Google Research 和 Google DeepMind 的 AMIE 医疗 AI 系统在一项首创性随机研究中展示了专家级的实时视听临床会诊能力,临床评估人员在核心能力方面给予其好评。
介绍一种名为Combodied Agents的新范式,它统一了数字智能体和具身智能体,以建模、预测并长期支持个体人类状态轨迹,重点关注人类的持续福祉而非任务完成。
这篇arXiv论文评估了在来自三个医疗系统的ICU EHR数据上,对令牌化生成式事件模型(GEMs)进行联邦训练的效果,结果表明联邦学习能够保留集中式训练的大部分性能,并且与传统监督模型相比,提高了跨站点的可迁移性。
HealthClaw 是一个开源的代理架构,用于纵向个人健康管理,它使用自进化记忆来改进对重复交互的支持,在生物医学任务中实现了比基线更高的准确性和隐私性。
RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。
本研究评估了大型语言模型(Gemini 3.0 Flash)结合个人健康记录回答患者健康查询的效果,发现当提供PHR上下文时,在有用性、安全性和个性化方面有显著改善。
本文批评了Mark Kaplan通过其平台healtthruth.ai微调医疗大语言模型的方法,指出了在医疗AI中覆盖基础训练的陷阱。
<p> 跨记录、化验、可穿戴设备提问健康 </p> <p> <a href="https://www.producthunt.com/products/perplexity-ai?utm_campaign=producthunt-atom-posts-feed&utm_medium=rss-feed&utm_source=producthunt-atom-posts-feed">讨论</a> | <a href="https://www.producthunt.com/r/p/1102596?app_id=339">链接</a> </p>
OpenAI 推出 ChatGPT Health,这是一项专为增强隐私和安全而设计的专属体验,用户可安全连接医疗记录和健康应用,获取更个性化的健康指导。该功能针对 ChatGPT 上常见的健康查询用例(每周超过 2.3 亿用户),同时严格隔离数据,并拒绝将健康对话用于模型训练。