标签
本文提出了一个从初步筛选预测可量化性以在药物发现中优先安排剂量反应分析的框架,表明效力估计的可用性可以与生物活性区分开来。
一项针对GPT-4o-mini的仿真研究发现,将分诊决策分布到带有审计阶段的多智能体流水线中并不会减少偏见结果,但审计能力显著影响偏见是否被发现。按估计风险对审计进行重新排序,可以在负载下恢复大部分丢失的覆盖范围。
本文介绍了Guideline-as-Oracle(GAO),一种通过将美国眼科学会指南编译成70行规则表并用于生成3000个训练对话,从而对多轮眼科电话分诊代理进行零标注训练的方法。在此语料上微调一个9B模型,可将与操作参考的一致性从61.7%提升至74.1%,紧急病例召回率从9.5%提升至69.0%,且在推理时无需前沿模型即可超越多个通用系统。
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。
一位开发者构建了一个基于Go的AI代理,使用只读工具对SAST扫描器的误报进行分类,并在OWASP BenchmarkJava上使用Claude Sonnet、DeepSeek-V4-Pro和Kimi k3进行测试,取得了强劲的结果,尤其是Kimi k3。
本文分析了2053次真实患者与聊天机器人的对话,发现沟通风格差异巨大,且能显著改变分诊结果。研究表明,能够模拟情绪状态和对话策略的患者模拟器所生成的对话,在图灵测试中几乎与真实对话无法区分。
Google 正在为 Workspace 用户在 Gemini 应用中测试一个新的专用收件箱分区,具备过滤器功能,可在 Inbox Zero 工作流中对邮件和任务进行分类处理,将 Gemini 定位为整合的桌面工作空间。
Filippo Valsorda 认为,LLM 使得漏洞报告不再特殊,因为人工智能现在可以生成曾经只有人类研究人员才能提供的洞察,瓶颈已从发现转向分类。
本文探讨了AI智能体中每提示词模型路由的挑战,质疑是否有人真正有效解决了这个问题。文章指出,当前实践依赖直觉,固定费率计划降低了优化压力,而分流层本身也可能带来额外成本。
Warp CEO Zach Lloyd 提出了一个双层循环方法,让 AI Agent 的 Skill 从用户反馈中自我进化,以 GitHub issue 自动三分类为例,内循环处理新 issue,外循环收集信号并提炼规则,已开源框架 oz-for-oss。
这是一个使用 Claude Code 构建的自助式安全报告分类代理的演示,它可以读取电子邮件、在沙盒中访问源代码,并向用户发送建议的回复。
本文介绍了FETCH分类器,它使用大型语言模型集成来为自动化法律受理生成跟进问题,评估问题质量和成本权衡。研究发现,需要GPT-5等高成本模型才能提出有效的平实语言问题,并提出了评估此类问题的评分标准。
一条推文指出,许多AI认知将足以完成任务,剩余的工作涉及诊断性分类,例如决定是否值得花钱请律师。
SOC分析师违反政策,使用外部AI工具进行分类,导致内部数据泄露;现正在寻找经批准的替代方案,以避免数据处理风险。
介绍了TRIAGE,一个在令牌预算下评估大语言模型前瞻性元认知控制的框架,发现它们在跨问题有效分配计算资源的能力上存在显著差距。
本文提出了一种轻量级的、基于信号的框架,通过计算低成本指标来高效分流智能体交互轨迹,这些指标能识别出信息丰富的样本,且不影响在线智能体行为,在基准测试上实现了82%的信息率。