标签
本文分析了2053次真实患者与聊天机器人的对话,发现沟通风格差异巨大,且能显著改变分诊结果。研究表明,能够模拟情绪状态和对话策略的患者模拟器所生成的对话,在图灵测试中几乎与真实对话无法区分。
Google 正在为 Workspace 用户在 Gemini 应用中测试一个新的专用收件箱分区,具备过滤器功能,可在 Inbox Zero 工作流中对邮件和任务进行分类处理,将 Gemini 定位为整合的桌面工作空间。
Filippo Valsorda 认为,LLM 使得漏洞报告不再特殊,因为人工智能现在可以生成曾经只有人类研究人员才能提供的洞察,瓶颈已从发现转向分类。
本文探讨了AI智能体中每提示词模型路由的挑战,质疑是否有人真正有效解决了这个问题。文章指出,当前实践依赖直觉,固定费率计划降低了优化压力,而分流层本身也可能带来额外成本。
Warp CEO Zach Lloyd 提出了一个双层循环方法,让 AI Agent 的 Skill 从用户反馈中自我进化,以 GitHub issue 自动三分类为例,内循环处理新 issue,外循环收集信号并提炼规则,已开源框架 oz-for-oss。
这是一个使用 Claude Code 构建的自助式安全报告分类代理的演示,它可以读取电子邮件、在沙盒中访问源代码,并向用户发送建议的回复。
本文介绍了FETCH分类器,它使用大型语言模型集成来为自动化法律受理生成跟进问题,评估问题质量和成本权衡。研究发现,需要GPT-5等高成本模型才能提出有效的平实语言问题,并提出了评估此类问题的评分标准。
一条推文指出,许多AI认知将足以完成任务,剩余的工作涉及诊断性分类,例如决定是否值得花钱请律师。
SOC分析师违反政策,使用外部AI工具进行分类,导致内部数据泄露;现正在寻找经批准的替代方案,以避免数据处理风险。
介绍了TRIAGE,一个在令牌预算下评估大语言模型前瞻性元认知控制的框架,发现它们在跨问题有效分配计算资源的能力上存在显著差距。
本文提出了一种轻量级的、基于信号的框架,通过计算低成本指标来高效分流智能体交互轨迹,这些指标能识别出信息丰富的样本,且不影响在线智能体行为,在基准测试上实现了82%的信息率。