标签
介绍了RESPClinBench,一个用于呼吸科临床决策的真实世界场景基准,评估了七个LLM在COPD和肺结节病例上的表现。发现了任务特定的局限性,包括影像幻觉和用药安全风险。
构建营收智能体揭示出,最困难的挑战是防止看似合理但有缺陷的输出转化为实际行动。
本文评估了四种机器学习模型在政策偏好诱导中的离散选择建模,使用蒙特卡洛实验和真实能源政策案例研究,以评估在个体异质性和选择复杂性下的性能。
Jenova AI 的 What-If Analyst 是一款决策工具,可跨生活领域映射一阶、二阶和三阶效应,揭示隐藏的假设,并自动研究当前数据,支持 Web、iOS、Android,提供免费套餐和 API。
一篇博客文章警告,AI 编码代理通常会默认选择流行但不适用的技术,导致技术债务,并敦促开发者在架构决策中保持主导权。
本文介绍了心智世界建模(MWM),这是一个将隐藏的心理状态作为世界模型核心组件的框架,并提出了MENTIS,一个无需训练的基线。基于8个LLM世界模型的实验表明,显式的心智状态建模对于预测情境化场景中的人类决策至关重要。
本文探讨了人工智能是否真正改善了业务运营,还是仍然主要是炒作,并寻求在聊天机器人和内容生成之外,诸如减少任务、客户支持、数据分析和工作流自动化等领域的实际案例。
一篇哲学论述文章,主张关于AI使用的关键问题并非是否使用了AI,而是谁做出了决策、谁提供了方向,强调人类判断重于工具使用。
一位开发者演示了两个共享内存、完全在笔记本电脑上本地运行的AI智能体如何能够捕捉并阻止糟糕的决策,甚至在重启之后依然有效。关键在于,持久化的共享内存使得智能体能够像一个真正的团队一样运作。
介绍DFAH-Bench,一个用于衡量金融智能体决策中行为不稳定性的重放基准,发现仅凭结果一致性会遗漏显著的轨迹分歧。
本文主张不应盲目采用LLM,并提出了六个问题来评估LLM是否适合特定工作流程,强调LLM以确定性换取灵活性,仅在必要时才应使用。
本文认为,AI原生生物技术公司应使用一种称为公司世界模型(Company World Model)的核心计算抽象,而非模仿人类部门结构。文章引入了一个干实验基准来比较不同架构,发现价值转换架构(value-conversion architecture)优于人类组织模仿,但结果对目标敏感。
本文提出了一种决策感知的弱到强(W2S)学习框架,该框架利用有限的标注数据训练一个弱模型,然后由该模型在未标注数据上生成软监督信号,用于训练一个强模型,以改进上下文随机优化。理论界限和实证实验表明,当弱特征表示与强特征表示之间的相关性较小时,大量未标注数据能够降低下游决策风险。
本文探讨了如何确定面向客户的AI代理的合理边界和限制,重点讨论了何时允许其自主行动,何时需要人工监督。
一个MCP服务器,将异步优先的工作实践作为工具集成到AI助手中,允许用户起草决策文档、将会议转化为制品、对状态更新进行评分等。
研究表明,最小化预期自由能(EFE)等价于求解一个以预期信息增益为效用且探索权重固定为1的ρ-POMDP。证明了在“先观测后决策”POMDP中的等价性,并将其扩展到因子化观测POMDP,实验表明未调优的权重与仅依赖奖励的规划相比效果相当或更优。
本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。