decision-making

标签

Cards List
#decision-making

RESPClinBench:呼吸专科护理中多模态临床决策与纵向疾病管理的基准测试

arXiv cs.CL · 3天前 缓存

介绍了RESPClinBench,一个用于呼吸科临床决策的真实世界场景基准,评估了七个LLM在COPD和肺结节病例上的表现。发现了任务特定的局限性,包括影像幻觉和用药安全风险。

0 人收藏 0 人点赞
#decision-making

我们构建了一个营收智能体。难点在于防止看似合理的草稿变成糟糕的行动。

Reddit r/AI_Agents · 6天前

构建营收智能体揭示出,最困难的挑战是防止看似合理但有缺陷的输出转化为实际行动。

0 人收藏 0 人点赞
#decision-making

机器学习方法在复杂离散选择任务中增强决策制定的分析

arXiv cs.LG · 6天前 缓存

本文评估了四种机器学习模型在政策偏好诱导中的离散选择建模,使用蒙特卡洛实验和真实能源政策案例研究,以评估在个体异质性和选择复杂性下的性能。

0 人收藏 0 人点赞
#decision-making

@JenovaAIAgent:“优点:自由。缺点:没有收入。”并非分析。What-If Analyst 映射一阶、二阶、三阶效应,涵盖幸福……

X AI KOLs Following · 2026-07-30 缓存

Jenova AI 的 What-If Analyst 是一款决策工具,可跨生活领域映射一阶、二阶和三阶效应,揭示隐藏的假设,并自动研究当前数据,支持 Web、iOS、Android,提供免费套餐和 API。

0 人收藏 0 人点赞
#decision-making

@bibryam: 使用代理,保持主导权. https://devindickerson.dev/posts/using-agents-keeping-agency/…

X AI KOLs Timeline · 2026-07-29 缓存

一篇博客文章警告,AI 编码代理通常会默认选择流行但不适用的技术,导致技术债务,并敦促开发者在架构决策中保持主导权。

0 人收藏 0 人点赞
#decision-making

AI狂潮正在摧毁全球决策

Lobsters Hottest · 2026-07-29 缓存

作者认为,AI投资大多失败,并导致组织内部出现非理性决策,这源于集体性狂热而非实际成效。

0 人收藏 0 人点赞
#decision-making

心智世界建模

Hugging Face Daily Papers · 2026-07-29 缓存

本文介绍了心智世界建模(MWM),这是一个将隐藏的心理状态作为世界模型核心组件的框架,并提出了MENTIS,一个无需训练的基线。基于8个LLM世界模型的实验表明,显式的心智状态建模对于预测情境化场景中的人类决策至关重要。

0 人收藏 0 人点赞
#decision-making

人工智能真的在改善业务运营,还是目前大多是炒作?

Reddit r/ArtificialInteligence · 2026-07-27

本文探讨了人工智能是否真正改善了业务运营,还是仍然主要是炒作,并寻求在聊天机器人和内容生成之外,诸如减少任务、客户支持、数据分析和工作流自动化等领域的实际案例。

0 人收藏 0 人点赞
#decision-making

人人都在问“这是AI做的吗?”,却没人问“是谁做的决策?”

Reddit r/ArtificialInteligence · 2026-07-27

一篇哲学论述文章,主张关于AI使用的关键问题并非是否使用了AI,而是谁做出了决策、谁提供了方向,强调人类判断重于工具使用。

0 人收藏 0 人点赞
#decision-making

@PrajwalTomar_: 我试图偷偷将一项糟糕决策塞给我的AI智能体。它们没让我得逞。

X AI KOLs Following · 2026-07-24 缓存

一位开发者演示了两个共享内存、完全在笔记本电脑上本地运行的AI智能体如何能够捕捉并阻止糟糕的决策,甚至在重启之后依然有效。关键在于,持久化的共享内存使得智能体能够像一个真正的团队一样运作。

0 人收藏 0 人点赞
#decision-making

DFAH-Bench:金融决策中可观测智能体不稳定性的基准评测

arXiv cs.AI · 2026-07-24 缓存

介绍DFAH-Bench,一个用于衡量金融智能体决策中行为不稳定性的重放基准,发现仅凭结果一致性会遗漏显著的轨迹分歧。

0 人收藏 0 人点赞
#decision-making

Fathom

Product Hunt · 2026-07-23

Fathom 帮助将混乱的银行数据导出转化为清晰的财务决策。

0 人收藏 0 人点赞
#decision-making

在添加LLM之前要问的六个问题

Hacker News Top · 2026-07-22 缓存

本文主张不应盲目采用LLM,并提出了六个问题来评估LLM是否适合特定工作流程,强调LLM以确定性换取灵活性,仅在必要时才应使用。

0 人收藏 0 人点赞
#decision-making

AI原生生物技术公司是否需要部门?为AI驱动药物开发的公司世界模型基准测试

arXiv cs.AI · 2026-07-22 缓存

本文认为,AI原生生物技术公司应使用一种称为公司世界模型(Company World Model)的核心计算抽象,而非模仿人类部门结构。文章引入了一个干实验基准来比较不同架构,发现价值转换架构(value-conversion architecture)优于人类组织模仿,但结果对目标敏感。

0 人收藏 0 人点赞
#decision-making

决策中的弱到强学习

arXiv cs.LG · 2026-07-22 缓存

本文提出了一种决策感知的弱到强(W2S)学习框架,该框架利用有限的标注数据训练一个弱模型,然后由该模型在未标注数据上生成软监督信号,用于训练一个强模型,以改进上下文随机优化。理论界限和实证实验表明,当弱特征表示与强特征表示之间的相关性较小时,大量未标注数据能够降低下游决策风险。

0 人收藏 0 人点赞
#decision-making

不是工具,而是行动——防止AI自主决定提问的合同设计

Reddit r/AI_Agents · 2026-07-21

讨论了一种合同设计方法,旨在防止AI自主决定提问,将AI治理的重点从工具转向行动。

0 人收藏 0 人点赞
#decision-making

如何决定你的面向客户的代理不能自主执行哪些操作?

Reddit r/AI_Agents · 2026-07-21

本文探讨了如何确定面向客户的AI代理的合理边界和限制,重点讨论了何时允许其自主行动,何时需要人工监督。

0 人收藏 0 人点赞
#decision-making

Show HN: 一个将异步工作实践转化为工具的MCP服务器

Hacker News Top · 2026-07-21 缓存

一个MCP服务器,将异步优先的工作实践作为工具集成到AI助手中,允许用户起草决策文档、将会议转化为制品、对状态更新进行评分等。

0 人收藏 0 人点赞
#decision-making

预期自由能作为rho-POMDPs的信念依赖效用

arXiv cs.AI · 2026-07-21 缓存

研究表明,最小化预期自由能(EFE)等价于求解一个以预期信息增益为效用且探索权重固定为1的ρ-POMDP。证明了在“先观测后决策”POMDP中的等价性,并将其扩展到因子化观测POMDP,实验表明未调优的权重与仅依赖奖励的规划相比效果相当或更优。

0 人收藏 0 人点赞
#decision-making

一些大型语言模型表现出一致的风险态度

arXiv cs.AI · 2026-07-21 缓存

本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈