MasterControl Seventeen 每次都可靠
摘要
本文介绍了一种受控分析框架,该框架将语言模型用于意图解释与确定性策略执行相结合,执行预批准的程序,在运行时规划代理失败的情况下实现了完全可靠性。
查看缓存全文
缓存时间: 2026/09/09 16:32
论文页面 - MasterControl Seventeen Every Time
来源:https://huggingface.co/papers/2609.03209
摘要
一种受管控的分析框架将语言模型用于意图解释,与预先批准程序的确定性策略执行相结合,在运行时规划智能体失败的场景中实现了完整的答案与证据可靠性。
我们研究了一种受管控的企业分析方法:语言模型(https://huggingface.co/papers?q=language%20model)解释问题,而确定性策略选择并运行一个预先批准的分析程序,该程序返回结果和证据。我们证明,在定义的分析类别内(使用关系操作加上聚合、比较、窗口、排名和相似度),这种限制仍然可以具有表达力。固定的含义、策略、数据和执行规则也使结果可重现。在440次运行中,三个8B模型在运行时生成SQL并选择工具,而Qwen3-8B(https://huggingface.co/papers?q=Qwen3-8B)仅解释意图,策略执行预先批准的程序。在所有测试数据集中,330个运行时规划(https://huggingface.co/papers?q=runtime-planning)实验中,没有一个完全满足答案与证据的约定;而策略驱动的分析器在110个实验中匹配了110个。这是一个特定配置的结果,并非运行时智能体(https://huggingface.co/papers?q=agents)在其他设计下无法成功的证据。
查看arXiv页面 (https://arxiv.org/abs/2609.03209) 查看PDF (https://arxiv.org/pdf/2609.03209) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.03209)
在你的智能体中获取此论文:
hf papers read 2609\.03209
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型关联此论文
在模型的README.md中引用 arxiv.org/abs/2609.03209 以将其链接到此页面。
引用本文的数据集0
无数据集关联此论文
在数据集的README.md中引用 arxiv.org/abs/2609.03209 以将其链接到此页面。
引用本文的Spaces0
无Space关联此论文
在Space的README.md中引用 arxiv.org/abs/2609.03209 以将其链接到此页面。
包含本文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
MasterControl Seventeen 每次运行
本文提出了一种用于受控数据分析的小型分析代数,证明了确定性策略执行方法在跨实验中保留分析意义和证据方面优于运行时规划。
你的智能体拥有基因组:LLM驱动的自主智能体的序列级行为分析与运行时治理
本文介绍了Base Sequence Analysis框架,该框架将LLM智能体的运行时行为编码为紧凑序列,揭示了高风险模式(如'P-X-P'三元组)和验证缺失。它提出了Governor,一个运行时干预系统,使任务成功率提高了6.2%,并将令牌消耗减少了44%。
神经代理控制:一种基于深度学习、LLM驱动的代理AI框架,用于安全控制的管控
本文介绍了一种神经代理控制框架,该框架将一个基于LLM的规划器(Gemini 2.5 Flash-Lite)与一个预训练的时间序列基础模型(TimesFM)相结合,用于工业物联网中基于物理的自主防御。一种反事实物理注入机制确保仅执行安全、非幻觉的动作,在SWaT数据集上实现了零无效动作,并且比LSTM和TCN基线具有更好的入侵预防效果。
@mikenevermiss: https://x.com/mikenevermiss/status/2066401066518802637
Boris Cherny 等人描述了从提示 AI 代理转向设计持续运行的自主循环,利用内存文件和评估器模式来保证代码质量。
运行时的管理自主性:基于档位的单/多智能体信息物理系统安全与治理
本文介绍了EntropyRuntime,一个用于单/多智能体LLM驱动及机器人智能体的离散时间控制系统,采用五个执行档位,配备效用门控调度和事件驱动回退,以确保安全、稳定和连续性。它提供了形式化证明,并在一个三智能体UR5机器人装配单元上进行评估,实现了99.6%的异常检测率。