重复出现的 LLM 轨迹能否被合成为由类型化 ML 和 NLP 算子组成的确定性流水线?[D]

Reddit r/MachineLearning 论文

摘要

本文探讨了重复出现的 LLM 工作负载是否可以在适当情况下被自动合成的、由类型化 ML/NLP 算子组成的确定性流水线所替代,并征求关于可行性和方法的反馈。

我们正在研究,在适当的情况下,重复出现的 LLM 工作负载是否可以被自动构建的流水线所替代,这些流水线由正则表达式、确定性解析器、传统 ML 和 NLP 模型组成。例如,假设一个应用反复要求前沿模型阅读年度报告,并返回所有客户-供应商关系,作为包含客户、供应商和支持证据的结构化记录。一个可能的替代流水线可以运行命名实体识别、实体归一化、候选生成、实体链接、关系抽取和模式验证。一个经过校准的不确定性或分布外(out-of-distribution)门控会在输入处于其验证领域内时使用流水线,而对于其他情况则升级到原始前沿模型。NER → entity normalization → candidate generation → entity linking → relation extraction → schema validation 我们当前的动作空间是一个由 41 种原子任务类型组成的分类体系,涵盖分类、词元和片段标注、结构化抽取、检索与实体解析、相似度、归一化、重塑以及确定性计算。我们的想法是,首先将重复出现的轨迹聚类为工作负载族,并为每个族归纳出一个端到端的类型化契约。然后,使用这 41 种任务类型作为构建块生成候选 DAG,为每个节点实例化合适的实现,并在质量、成本和延迟方面优化组合。候选流水线将在时间分隔和组分隔的保留集上进行测试,然后才部署在弃权(abstention)和回退(fallback)机制之后。 即使契约被正确推断,仅凭输入和输出契约,问题本身也很可能是不确定的(undetermined)。因此,中间图并非恢复出的潜在推理轨迹,而是一个被假设为在有界输入分布上行为等效的合成程序。固定的任务分类体系可能有助于约束搜索空间,并提供类型签名、候选实现和特定任务的评估器。目前,我们将这个问题视为程序合成和形式化验证的一种形式,但也在思考这是否是正确的做法,以及是否有更好的方法。我们希望与在该问题领域和/或程序合成领域工作过的人交流,以获取见解。 TL;DR(太长不看):我们希望通过 LLM 轨迹为合适的任务合成由正则表达式、确定性解析器和 ML/NLP 模型组成的可执行 DAG。这看起来可行吗?有哪些好方法?
查看原文

相似文章

类型与神经网络

Hacker News Top

# 类型与神经网络 来源:[https://www.brunogavranovic.com/posts/2026-04-20-types-and-neural-networks.html](https://www.brunogavranovic.com/posts/2026-04-20-types-and-neural-networks.html) 发布于 2026 年 4 月 20 日 \[本文已同步发布至 [GLAIVE 博客](https://glaive-research.org/2026/04/20/types-and-neural-networks.html)\] 神经网络正被越来越多地应用于生成代码,主要针对那些支持高度泛型与可证明正确性编程的语言,如 Idris、Lean 和 Agda,fo

你的LLM不应该是你的编码智能体工作流

Reddit r/openclaw

主张在编码智能体工作流中,LLM应仅用于推理,而由确定性基础设施处理队列、状态、重试和恢复,这样即使达到使用限制,流程也不会中断。

让AI自动化消失

Hacker News Top

本文讨论了将非确定性LLM与确定性工具和正式工作流相结合以自动化AI开发的理念,并以Beagle SCM为例。它建议让LLM自行自动化消失,转而采用可靠的确定性流程。

用 LLM 优化 LLM:面向测试时扩展的智能体发现方法

Hugging Face Daily Papers

本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。