标签
在用于结构化数据提取的大语言模型流水线中添加自我纠正循环,导致一致性从85%下降到62%,原因在于复合噪声和再生漂移。文章探讨了潜在的解决方案,如细粒度差异机制或确定性门控。
本文针对BioASQ 14b Task B生物医学问答挑战,提出了一种问题类型特定的大语言模型框架。该框架对是非题、事实题和列表题分别采用不同的推理策略(片段打乱、思维链、多智能体协作),取得了具有竞争力的结果,包括在第四批次的事实题子任务中获得第一名。
FAPO是一个用于多步骤LLM流水线的全自动提示优化框架,结合了提示编辑和结构变化。在18次对比中,它在15次中优于GEPA基线,在安全任务上收益高达+33.8个百分点。
QUIVER 提出了一种形式化框架,用于量化在结构化为计算图的复合AI系统中扰动的传播方式,定义了灵敏度矩阵、轨迹发散、分岔阈值和分布忠实性,并在生产管道和公共管道上进行了验证。
本文将在多智能体LLM流水线中的工作流学习形式化为一个接口约束的半马尔可夫决策过程(IC-SMDP),并提出IC-ICQQ,一种异步分布式Q学习算法,具有有限样本界,可分解误差源,为分布式部分可观测性下的神经Q学习提供了首个有限样本保证。
本文提出了一种面向生产级文档AI管道的微服务架构,该架构结合了分类、OCR和LLM提取,分享了设计决策和批量分析洞察,揭示了OCR(而非LLM解析)主导了延迟。