标签
这篇文章报告了对确定性AI金融验证引擎的基准测试结果,显示在结构化声明上表现完美(66/66),但当使用LLM生成的声明时表现不佳(19/66),表明LLM与形式系统之间存在翻译差距。
本文介绍了一种使用LLM对电子商务查询进行分类的技术,其做法是让模型“幻觉”出假设性分类,再利用嵌入将其映射到真实分类体系,这比受限的结构化输出更便宜、也更简单。
一项研究表明,语言模型在需要填写JSON等结构化字段时会生成幻觉,即使它们在自由文本中会诚实地回避。PhantomFill基准测试衡量了强制编造率。
Chiron 是一个精确定位或拒绝的证据门,用于结构化输出,将声明验证为 VERIFIED(已验证)、REFUTED(已驳斥)或 REFUSED(已拒绝),并配有公开的评估历史记录和源代码。
关于使用 Pydantic AI 和 Pydantic Evals 确保 LLM 结构化输出的详细指南,涵盖结构验证、内容正确性和开放式判断。
本文研究了微调视觉语言模型生成稠密坐标列表如何创建可控干涉面,发现可移除重复压力而不牺牲定位精度。
探索递归语言模型(RLM)中一个常见的失败模式,其中自由文本子代理响应会导致问题,并提出一种使用结构化输出提高可靠性的解决方案,通过NarrativeQA中的长上下文问答示例进行说明。
参加了在柏林举办的应用人工智能大会,并做了关于构建文档代理的演讲,其中包括使用LlamaIndex构建的文档处理代理LobsterX的详细演示,该代理采用了结构化输出和事件驱动工作流。
本文引入了'约束税'这一概念,即小语言模型中结构化输出约束导致的准确性损失,并提出了一种测量协议来量化有效性与正确性之间的权衡。
作者分享了关于 JSON Schema 结构化输出在不同 AI 提供商(如 OpenAI、Gemini 和 Anthropic)之间缺乏可移植性的研究结果,强调了约束执行方面的一致性缺失,并为稳健的集成提供了实用建议。
本文识别了在策略蒸馏中结合奖励外推的一个安全阈值,超过该阈值后,结构化输出任务会丢失格式保持能力。实证验证表明,在该阈值以下运行,1.7B学生模型能够在Amazon Fashion任务上以五分之一的参数量匹配8B SFT基线。
OpenAI 向 API 发布 o1 模型,具备生产就绪的功能,包括函数调用、结构化输出、视觉能力,以及比 o1-preview 低 60% 的延迟。其他开发者工具包括 Realtime API 改进、偏好微调,以及新的 Go 和 Java SDK。
OpenAI 在其 API 中引入了结构化输出功能,使开发者能够可靠地从语言模型获取符合 JSON Schema 的输出,改进与下游系统的集成并减少解析错误。