标签
Empero AI 发布了 Qwythos-9B,这是一个经过微调的推理模型,具有100万令牌的上下文和无审查能力,在基准测试中相比于其基础模型 Qwen3.5-9B 有显著提升。
认为使用LLM生成的代码调用外部工具(代码调用)比传统的基于JSON的函数调用更高效、功能更强,但需要安全的沙箱环境。作者正在为此方法构建一个框架。
文章提出在Coding Agent中,工具调用应视为契约而非简单函数,强调Harness在验证、权限、生命周期管理等环节的裁决作用,并详细讨论了工具契约的组成和生命周期。
Perplexity 发布 Search as Code (SaC) 新架构,让 AI agent 直接编写 Python 代码来编排搜索流水线,取代传统的 function calling,实现了更高效、更准确的搜索,在多个基准测试中表现优异。
GenesisFunc是一个自动化多智能体管道,用于为LLM中的函数调用生成高质量、多样化的合成训练数据。在此数据上微调一个8B模型,可以在领域内和跨领域性能上取得强劲表现,与某些基于API的模型相媲美。
一项在CPU函数调用上比较Needle 26M和Qwen3-0.6B的基准测试显示,较小的Needle模型在准确率和速度上胜出,但失败模式截然不同:Needle选择错误的工具,而Qwen3则经常无法发出工具调用。
介绍了反思式提示调优(RPT),一种利用LLM函数调用,基于系统性错误模式迭代诊断和修改提示的框架,从而提升推理任务性能和校准能力。
这篇文章总结了将AI Agent从Demo部署到生产环境过程中遇到的四个常见陷阱:function calling不可靠、多步任务失败率累积、记忆管理不当、以及安全权限问题,并给出了相应的解决方案。
在为服务型企业运行语音AI代理6个月后,作者揭示了现实世界中的延迟是双峰的(中位数约800ms,p95约2.4s),而p95决定了用户的感知。诸如VAD误触发、长提示词下函数调用退化、以及TTS质量等问题比LLM的选择更重要,而多语言支持则增加了显著的成本。
Cactus-Compute 发布了 Needle,这是一个拥有 2600 万参数的开源模型,从 Gemini 蒸馏而来。它采用一种不含 MLP 的新型“简单注意力网络”架构,旨在实现高效的端侧函数调用。
OpenAI 向 API 发布 o1 模型,具备生产就绪的功能,包括函数调用、结构化输出、视觉能力,以及比 o1-preview 低 60% 的延迟。其他开发者工具包括 Realtime API 改进、偏好微调,以及新的 Go 和 Java SDK。
OpenAI 发布了 Assistants API,使开发者能够构建具有持久线程、代码解释器、检索和函数调用功能的类似代理的体验。该公司还推出了自定义模型计划,让企业组织能够训练具有独占访问权的特定领域 GPT-4 模型。
OpenAI 宣布为 GPT-4 和 GPT-3.5-turbo 模型推出函数调用功能,允许开发者通过 JSON Schema 描述函数,让模型智能地选择输出结构化 JSON 以集成外部工具。此次更新还将对旧版模型的支持延长至 2024 年 6 月,并改进了模型评估方法。