标签
本研究通过引入合成数据集并微调模型,扩展了 FunctionGemma 270M 以应用于实际的设备端 Android 工作流,实现了函数调用准确性的提升,同时平衡了性能和覆盖范围。
Google AI 开发者展示了如何使用 Gemini 3.8 Live Extended Thinking 构建一个编程导师,该导师通过分析屏幕并引用 p5.js 库来辅助调试。
本文介绍了一种封闭世界解决方案,用于应对LLM代理中的工具幻觉,并提供了一个分类体系和基准测试,以测量和解决虚构的工具调用。
Cactus Needle 3是一个小巧、可切片的基础模型,专为自动化任务设计,可在设备上运行,在函数调用和结构化提取方面达到与更大模型相当的性能。
由 typesafe AI 提供的 Jev 支持函数调用在用户输入时实时执行,无需等待回车键,即可理解意图和参数。
本文提出了一种面向边缘-云系统中功能调用LLMs的碳感知路由框架,在保持云级准确性的同时,将运营碳排放平均减少4倍。
一篇研究论文提出了一种方法,使用通过SLERP合并的单独GRPO专家来训练较小的自托管LLM,该LLM在企业任务上优于更大的基线模型,并以更低的成本服务一半的平台流量。
Liquid AI 发布了针对其 LFM 系列的 DSpark 草稿模型,结合推测解码,在设备上实现高达4倍的解码加速,同时保持输出质量。
本文研究了受限解码对工具调用放弃的影响,将语法约束的效果分解为停止和发射组件,并评估了跨语言小型开源模型的性能。
LiquidAI announces LFM2.5-VL-3B, an efficient vision-language model for edge hardware with improved screen understanding, grounding, multi-image input, and function calling, trained with 4x more vision data and post-training via SFT and RL.
InclusionAI(蚂蚁集团实验室)发布了Ling 3.0 Tiny,一个封闭API模型,总参数7.9B中激活1.3B,支持256K上下文、原生函数调用,并具备思考/即时模式,面向多轮智能体工具循环。文章质疑其效率曲线,并指出尚无独立评测或开放权重。
Data Turnstile is an open-source framework for generating high-quality synthetic function-calling training data from API specifications. Fine-tuning small language models with this data significantly improves their tool-use performance, closing the gap with much larger models.
SAAG提出了一种级联诊断框架,用于评估LLM智能体函数调用,通过将评估分解为注册一致性、结构完整性和参数基础验证三个阶段,实现可解释的诊断和迭代自我修复。在sub-4B模型上的实验表明,与单次评估相比,参数精度得到提升,值幻觉减少。
GnLOLot 发布了 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking 模型的 GGUF 量化版本。该模型是一个 10 亿参数的思考模型,基于 Fable 5 数据微调,相比 V1 版本在工具调用/函数调用方面有所改进,旨在通过 llama.cpp 及兼容运行时进行本地部署。
本文介绍如何将单轮RAG升级为Agentic RAG,通过让LLM自主决定多次检索和调用工具,解决复合问题的多步推理。提供了基于Qwen3.7-Max的代码示例和实现思路。
Google 正在扩展 Gemini API 中的托管代理,新增后台执行、远程 MCP 服务器集成、自定义函数调用和凭据刷新等功能,从而打造更可靠、更面向生产的代理。
ModelScope推出Agents-A1,一个35B MoE智能体模型,支持256K上下文和函数调用,在长周期任务和指令遵循上达到SOTA。
Qwythos 9B 是一款新的开源、无审查推理模型,基于Qwen3.5,提供GGUF量化版本,拥有100万token上下文、视觉能力和函数调用功能,性能相比基础模型有显著提升。
在Claude Mythos轨迹上训练了一个9B模型(Qwythos 9B),在漏洞查找、SQL和函数调用方面取得了强劲成果,同时在A6000上使用llama.cpp本地运行。
Empero AI 发布了 Qwythos-9B-Claude-Mythos-5-1M-GGUF,这是一个基于 5 亿以上 tokens 的 Claude Mythos/Fable 轨迹(包含思维链)微调而成的 9B 参数推理模型,相比 Qwen3.5-9B 取得了显著提升,并通过 YaRN 旋度缩放支持 100 万 token 上下文。GGUF 量化版本支持在 llama.cpp 及兼容运行时上进行本地推理。