标签
一位用户分享了对 Ornith 1.5 模型的正面评价,强调了其高推理速度和强大的工具调用能力,并在日常测试使用中将其与 Qwen 3.8 进行有利比较。
PROOF-Gen 提出了一种每个场景的反思优化方法,用于恢复失败的轨迹以蒸馏工具调用能力,从而提升蒸馏流程中的数据质量和模型性能。
描述了用于Agent Harness的推测性程序化工具调用方法,其中LLM在令牌流式传输期间队列化工具调用,作为代码执行中的未来值。
本文基准测试了经过微调的Qwen3.6-35B-A3B模型的工具调用能力,显示Ornith 1.5和Tiel-Coder表现最佳,接近更大Qwen模型的分数。该研究使用了大量GPU时间和tool-eval-bench工具进行评估。
Granite 4.2是IBM推出的新型推理LLM系列,提供3B、8B和30B尺寸,具备思考模式、工具调用功能,并在Apache 2.0许可证下通过多阶段强化学习流水线进行训练。
本文提出推测性编程工具调用(sPTC),一种优化AI框架中工具调用的技术。它受CPU和大语言模型中推测执行的启发,通过重叠执行与令牌生成来降低延迟。
本文介绍了一个专为AI智能体工具调用设计的48M参数模型的开发。该模型使用语法确保有效的JSON输出,并且开源,可在特定API目录上进行定制。
介绍 Speculative Programmatic Tool Calling (sPTC),一种在代码生成期间推测工具调用的技术,以与令牌生成和执行时间重叠,提高 AI 框架中的效率。
MobilePA-Bench是一个交互式基准测试,旨在评估移动规划智能体在复杂真实世界任务上的表现,重点考察工具调用、子智能体协作、记忆使用和运行时约束下的技能调用。
关于 Qwen3.8-27B 的社区反馈汇总,强调其在代理编码和工具调用方面的强大性能,同时指出在知识回忆和思考级别设置方面存在的问题。
一个通过QLoRA训练优化的微调版 Gemma 4 12B,适用于配备16GB VRAM的消费级GPU,可将工具调用可靠性提高2.7倍。
GLM 5.3 AI 模型目前可通过 ZenMux 和 Z.ai 免费使用,具备 1M 上下文窗口、最高 128K 输出以及支持 MCP 的工具调用功能。
DART-SD提出了一种拓扑感知的检索和调优框架,用于基于LLM的工具调用代理的自蒸馏,通过仅纠正关键拓扑断点并保留有效推理来提升策略多样性。
@mtasic85 证明了仅通过提示编程,无需微调,LFM2.5 2.6B 在工具调用和技能系统应用中可以表现接近 Qwen3.8 27B。
初创公司通过利用更智能的模型选择、推理和工具调用,学习如何使用GPT-5.6构建经济高效的AI代理来处理复杂工作。
作者使用JavaScript和LLM工具调用从零开始构建了一个网页搜索AI智能体,展示了无框架下的智能体构建,并将代码分享在GitHub上以获取反馈。
作者讨论了在CI/CD中由于LLM的非确定性,AI代理工具调用自动化回归测试面临的挑战,并寻求社区关于有效设置和痛点的见解。
一位从业者诚实地剖析了构建 AI 报告生成 Agent 的过程,说明 90% 的代码都是用来处理模型安静且自信的失败,并确保生产环境中的可靠性。