标签
Jenny 是一款免费、开源的 Electron 桌面应用,用于运行本地 LLM,支持工具调用、回滚和 IDE 功能,作为一个独立项目开发了超过 1.5 年。
作者探讨了使用控制工具管理AI编码代理的重要性,并分享了借助Cursor、Claude和Deepseek等工具提升生产力和模型使用成本效益的技巧。
本文介绍了一个用于精确比分足球预测的可审计LLM框架,该框架在四个系统迭代中整合了动态泊松族模型与基于LLM的上下文推理,并提供了2025-26赛季英格兰足球超级联赛比赛的探索性结果。
本文探讨了设计LLM控制框架的原则,旨在使其直观、透明且精简,借鉴Unix哲学以减少认知负荷并提高可靠性。
AgentScope团队推出了PawBench,这是一个用于评估模型与代理框架综合性能的基准测试。通过对4,050个测试单元的分析,结果表明框架选择的影响堪比模型升级。
Browser Use 0.13.0 是完全用Rust重写的,提供了针对最先进模型优化的自定义LLM和浏览器框架,取代了之前以GPT-4为中心的版本。
Browser Use Terminal 是一个用于浏览器代理的 Rust TUI,允许用户从终端自动化浏览器任务,它配备了一个新的LLM harness,比Browser Harness便宜2倍且快2倍。
作者更新了自定义的适配器和 UI 桥接工具,以便通过 llama.cpp 在本地 RTX 5090 上运行 Qwen 3.6 模型,从而在 GitHub Copilot Codex 中使用。本文详细介绍了已实现的功能、修复的 Bug 以及在实现与原生 OpenAI 模型等效性方面仍存在的局限性。
作者分享了一次调试经历:代理循环是由框架截断工具输出导致的,而非模型故障,突显了代理基础设施相比模型存在的可靠性差距。