标签
Token Forecaster 是一款开源工具,可在执行前预测大语言模型(LLM)响应的长度,并实时监控。它基于本地历史数据提供准确性。
uivoid 现提供免费托管的 PostgreSQL 数据库,专为大语言模型设计,支持端到端系统创建与托管,集成身份验证和 MCP 服务器功能。
本文评估了用于ICD-10-CM编码的神经网络、工作流和代理系统,识别了罕见和复杂编码上的失败模式,并表明工具增强的代理配置可以在特定子集上恢复性能。
本文宣布发布八个免费、开源的 AI Agent 技能,附带评估,重点介绍了热门选择如使用多个 AI 模型的 orchestrator、reader simulator 和 project analyzer。
这篇文章探讨了为LLM设计专用工具的理由和好处,而不是让它们使用通用的人类工具,强调了LLM的独特需求和能力限制如何能增强其能力。
一个Python和TypeScript库,用于下载大型语言模型目录,并构建管道以根据价格、延迟和基准测试等标准过滤和选择模型。
本文详细介绍了使用 Arize Phoenix 和 OpenTelemetry 为 LangChain 应用实现成本和令牌可观测性的方法,重点区分 LLM 工具调用、工具执行和最终响应,以避免指标混淆。
MCP服务器使AI智能体能够将确定性任务卸载到像BrainyCalc这样的可信工具,确保在LLM可能出错的地方提供准确和可重复的结果。
WaterCrawl是一个开源Web应用,它爬取网站以将提取的内容转换为适用于大语言模型(LLM)的数据结构,使用Python、Django、Scrapy和Celery构建。
作者构建了Seendiff,一个用于代理代码审查的工具,以跟踪进度、与Claude等语言模型协作,并简化大型代码变更,同时询问其他人的审查流程。
WebMCP 是由 MCP-B 实现的协议,允许网站充当 MCP 服务器,通过标签页或扩展传输将浏览器 JavaScript 功能作为工具暴露给 LLM。该代码库仅出于历史参考目的维护。
用户发帖批评Kimi Code的交互设计,指出ask user question tool的提交方式不合理以及命令选择时容器高度变化导致状态栏抖动等问题,希望Kimi团队优化。
本文识别了自主LLM工具(如Claude Code)中的一种失效模式:会话压缩摘要将超时命令的部分终端输出误解为已确认结果,从而在跨会话和模型版本中传播误报,且未重新验证。
本文比较了在四个层面上用于智能体可靠性的热门开发者工具:追踪/评估、运行时护栏和网关。结果表明,没有一款开源工具能覆盖所有层面,大多数开发者会组合使用多种工具。
本文提出了 MCP 服务器的设计模式,以提升 LLM 工具选择的准确性,并发现可见工具过多会降低性能,尤其是对较弱的模型而言。
LiteLLM已从Python迁移到Rust,性能大幅提升:请求开销降低150倍至0.05ms,吞吐量提升15倍,内存占用降低11倍至32MB。
一条Twitter帖子列出了20个对AI工程至关重要的GitHub仓库,涵盖了本地AI代理、LLM、图像生成和工作流自动化方面的工具、框架和模型。
rtk 库通过压缩 shell 命令输出来减少 token 消耗,在两周内为编码代理节省了 250 万个 token。
LlamaIndex 用 Rust 重写了文档解析器,将 457 页 PDF 的解析时间缩短至 0.7 秒,开源免费且支持多种运行环境。