标签
LLM-as-a-Verifier 是一个通用的验证框架,为AI代理提供细粒度反馈,在Terminal-Bench和SWE-Bench等基准测试上实现了最先进的性能。
FrontierHarness Eval 对九个软件工程测试框架在单一模型上进行基准测试,表明根据所使用的测试框架,每个成功任务的成本差异最高可达17倍。
这篇文章介绍了一个AI技能合集网站,提供了78个分类整理的技能,用于增强AI代理在编码、设计、研究等方面的能力。
KeenableAI 被宣布为一款专门为AI代理设计的AI原生搜索引擎,拥有自己的爬虫、网页索引和基础设施,以改善延迟、质量和成本效率。
用户成功使用edulab Skills在Qwen3.8 27B模型上生成3D立体几何解题演示,并讨论了在特定硬件配置下的性能表现和优化需求。
SkillEffect 引入了一个用于 AI 代理工具的检查下降运行时,通过审计实现强制执行内存边界,从而显著降低峰值内存使用并提高内存受限条件下的完成率。
一条推文探讨了AI技能在流程持续改进方面的不足,提出一个潜在工具如'/improve-me',用于更新编码标准并优化智能体行为。
DashClaw 是一个开源的AI代理审批层,通过 Telegram 要求对破坏性操作(如强制推送或文件删除)进行人工确认,增强无人值守会话期间的安全性。
作者构建了一个MCP工具,让AI智能体能够检索Google Maps评论者的完整历史和元数据,以审核评论并检测欺诈模式。
作者构建了一个服务,通过 MCP 将 Google Patents 数据以结构化 JSON 暴露出来,让 AI 代理能够跨多个专利局查询专利权利要求、引证、同族图谱和摘要,并按事件付费。
Mu 为 AI 智能体提供 67 个日常互联网工具(新闻、邮件、搜索、市场等),统一封装在单个 MCP 端点之后,使用真实实现而非 API 包装器,同时提供托管服务和自托管 Go 二进制两种使用方式。
本文阐述了'工具腐化悖论',即在生产中安装大量静态代理技能会导致上下文窗口退化及安全问题,并倡导采用动态发现方法,通过元技能按需获取工具,以保持系统提示简洁。
Monid是一个新的API,让AI代理无需登录或订阅即可读取社交平台,每次请求仅需0.0015美元,是比Apify更便宜的选择。
一位开发者分享了一种新的方法,通过GitHub星速而非总星数来排名AI代理工具,重点介绍了codex-model-routing、pilotfish和motion-anything等热门项目。该方法将GitHub与MCP注册表进行交叉验证,以过滤掉虚假星标。
介绍了 Pi 生态中几个值得关注的扩展,包括安全讨论模式、网页搜索、多 agent 工作流编排以及模型用量可视化工具。
一个基于浏览器的代理,能够逆向工程Web应用API,自动生成代理工具,实现无需修改代码的深度集成。
一条推文列出了 GitHub 上六个快速增长的人工智能代理仓库,包括 agency-agents、codebase-memory-mcp、OpenMontage、Agent-Reach、orca 和 OmniRoute,并附有简要描述。