标签
介绍了PatchOptic,这是一种用于共享状态LLM工作流的接口,它采用投影读取和验证的结构化补丁来确保更新的有效性。通过PatchBench对46个案例进行了评估,结果显示在保持质量的同时减少了token成本和泄漏。
Anthropic 发布了四种让 Claude Code 自主运行的循环类型:基于回合、基于目标、基于时间和主动式,允许不同级别的任务交接。
Forethought 是一种神经符号推理系统,它将推理视为由符号与神经基元组合成的显式、可验证的程序。该系统可将基础模型准确率相对提升约 30%,使小模型在保持模型无关性与可审计性的同时,达到甚至超越前沿模型。
基于 Qwen3.6-35B-A3B-UD-Q8_K_XL 在 DGX Spark 上的基准测试结果,使用 Mia 发布的 llama.cpp 脚本,展示了在不同上下文长度下快速的 token 生成时间。
文章讨论了AI工作流成本激增的常见原因,例如重试、重复的工具调用、长时间运行的工作流以及不断增长的上下文,并询问团队如何调查此类问题。
该推文同意每周200美元足以支付工程和研究工作,批评在昂贵模型和膨胀的自主工作流上的浪费性支出。
OpenRouter 在 Insights 博客发文,指出四个开放权重模型已进入能够支撑真实智能体流程的阶段,并解释了公司为何在六月选择这些模型。
Anthropic的计算机使用团队正在招聘产品工程师和研究员,寻找对代理工作流程充满热情且能适应不确定性的候选人。
本文证明,将代理工作流程序编译到小型微调模型的权重中,与上下文基线相比,实现了接近前沿的质量,成本降低128至462倍,解决了质量、成本和灵活性的感知障碍。
John Lindquist 分享了他的演讲《Agentic Power User's Playbook》,涵盖了高效管理 AI 代理的实用工作流程、快捷操作和习惯。
关于自主AI代理在生产环境中实际失败案例的讨论,例如发送未经授权的电子邮件、修改记录、删除数据、花费金钱等,寻求经验和防护措施。
PostHog 解释了为什么“循环”(即自我提示的代理工作流)正在受到青睐,这得益于模型能力的提升以及 Stripe 和 Lovable 等公司的实际成果。该帖子详细说明了构建循环所需的要素,并展示了诸如 PR 监控和 Bug 修复等示例。
Atomic Mail 推出了一款 API 优先的电子邮件服务,为 AI 智能体提供专属收件箱,支持通过 MCP 或 Agent Skill 与 Claude Desktop、Cursor 等流行智能体集成,并包含工作量证明(Proof-of-Work)和信誉机制来对抗垃圾邮件。
作者分享了一种构建外部LLM漂移检测系统的方法论,该系统持续探测模型行为(模式遵循、指令遵循、拒绝率等),以捕捉API性能的静默退化,并邀请对方法、定价和用例的反馈。
一条Twitter帖子概述了2026年AI工程面试中占据主导地位的七个关键领域,包括LLM基础、RAG系统、智能体工作流、推理优化、评估、MLOps以及生产实践。
Vicki Boykis分享了她使用本地AI模型进行开发的经验,指出像Gemma 4这样的最新版本已使智能体工作流在本地可行,准确率约为前沿模型的75%。
Arize Phoenix内置智能体PXI现在支持斜杠命令和技能,允许用户直接从聊天中调用自定义工作流。
FlowBank引入了一个三阶段框架,通过预计算一组多样化的可重用工作流并自适应地为每个查询选择最佳工作流,来优化LLM多智能体系统中的智能体工作流,在保持成本竞争力的同时实现了更高的分数。
一份关于使用多 LLM 系统与持久内存构建研究代理框架的详细指南,通过基于文件的身份、项目文档和记忆索引,让研究人员无需在每次会话中重复解释上下文。