production-systems

标签

Cards List
#production-systems

SAGE:面向生产级RAG系统的SLO感知自适应检索策略

arXiv cs.LG · 3天前 缓存

SAGE是一种面向生产级RAG系统的基于学习的SLO感知自适应检索策略,能够根据每个查询动态选择检索段落数量,在几乎不损失质量的前提下提升SLO合规性并降低延迟与成本。

0 人收藏 0 人点赞
#production-systems

没有停止策略的AI智能体只是一个昂贵的循环

Reddit r/AI_Agents · 2026-07-30

关于AI智能体可靠性的实用说明,主张生产环境中的智能体需要明确的门控机制,包括证据阈值、重试预算和影响评估,而不是仅依赖记忆来确定任务是否完成。

0 人收藏 0 人点赞
#production-systems

另类观点:'玩具'AI代理与生产系统之间的区别与模型智能毫无关系

Reddit r/AI_Agents · 2026-07-21

认为生产级AI代理的关键在于问责基础设施(如限定范围记忆、人在回路、追踪日志),而非模型智能。

0 人收藏 0 人点赞
#production-systems

@asmah2107: 给所有询问推理工程应该构建什么的人:> 推理服务器(C++/Rust)> 分页KV缓存(如vLL…

X AI KOLs Timeline · 2026-07-20 缓存

一条推文列出了在推理工程中应构建的关键项目,以理解生产级LLM系统,包括推理服务器、分页KV缓存、推测解码、量化库和防护措施。

0 人收藏 0 人点赞
#production-systems

@DanKornas:如果你真的想构建能够投入生产的多智能体系统,仅仅有更好的提示是不够的。一个能力…

X AI KOLs Timeline · 2026-07-14 缓存

一个推文线程,推广丹尼斯·罗斯曼(Denis Rothman)的著作《Context Engineering for Multi-Agent Systems》(多智能体系统上下文工程),该书教授如何通过上下文工程、双重RAG以及其他技术构建透明、模块化的多智能体系统。

0 人收藏 0 人点赞
#production-systems

既然智能体现在能采取实际行动(不仅生成文本),人们是如何应对智能体AI安全的?

Reddit r/AI_Agents · 2026-07-13

讨论当AI智能体不仅能生成文本还能采取实际行动(例如更新记录、调用API)时出现的新安全挑战,探索所需的基础设施,如限定范围的身份、策略层和操作日志。

0 人收藏 0 人点赞
#production-systems

低延迟系统中工具制作与自进化LLM代理

arXiv cs.CL · 2026-07-10 缓存

本文提出了一种方法,将重复的标准操作流程步骤编译为经过验证、有版本管理的工具,在部署前完成,替代推理时的代码生成。在一个配送中心的报警分类系统中,该方法将p50延迟降低了42%,端到端错误率降低了最多53%。

0 人收藏 0 人点赞
#production-systems

我认为我们在AI代理上重蹈了早期微服务的覆辙

Reddit r/ArtificialInteligence · 2026-07-05

作者将早期的微服务热潮与当前的多智能体系统热潮进行了类比,认为工程实践——而非更好的模型——可能是实现可靠多智能体系统的关键。

0 人收藏 0 人点赞
#production-systems

@ba_niu80557: https://x.com/ba_niu80557/status/2069042546886787419

X AI KOLs Timeline · 2026-06-22 缓存

本文深入探讨了 Forward Deployed Engineering (FDE) 在 AI 落地中的真正含义,强调 FDE 并非简单的 API 调用或搭建 Agent,而是面向生产落地的系统工程,包括业务翻译、系统设计、平台整合、生产运营和能力沉淀。

0 人收藏 0 人点赞
#production-systems

@sairahul1: https://x.com/sairahul1/status/2067540315620405543

X AI KOLs Timeline · 2026-06-18 缓存

一条解释构建生产级AI系统所需的六个关键AI概念(token、嵌入、向量搜索等)的推文串,强调理解这些概念可以避免像API成本失控等代价高昂的失败。

0 人收藏 0 人点赞
#production-systems

APEX: Adaptive Principle EXtraction — 面向生产级AI智能体的三层自进化框架

arXiv cs.AI · 2026-06-16 缓存

APEX 提出了一个面向生产级AI智能体的三层自进化框架,同时优化了控制层(harness)、行为原则和工作流拓扑。在生产级智能体上的实验显示,健康评分和工作流质量显著提升,且仅需极少的LLM调用。

0 人收藏 0 人点赞
#production-systems

什么应管控自我改进的AI代理循环?

Reddit r/AI_Agents · 2026-06-14

作者讨论了在自我改进的AI代理系统中需要第四个治理循环以防止目标漂移,并提出了定期人工审核、保留基准和轮换评估者等实际控制措施。

0 人收藏 0 人点赞
#production-systems

在实际中,你如何真正结合记忆和知识库?将两者都塞进上下文真的是标准做法吗?

Reddit r/AI_Agents · 2026-06-05

讨论在个性化AI代理中结合长期记忆和知识库的实际挑战,质疑将所有内容塞进上下文是否为标准,并探索替代方案,如单独的检索流程或基于工具的交互。

0 人收藏 0 人点赞
#production-systems

有人真的解决了记忆漂移问题吗?

Reddit r/AI_Agents · 2026-05-30

讨论AI系统中的记忆漂移问题:偏好和事实会过时,但系统只追加存储新信息,导致版本冲突和检索不可靠。

0 人收藏 0 人点赞
#production-systems

仅靠基准测试不够:RAMP——生产系统中代理模型的运行时评估

Hugging Face Daily Papers · 2026-05-26

RAMP是一个基于生产环境的LLM代理评估框架,可揭示静态基准测试无法察觉的显著能力退化,显示任务完成率在串行工作流中从100%骤降至20%。该框架在真实的编译器构建工作负载上评估了15个主流模型,涉及复杂的工具链交互和分阶段恢复机制。

0 人收藏 0 人点赞
#production-systems

我们是否高估了模型智能,低估了工作流质量?

Reddit r/AI_Agents · 2026-05-16

文章认为,令人印象深刻的AI与无用的AI之间的区别往往不在于模型本身,而在于围绕它的工作流——上下文、记忆、工具访问和编排。它表明,工作流架构可能成为比原始模型能力更重要的竞争优势。

0 人收藏 0 人点赞
#production-systems

使用AI代理重构单体应用的经验教训

Lobsters Hottest · 2026-05-15 缓存

1Password分享了使用AI代理分析和重构大型Go单体应用的经验,详细介绍了确定性工具的成功以及将代理应用于实时生产变更的挑战。

0 人收藏 0 人点赞
#production-systems

分享 KGC 2026 所有演示文稿。这是我参加过的任何会议中见过的生产级知识图谱系统最多的。[D]

Reddit r/MachineLearning · 2026-05-13

本文分享了知识图谱大会(KGC)2026 的演示文稿,突显了企业部署生产级知识图谱用于推理和治理,而不仅仅是向量检索的趋势。

0 人收藏 0 人点赞
#production-systems

@techNmak: 这可能是目前网上最坦诚的AI架构解析。九层AI生产架构…

X AI KOLs Timeline · 2026-05-08

一份关于九层生产AI架构的详细解析,涵盖RAG管道、代理、提示词、安全、评估和可观测性层。

0 人收藏 0 人点赞
#production-systems

AI agents 正在改变人们对计算成本的看法

Reddit r/AI_Agents · 2026-05-07

本文讨论了AI代理工作流如何将优化重心从单纯的推理成本转向更广泛的挑战,如延迟、编排开销和可靠性。文章强调了向混合架构和动态模型路由发展的趋势,以应对这些多步骤工作流的复杂性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈