标签
本文研究了提示侧智能体剧本(从先前运行中提炼出的流程)是否能在不同设置之间迁移,发现冻结迁移仅在有条件下有效,具体取决于与目标部署的兼容性;在ALFWorld、TAU2-Bench和XBench-DeepSearch上的结果参差不齐。
一篇技术文章,探讨传统web服务器部署模型(TLS终止、反向代理、静态文件服务、缓存)如何在对必须易于自托管的爱好者级应用上失效,导致效率低下和复杂度增加。
Microsoft Research的Atlas Playbook提供了框架和工具,用于设计、部署和评估在多样化文化背景下以人为本的人工智能系统,其基础是在肯尼亚和印度的实地研究。
对10,000通语音AI电话的分析揭示了关键失败点:STT错误率、前8秒混乱、中断处理、长时间静默、工具调用延迟、LLM故障以及转接失败——为代理构建者提供了实用见解。
一份教育指南,详细拆解了生产部署的各个阶段——构建、构建产物、数据库迁移、健康检查、滚动更新和回滚——并讨论了何时该使用 PaaS,何时该运行自己的部署基础设施。
This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.
这篇arXiv论文提出了一种统一的LLMOps架构,用于实时、企业级LLM部署,集成了数据摄入、持续学习、RAG和反馈循环。它引入了AIPO、STAR+FAR和SAGE等组件,以解决受监管行业中知识过时、幻觉和延迟-成本权衡的问题。
一位软件工程师讨论了功能开关在何种情况下有意义,例如用于A/B测试和复杂部署,并提醒团队在能够控制部署时不要过度使用它们。
本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。
这篇演讲介绍了如何用 Nix 实现从开发环境、构建到云部署的全面可复现性,并展示了 Antithesis 基于 Nix 的“命令集”框架来替代杂乱脚本。
一位开发者反思将 AI 智能体工作流迁移到服务器的经历,发现 systemd、日志、幂等性和故障告警这些枯燥的基础设施问题比智能体本身更重要。
53AI Hub 是一个可自托管的开源 AI 门户,集成了多个智能体平台和云服务,让团队能够通过统一界面管理和发布智能体、提示词及 AI 工具。
一位从业者分享了将AI智能体部署到生产环境中的真实挑战,指出治理、审计和部署防护措施现在已成为瓶颈,而非智能体构建本身,并提到了Lyzr Control Plane和微软参考架构等新兴解决方案。
Kimi K3 权重今日发布。该模型拥有2.8万亿参数、MoE架构(896个专家)、100万上下文、视觉能力以及MXFP4量化。在A100和H200上部署需要多节点,但单个B300节点即可容纳。预计本周末将公布各GPU配置下的tok/s、ttft及每百万token成本等基准数据。
BentoML是一个开源Python框架,简化了将AI模型打包、提供服务和部署为REST API的过程,支持容器化和多模型编排。
本文测试了不同LLM系列在不同时间和界面上如何评估族裔民族主义伪科学,发现认知立场取决于部署配置而非稳定的模型属性,引发了关于认知问责性的关切。
ODS是一个全栈自托管的AI部署系统,只需一条命令即可在Windows、Linux和MacOS上安装和配置本地AI工具。
freeCodeCamp发布了一门关于TRAE IDE的课程,展示了如何使用多代理AI协作从构思到生产构建和部署一个应用。