llm-deployment

标签

Cards List
#llm-deployment

在云端AI与本地大语言模型之间做决策

Reddit r/AI_Agents · 3天前

本文讨论了开发人员在选择使用云端AI服务还是本地运行大语言模型时的权衡和注意事项。

0 人收藏 0 人点赞
#llm-deployment

在Mac Studio 96GB上运行Qwen3.5-122B:修复了3个使长上下文推理变得可用的bug

Reddit r/LocalLLaMA · 2026-07-13

修复了qMLX分支中运行Qwen3.5-122B的三个bug,将长上下文推理的预填充时间从几分钟降低到亚秒级;开源了该分支和基准测试脚本。

0 人收藏 0 人点赞
#llm-deployment

@JaydevTonde:今天探索了NVIDIA Dynamo,它为我们提供了很多在GPU集群中跨多个节点部署LLM的功能。它包…

X AI KOLs Timeline · 2026-07-09 缓存

探索了NVIDIA Dynamo,这是一个用于在多个GPU集群节点上部署LLM的工具,具有模型缓存、自动扩展、多节点部署以及Kubernetes集成等功能。

0 人收藏 0 人点赞
#llm-deployment

@lilianweng: 关于AI自我改进的 Harness 工程新博文:https://lilianweng.github.io/posts/2026-07-04-harness/… 这是……

X AI KOLs Timeline · 2026-07-07 缓存

Lilian Weng 的博文探讨了 Harness 工程的概念,将其作为 AI 系统递归自我改进的关键组成部分,讨论了设计模式、工作流自动化以及与操作系统的类比。

0 人收藏 0 人点赞
#llm-deployment

@TheAhmadOsman: 想替代 Anthropic/OpenAI?从这里开始——本地运行 LLM 的圣经现已开放在线阅读……

X AI KOLs Timeline · 2026-06-27 缓存

一份涵盖多种硬件和软件配置的 LLM 本地运行全面指南现已免费在线阅读,涉及 llama.cpp、vLLM 等工具。

0 人收藏 0 人点赞
#llm-deployment

@charles_irl: Tried to squeeze the most important bits about the entire stack for cloud deployment of transformer inference, from app…

X AI KOLs Following · 2026-06-10 缓存

本文全面介绍了云端部署 Transformer 推理的完整技术栈,涵盖应用场景、工作负载定义、模型、推理引擎、硬件、可观测性及性能优化,并展望了未来趋势。

0 人收藏 0 人点赞
#llm-deployment

从人工引导到自主:面向空间NPU的端到端LLM部署的智能体技能系统

arXiv cs.LG · 2026-06-09 缓存

本文提出了一种两阶段方法论,用于在空间NPU上进行端到端大语言模型(LLM)部署,从人工引导开发逐步过渡到自主智能体技能系统。该系统在参考模型上实现了预填充阶段2.2倍、解码阶段4.0倍的加速,并以极少的人工引导在AMD XDNA 2 NPU上自主部署了另外八个LLM。

0 人收藏 0 人点赞
#llm-deployment

人们如何让OpenClaw/Hermes代理24/7运行而不耗尽API预算?

Reddit r/AI_Agents · 2026-05-21

一位从业者寻求建议,希望在不产生高额API成本的情况下让AI代理24/7运行,询问本地模型、云GPU或托管API,并希望获得兼顾可靠性和推理质量的成本效益方案。

0 人收藏 0 人点赞
#llm-deployment

@ickma2311: 高效AI讲座13:LLM部署技术 该讲座帮助我很好地理解了AWQ、vLLM和FlashAttention…

X AI KOLs Timeline · 2026-05-13 缓存

一场关于LLM部署技术的讲座,涵盖AWQ、vLLM、FlashAttention、量化和激活平滑,以实现高效服务。

0 人收藏 0 人点赞
#llm-deployment

当客户希望内部部署大语言模型但数据治理混乱不堪时,你是选择接手并先修复数据,还是直接走人?

Reddit r/AI_Agents · 2026-05-13

探讨了顾问在面对数据治理不佳的客户却急于部署大语言模型时所面临的挑战,权衡了“先修复数据”与“在混乱数据上快速部署”之间的风险。

0 人收藏 0 人点赞
#llm-deployment

台湾公司Skymizer发布HTX301 - 配备384GB内存、功耗约240瓦的PCIE推理卡

Reddit r/LocalLLaMA · 2026-05-08 缓存

Skymizer发布HTX301,一款能够本地运行700B参数大语言模型、拥有高内存和低功耗的PCIE推理卡。

0 人收藏 0 人点赞
#llm-deployment

@anyscalecompute:大多数 Agent 框架解决了编排问题,却在基础设施方面完全未予解决。最新博文:面向生产的 AI…

X AI KOLs Following · 2026-05-07 缓存

Anyscale 发布了一篇技术指南,介绍如何使用 Ray Serve、MCP 和 A2A 协议部署面向生产环境的 AI Agent。文章针对常见的底层基础设施瓶颈,提出了一种解耦的微服务架构,支持 LLM、工具与 Agent 的独立扩缩容。

0 人收藏 0 人点赞
#llm-deployment

几何金丝雀:通过表征稳定性预测可操控性与检测漂移

Hugging Face Daily Papers · 2026-04-20 缓存

# 论文页面 - 几何金丝雀:通过表征稳定性预测可操控性与检测漂移 来源:[https://huggingface.co/papers/2604.17698](https://huggingface.co/papers/2604.17698) ## 摘要 几何稳定性指标既能预测语言模型的可控性,也能检测其结构退化;其中监督版在操控预测上表现优异,无监督版在漂移检测上更胜一筹。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈