inference

标签

Cards List
#inference

@rohanpaul_ai:萨姆·奥尔特曼谈庞大的推理需求将如何在不需要高利润率的情况下为OpenAI的前沿训练提供资金。“我们…

X AI KOLs Following · 昨天 缓存

萨姆·奥尔特曼解释了庞大的推理需求将如何在不需要高利润率的情况下为OpenAI的前沿模型训练提供资金,并预测智能将变得可替代,优势将转向拥有最大、最便宜计算集群的一方。

0 人收藏 0 人点赞
#inference

对于智能体构建者来说,缺失的从来不是框架,而是资本。现在有了一个场所,智能体可以在其中融资、赚钱,并获得推理费用的支付。

Reddit r/AI_Agents · 昨天

Bankr 是一个平台,AI 智能体可以在其中启动、融资、赚取使用费,并获得推理成本补贴,将自己定位为面向智能体原生项目的 VC 融资替代方案。

0 人收藏 0 人点赞
#inference

Qwen 3.6 27B 在 llama.cpp 中的标志/设置

Reddit r/LocalLLaMA · 2天前

一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。

0 人收藏 0 人点赞
#inference

Wan-Animate-2:拓展角色动画模型的应用边界

Reddit r/LocalLLaMA · 2天前

Wan-Animate-2 是一个全新的端到端角色动画框架,它在重新设计的 Diffusion Transformer 中直接输入驱动视频,实现高保真动作生成和身份保持。它还推出了一个轻量级变体,用于实时流式动画,并已发布开源权重。

0 人收藏 0 人点赞
#inference

Answer First, Reason Later: Commitment Order in Diffusion LLMs

arXiv cs.CL · 2天前 缓存

This paper investigates why diffusion LLMs fail at reasoning tasks: unconstrained token commitment freezes answers early and collapses to answer-only outputs. The authors identify commitment order as the root cause and propose a training-free, frontier-gated decoding intervention that recovers performance while preserving parallel decoding.

0 人收藏 0 人点赞
#inference

AMD将收购AI芯片初创公司Taalas(4分钟阅读)

TLDR AI · 2天前 缓存

AMD已达成最终协议,收购总部位于多伦多的AI芯片初创公司Taalas,该公司专注于将AI模型硬连线到定制硅上,以实现高效推理。该交易旨在以差异化的推理性能和效率强化AMD的AI产品组合。

0 人收藏 0 人点赞
#inference

@QuixiAI:推理硬件不断被吞并。我理解想要退出的想法。但我们需要这些显卡大规模生产,并进入消费者的……

X AI KOLs Following · 3天前 缓存

QuixiAI 就 Taalas Inc 加入 AMD 发表评论,表示希望高性能推理硬件能够面向消费者,而不是仅限于数据中心,并引用了 Taalas 的收购公告。

0 人收藏 0 人点赞
#inference

AMD 收购 Taalas,通过在硅片中蚀刻模型来提升推理性能

Hacker News Top · 3天前 缓存

AMD 收购 AI 芯片初创公司 Taalas,后者将模型权重直接蚀刻进硅片,有望带来数量级的推理性能提升。此举被视为 AMD 挑战 Nvidia 在 AI 硬件领域主导地位的举措。

0 人收藏 0 人点赞
#inference

我将vLLM的服务栈移植到C++20:66 MiB二进制,推理时无Python,输出与vLLM逐token核对

Reddit r/LocalLLaMA · 3天前

作者将vLLM的服务栈移植到C++20,生成一个66 MiB的二进制文件,推理时无Python,可逐token与vLLM核对,且在测试硬件上吞吐量具竞争力。

0 人收藏 0 人点赞
#inference

Inkling-Small 276B-A12B 在低于10GB内存下约2.9 tok/s

Reddit r/LocalLLaMA · 4天前

Mference,一个基于 Swift + Metal 的推理引擎,现已支持 Inkling-Small 276B-A12B,在低于10GB内存下以约2.9 tok/s运行,使得大型MoE模型能够在消费级Apple硬件上运行。

0 人收藏 0 人点赞
#inference

jabbatheduck/DeepSeek-v4-flash-mini · Hugging Face

Reddit r/LocalLLaMA · 4天前 缓存

jabbatheduck 发布了 REAP 专家剪枝后的 DeepSeek-V4-Flash 检查点的 GGUF 量化版本,为消费级 GPU 上的内存受限推理进行了大幅压缩,同时保留了路由器和注意力的精度。

0 人收藏 0 人点赞
#inference

@akshay_pachaar: https://x.com/akshay_pachaar/status/2084992645966016757

X AI KOLs Timeline · 4天前 缓存

一份技术指南,演示如何使用开源工具在单个 GPU 上部署五个专用的小型模型(SLM、OCR、NER、重排序器、目标检测器),涵盖内存管理、批处理以及 Superlinked Inference Engine。

0 人收藏 0 人点赞
#inference

Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models

arXiv cs.CL · 4天前 缓存

This paper proposes speculative correction, a training-free draft-then-refine decoding strategy for diffusion language models, showing quality-latency improvements using LLaDA2.1 models.

0 人收藏 0 人点赞
#inference

Kimi K3 完整模型在 16x GB10 集群上运行,速度超过 20 tps

Reddit r/LocalLLaMA · 5天前

Kimi K3 完整模型在 16x GB10 集群上运行,平均每秒处理 20+ 个 token,并计划发布 vllm 镜像和说明。

0 人收藏 0 人点赞
#inference

Show HN:Maple-Preview——在 iPhone 上以 120 tok/s 运行的三值 20B MoE

Hacker News Top · 5天前

Maple-Preview 是一个三值 20B MoE 模型,在 iPhone 上每秒可运行 120 个 token,展现了高效的端侧推理能力。

0 人收藏 0 人点赞
#inference

一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s

Reddit r/LocalLLaMA · 5天前

一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。

0 人收藏 0 人点赞
#inference

@LambLabs:Lamb Labs(YC S26)正在构建定制AI推理芯片,可实现20,000+ tok/s的速度,且每瓦特智能(Intelligence per Watt)比传统GPU高63倍……

X AI KOLs Following · 5天前 缓存

Lamb Labs(YC S26)宣布推出定制AI推理芯片,声称速度可达20,000+ tok/s,且每瓦特智能(Intelligence per Watt)比传统GPU高63倍,并指出GPU之所以被广泛采用是因为其可用性,而非其适用性。

0 人收藏 0 人点赞
#inference

@maximelabonne:使用LFM2.5-2.6B在本地运行后台代理来管理你的日历。推理免费,因此你可每小时消耗超过100万token,而无需额外成本…

X AI KOLs Timeline · 5天前 缓存

Maxime Labonne强调使用LFM2.5-2.6B模型在本地运行后台代理来管理你的日历,推理免费,每小时可消耗超过100万token,且无额外边际成本。

0 人收藏 0 人点赞
#inference

前沿模型是否正在成为不需要它们的任务的默认选择?

Reddit r/artificial · 5天前

文章讨论了大多数AI流量由简单、可重复的任务组成,如分类和提取,然而前沿模型常常被用于所有事情。它质疑将任务路由到较小的专用模型是否会成为降低成本和延迟的标准做法。

0 人收藏 0 人点赞
#inference

数据中心的未来是便携式的吗?Runware 打造了一个模块化数据中心来寻找答案

TechCrunch AI · 5天前 缓存

Runware 宣布推出 Sonic Inference Pod,这是一种面向 AI 推理的便携式模块化数据中心,旨在相比传统数据中心提供更低的成本、更快的部署和灵活的扩展。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈