标签
The paper presents LLM Agents Factory, a retrieval-based framework that constructs domain-specific LLM agents from a base of over 20K predefined agent profiles, offering a cost-efficient and controllable alternative to dynamic agent generation. Experiments show accuracy comparable to AutoGen with a 120B backbone at substantially lower inference cost.
Soniox TTS v2 是一款新的文本转语音模型,提供优质语音质量、通过音频标签实现的表现力控制、高保真语音克隆、支持 60 多种语言,以及低延迟流式传输,定价为每生成小时 0.70 美元。
NVIDIA 宣布推出 Magpie 多语言 TTS,这是一个开放权重的文本转语音模型,支持 12 种语言,可通过 NVIDIA NIM 进行低延迟部署,用于构建生产级语音代理。
C++之父Bjarne Stroustrup已加入高频交易公司Susquehanna,担任兼职技术研究员,帮助优化和演进公司的代码库,继续他在金融软件领域的工作。
AOSpec 是一个无损框架,它在 LLM 智能体-环境循环中协同推测动作和观察,以降低延迟,在各种服务设置下实现了显著的端到端延迟降低。
OpenAI 描述了如何构建 GPT-Live,一个全双工实时语音 AI 系统,它消除了轮流检测器,实现了自然的连续对话。文章详细介绍了六个月内推理、上下文管理和媒体传输方面的架构改进。
Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。
OpenAI 发布了两个新的转录模型:GPT Live Transcribe 用于低延迟场景,GPT Transcribe 用于批处理工作负载,错误率降低高达 41%,并通过上下文提高了语义准确性。
Google AI 演示了 Gemini 3.5 Flash-Lite 处理超过100万张目录图片,以低延迟和高效令牌提取结构化数据,适用于大规模工作流。
AMD与Cerebras宣布联合推出AI推理解决方案,该方案将AMD Helios机架级解决方案与Cerebras晶圆级引擎相结合,旨在实现超低延迟和高吞吐量。这种解耦式推理工作流预计每瓦每秒可处理的token数量提升高达5倍。
本文介绍了可微分逻辑门网络(Diff-Logic)作为传统神经网络的一种硬件原生替代方案,用于边缘设备上的实时脑电图分类,在显著降低延迟和模型大小的同时实现了有竞争力的性能。
libargus 是一个零分配的原生 AI 推理运行时,它将 LLM、语音和视觉流水线整合到 Java 22+ 的 Project Panama FFM 边界之后,实现低延迟的本地执行。
Wi-Fi 8 将重点从速度转向可靠性、稳定性和更低延迟,引入了多接入点协调和无缝漫游域等功能。该标准尚未最终确定,但有望在连接质量方面带来显著提升。
文章认为,AI编程加速了开发速度与系统重要性的脱钩,导致关键系统变得脆弱且故障波及范围广,并倡导实施强制谨慎设计的‘慢速软件’。
本文提出了一种方法,将重复的标准操作流程步骤编译为经过验证、有版本管理的工具,在部署前完成,替代推理时的代码生成。在一个配送中心的报警分类系统中,该方法将p50延迟降低了42%,端到端错误率降低了最多53%。
巴黎人工智能语音初创公司Gradium从英伟达等投资方获得1亿美元种子轮融资,用于扩展其超低延迟语音AI模型,并在湾区开设办公室。
Simulstream 是一个开源框架,用于评估和演示流式语音到文本翻译系统,支持长语音的增量解码和重新翻译解码,并具备细粒度日志记录和交互式 Web 界面。
Gepard是一款新的流式TTS模型,具备实时对话能力,首音延迟约50ms,支持语音克隆和高并行度,以Apache 2.0许可发布。