标签
本文首次对智能体 AI 工作流进行架构特征分析,揭示了碎片化、异构化的执行模式与常规服务器设计不匹配的问题,并介绍了一个名为 Agora 的原型服务器以提高 CPU/GPU 利用率和吞吐量。
Marker 2 已发布,与 mineru、docling 和 liteparse 相比,将 PDF、图片和 DOCX 转换为 markdown 的速度快达5倍,且准确度更高。
KTransformers 是一个优化大型混合专家模型推理和微调的框架,它通过将活跃的专家动态放置在 GPU 上,其余专家保留在 CPU 内存中,使得像 DeepSeek-V3 这样的大型模型能够在有限的消费级 GPU 内存上运行。
OpenInfer 展示“垂直拆解”,通过单节点 AMD EPYC CPU 与 Nvidia L40S GPU 协同执行量化层,并配合自定义 SLA 感知调度器,将 Qwen 3.5 27B 的吞吐量提升约 50%。