标签
作者训练了一个小型语言模型来替代Gemini Flash进行摘要任务,达到了97%的准确率和0.06秒的延迟,适合在内部应用中部署。
一位开发者分享了在本地硬件上将对象检测延迟降低到0.35秒以下的成就,突显了人工智能性能优化的进展。
讨论Qwen-Image-2.1本地部署的图像生成速度,并祝贺其发布,认为其在小参数和高效率上有所突破,有望成为国产AI图像生成的领军者。
Cua开源了CUA-S1-FORMS,这是一个微小的2.8MB AI模型,专为表单填写任务设计,达到99.7%的准确率,并支持本地部署。
介绍Ternary Bonsai 2 27B,这是一个高度压缩的AI模型,在占用空间缩小9倍的同时保留了98.2%的性能,使得推理、编码和多模态处理等任务能够高效地在本地部署。
llama.cpp 发布版本 b11003,这是一个 C/C++ 工具,可在各种硬件上以最少的设置实现高效的大语言模型推理。
本文提出BudgetBench,一个通过调整每次调用的输入令牌预算来评估本地大型语言模型代理内存策略的协议与工具,为社区基准测试提供可重用的测量平台。
OpenBMB已经开源了MiniCPM5-2B,一个2B参数的AI模型,针对资源受限硬件优化,用于推理、编码和工具使用,在其尺寸类别中达到最先进的性能,并展示了有效的本地部署能力。
LTX-2.5是一款支持本地部署、具备微调功能,并改进了生成功能和编辑功能的开源视频模型,强调构建者对AI技术栈的所有权。
NVIDIA Cosmos3,一个64B参数的图像生成模型,发布了INT4量化版本,支持在CUDA和MLX上本地部署,代码和权重可用,并在Apple Silicon上展示了性能。
CosineAI 宣布了 Lumen Sovereign 的早期版本,这是一个在英国训练的 AI 模型,正在本地 Apple Mac Studio 上运行,并计划扩展到一个 1 万亿参数的模型。
该文章详细介绍了一款名为"Sunny Narrator"的开源工具,该工具利用基于Tesla P40 GPU的双模型AI流水线翻译小说,并通过优化的llama-server配置与MTP投机解码技术,实现了每秒40-70个token的生成速度。
本文详细测试了Ling-3.0-tiny模型在Apple M5芯片Mac上的本地部署与性能,展示了在无独立显卡时以47 token/s的速度运行7.9B参数模型的可行性。
本文分享了三个Qwen3.8-27B模型的无审查量化版本,用于本地部署,作者亲自测试并警告谨慎使用。
本文详细介绍了Qwen3.8 27B模型的本地部署指南,覆盖Mac和Nvidia显卡的两条路线,并提供实测性能数据,帮助用户在消费级硬件上运行该模型。
成功在双机 DGX spark GB10 系统上本地部署了 DeepSeek-V4-Flash-0731 模型。
Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。
Qwen3.8-27B 无审查版本发布,专为 Mac M 芯片优化,支持本地部署,保留多模态能力和安全研究功能,提供简化安装步骤。
Qwen3.8-27B 模型被展示为具有高性价比的本地部署AI模型,通过成本分析显示其在性能和成本上显著优于云端模型如Opus,强调了本地推理的经济效益。
本文对比了NVIDIA DGX Spark和魔改RTX 4090在本地部署Qwen3.8-27B和Ling-3.0-flash模型的性能,提供了基准测试数据和购买建议。