来自 HuggingFace 的文章
NVIDIA 发布了 Nemotron 3 Diarization,这是一个开源100M参数模型,实现了最先进的说话人识别,错误率为14.72%,支持最多八名说话人的实时和离线处理。
本文介绍了JEV-as-a-Judge,这是一种用于大型语言模型(LLMs)的经济高效评估方法,它使用一个仅基于决策的评判器,设置置信度阈值来接受确定的判定并上报不确定的判定,以显著更低的成本实现了与最先进模型相当的准确性。
Agensh 是一个可扩展的自组织多代理系统,无需中央协调器,通过扩展代理数量来提高复杂任务的性能,在ProgramBench和pandoc等基准测试中显示出显著的测试通过率提升。
RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。
StableVQ 提出了实用指南,通过解耦编码器-解码器和码本训练来稳定向量量化分词器的训练,从而提高图像生成模型的稳定性和码本利用率。
Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。
UK AISI 与 EvalEval 正在合作,通过标准化架构和平台公开共享人工智能评估结果,从而提升人工智能模型基准测试的可复现性和透明度。
Hugging Face 的 Transformers 库现在支持来自 llama.cpp 的 GGUF 模型,通过熟悉的 API 实现消费级硬件上的高效本地推理。
Jun Kim, oMLX 的创建者,加入 Hugging Face 以支持 MLX 社区,提升在 Apple Silicon 上本地 AI 的稳定性和开发。
论文提出了一种受物理学启发的LLM块修剪方法,通过将块移除建模为一个受约束的二元优化问题并映射到Ising玻璃,无需对每个配置进行基准测试,实现了显著的压缩增益。
本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。
本文介绍了Ovis-Embedding,一种最先进的全模态嵌入模型,它使用共享骨干网络将文本、图像、视频和音频编码到公共表示空间中,在MMEB-v3和MVEB等基准测试上取得了顶级性能。