来自 HuggingFace 的文章
Vision-RL²是一种方法,通过区域级强化学习压缩视觉令牌,在不进行全模型微调的情况下,提升多模态大型语言模型在多个基准测试中的精细粒度感知性能。
VABench 引入了一个基准,通过测试模型在视觉演示和主动感知下观察、推理和行动的能力,来评估模型中的具身空间智能。它表明主动摄像头控制提高了任务成功率,但没有模型能完成长期任务。
JEPA-Anything 提出了一种基于正交预测因子分解的领域无关框架,用于跨视觉、生物学和控制等多种系统学习预测模型,并展示了改进效果和实验验证。
Video DeltaNet提出了一种混合注意力机制,结合Softmax和线性注意力,以提高视频生成模型的效率,实现了比基线方法快14.5倍的加速。
介绍了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B参数,采用先进的KV缓存压缩技术,以降低部署成本并提升长上下文代理工作负载的效率。
When2Think 是一个后训练框架,能根据问题难度在大型推理模型中动态分配计算资源,从而在数学基准测试中优化准确性与效率的权衡。
本文提出了RetireOPD,一种利用自退隐策略内蒸馏训练多轮智能体的方法,提升了在ALFWorld和WebShop基准测试上的性能。
Prism ML 发布了一款三元权重27B级AI模型,专为Apple笔记本电脑的本地使用优化,以8.60 GB的占用空间和约47 tok/s的性能,保留了98.2%的全精度智能。
发布 Ternary-Bonsai-2-27B-gguf,一款 27B 参数的语言模型,采用三元权重实现极端压缩(5.9 GB),同时保留 98.2% 的 FP16 精度性能,并针对笔记本电脑和单 GPU 的高效推理进行优化。
openjev 是一个基于 Qwen3.5 的模型,为蕴含任务而训练,使其能够在重排序、评分和实时游戏等应用中使用,v2 版本增加了多模态能力和改进的零样本性能。
Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。
Needle 3 是一款针对移动设备和可穿戴设备等边缘设备优化的紧凑AI基础模型,在一个8-29 MB的文件中提供工具调用、结构化提取和文本嵌入功能。
这是一个基于 Apple Silicon 和 MLX 的高吞吐量推理引擎,专用于结构化信息提取,支持并行约束解码,可将延迟降低 5.6 至 7.0 倍,并实现 100% 的模式有效性。
ALPINE 介绍了一种超轻量级的空间关系架构,用于小样本图像分类,与基线模型如 Prototypical Networks 和 MAML 相比,它用更少的参数实现了精度提升,收敛更快,鲁棒性更好。
本文介绍了GAVEL,这是一个使用图世界模型来验证和修复机器人任务长时域LLM规划的框架,显著提高了仿真中的成功率和效率。
FRAUDSkill是一个用于音频反欺诈检测的结构化冻结权重适配框架,它通过优化外部技能程序而不修改底层音频语言模型,实现了更高的准确性和更少的无效输出。
本文通过引入一个综合框架来评估 MiniMax-H3——一种全模态生成模型——在通过多模态输入推理物理世界方面的能力。评估显示,基于视频的决策推理表现最佳,而基于音频的歧义推理则最弱。