全部文章,按抓取时间从新到旧排列。
NaviDC-OCR是一个统一的视觉-语言框架,通过变形感知学习和自适应采样提高文档解析准确性,在多个基准测试中达到了最先进的结果。
MegaParts 引入了一个可扩展的框架,用于部件感知3D物体生成,该框架使用令牌高效的向量量化令牌和自回归建模,使得能够生成具有多达300个部件的物体。
本文提出了VibeWorlding,一个用于基准测试和训练多模态智能体的框架,使其能够从用户查询构建3D开放世界,并展示了强化学习如何提升开源模型以与闭源前沿模型竞争。
GenRouter 是一个用于代理式图像生成的统一路由框架,能够自适应地将提示引导至最优工作流,通过需求建模和自我进化显著降低成本与延迟,同时提升视觉对齐效果。
R^3-Bench 引入了一个基准测试,表明大型语言模型在跨数学、编程和抽象推理等多个推理任务分配共享计算预算时,难以维持性能表现。
本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。
ENTLORE是一个基于图的基准框架,用于企业问答中的潜在组织推理评估,它表明即使拥有黄金文档来源,许多隐式关系问题仍然无法回答。
Ventor-QTest提出了一种针对供应商托管LLM API的黑盒审计方法,通过重复和长序列探测来测量保真度损失并检测长期代理任务中的退化。
ConceptFormer学习用于视觉文档检索的连续潜在概念表示,无需文本中间体即可连接视觉证据和语义相关性,相对于基线实现了显著改进。
本文提出D-SCAN,一种针对RAG投毒的检测框架,通过监控语言模型生成中的注意力崩溃动态,即使在输出看似良性时,也能有效抵御对抗性攻击。
UI-Mate 是一个基础GUI代理,它使用环境接地训练和上下文演示来提高在长期办公任务中的可靠性,并在计算机使用基准测试中取得了最先进的成果。
VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。
PACE-Bench 引入了一个基于模拟器的基准,用于评估在物理适应任务中,经过环境突变后需要迭代重新设计代码的自进化智能体,并揭示了相比参数推断,机制重新设计是一个主要瓶颈。
在 Simon Willison 的博客文章中强调,Qwen 3.8 27B AI 模型在 Artificial Analysis Intelligence Index 上取得了 52 分。