标签
GAS 引入了一种生成引导的训练框架,通过解耦的混合Transformer架构,使用辅助生成任务来提高多模态模型中的视觉理解,且无推理开销。
Kimi K3 是一款全新AI模型,拥有2.8万亿参数和100万上下文长度,已在网页和App上发布,在编程、智能体任务、推理、视觉和智能体集群方面具备领先能力。
Jerry Liu报告了Mistral OCR在ParseBench上的更新结果,显示其性能优于GPT-5.5,仅落后于Gemini 3.1 Pro,在内容忠实度和语义格式方面表现强劲。
视觉美学基准(VAB)通过对比选择评估多模态模型的审美判断能力,揭示其与人类专家的显著差距,并表明基于专家示例的微调可提升准确率。
本文介绍了 UNO,这是一种以理解为导向的后训练框架,利用理解任务作为监督信号,以增强统一多模态模型中的图像生成和编辑能力。
一份全面的调查论文,审视图像分类到高级和抽象类别的任务,通过对常识语义、情感语义、美学语义和解释语义的多学科分析,澄清了计算机视觉中高级语义的隐性理解。该论文指出了抽象概念图像分类中存在的持久挑战,强调了混合人工智能系统在处理复杂视觉推理任务中的重要性。