标签
本文介绍了SABLE,一个开源的智能体框架,利用自然语言编排与大语言模型(LLM)来引导药物发现中受合成约束的多目标先导化合物优化,整合了反应模板化类似物枚举、性质预测和贝叶斯优化。
SCOUT 提出了一种恢复感知的智能体框架,采用自适应探索-利用策略,用于超长自我中心视频推理。该框架通过 UPS-GRPO 训练,这是一种不确定性优先的强化学习方法,具备回合级优势分解。它在超长自我中心基准上取得了最先进的结果,并在较短的长时间视频场景中保持竞争力。
CASCADE是一个智能体框架,利用调控网络预测基因扰动的下游转录效应,并在TCGA癌症类型中进行患者数据验证。该论文展示了MYC及其他调控因子的方向一致性,尽管其并未超越现有的精选知识。
VideoAgent 是一个一体化的开源框架,用于全面视频智能,通过统一的智能体工作流结合理解、编辑和创意生成。
EvoPINN 是一个智能体式框架,将 PINN 开发重新表述为基于执行验证的算法发现问题,利用 LLM 智能体提出程序化修改。它能够自主发现针对 PDE 特化的学习算法,包括一种名为 SLRC-PINN 的新型架构,该架构在多种 PDE 场景中均优于基线方法。
GoGoTB 是一个用于端到端 RTL 验证的智能体框架,实现了基于规范的覆盖率收敛,在无需人工干预的情况下在 8 个设计上达到高覆盖率。
ProcAgent 是一个完全在设备端运行的、基于视觉的智能体程序助手,采用提出-验证架构,在 NVIDIA Jetson AGX Orin 上实现实时自适应指导。它支持反应式和主动式两种模式,并支持人在回路中的确认,实现响应式交互,并在用户研究中获得积极评价。
介绍了VideoCoCo,一种代理双引擎框架,使用可执行的Blender代码作为思维链中间表示,用于物理一致的视频生成,在PhyGenBench和VBench-2.0上取得了最先进的分数。
ReDesign是一个智能体框架,通过跨模态选择和组合专门工具,从光栅图像中恢复可编辑的图层层次结构,并引入优雅校验以防止错误累积。它还引入了FigmaEditReplay基准测试,用于大规模评估可编辑性,在基线之上实现了高视觉保真度和卓越的可编辑性。
介绍了EpiNarrate,一个将结构化数值推理与自然语言生成分离的智能体框架,用于从集成预测中生成有依据的流行病学叙述。
O-VAD 提出了一种无需训练的智能体框架,用于工业视频异常检测,该框架随时间跟踪对象状态演变,并在时间轨迹上进行推理以识别异常对象,在三个数据集上优于现有的 VLM 和 VAD 方法。
本文介绍了ChartCynics,一种将感知与验证解耦的智能体双路径框架,用于鲁棒地回答关于误导性图表的问题。它通过使用诊断视觉路径和OCR驱动的数据路径,以及用于推理蒸馏和对抗对齐的两阶段协议,实现了最先进的准确率。
提出了AgentKGV,一种基于两阶段训练(蒸馏SFT和轨迹级GRPO)的智能LLM-RAG框架,用于验证知识图谱中的事实,在T-REx基准上取得了显著改进,同时减少了检索调用。
HASE 是一个强化学习框架,它在统一的智能体过程中协同进化模型权重、任务解决方案以及流程组件(引导与评估),使单个8B参数的模型在文本分类和阿尔法因子挖掘任务上能够匹配更大系统的性能。
提出了一种智能体框架,利用通用编码大语言模型将研究级数学自动形式化为Lean 4代码,并在Putnam问题和STOC会议论文上进行了评估。
VideoSearch-R1 引入了一种智能体框架,该框架通过连续潜在空间优化和策略优化,迭代式地检索视频并优化搜索查询,在视频语料库时刻检索和时间定位任务上取得了最先进的性能。
本文提出了Robust-TO,一个智能视频理解框架,它整合了每帧的可信度来解决盲信任问题,在真实扰动下实现了显著的精度提升。
Robust-TO通过将每帧可信度集成到智能框架中,解决了视频推理中的盲目信任问题,通过校准证据加权和可靠性感知推理,在现实扰动下提高了准确性。
Qwen-Image-Agent 提出了一种统一的代理框架,通过整合规划、推理、搜索和记忆机制,解决了文本到图像生成中的上下文差距问题。该框架引入了 IA-Bench 进行评估,并取得了最先进的性能。
OmniPath是一个多模态代理框架,结合了OpenStreetMap网络拓扑与航空LiDAR数据,通过高分辨率分析坡度、表面不连续等物理障碍来审计轮椅无障碍性,并经过实地调查验证。