标签
介绍了Thea,一个用于具身智能体的操控框架,将机器人能力编排为可调用的工具,引入场景图作为上下文和评估作为退出码,以闭环连接智能体与物理世界。
GraphThink 是一个将任务图与场景图相结合的框架,旨在增强基于LLM的长时程具身任务规划,在ALFRED基准上取得了最先进的结果,并提升了泛化能力和闭环重规划能力。
本文介绍了Agentic RAG-VLM,一个统一的框架,将检索增强生成与视觉语言模型及自反思规划相结合,实现在杂乱环境中的泛化机器人抓取,成功率达到78.3%。
物理问题场景图(PQSG)是一种基于层次化问题的评估流程,利用视觉语言模型(VLM)对视频生成模型的物理合理性进行细粒度的违规检测。该工作引入了FinePhyEval数据集,并显示出比以往工作更高的与人类判断的相关性。
PhyDrawGen 是一个神经符号管道,它结合基于大语言模型的场景理解、确定性约束求解器以及基于视觉语言模型的验证循环,从自然语言生成物理精确的示意图,在物理问题基准测试中优于现有模型。
# 论文页面 - HSG:双曲场景图 来源:[https://huggingface.co/papers/2604.17454](https://huggingface.co/papers/2604.17454) 在你的 agent 中获取这篇论文:`hf papers read 2604\.17454` 还没有最新的 CLI?`curl \-LsSf https://hf\.co/cli/install\.sh \| bash` ## 引用本文的模型0 暂无模型关联此论文 在模型的 README.md 中引用 arxiv\.org/abs/2604\.17454,即可从此页面链接到它\. ## 引用本文的数据集0 暂无数据集关联此论文 引用 arxiv\.org/abs/2604\.