标签
一个完全可微分的神经软符号框架在单个计算图中集成视觉感知和任务规划,在Blocksworld和PlanBench等基准测试中实现更高的成功率并减少计算量。
本文介绍了The Unwritten Benchmark,这是一个用于评估多模态AI模型抽象感知推理能力的新挑战,揭示了人类与当前模型如GPT-4o和Gemini 2.5-Pro之间的显著性能差距。