constraint-reasoning

标签

Cards List
#constraint-reasoning

MolDesignBench:评估基于场景的分子设计的LLM智能体

arXiv cs.AI ↗ · 昨天 缓存

MolDesignBench是一个新的基准测试,用于评估基于场景的分子设计中的LLM智能体,包含2000个具有隐式和显式约束的实例,揭示了当前前沿的LLMs成功率较低,尤其是在推理隐式约束和检测不可行性方面。

0 人收藏 0 人点赞
#constraint-reasoning

基于MaxSAT的反馈引导视觉语言模型解决数独

arXiv cs.AI ↗ · 2026-07-15 缓存

本文提出了一种神经符号方法,将MaxSAT预言机作为一致性验证器,引导视觉语言模型(VLM)解决数独谜题,从而提高逻辑一致性和求解实例数量。

0 人收藏 0 人点赞
#constraint-reasoning

残余漂移主导多轮约束推理中的矛盾

arXiv cs.AI ↗ · 2026-05-26 缓存

本文介绍了可满足漂移(satisfiable drift),这是一种多轮推理系统在保持内部逻辑一致性的同时,默默违反先前承诺的故障模式,并主导了矛盾。作者提出了DRIFT-Bench,一个包含816个问题的基准测试,并发现经过修复后,98-100%的残余错误是漂移错误。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈