标签
本文研究了LLM评审器在复杂专业任务中的可靠性,以专利起草为试验平台,发现评审器指导的修订能提升质量,但与人类专家评估的协议度依赖于具体指标。
Discovery Foundation Models 被提议作为通用系统,通过迭代问题表述、假设测试和基于证据的修订,在干湿实验室环境中实现开放式科学发现。本文引入了一个具有问题发现和持续改进等能力的框架,并通过Zetema和GALILEO等系统进行实例化。