标签
介绍了DrawingVQA,这是首个用于评估多模态大语言模型在真实建筑图纸上表现的基准,包含33张图纸和92组涵盖三种推理深度的问答对,揭示了模型与专家性能之间的差距。
法律专业人士生成式AI平台Harvey与OpenAI合作,创建了一个定制训练的案例法模型,该模型减少了幻觉现象,改善了文件起草和合同分析等复杂法律任务的推理能力。该定制模型在10亿个美国案例法令牌上进行了训练,在律师偏好度测试中超过标准基础模型97%。