标签
本研究提出了一种使用领域特定大型语言模型的综合框架,用于BIM中设计缺陷的智能识别与修复,实现了85%的准确率和94%的合理修复建议,并具有有效的幻觉控制。
DR³-Eval 是一个基准测试,用于评估深度研究代理在多模态、多文件报告生成中的表现,它通过真实的网络环境模拟和全面的评估框架,衡量信息召回、事实准确性、引用覆盖率、指令遵循和深度质量。