标签
本文探讨了利用人类-LLM不一致来增强系统综述中基于清单的质量评估,表明分析不一致可以识别模糊项目并改进清单设计,以提高一致性和保持研究排名。
本研究探讨了类别不平衡和批处理如何影响系统综述中基于LLM的筛选,揭示了批处理显著改变了决策行为,而流行率元数据的影响微乎其微。
本研究评估了像 ChatGPT、Claude 和 Gemini 这样的 AI 聊天机器人如何为医学问题检索临床研究,发现模型和用户角色对性能有显著影响,并且对较大样本大小存在偏倚。