标签
本研究评估了使用GPT-5对早期儿童课堂中师幼互动进行评分,与人类评分者进行比较,发现部分一致性,但在全面评估中存在局限性。
本文介绍了体验性互文性检测,使用包括零样本LLM评分在内的无标注方法,以识别来自不同路线的法语移民叙事中共享的体验回声。
作者开发了Research Radar,一个开源工具,可自动获取arXiv论文,使用LLMs对摘要进行评分以匹配用户定义的研究兴趣,并生成包含深度阅读摘要的个性化每日摘要。