在不同作答条件下评估非一致信度:以自动作文评分为例的条件概化框架

arXiv cs.CL 论文

摘要

本文提出了一种条件概化框架,用于在自动作文评分中评估不同作答条件下的非一致信度。

arXiv:2607.11981v1 公告类型:新 摘要:汇总信度估计可能会掩盖不同作答条件下测量设计负担的异质性,因此单一的G研究或D研究可能错误描述设计对特定层级的充分性。本研究引入了一个包含三个组成部分的条件概化框架。首先,自动评分配置——即固定流程中允许的编码器架构和评分头家族——被视为可接受的测量条件总体,而非偶然的建模选择。其次,分析性D研究预测与在有限评分池上的经验配置扫描进行比较,得出两个设计充分性的估计量,它们的一致或分歧可诊断已实现的配置总体。第三,将证据基于熵定义的作答层级进行条件化,将熵视为操作性分层变量,而不是关于写作质量的构念主张。近年来的概化理论扩展解决了作答侧由AI生成的题目变体问题,而本框架则解决了类似的评分侧问题:由AI介导的评分配置。通过定时二语写作的自动评分进行演示,所实现的设计在总体上是可靠的(Phi约0.76)。在熵层级内重新估计后,信度保持较高但略有且稳健地下降(Phi = 0.88, 0.87, 0.84)——这一梯度意味着不同的决策研究要求,最高熵层级需要最多的交叉条件。该框架为评估非一致信度提供了一个可移植的工作流程。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:21

# 评估不同答题条件下的非均匀可靠性:以自动作文评分为例的条件泛化框架
来源:https://arxiv.org/abs/2607.11981
书目工具

## 书目与引用工具

书目浏览器 切换

代码、数据、媒体

## 本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于arXivLabs

## arXivLabs:与社区合作者的实验性项目

arXivLabs是一个框架,允许合作者直接在网站上开发和分享新的arXiv功能。

与arXivLabs合作的个人和组织都已接受并认同我们对开放性、社区、卓越和数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。

有一个能为arXiv社区增加价值的项目想法?**了解更多关于arXivLabs的信息**(https://info.arxiv.org/labs/index.html)。

相似文章

智能体行为契约 II:在不假设独立性的前提下认证组合可靠性

arXiv cs.AI

本文检验了多智能体系统组合可靠性界限所依据的独立性假设,发现同模型智能体以高比率共同失效,且常见的证书不健全。它提出了一种通过协同执行矩上的线性规划得到的有限样本、无依赖性的证书,并在18,000次任务上进行了验证。