在不同作答条件下评估非一致信度:以自动作文评分为例的条件概化框架
摘要
本文提出了一种条件概化框架,用于在自动作文评分中评估不同作答条件下的非一致信度。
查看缓存全文
缓存时间: 2026/07/15 04:21
# 评估不同答题条件下的非均匀可靠性:以自动作文评分为例的条件泛化框架 来源:https://arxiv.org/abs/2607.11981 书目工具 ## 书目与引用工具 书目浏览器 切换 代码、数据、媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区合作者的实验性项目 arXivLabs是一个框架,允许合作者直接在网站上开发和分享新的arXiv功能。 与arXivLabs合作的个人和组织都已接受并认同我们对开放性、社区、卓越和数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。 有一个能为arXiv社区增加价值的项目想法?**了解更多关于arXivLabs的信息**(https://info.arxiv.org/labs/index.html)。
相似文章
Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations
This paper applies Generalizability Theory to agent benchmarks, showing leaderboards rank specialization rather than capability, and proposes a framework (DDR) for sizing reliable deployment evaluations.
绘制评估前沿:十一种评估者-代理条件下偏差-可靠性权衡的实证调查
这项实证调查通过测量11种条件下的评估者耦合、策略多样性和小样本可靠性,扩展了先前关于LLM评估中偏差-可靠性权衡的研究,证实了低评估者影响会导致高测量噪声,而强耦合会降低多样性和噪声。
Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes
The paper introduces Evaluation-Conditioned Training (ECT), a post-training framework that conditions on natural language descriptions of feedback fidelity to help LLMs generalize to stronger oversight, with proof-of-concept experiments showing improved even-handedness and reduced sycophancy.
一种用于自主上下文感知数据质量评估的智能体检索框架
一篇研究论文,提出了一种统一的智能体检索框架,用于自主上下文感知数据质量评估。该框架解释自然语言使用描述,通过多智能体工作流生成可执行验证逻辑,并使用可行性验证来确保可靠性。
智能体行为契约 II:在不假设独立性的前提下认证组合可靠性
本文检验了多智能体系统组合可靠性界限所依据的独立性假设,发现同模型智能体以高比率共同失效,且常见的证书不健全。它提出了一种通过协同执行矩上的线性规划得到的有限样本、无依赖性的证书,并在18,000次任务上进行了验证。