majority-voting

标签

Cards List
#majority-voting

关键投票盲点:聚合独立性指标忽略了验证真正有助益的场景

arXiv cs.AI · 5天前 缓存

本预印本对LLM评审团的聚合独立性指标提出质疑,表明验证信号仅在关键的“一票之差”查询上提升准确率,并提出一种按票数差距分层的调用缩减规则。

0 人收藏 0 人点赞
#majority-voting

社会压力破坏LLM安全评审小组的多数投票

arXiv cs.CL · 2026-08-06 缓存

这篇arXiv论文研究了来自模拟同行的共享社会线索如何破坏LLM安全评审小组中的多数投票保护。它表明,当所有评审者收到相同的错误“不安全”标签时,小组的误报率跃升至100%,揭示了一种失败模式,并提供了一种部署前的诊断方法。

0 人收藏 0 人点赞
#majority-voting

SynthAVE:可扩展的电子商务合成标注与LLM-Arena验证

arXiv cs.CL · 2026-07-09 缓存

本文介绍了SynthAVE,一个大规模人工验证的电子商务属性值提取基准,采用多LLM竞技场框架(含21种裁判配置)来高效且经济地验证合成标签,同时保持与人工审核相当的质量。

0 人收藏 0 人点赞
#majority-voting

委托投票何时击败多数表决?一种基于委托的多样本LLM推理聚合器

arXiv cs.AI · 2026-06-09 缓存

论文提出了一种基于委托的聚合器,名为传播代理投票(PPV),它利用字母熵和推理几何改进多样本LLM推理中的多数投票,在MMLU-Pro上取得了收益,无需外部标签或辅助训练。

0 人收藏 0 人点赞
#majority-voting

基于RAG的跨模型多数投票工作流评估ChatGPT在生物医学关联生成与验证中的协议

arXiv cs.CL · 2026-06-01 缓存

这篇arXiv论文提出了一种协议,用于评估ChatGPT在生成和验证生物医学关联方面的能力,采用基于RAG的跨模型多数投票工作流,以解决幻觉问题和本体论局限性。

0 人收藏 0 人点赞
#majority-voting

模型能力主导:AIMO 3推理时优化的经验启示

Hugging Face Daily Papers · 2026-04-16 缓存

本论文分析了AIMO 3的推理时优化技术,发现模型能力优于提示工程和多样化采样策略。研究表明高温度采样已经能够最大程度地去相关化误差,为基于提示的改进留下了很少余地,并识别出单个模型pass@20与多数投票共识之间存在6分的选择损失差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈