ensemble

标签

Cards List
#ensemble

你被录用了:LLM协作中的战略性模型选择

arXiv cs.CL ↗ · 2天前 缓存

本文提出了一种针对多LLM协作的9种模型选择算法的分类体系,研究表明,在数学、编程、问答和推理任务中,基于能力感知的选择策略相比随机或启发式的团队组建方式,性能提升最高可达36.1%。

0 人收藏 0 人点赞
#ensemble

EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

arXiv cs.CL ↗ · 2026-08-12 缓存

This paper presents EVIL-Detect, a multi-signal ensemble framework with conflict-aware fusion for detecting LLM-generated, refined, and human-written Chinese text in the NLPCC 2026 Shared Task 6, achieving first place with a macro-F1 of 0.8888.

0 人收藏 0 人点赞
#ensemble

精确集成,脆弱叙事:多尺度堆叠与信用风险LLM生成解释的保真度审计

arXiv cs.LG ↗ · 2026-08-11 缓存

本文构建了一个用于信用风险评分的多尺度堆叠集成,并对LLM生成的解释进行了审计,发现排名提升虽然真实但幅度较小,而叙述性解释往往不忠实,SHAP和LIME在重要特征上一致,但在特征顺序或符号上不一致。

0 人收藏 0 人点赞
#ensemble

面向SAT的领域特定超专业化

Lobsters Hottest ↗ · 2026-08-07 缓存

LymphoSAT,一个由LLM辅助生成的126个专用求解器组成的集成系统,赢得了SAT竞赛2026,展示了领域特定超专业化作为SAT求解的新方法。

0 人收藏 0 人点赞
#ensemble

基于预训练Transformer的感知模型的对抗鲁棒溯因融合

arXiv cs.AI ↗ · 2026-08-06 缓存

本文提出了一种无需领域知识的元认知层,用于融合多个基于预训练ViT的感知模型,利用标签向量池和基于一致性的溯因。在干净数据上,它可与多数投票基线持平,并且对协同标签翻转攻击尤其鲁棒。

0 人收藏 0 人点赞
#ensemble

推理共识:基于加权DAG聚合的LLM推理结构集成

arXiv cs.CL ↗ · 2026-07-31 缓存

本文提出一个框架,通过加权合并从多个大语言模型中提取的有向无环图(DAGs)来集成其推理结构,从而在多个基准测试中实现更准确、更具可解释性的共识推理。

0 人收藏 0 人点赞
#ensemble

面向多LLM系统中不确定性感知的信任估计方法:基于结构化专家判断

arXiv cs.LG ↗ · 2026-07-24 缓存

本文介绍了一种面向多LLM预测聚合的不确定性感知信任估计方法,该方法改编自结构化专家判断,采用库克风格对数加权来惩罚过度自信的错误预测。在MMLU和MMLU-Pro上的评估表明,该方法在异构和受污染的专家面板下实现了优越的准确性与可靠性平衡。

0 人收藏 0 人点赞
#ensemble

@no_stp_on_snek: 如果你构建 multi-agent 或 mixture-of-agents 系统,请阅读 @dangerm00se 的文章。让我印象深刻的一个发现:甚至…

X AI KOLs Timeline ↗ · 2026-07-06 缓存

一位用户强调了 Hugh Madden 关于 multi-agent 系统的文章中的一个发现:即使是强大的仲裁者(GPT-5.5),如果先看到较弱代理的输出,也会产生偏差,从约 98% 的单独准确率下降到 7/9。

0 人收藏 0 人点赞
#ensemble

LV-ROVER: 多流Tesseract投票用于马耳他语段落OCR

arXiv cs.CL ↗ · 2026-07-02 缓存

本文介绍了LV-ROVER,一个用于马耳他语OCR的多流Tesseract集成系统,通过合成数据训练和后处理,字符错误率降低了70%,解决了马耳他语低资源OCR的挑战。

0 人收藏 0 人点赞
#ensemble

基于可解释集成机器学习模型检测丙型肝炎患者肝硬化的存在

arXiv cs.AI ↗ · 2026-06-26 缓存

本文应用集成机器学习模型(随机森林、梯度提升、XGBoost、极端随机树)检测丙型肝炎患者的肝硬化,使用了来自2038名埃及患者的28个特征。极端随机树模型仅用16个特征就达到了96.92%的准确率,优于其他模型。

0 人收藏 0 人点赞
#ensemble

基于生理信号的多模态情感识别的深度时间建模与集成融合

arXiv cs.CL ↗ · 2026-06-16 缓存

本文评估了深度学习模型(LSTM、TCN、Transformer)在WESAD数据集上基于生理信号的多模态情感识别表现,结果表明集成方法达到了98.91%的准确率。

0 人收藏 0 人点赞
#ensemble

我越是用多个模型,就越觉得“AI共识”是个陷阱——分歧才是唯一值得关注的部分

Reddit r/artificial ↗ · 2026-06-06

一篇反思文章,认为在多模型设置中,共识输出的价值低于分歧,分歧揭示了问题中真正存在争议的部分。文章质疑共识是否应该是目标,以及如何区分有建设性的分歧与无意义的噪音。

0 人收藏 0 人点赞
#ensemble

从TF-IDF到Transformer:情感分类的比较与集成方法

arXiv cs.CL ↗ · 2026-05-22 缓存

本文比较了多种机器学习与Transformer模型在电影评论情感分类中的表现,发现RoBERTa达到了93.02%的准确率,而软投票集成方法进一步提升了性能。

0 人收藏 0 人点赞
#ensemble

RaguTeam参加SemEval-2026任务8:在法官协调的大语言模型集成中使用Meno及其伙伴进行忠实的多轮响应生成

Hugging Face Daily Papers ↗ · 2026-05-06 缓存

本文介绍了SemEval-2026任务8生成子任务的获胜系统。该系统采用由七个大语言模型组成的异构集成,结合双重提示策略,并使用GPT-4o-mini作为裁判来挑选最佳响应。该系统以0.7827的条件调和平均数获得第一名,优于所有基线模型,证明了模型多样性的价值。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈