ensemble

标签

Cards List
#ensemble

面向多LLM系统中不确定性感知的信任估计方法:基于结构化专家判断

arXiv cs.LG · 2天前 缓存

本文介绍了一种面向多LLM预测聚合的不确定性感知信任估计方法,该方法改编自结构化专家判断,采用库克风格对数加权来惩罚过度自信的错误预测。在MMLU和MMLU-Pro上的评估表明,该方法在异构和受污染的专家面板下实现了优越的准确性与可靠性平衡。

0 人收藏 0 人点赞
#ensemble

@no_stp_on_snek: 如果你构建 multi-agent 或 mixture-of-agents 系统,请阅读 @dangerm00se 的文章。让我印象深刻的一个发现:甚至…

X AI KOLs Timeline · 2026-07-06 缓存

一位用户强调了 Hugh Madden 关于 multi-agent 系统的文章中的一个发现:即使是强大的仲裁者(GPT-5.5),如果先看到较弱代理的输出,也会产生偏差,从约 98% 的单独准确率下降到 7/9。

0 人收藏 0 人点赞
#ensemble

LV-ROVER: 多流Tesseract投票用于马耳他语段落OCR

arXiv cs.CL · 2026-07-02 缓存

本文介绍了LV-ROVER,一个用于马耳他语OCR的多流Tesseract集成系统,通过合成数据训练和后处理,字符错误率降低了70%,解决了马耳他语低资源OCR的挑战。

0 人收藏 0 人点赞
#ensemble

基于可解释集成机器学习模型检测丙型肝炎患者肝硬化的存在

arXiv cs.AI · 2026-06-26 缓存

本文应用集成机器学习模型(随机森林、梯度提升、XGBoost、极端随机树)检测丙型肝炎患者的肝硬化,使用了来自2038名埃及患者的28个特征。极端随机树模型仅用16个特征就达到了96.92%的准确率,优于其他模型。

0 人收藏 0 人点赞
#ensemble

基于生理信号的多模态情感识别的深度时间建模与集成融合

arXiv cs.CL · 2026-06-16 缓存

本文评估了深度学习模型(LSTM、TCN、Transformer)在WESAD数据集上基于生理信号的多模态情感识别表现,结果表明集成方法达到了98.91%的准确率。

0 人收藏 0 人点赞
#ensemble

我越是用多个模型,就越觉得“AI共识”是个陷阱——分歧才是唯一值得关注的部分

Reddit r/artificial · 2026-06-06

一篇反思文章,认为在多模型设置中,共识输出的价值低于分歧,分歧揭示了问题中真正存在争议的部分。文章质疑共识是否应该是目标,以及如何区分有建设性的分歧与无意义的噪音。

0 人收藏 0 人点赞
#ensemble

从TF-IDF到Transformer:情感分类的比较与集成方法

arXiv cs.CL · 2026-05-22 缓存

本文比较了多种机器学习与Transformer模型在电影评论情感分类中的表现,发现RoBERTa达到了93.02%的准确率,而软投票集成方法进一步提升了性能。

0 人收藏 0 人点赞
#ensemble

RaguTeam参加SemEval-2026任务8:在法官协调的大语言模型集成中使用Meno及其伙伴进行忠实的多轮响应生成

Hugging Face Daily Papers · 2026-05-06 缓存

本文介绍了SemEval-2026任务8生成子任务的获胜系统。该系统采用由七个大语言模型组成的异构集成,结合双重提示策略,并使用GPT-4o-mini作为裁判来挑选最佳响应。该系统以0.7827的条件调和平均数获得第一名,优于所有基线模型,证明了模型多样性的价值。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈