标签
本文展示了如何使用任何GGUF模型与llama.cpp进行二元分类任务(如垃圾邮件检测),通过配置参数从logprobs中输出概率。
ProbPlug 引入了一个轻量级框架,用于基于内部标记特征估计LLM二分类的置信度,在不修改基础模型的情况下提高了文本和多模态任务中的可靠性。
本文证明,单调对抗腐败可以使某些多类和部分二元分类问题变得不可学习,提供了腐败预算的紧界,并扩展了先前关于二元分类的结果。
本研究在有限标签噪声条件下测试主动学习中的不确定性采样,通过比较不同数据集上的误差暴露和误差定位效应,以评估其鲁棒性和性能。
Raindrop推出由rd-signal-2驱动的Signals 2.0,这是一个从生产轨迹构建任务特定二元分类器的新模型管道。它声称在成本降低1600倍的情况下,实现了接近GPT-5.6 Sol xhigh的准确率,同时还推出了Signal Builder,用于构建自定义分类器,且零数据保留。
本文系统表征了线性模型与单量子比特混合态模型在二分类任务中的内在可解释性差异,揭示了量子模型学习的是超椭球而非超平面,并探讨了这一发现对归纳偏置及教学法的启示。
本文提出PUe,一种用于有偏正-无标记学习的框架,使用归一化倾向得分和归一化逆概率加权来处理选择偏差,在非均匀标签分布下改进分类性能。
本文提出了一种二元少样本分类的光谱相图,通过分析内在维度和几何饱和进行表征诊断。
本文提出了基于生产车辆巡航信号的机器学习框架,用于道路表面条件的二元分类(抓地 vs 打滑),解决了传统摩擦估计方法在低滑移条件下失效的问题。
本文探讨了当标准为二元时,哪些用于LLM评委验证的一致性统计是冗余的,并提供了一个包含弃权处理在内的正确报告清单。
本文提出使用成对查询来改进二分类中的选择性分类,特别是在置信度估计不一致的情况下(如大语言模型的上下文学习)。理论条件及在合成和真实数据集上的实验表明,基于成对查询的算法比原始置信度估计能实现更好的准确率-成本权衡。
本文介绍了 Counter Turing Test 共享任务在AI生成文本检测方面的发现,顶级系统在二分类任务中达到了完美表现,但在模型归因方面性能显著较低,突显了区分不同大语言模型输出的难度。
本文系统评估了五种不平衡处理方法(RUS、ROS、SMOTE、重加权、直接F1优化)在三个生物医学数据集(表格、文本、图像)上使用不同复杂度模型的效果。结果表明,收益取决于模型复杂度和数据模态,其中ROS、重加权和直接F1优化对非结构化数据上的复杂模型有效。