标签
本文提出了一种新颖的无监督数据增强方法,结合高斯混合模型和大语言模型,通过为代表性不足的聚类生成合成文档,改善不平衡文本数据集上的聚类效果。
This paper applies clustering methods, including a Bernoulli Mixture Model, to a large dataset of UK national-level exam results to test assumptions about discrete mathematical abilities, finding that overall student ability is the dominant factor in performance.
本文评估了无监督子组方法与因果发现和政策评估相结合,用于观察性数据中的预算约束健康干预,发现在留出评估中没有单一方法始终优于其他方法。
提出Big-means++,一种简单的算法,通过系统性地整理输入并使用样本诱导的代理景观,实现大数据K-means聚类的全局优化质量。
CRAFT将基于评分标准的评估转化为LLM的分层能力诊断,识别特定弱点并生成有针对性的微调数据,在四个开源模型的金融和法律基准上取得了更强结果。
FastCentNN 是质心神经网络的一种加速变体,它利用基于每个训练轮次质心移动的熵代理来触发早期分裂,从而将运行时间减少高达16%,同时保持聚类质量。
本文比较了用于过滤风电场SCADA数据以仅保留正常运行测量值的聚类算法,引入了适用于未标记数据的评估指标,并基于对三台海上风机的测试给出了建议。
本文提出了一种可学习的狄利克雷过程缓存,仅为新颖输入分配内存槽,使得缓存大小与独特项目数而非令牌数成比例,从而实现高效的关联回忆。它将DP-means聚类与循环骨干网络相结合,在关联回忆基准测试和真实世界数据流上展示了有效性。
本文提出了一种非参数贝叶斯逆强化学习方法,使用狄利克雷过程先验从专家演示中推断多个潜在奖励类型,并通过Ray实现并行的折叠吉布斯采样器以提高可扩展性。
提出了CAGI,一个将聚类与生成对抗网络相结合的框架,通过利用潜在子组结构改进缺失数据插补,在基准数据集上取得了优越性能。
本文提出一种基于K-Means++的无监督聚类框架,用于检测资本市场数据中的可疑交易模式,轮廓系数达到0.561,识别出2.02%的交易可能为欺诈。
介绍了PRISM,一种原型语言模型架构,它使用稀疏、非负的已学习原型混合体进行可解释的序列建模,实现了具有竞争力的性能,并支持快速训练数据归因和无需微调的模型编辑。
提出scKDGM框架,利用KAN引导的动态图掩码学习和跨视图对比学习对单细胞RNA-seq数据进行聚类,在12个真实数据集上达到最先进性能。
提出了一种面向成本感知的LLM服务的两阶段级联框架,该框架将查询聚类并路由至最具成本效益的模型,然后将低质量输出升级至更强的模型。在降低推理成本的同时,保留了97-99%的准确率。
提出了一种基于术语的框架,用于从异质文本源中归纳层级分类体系,实现跨源对齐和可解释的层级结构。在多源基准上的实验表明,与基于文本和摘要的基线相比,该框架在一致性和质量上有所提升。
本文提出了一种名为“学习聚类”的方法,用于量化和解读行人之间的社会互动,以实现更准确的轨迹预测。该方法利用概率潜变量生成学习,在无标签的情况下对社会互动进行聚类,提高了自动驾驶和社交机器人的鲁棒性。
Flash-KMeans是精确KMeans的一种I/O感知实现,它围绕现代GPU瓶颈重新设计了算法,通过消除冗余的内存读写,相比cuML实现了33倍加速,相比FAISS实现了200倍加速。
本文提出CRUMB,一种三阶段推理封装方法,通过聚类测试查询并利用最小化最大均值差异(MMD)选择分布匹配的训练子集,从而实现对大规模数据集的高效先验拟合网络推理。在51个TabArena数据集上,该方法在上下文选择方面达到了最先进水平。
Yagil Bubrovnik在WWDC上演讲,现场演示了LM Studio即将推出的聚类功能,并对MLX团队的工作表示感谢。
Sigma-Branch 将预训练的稠密网络重构成一个层次化二叉树结构,包含共享主干、路由器和专用叶子节点。在 CIFAR-100、ImageNet-1K 和 ModelNet40 上,每次推理的活跃参数减少 58-60%,同时精度下降不超过基线精确率的 1.72 个百分点。