clustering

标签

Cards List
#clustering

使用GMM和LLM通过定向数据增强进行不平衡数据聚类

arXiv cs.CL · 12小时前 缓存

本文提出了一种新颖的无监督数据增强方法,结合高斯混合模型和大语言模型,通过为代表性不足的聚类生成合成文档,改善不平衡文本数据集上的聚类效果。

0 人收藏 0 人点赞
#clustering

Archetypes or ability? Clustering for modelling student mathematical competence

arXiv cs.AI · 3天前 缓存

This paper applies clustering methods, including a Bernoulli Mixture Model, to a large dataset of UK national-level exam results to test assumptions about discrete mathematical abilities, finding that overall student ability is the dominant factor in performance.

0 人收藏 0 人点赞
#clustering

从无监督子组到假设状态干预策略:观察性健康数据中选定子组方法的评估

arXiv cs.LG · 4天前 缓存

本文评估了无监督子组方法与因果发现和政策评估相结合,用于观察性数据中的预算约束健康干预,发现在留出评估中没有单一方法始终优于其他方法。

0 人收藏 0 人点赞
#clustering

大数据K-means聚类的数据原生全局优化

arXiv cs.LG · 2026-07-20 缓存

提出Big-means++,一种简单的算法,通过系统性地整理输入并使用样本诱导的代理景观,实现大数据K-means聚类的全局优化质量。

0 人收藏 0 人点赞
#clustering

CRAFT:聚类评分标准以诊断弱项LLM能力并生成有针对性的微调数据

arXiv cs.AI · 2026-07-20 缓存

CRAFT将基于评分标准的评估转化为LLM的分层能力诊断,识别特定弱点并生成有针对性的微调数据,在四个开源模型的金融和法律基准上取得了更强结果。

0 人收藏 0 人点赞
#clustering

FastCentNN: 使用熵代理加速质心神经网络

arXiv cs.LG · 2026-07-16 缓存

FastCentNN 是质心神经网络的一种加速变体,它利用基于每个训练轮次质心移动的熵代理来触发早期分裂,从而将运行时间减少高达16%,同时保持聚类质量。

0 人收藏 0 人点赞
#clustering

用于多变量风电场SCADA数据滤波的聚类算法

arXiv cs.LG · 2026-07-16 缓存

本文比较了用于过滤风电场SCADA数据以仅保留正常运行测量值的聚类算法,引入了适用于未标记数据的评估指标,并基于对三台海上风机的测试给出了建议。

0 人收藏 0 人点赞
#clustering

记住独特项目而非标记:一种可学习的狄利克雷过程缓存,介于状态空间模型与注意力机制之间

arXiv cs.LG · 2026-07-14 缓存

本文提出了一种可学习的狄利克雷过程缓存,仅为新颖输入分配内存槽,使得缓存大小与独特项目数而非令牌数成比例,从而实现高效的关联回忆。它将DP-means聚类与循环骨干网络相结合,在关联回忆基准测试和真实世界数据流上展示了有效性。

0 人收藏 0 人点赞
#clustering

使用数据并行吉布斯采样的非参数贝叶斯逆强化学习

arXiv cs.LG · 2026-07-14 缓存

本文提出了一种非参数贝叶斯逆强化学习方法,使用狄利克雷过程先验从专家演示中推断多个潜在奖励类型,并通过Ray实现并行的折叠吉布斯采样器以提高可扩展性。

0 人收藏 0 人点赞
#clustering

插补与聚类相结合:利用潜在子组结构进行缺失数据恢复

arXiv cs.LG · 2026-07-09 缓存

提出了CAGI,一个将聚类与生成对抗网络相结合的框架,通过利用潜在子组结构改进缺失数据插补,在基准数据集上取得了优越性能。

0 人收藏 0 人点赞
#clustering

基于聚类的资本市场可疑交易模式识别框架

arXiv cs.AI · 2026-07-07 缓存

本文提出一种基于K-Means++的无监督聚类框架,用于检测资本市场数据中的可疑交易模式,轮廓系数达到0.561,识别出2.02%的交易可能为欺诈。

0 人收藏 0 人点赞
#clustering

原型语言模型

arXiv cs.LG · 2026-07-02 缓存

介绍了PRISM,一种原型语言模型架构,它使用稀疏、非负的已学习原型混合体进行可解释的序列建模,实现了具有竞争力的性能,并支持快速训练数据归因和无需微调的模型编辑。

0 人收藏 0 人点赞
#clustering

scKDGM: KAN引导的动态图掩码学习用于单细胞RNA-seq聚类

arXiv cs.LG · 2026-06-30 缓存

提出scKDGM框架,利用KAN引导的动态图掩码学习和跨视图对比学习对单细胞RNA-seq数据进行聚类,在12个真实数据集上达到最先进性能。

0 人收藏 0 人点赞
#clustering

聚类、路由、升级:面向成本感知的LLM服务的级联框架

arXiv cs.CL · 2026-06-29 缓存

提出了一种面向成本感知的LLM服务的两阶段级联框架,该框架将查询聚类并路由至最具成本效益的模型,然后将低质量输出升级至更强的模型。在降低推理成本的同时,保留了97-99%的准确率。

0 人收藏 0 人点赞
#clustering

基于术语的异质语料库层级归纳

arXiv cs.CL · 2026-06-26 缓存

提出了一种基于术语的框架,用于从异质文本源中归纳层级分类体系,实现跨源对齐和可解释的层级结构。在多源基准上的实验表明,与基于文本和摘要的基线相比,该框架在一致性和质量上有所提升。

0 人收藏 0 人点赞
#clustering

学习量化行人行走中的社会互动约束

arXiv cs.AI · 2026-06-17 缓存

本文提出了一种名为“学习聚类”的方法,用于量化和解读行人之间的社会互动,以实现更准确的轨迹预测。该方法利用概率潜变量生成学习,在无标签的情况下对社会互动进行聚类,提高了自动驾驶和社交机器人的鲁棒性。

0 人收藏 0 人点赞
#clustering

@_avichawla: 研究人员将KMeans提速200倍。这一新技术也超越了cuML和FAISS等方法。Flash-KMeans是一种…

X AI KOLs Timeline · 2026-06-16 缓存

Flash-KMeans是精确KMeans的一种I/O感知实现,它围绕现代GPU瓶颈重新设计了算法,通过消除冗余的内存读写,相比cuML实现了33倍加速,相比FAISS实现了200倍加速。

0 人收藏 0 人点赞
#clustering

CRUMB:基于分布匹配上下文批处理的高效先验拟合网络推理

arXiv cs.LG · 2026-06-11 缓存

本文提出CRUMB,一种三阶段推理封装方法,通过聚类测试查询并利用最小化最大均值差异(MMD)选择分布匹配的训练子集,从而实现对大规模数据集的高效先验拟合网络推理。在51个TabArena数据集上,该方法在上下文选择方面达到了最先进水平。

0 人收藏 0 人点赞
#clustering

@yagilb: 我今年有幸在WWDC上演讲,在舞台上现场演示@lmstudio即将推出的聚类功能…

X AI KOLs Following · 2026-06-10 缓存

Yagil Bubrovnik在WWDC上演讲,现场演示了LM Studio即将推出的聚类功能,并对MLX团队的工作表示感谢。

0 人收藏 0 人点赞
#clustering

Sigma-Branch: 面向动态推理的分层单路径网络重构,减少活跃参数

arXiv cs.LG · 2026-06-10 缓存

Sigma-Branch 将预训练的稠密网络重构成一个层次化二叉树结构,包含共享主干、路由器和专用叶子节点。在 CIFAR-100、ImageNet-1K 和 ModelNet40 上,每次推理的活跃参数减少 58-60%,同时精度下降不超过基线精确率的 1.72 个百分点。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈