标签
This paper introduces MINT, a method that stacks recurrence (self-similarity) matrices of multiple time series into a tensor and applies tensor decomposition to mine co-clustered cross-sensor patterns. Experiments on transit, electricity, wind turbine, and traffic data show effective co-clustering of motifs in regular time series.
在aiDotEngineer世界博览会上,Vtrivedy10讨论了从追踪数据中进行数据挖掘是一种高杠杆率的实践,有助于理解AI智能体、大规模整理数据并运行改进循环。
MediaCrawler 是一个 GitHub 上 5.4 万+ Star 的开源多平台社交媒体爬虫工具,支持小红书、抖音、B站等 7 大平台的数据采集,具备多账号、IP 代理、断点续爬和 AI 集成等特性。
AnTenA 是一个可解释性系统,利用大语言模型为通过张量分解提取的隐藏模式生成自然语言解释,无需依赖可能不准确的标签或元数据。
该帖子概述了一个未来智能体配方,通过微调高效、专业化的开源模型,在LLM-as-a-judge任务上超越前沿性能,并将其应用于从追踪数据中提取信号以实现持续学习。LangChain Labs 和 FireworksAI 发布了展示这一方法的新工作。
本文介绍了FewRS,一种基于重采样的方法,它大幅减少了统计可靠数据挖掘所需的重采样数据集数量,在保持严格错误发现控制和高统计功效的同时,实现了高达两个数量级的加速。
C-Mining提出了一个无监督框架,通过利用嵌入空间中的跨语言几何错位来发现LLM训练数据中的文化种子,实现可扩展的合成数据生成以支持文化对齐,无需手动或LLM监督。