标签
Presents STCAD, a scalable framework using BERT-based encoding and CURE clustering to perform trajectory clustering and anomaly detection on terabyte-scale AIS maritime data, demonstrating stable clusters and clear separation of anomalous vessel behavior.
This paper introduces GRACE, a framework that uses LLM-generated semantic descriptions at the attribute-value level to create unified metric spaces for clustering mixed tabular data, achieving scalability comparable to statistical baselines while improving clustering accuracy.
提出了一种用于LLM预训练的可扩展子文档去重框架,将重复检测与副本保留分离,采用频次与长度感知策略。在FineWeb-Edu和代码网页语料上的实验表明,模型性能得到提升。
DecoupleMix引入了一个系统框架,通过解耦类间和类内比率搜索来优化视觉语言模型的预训练数据混合,使用凸优化来提升可扩展性和性能,超越启发式基线。
Molt是一个基于PyTorch原生的智能体强化学习训练框架,设计简洁紧凑,易于修改,同时实现了与基于Megatron的框架相当的性能。
本文提出了一种基于GPT-5模型变体的生成式AI辅助摘要框架,以解决自动作文评分中输入长度限制的问题,并在ASAP 2.0数据集上展示了模型能力、摘要保真度和计算成本之间的权衡。
提出了一种基于扰动的学习规则,用于Echo State Networks中的在线自监督学习,通过分解学习成本并仅扰动输入相关部分,避免了依赖于储层大小的方差增长。
本文提出SCISE,一个可扩展的无监督图聚类框架,通过社区感知采样和结构熵克服小批量训练中的结构孤立问题,在基准数据集上取得了最先进的结果。
本文提出了用于AI安全验证的单证明者交互证明,避免了两竞争模型之间的辩论需求,并将该方法扩展到预言机辅助计算。
Memora 是一种为 AI 智能体设计的可扩展记忆系统,它将存储与检索分离,能够支持长周期任务,同时将上下文令牌减少多达 98%,并在基准测试上取得了新的最佳性能。该论文发表于 ICML 2026。
DataStates-LLM提出了一种可扩展的检查点架构,利用可组合的状态提供程序,相比于现有解决方案,吞吐量提升高达4倍,训练时间减少2.2倍。
该研究表明,人工智能可以使专家主导的旧病例定期再分析更具可扩展性,帮助临床医生随着医学知识的进步重新审视病例,挖掘值得调查的线索,并可能为更多此前难以分析的病例找到答案。
μ_0是一种可扩展的世界模型,可预测交互点的平滑3D轨迹,通过使用TraceExtract系统进行监督,实现无需动作标签的、与具身无关的机器人学习。
PatchSTG 提出了一种基于补丁的时空图变换器,用于不规则传感器网络的交通预测,实现了近线性复杂度并保持了有竞争力的性能。
GRASP 提出了一种几何感知、基于交互的可扩展预训练数据归因方法,该方法对子集动态进行建模,在任务级秩相关上比现有加性方法提升超过两倍,同时降低了计算成本。
mimalloc 是一个开源、高性能、可扩展的内存分配器,可作为 malloc 和 free 的直接替代品。它专为现代高并发应用和大内存规模而设计,被用于 Bing 等主要服务,并集成到 NoGIL CPython 和 Unreal Engine 等项目中。
Browser Use 推出全新浏览器基础设施服务,具备亚秒级冷启动、更低成本(每小时0.02美元)以及无限扩展能力,现已面向开发者上线。
本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。