将感知与描述解耦:多元时间序列与语言之间的计算基础表征对齐
摘要
本文介绍了CGTime,一个4B参数的计算基础时间序列-语言模型,通过确定性统计和LLM言语化将感知与描述解耦,在多元理解任务上优于更大的通用模型。
arXiv:2608.05238v1 公告类型:新
摘要:训练多模态模型以对齐时间序列与语言会陷入自我监督陷阱。通常的做法是让LLM读取序列并编写描述,因此标签质量受限于模型本应学习的感知能力。数据永远无法教授超出标注者已知的内容。第二个差距使问题更严重:大多数数据集使用单变量,但重要的模式(跨通道相关性、领先-滞后结构、共现异常)只有在多个变量中才会出现,这正是标注LLM的局限暴露最明显的地方。这两个问题构成了一个三难困境:现有方法要么可靠、要么现实、要么可扩展,但没有一种能同时实现三者。我们通过将感知与描述解耦来解决这一问题。确定性代码从真实、开源的多变量序列中计算一组统计量;LLM将预先计算的事实言语化。感知——LLM不擅长的部分——由计算处理,而LLM负责表达。这产生了CGTime,我们的4B参数计算基础时间序列-语言模型。CGTime在多元理解任务上优于大得多的通用模型:在我们保留的基准上取得了最佳多变量事实分数(0.283,而GPT-4o-mini为0.173,GPT-5.4-nano为0.203),这一差距在对每个基线的Holm校正配对显著性检验中仍然成立。它还在生成的标题中更准确地陈述可验证的数值事实,并覆盖更广泛的统计属性。
查看缓存全文
缓存时间: 2026/08/07 07:48
# 将感知与描述解耦:多元时间序列与语言之间基于计算的对齐 来源:https://arxiv.org/abs/2608.05238 查看 PDF(https://arxiv.org/pdf/2608.05238) > 摘要:训练多模态模型以对齐时间序列与语言,会陷入一个自监督陷阱。常规做法是让LLM读取序列并写出描述,因此标签质量受限于该模型本应学习的感知能力。数据永远无法教导超出标注者已知范围的内容。第二个差距使情况更糟:大多数数据集只使用单一变量,但有意义的模式(跨通道相关性、领先-滞后结构、共现异常)只有在多个变量下才会出现,而恰恰在此时标注LLM的局限性暴露得最明显。这两个问题造成了一个三难困境:现有方法要么可靠、要么真实、要么可扩展,但没有一种能同时实现三者。我们通过将感知与描述解耦来解决这一问题。确定性代码从真实的开源多元序列中计算一组统计量;LLM 将这些预先计算的事实进行语言化。LLM 不擅长的感知由计算处理,而 LLM 负责表达。由此产生了 CGTime,我们 4B 参数的基于计算的时间序列-语言模型。CGTime 在多元理解任务上优于远大于它的通用模型:在我们留出基准上取得了最佳多元事实得分(0.283 对 GPT-4o-mini 的 0.173 和 GPT-5.4-nano 的 0.203),这一差距在与每个基线的经 Holm 校正的配对显著性检验中依然成立。它在生成的描述中也更准确地陈述了可验证的数值事实,并覆盖了更广泛的统计属性。 ## 提交历史 来自:Xinran Feng [查看电子邮件(https://arxiv.org/show-email/7e231c08/2608.05238)] **\[v1\]** 2026年8月5日星期三 13:57:08 UTC(6,665 KB)
相似文章
Chronicle:用于联合语言和时间序列理解的多模态基础模型
Chronicle 是一个 324M 参数的纯解码器 Transformer,从零开始在自然语言和时间序列上预训练,在 NLU 和时间序列分类任务上取得了有竞争力的性能,并在 UCR/UEA 数据集上的冻结嵌入时间序列分类中创造了新的最先进水平。
TimeThink:激发时间序列大型语言模型中的组合推理
TimeThink 引入了一个合成框架,通过带有可验证奖励的强化学习来增强时间序列大型语言模型中的组合推理,在合成和真实任务上显示出相对于基线的显著改进。
用于在剩余使用寿命中锚定多模态语言模型的时间序列检索
本文提出了一种利用时间序列检索锚定多模态大语言模型进行剩余使用寿命预测的框架,展示了基于检索的方法在准确性和稳定性方面优于非检索基线。
ConceptTS: LLM引导的概念瓶颈用于可解释的多元时间序列预测
ConceptTS 引入了一个可解释的预测框架,该框架使用大语言模型为多元时间序列预测提出人类可读的概念,通过概念瓶颈在保持透明度的同时实现了具有竞争力的准确性。
GigaChat Audio: 时间感知的大型音频语言模型
本文介绍了 GigaChat Audio,一个时间感知的大型音频语言模型,能够对长达120分钟的音频回答问题并给出明确的时间戳,使用交错周期性时间标记和合成监督。该模型在基准测试中实现了强时间定位准确性,作者已发布模型权重和数据集。