首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

将感知与描述解耦:多元时间序列和语言之间基于计算的表示对齐

2026-08-07 1 阅读 约1分钟阅读 Xinran Feng, Yi Xie, Chao Zhang, Ruikun Li, Wanyun Ling, Ziyue Li, Chenxi Liu
分享:
字号:
arXiv:2608.05238v1 公告类型:新 摘要:训练多模态模型以使时间序列与语言保持一致会陷入自我监督陷阱。通常的方法要求法学硕士阅读一系列文章并撰写描述,因此标签质量受到模型应该学习的感知技能的限制。数据所教的内容永远不会超过贴标者已经知道的内容。第二个差距使情况变得更糟:大多数数据集使用单个变量,但重要的模式(跨渠道相关性、超前滞后结构、同时出现的异常)仅出现在多个变量中,而这正是标记法学硕士的限制最明显的地方。这两个问题造成了一个三难困境:现有的方法是可靠的、现实的或可扩展的,但没有一个方法能够同时实现这三个目标。我们通过将感知与描述脱钩来解决这个问题。确定性代码根据真实的开源多元序列计算一组统计数据;法学硕士用语言表达了这些预先计算的事实。感知是法学硕士做得很差的,它是通过计算来处理的,而法学硕士则处理表达。这产生了 CGTime,我们的基于 4B 参数计算的时间序列语言模型。 CGTime 在多变量理解任务上的表现优于更大的通用模型:它在我们的基准测试中获得了最佳的多变量事实得分(GPT-4o-mini 为 0.283,GPT-4o-mini 为 0.173,GPT-5.4-nano 为 0.203),这一差距在针对每个基线的 Holm 校正配对显着性测试中仍然存在。它还更准确地在生成的标题中陈述可验证的数字事实,并涵盖更广泛的统计属性。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱