智能AI
morning
CapMem:自我中心视频中基于字幕的情景记忆的基准
摘要
arXiv:2609.17688v1 Announce Type: new Abstract: Wearable assistants require episodic memory over egocentric video, yet current vision-language models face bounded frame budgets, growing visual-token c...
and
episodic
memory
video
models
long
the
caption
over
egocentric
2026-09-17
1 阅读
约1分钟阅读
Dingli Liang, Yiqiao Xie, Yukai Huang, Zhaokai Wang, Weitong Cai, Guangwen Feng, Jifei Song, Zhensong Zhang, Hang Zhang
字号:
arXiv:2609.17688v1 公告类型:新 摘要:可穿戴助手需要对以自我为中心的视频进行情景记忆,但当前的视觉语言模型面临有限的帧预算、不断增长的视觉令牌成本和长上下文检索失败。在这些实际限制下,我们研究文本字幕是否可以作为可重用的情景记忆。我们定义了情节记忆视频字幕 QA 任务,并引入了 CapMem,这是一个人工注释的基准测试,包含 75 个视频,总计 33.7 小时,以及 16 个场景的 1,000 个多项选择题。在长视频(>20 分钟)上,具有 30 秒和 60 秒字幕窗口的全覆盖 CaptionQA 的性能分别优于 10/12 和 8/12 模型的直接 VideoQA。在同一视频子集上,六个 Qwen 模型的匹配帧控制分别保留了 3.22 点和 2.55 点的平均精度增益。我们的字幕引导检索和验证工具进一步将准确性提高了 5.3 点。这些结果支持了字幕记忆对于长段自我中心视频的情景推理的有效性。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱