首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

让视频模型学习得更好、更快

2026-08-27 1 阅读 约5分钟阅读 schopra909
分享:
字号:
通向 Linum v3 之路·第 01 期 自从一月份发布 Linum v2 以来,我们一直致力于开发下一个开放权重生成视频模型。对于 Linum v3,我们的目标是三个关键改进:更好的提示依从性、训练/推理加速和一致的物理原理。在本系列博客中,我们将详细介绍从头开始训练文本到视频模型的工程工作和基础研究。尽管自稳定扩散 3 以来这些模型的内部结构没有发生太大变化,但图像和视频模型在过去几年中已经取得了很大的进步。当然,也有一些小的变体,例如 GPT-Image 普及的自回归扩散。但在高层次上,它几乎都是与变压器主干和 v 预测目标相匹配的流。根据我们的经验,大部分收益可直接归因于 3 种数据改进:强化学习推动了一些改进,但它在过去几个月才开始真正适用于图像和视频。数据过滤和重新平衡:战略性地删除噪声数据并重新采样数据,以便您的模型更有效地学习数据注释:收集更好的注释,例如更丰富的标题、边界框和字体细节,以便您的模型更容易消除视觉概念的歧义 法学硕士在过去 12 个月中在图像字幕方面取得了无限的进步。对于视频来说情况不太如此,但那是另一次了。合成数据生成:对现有生成模型的集合进行微调,以创建几乎没有自然发生数据的训练数据(例如,纳米香蕉样式模型的图像编辑/参考调节),通常是针对非常具体的任务进行训练的脆弱 LoRA 的集合,以及经过微调以过滤掉不良合成数据的 LLM。几年前,所有生成模型(无论是文本、图像、音频)的普遍智慧是聚集尽可能多的数据进行预训练。幸运的是,该领域在这方面已经变得更加聪明。如果您将一堆低质量数据(例如严重压缩的 JPEG)放入预训练中,您的模型将浪费大量容量来学习如何模仿这部分数据。如果你很好地过滤了你的数据集,你的模型将更容易地学习你想要它学习的内容。我们知道这听起来很明显,但在实践中却很难做到。话又说回来,所有好的建议回想起来都应该是显而易见的。今天,我们将向您介绍自 2024 年以来我们的数据过滤方法是如何演变的。并且,如果您最终训练自己的生成模型,希望我们能够帮助您解决一些令人头痛的问题。 2024 年 CPU 上的老式简历 CPU 2025 年初 GPU 上的微调法学硕士 GPU 2025 年末 强化学习 GPU 一直被丢弃 错误地被丢弃 保留但应该被丢弃 RL 标题 [2024] 预算过滤 - CPU 上的传统简历 在第一次尝试时,我们决定通过老式计算机视觉算法推送我们的原始数据集。通过这种方式,我们可以使用廉价的 CPU 实例集群,而不是运行多模式 LLM 的大量 GPU。或者,花费数百万美元购买 GPT-4 代币。场景检测 我们需要过滤数百亿张图像和视频来创建预训练数据集。图像实际上并不需要任何特定的预处理,但原始视频则需要。当您训练生成视频模型时,首先需要对图像生成进行预训练。如果模型在学习动词之前学习名词,它往往会更好(更快)地收敛。下次您观看电视节目或电影时,跟踪镜头切换的频率。如果您正在观看过去 20 年制作的影片,您很可能每 5 秒就会看到一个剪辑。何时剪切以及如何剪切是作者的决定,而不是生成视频模型应该随意做的事情。因此,我们需要将镜头边界上的视频切成视频剪辑,然后才能对其进行过滤。在我们只考虑 CPU 的小气计划中,我们选择了 PySceneDetect 。在较高级别上,它维护 K 帧的滚动窗口,如果 K+1 帧具有显着不同的图像统计数据,则它将该帧分类为剪切。没有底层的机器学习模型。它运行速度非常快,但难以处理常见的过渡,如溶解、淡入淡出和抖动剪切(低调是一个大问题)。了解您的数据 每当您获得新数据时,您应该花几天时间检查随机样本,列出您想要保留的内容以及您想要丢弃的内容。理想情况下,您花时间起草“好”和“坏”类别的本体,并跟踪这些类别的相对大小。在数据过滤过程中的某个时刻,您的工程师大脑将接管,您将花费太多时间调整启发式(或法学硕士)的旋钮,追逐“完美”决策边界。这些笔记将帮助你摆脱自我的束缚。他们会给你法
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱