Folia
← 返回头版

让视频模型学得更好更快:Linum公司披露数据过滤流水线演进

Linum公司的两兄弟团队目前正在从头训练文本到视频生成模型,并发布了技术博客,介绍了训练文本到视频生成模型时数据过滤流水线的演进历程 1。该团队的数据处理方案经历了从2024年使用低成本传统计算机视觉算法,到2025年初使用数千GPU运行微调大语言模型的显著升级 1。

在2024年的初始阶段,团队在CPU上运行启发式规则,使用PySceneDetect进行场景检测,使用EAST Detector进行文本检测,使用Haar-cascade进行人脸检测 1。2025年初,流水线迁移至数千GPU,部署在Nvidia A10Gs和L4s上,使用AutoShot和TransNetV2替代PySceneDetect,使用PaddleOCR+TensorRT替代EAST Detector 1。此外,团队使用SFT微调Qwen-2-VL-2B作为类别分类器,图像类别包括劣质产品图、图表截图、拼贴画和带水印图像等 1。在美学评估方面,团队使用RLVR(带有可验证奖励的强化学习)训练Qwen-2.5-VL-3B进行美学评分,采用GSPO算法,评分范围为1至4分 1。

最终,团队将约150亿张图像候选池过滤至约2.5亿张(1.7%),将约10亿个视频片段候选池过滤至约5000万个(5%)用于训练 1。同时,团队使用SOTA光流预测器WAFT过滤长尾低运动视频 1。CMU 2025年研究显示,电影摄影专家在标注镜头运动时与'ground truth'的分歧率约24%,经多次迭代才能达到96%一致率 1。


评论