Folia
← 返回头版

OpenWAM:可组合世界-动作模型的开放框架发布

研究人员发布了OpenWAM框架,这是一个支持视频预测与机器人控制灵活组合的开放基础设施1。该框架在32块NVIDIA B200 GPU上进行了14天的预训练,使用约334万轨迹和14.64k小时源视频1。通过采用混合专家架构并应用反事实数据集增强,OpenWAM在LIBERO基准测试中实现了98.6%的平均成功率,在LIBERO-Long上超过95%1。

框架的核心创新在于支持独立训练的组件在推理时的灵活组合1。相比原始Wan2.2初始化,机器人视频预训练在LIBERO-Long上分别为VTA和Joint带来29.4个百分点和34.4个百分点的性能提升1。研究团队创建了包含32,000个反事实片段跨越10个任务的LIBERO-Long-CF数据集1,其中冻结的反事实逆动力学模型在新任务上达到84.0%的平均成功率,相比仅依赖演示的47.0%实现了显著提升1。在执行精度方面,端效应器位置在平均3.34厘米内(中位数1.90厘米),反事实监督将RGB均方误差降低34.5%,并将16个替代方案中正确未来的识别率从21.1%提升至71.3%1。


评论