vla vigen wam
First Frame Is the Place to Go for Video Content Customization 20025.11 Arxiv
把要生成的reference拼接在一起,得到一个frame,并把这个frame作为noise input的首帧,并引入transition指令到Instruction里(比如"ad23r2 the camera view suddenly changes.")
利用videogen模型本身的能力,从首帧素材里提取对应元素用于受控生成。不过有个问题是,需要把首帧和相邻的几帧一起去掉,这几帧都是不能用的。
Video-As-Prompt 2025.10 Arxiv
R2V,条件和目标只共享抽象语义,没有像素对应关系。从I2V出发,为reference所有condition构建新的stream,并通过full attention和target(noise)stream进行数据交换。
同时因为reference和target没有对应关系,给rope加偏置,让两段token的位置编码不一致。
wan
wan2.1
wan最重要的应该就是vae,首帧被单独仅作空间压缩,剩余帧以4帧一个分组做时空压缩。另外,因为需要切成一个个chunk做编码,所以causal Conv3D需要一些缓存机制才能确保每个chunk之间处理不间断。如果时间通道不压缩,那么就直接把前面的帧历史编码移过来就行了;但是如果时间通道也要压缩,那么就需要结合stride的数值来重新考虑怎么填充来确保相位对齐。
T2V: 就是把text通过umt5编码后用cross attention融入到dit里。
I2V: I2V的首帧会被单独处理,首帧非常重要。
Camera traj Guided:给定每一帧的相机traj和内参(R t K),对于每一帧、每一个像素,都可以由相机内外参确定一条 3D ray,然后把这个ray转换成Plücker coordinates表示。camera adapter用类似 adaptive normalization 的方式调制每个 DiT block,通过zero-init的方式来注入camera信息。
wan2.2
wan2.2有两个expert,但是是串行的。早期阶段使用高噪声专家,专注于整体布局;后期阶段使用低噪声专家,细化视频细节。每个专家模型大约有14B参数,总共27B参数,但每步只有14B活跃参数,从而保持推理计算和GPU内存几乎不变。
然后wan2.2使用了压缩率更高的wan2.2-vae,有一个支持ti2v的模型。
VACE 2025.3 Arxiv
把“视频生成”和“视频编辑”的各种输入都抽象成同一种条件格式 VCU,然后用一个带 Context Adapter 的视频 DiT 模型统一处理 T2V、R2V、V2V、局部 masked editing 以及它们的组合任务。VCU=text+frame+mask,不同任务只是 F/M 的填法不同:T2V 用空帧与全 1 mask;R2V 把参考帧接在前面,并给参考帧配全 0 mask;V2V 用输入视频帧和全 1 mask;MV2V 用输入视频帧和用户给定的时空 mask。
另外,VACE 将 context frames F 按 mask 拆成两路:1)Reactive frames:Fc = F × M,表示需要被修改/重生成/作为控制信号的区域。2)Inactive frames:Fk = F × (1 − M),表示需要保留的区域或参考概念。这样子分离可以把控制条件和原始像素分离开,通过mask来表示哪些是需要重绘的,哪些是保留的。
但vace统一控制的话好像就没有单独去区分首帧信号了吧?
Wan-Move
利用i2v模型首帧特殊性,把motion相关内容从首帧feature里直接copy到对应latent space的对应位置上,这样不引入额外的motion encoder或者control相关的组件。
比如让给定了点a的轨迹,那么按照这个轨迹生成的视频对应的每个frame的点的position,然后以相同的vae压缩率得到这个点对应latent space的idx,然后把首帧的latent point feature直接copy到latent frame对应的idx上去,取代i2v默认的全0帧latent frame。
所以这种方法还需要前一级跟踪point。
CLAP 2026.1 arxiv
像lapa那样的算法在自监督训练codebook时,每个code不仅包含动作语义还包含像素变化语义。clap的想法是把动作codebook和语义codebook分离。
首先用真实机器人数据训练一个vqvae,称为act-vae,纯粹的action codebook。然后使用video数据的时候,混合机械臂数据,分别编码到act-vae(冻结)和新的vd-vae上。这样就能把action和像素语义分离,不过不是像素重建,是dino future feature重建。
然后再利用pseudo label大规模pretrain vlm,基于next token prediction来构建policy语义,同时使用video和robot数据来监督语义。最后再额外训练一个flow matching head来用于高效推理。也就是vlm做ar planning,flow matching head做action prediction。
Cosmos
cosmos 2.5 predict
专用的具身视频生成模型,统一生成结构。数据主要是真机相关很强视频,分成不同的domain,每个domain分别训练,然后model soup合并+grpo。文本编码器Cosmos-Reason1(Qwen2.5-VL-7B),视频编码器是wan2.1同款。另外,对于action是action embedding + timestep embedding当作调制信号注入的dit里的,不是做cross-atten注入(不过默认的ckpt仅支持t2w/i2w/v2w,要实现a2w需要引入新的conditioner)。另外这个v2w其实一般只用latent 2帧(pixel5帧)作为条件,说是v2w感觉有点生硬。
cosmos2.5基座本质感觉还是特化的i2v,对video扩展就5帧,然后action也需要额外的conditioner来注入。
Cosmos-Transfer2.5是一个类似ControlNet的框架,允许场景迁移。它把控制信号编码后分层注入到dit里,从而实现受控生成。
cosmos 3
Cosmos 3把前系列的需要分开表征的操作放到一个mot模型里(之前Cosmos Predict 做世界预测/视频生成,Cosmos Transfer 做可控生成,Cosmos Reason 做物理理解,Cosmos Policy 做动作/策略)。cosmos3把action也作为一个主要模态了,主体分为reasoner(理解文本、图像、推理)和generator(用推理来进行生成),text用ar出,其余模态用denoise出。
因为两个expert执行不同的策略。对于reasoner,训练的时候先用next token prediction使用qa数据pretrain,并使用平方根归一化来约束每个qa对于loss的贡献,避免长sequence主导训练;sft的时候会引入Physical AI和高质量qa数据保证指令跟随和物理先验理解。generator训练的时候会冻结reasoner,后续sft会强化成专用模型(nano,super-text2image之类的)
另外,对于不同的embodiment,使用不同的projective layer投影成相同长度的token。另外,action以相对位姿来表示(相对上一帧),其中旋转使用6D rotation representation(也就是旋转矩阵取前两列)。但好像不会强制让相同语义的动作在不同的的embodiment里映射成相似的token。
另外,关于mrope。文本是1d;vit的image token,同一帧t相同,hw随位置编码;vae的image token则是完整的3d rope;audio和action只有t的编码。generator部分要保证时间对齐,reasoner和generator时间编码有错位(resaoner和generator之间的编码有个15000的相位,如果直接紧跟的编码的话会出现over-saturation 和 checkerboard artifacts)。最后,因为需要处理不同的帧率,mrope的t也会随着帧率变化而进行相应的放缩。
在train的时候,会做Token packing,一个packed training row里拼接多个独立样本。这些样本在语义上仍然是独立的,通过atten mask来让他们不能互相看见;工程上只是为了把固定 context window 填满,提高 GPU 利用率。
Lingbot-video 2026.7 arxiv
MoE架构,稀疏激活3b,TI2V+FDM,single stream。ti用qwen3-vl来编码,video用wan编码,拼在一起输入给model。
Lingbot-va2 2026.7 arxiv
wam一般基于videogen模型,而video gen在denoise的时候是双向注意力,所以wam一般是给vigen模型加一个casual atten mask,这会有一定的mismatch。
在编码的时候没有使用wan,而是训练了一个Semantic Visual-Action Tokenizer,首帧只做spatial编码,后续帧做spatial-temporal编码(类似wan那样,4T+1)。先用语义video训练latent z,负责重建和对齐到teacher上;然后学习一个更小维度的中间表示u,使得u+zt->zt+1得到fdm以及zt->zt+1=u得到idm,联合训练idm和fdm,得到tokenizer从而获取pseudo action label。
整体高层规划+低层执行,moe+mot架构,action stream(dense)和video stream(moe)原生casual attention,推理时Multi-Chunk Prediction,主模块预测z1,三个辅助模块可以预测z2 z3 z4,可以保留,也可以丢弃,取决于inference需求。
world-moe 2026.7 arxiv
每个modality使用shared expert+对应modality expert激活参数,方便支持拓展。
IOI 2026.6 arxiv
给定urdf、历史video和目标action,生成future video。先利用fk来获取机器人的未来动作姿态,然后把机器人几何渲染成三个内参无关的canonical orthographic views,然后利用这些view的frame辅助videogen。