0%

论文阅读26-7

vla vigen wam

First Frame Is the Place to Go for Video Content Customization 2025.11 Arxiv

把要生成的reference拼接在一起,得到一个frame,并把这个frame作为noise input的首帧,并引入transition指令到Instruction里(比如"ad23r2 the camera view suddenly changes.")

利用videogen模型本身的能力,从首帧素材里提取对应元素用于受控生成。不过有个问题是,需要把首帧和相邻的几帧一起去掉,这几帧都是不能用的。

Video-As-Prompt 2025.10 Arxiv

R2V,条件和目标只共享抽象语义,没有像素对应关系。从I2V出发,为reference所有condition构建新的stream,并通过full attention和target(noise)stream进行数据交换。

同时因为reference和target没有对应关系,给rope加偏置,让两段token的位置编码不一致。

wan

wan2.1

wan最重要的应该就是vae,首帧被单独仅作空间压缩,剩余帧以4帧一个分组做时空压缩。另外,因为需要切成一个个chunk做编码,所以causal Conv3D需要一些缓存机制才能确保每个chunk之间处理不间断。如果时间通道不压缩,那么就直接把前面的帧历史编码移过来就行了;但是如果时间通道也要压缩,那么就需要结合stride的数值来重新考虑怎么填充来确保相位对齐。

T2V: 就是把text通过umt5编码后用cross attention融入到dit里。

I2V: I2V的首帧会被单独处理,首帧非常重要。

Camera traj Guided:给定每一帧的相机traj和内参(R t K),对于每一帧、每一个像素,都可以由相机内外参确定一条 3D ray,然后把这个ray转换成Plücker coordinates表示。camera adapter用类似 adaptive normalization 的方式调制每个 DiT block,通过zero-init的方式来注入camera信息。

wan2.2

wan2.2有两个expert,但是是串行的。早期阶段使用高噪声专家,专注于整体布局;后期阶段使用低噪声专家,细化视频细节。每个专家模型大约有14B参数,总共27B参数,但每步只有14B活跃参数,从而保持推理计算和GPU内存几乎不变。

然后wan2.2使用了压缩率更高的wan2.2-vae,有一个支持ti2v的模型。

VACE 2025.3 Arxiv

把“视频生成”和“视频编辑”的各种输入都抽象成同一种条件格式 VCU,然后用一个带 Context Adapter 的视频 DiT 模型统一处理 T2V、R2V、V2V、局部 masked editing 以及它们的组合任务。VCU=text+frame+mask,不同任务只是 F/M 的填法不同:T2V 用空帧与全 1 mask;R2V 把参考帧接在前面,并给参考帧配全 0 mask;V2V 用输入视频帧和全 1 mask;MV2V 用输入视频帧和用户给定的时空 mask。

另外,VACE 将 context frames F 按 mask 拆成两路:1)Reactive frames:Fc = F × M,表示需要被修改/重生成/作为控制信号的区域。2)Inactive frames:Fk = F × (1 − M),表示需要保留的区域或参考概念。这样子分离可以把控制条件和原始像素分离开,通过mask来表示哪些是需要重绘的,哪些是保留的。

但vace统一控制的话好像就没有单独去区分首帧信号了吧?

Wan-Move

利用i2v模型首帧特殊性,把motion相关内容从首帧feature里直接copy到对应latent space的对应位置上,这样不引入额外的motion encoder或者control相关的组件。

比如让给定了点a的轨迹,那么按照这个轨迹生成的视频对应的每个frame的点的position,然后以相同的vae压缩率得到这个点对应latent space的idx,然后把首帧的latent point feature直接copy到latent frame对应的idx上去,取代i2v默认的全0帧latent frame。

所以这种方法还需要前一级跟踪point。

flowmimic

在做v2v的生成的时候,source和target数据集构建比较困难,这篇文章把source和target的相对看作是时间上同步的随机游走的点对。对于图像编辑数据集,将source和target的图像按照同一个形变场来进行变换后组织成视频进行训练,这样理论上两者的差值随时间是一个定值,可以用于构建loss。

也就是可以不用v2v的数据集就可以用于训练v2v模型(从i2i变换得到)。

CLAP 2026.1 arxiv

像lapa那样的算法在自监督训练codebook时,每个code不仅包含动作语义还包含像素变化语义。clap的想法是把动作codebook和语义codebook分离。

首先用真实机器人数据训练一个vqvae,称为act-vae,纯粹的action codebook。然后使用video数据的时候,混合机械臂数据,分别编码到act-vae(冻结)和新的vd-vae上。这样就能把action和像素语义分离,不过不是像素重建,是dino future feature重建。

然后再利用pseudo label大规模pretrain vlm,基于next token prediction来构建policy语义,同时使用video和robot数据来监督语义。最后再额外训练一个flow matching head来用于高效推理。也就是vlm做ar planning,flow matching head做action prediction。

Cosmos

cosmos 2.5 predict

专用的具身视频生成模型,统一生成结构。数据主要是真机相关很强视频,分成不同的domain,每个domain分别训练,然后model soup合并+grpo。文本编码器Cosmos-Reason1(Qwen2.5-VL-7B),视频编码器是wan2.1同款。另外,对于action是action embedding + timestep embedding当作调制信号注入的dit里的,不是做cross-atten注入(不过默认的ckpt仅支持t2w/i2w/v2w,要实现a2w需要引入新的conditioner)。另外这个v2w其实一般只用latent 2帧(pixel5帧)作为条件,说是v2w感觉有点生硬。

cosmos2.5基座本质感觉还是特化的i2v,对video扩展就5帧,然后action也需要额外的conditioner来注入。

Cosmos-Transfer2.5是一个类似ControlNet的框架,允许场景迁移。它把控制信号编码后分层注入到dit里,从而实现受控生成。

cosmos 3

Cosmos 3把前系列的需要分开表征的操作放到一个mot模型里(之前Cosmos Predict 做世界预测/视频生成,Cosmos Transfer 做可控生成,Cosmos Reason 做物理理解,Cosmos Policy 做动作/策略)。cosmos3把action也作为一个主要模态了,主体分为reasoner(理解文本、图像、推理)和generator(用推理来进行生成),text用ar出,其余模态用denoise出。

因为两个expert执行不同的策略。对于reasoner,训练的时候先用next token prediction使用qa数据pretrain,并使用平方根归一化来约束每个qa对于loss的贡献,避免长sequence主导训练;sft的时候会引入Physical AI和高质量qa数据保证指令跟随和物理先验理解。generator训练的时候会冻结reasoner,后续sft会强化成专用模型(nano,super-text2image之类的)

另外,对于不同的embodiment,使用不同的projective layer投影成相同长度的token。另外,action以相对位姿来表示(相对上一帧),其中旋转使用6D rotation representation(也就是旋转矩阵取前两列)。但好像不会强制让相同语义的动作在不同的的embodiment里映射成相似的token。

另外,关于mrope。文本是1d;vit的image token,同一帧t相同,hw随位置编码;vae的image token则是完整的3d rope;audio和action只有t的编码。generator部分要保证时间对齐,reasoner和generator时间编码有错位(resaoner和generator之间的编码有个15000的相位,如果直接紧跟的编码的话会出现over-saturation 和 checkerboard artifacts)。最后,因为需要处理不同的帧率,mrope的t也会随着帧率变化而进行相应的放缩。

在train的时候,会做Token packing,一个packed training row里拼接多个独立样本。这些样本在语义上仍然是独立的,通过atten mask来让他们不能互相看见;工程上只是为了把固定 context window 填满,提高 GPU 利用率。

Lingbot-video 2026.7 arxiv

MoE架构,稀疏激活3b,TI2V+FDM,single stream。ti用qwen3-vl来编码,video用wan编码,拼在一起输入给model。

Lingbot-va2 2026.7 arxiv

wam一般基于videogen模型,而video gen在denoise的时候是双向注意力,所以wam一般是给vigen模型加一个casual atten mask,这会有一定的mismatch。

在编码的时候没有使用wan,而是训练了一个Semantic Visual-Action Tokenizer,首帧只做spatial编码,后续帧做spatial-temporal编码(类似wan那样,4T+1)。先用语义video训练latent z,负责重建和对齐到teacher上;然后学习一个更小维度的中间表示u,使得u+zt->zt+1得到fdm以及zt->zt+1=u得到idm,联合训练idm和fdm,得到tokenizer从而获取pseudo action label。

整体高层规划+低层执行,moe+mot架构,action stream(dense)和video stream(moe)原生casual attention,推理时Multi-Chunk Prediction,主模块预测z1,三个辅助模块可以预测z2 z3 z4,可以保留,也可以丢弃,取决于inference需求。

world-moe 2026.7 arxiv

每个modality使用shared expert+对应modality expert激活参数,方便支持拓展。

IOI 2026.6 arxiv

给定urdf、历史video和目标action,生成future video。先利用fk来获取机器人的未来动作姿态,然后把机器人几何渲染成三个内参无关的canonical orthographic views,然后利用这些view的frame辅助videogen。

Xiaomi-Robotics-U0 2026.7 arxiv

通过ar的方式来预测future muti view frame,把具身不同模态统一到一个架构里。对于robot的action,回通过urdf的方式处理成future frame mask,然后llm接受这个mask、text、image来执行预测。另外,用的是IBQ的离散词表,可以合并到text的词表。

对于图像的自回归会一次预测对角线的patch,因为每个patch自然前驱就只有上方和左方的patch。验证的的时候,直接用u0出mutiview frame,然后输出到pi0.5里,用action来控制机器人来验证mutiview的质量。

Xiaomi-Robotics-1 2027.6 arxiv

100k小时的umi数据,先做video qa的pretrain,再做10k小时的post train。架构没有大的变化,主要是数据的scaling up

Learning Action Priors for Cross-embodiment Robot Manipulation

正常的action head是随机初始话的,那么就可能会破坏vlm先验语义,可以用ki的方式隔离,这篇文章的话先做action expert的训练,再接入vlm。

先训练action的encoder-decoder,然后decoder作为action head;encoder作为监督,让vlm输出相似的latent vector,同时encoder还可以作为一个压缩的机制。

WAM-TTT

引入一个TTT Weight,可以用简单的human demo更新这部分weight,从而作为一种技能记忆,可以读取然后生成action。

每个TTT Weight包含slow weight和fast weight,slow weight负责生成 Key、Value、Query,以及把 memory 输出投影回 WAM hidden space;然后fast weight主要负责存储新的learning的参数。

训练的时候,构建robot-human pairs。inner loop人类视频经过 video expert,得到人类视觉 token,构建出k和v;outer loop机器人视频则构建出q。inner loop用人类视频计算重建loss和mem loss(fast weight Wf*K-V),也就是通过kv(人类视频)和q(机器人视频)来构建expert。每次训练的时候fast weight会重新构建,outer loss就是action loss。

RoboTTT 2026.7 arxiv

上一篇ttt是让从人类示范里增强robo能力;这一篇ttt是把fast weight作为机器人的记忆。

fast weight的目标是把当前token的k映射到v,从而写入上下文里。但是总感觉没有保证fast weight的更新不会破坏早期记忆,随着时间进行,只基于当前obs的k->v更新的话早期记忆不是慢慢就没了嘛?

Echo-Memory

视角旋转一周后,vigen生成的物体还能保持原样嘛?感觉是非常有意义的问题,很多流式wm都不能保证这一点。

GenCeption 2026.7 google deepmind arxiv

把一个大规模文本到视频生成模型当作视觉基础模型,再通过统一的多任务后训练,把它改造成由文本指令控制的、单次前向推理的通用视频感知模型。也就是把生成 DiT 当作确定性的 sequence-to-sequence 网络。

基于wan 2.1,但是只有一步denoise。因此输入的部分不是noise,而是rgb frame的latent编码图像,然后还对dit输出取负(原来是预测eps-x0,改成x0-eps)。

正常的mask预测、分割之类的稠密任务原生支持多通道frame输出,可以直接用vae decoder就行;对于稀疏的任务,比如关键点预测之类的任务,会用learnable token拼接在视频帧后面,然后用mlp解码出k维的输出。

但是这种learnable token因为破坏了atten的参数而且两种任务差异比较大,所以会出现一定的退化。

Let RGB Be the Language of Vision 2026.7 arxiv

跟刚才那个google的想法类似,把所有图像相关的任务统一成一个image edit的任务。感觉这个思想其实挺多的,比如让nano2 open-vocabulary出mask。

当然这篇文章只是一个验证,没有训练一个统一模型。对于稀疏任务和稠密任务也没有显示区分,依赖后处理来提取结果。

ZR0 2026.7 arxiv

给vlm加ecot监督,ntp+flow matching,数据集ProcCorpus-60M。

GigaWorld-Policy-0.5 2026.7 arxiv

muti view会被拼成一个复合图像,然后用wan vae统一编码。mot架构,action不能观测到future vision token。混合ac-wm和wam联合训练fdm和idm。并且future prediction是inference可选项。

Nemotron-Labs-Diffusion 2026.7 arxiv

在一个模型内保持ar、diffusion和diffusion 起草、AR 校验的 self-speculation 解码模式。这样可以让AR 提供可靠的从左到右语言先验,diffusion 提供对未来多个 token 的并行预测能力;并在训练时联合学习,推理时根据场景选择谁负责生成、谁负责校验。

训练的时候主要是先做ar,再联合ar+diffusion。

Abot-m0.5 2026.7 arxiv

带底盘的wam,vigen输出latent vector,从其中提取出motion latent vector,然后两个decoder分别decode出底盘和机械臂。

其中motion latent vector要求可加性和可逆性(i+j~=k, i->j = - j->i),也是利用vae的方式训练的。

关于sft部分,sft1监督future frame预测的准确性;然后在sft2的时候让模型在基于自己预测的future frame的基础预测action(dreaming forcing;正常一般都是用noise+gt这样子来输入)

PelicanVLA 0.5 2026.7 arxiv

主要探究感知信息的瓶颈的问题。预训练模型可能已经知道“该看哪里”,但还不会精确地“怎么操作”。主要从representation-to-action gap来分析这一问题。

用32个token来压缩语义+历史信息,bottleneck token只能看到语义+历史帧;suffix token只能看到bottleneck tokens,通过逐步去掉suffix token对语义token的可见性来进行迁移。同时引入正交损失来让bottleneck token强制压缩不同的信息。

PE-Field 4D 2026.7 arxiv

轨迹导向视频生成。使用重建几何来计算“位置地址”,但不要求重建结果直接成为最终视频,避免最终结果收重建质量的影响。

QWEN-ROBOTMANIP

40k小时的数据pretrain,但包含了很多合成数据,真机数据大概就10k小时左右。如果有外参,它所有的动作用camera frame里的位移和旋转变换,其中相机参数用CaPE注入到action里;如图没有外参,就用robot base的动作。有一个flag来显示指示当前是有外参还是无外参的输入。

它部署的时候也需要外参,但是总感觉这种单一flag的决策不是很稳定。

mv-wam 2026.7 arxiv

把idm和fdm的接口统一起来。在渲染fdm视频的时候,用urdf和action先在仿真器里把对应的机械臂视频渲染出来,然后作为reference送入v2v;渲染idm的时候,把物体的目标运动先mask出来绘制成轨迹,然后送入v2v。需要用外参来实现对齐。

Joy-ai

用空间理解增强生成与编辑,再用空间编辑生成新的观察视角,反过来辅助空间推理。把空间数据、空间编辑和新视角生成,把三者做成一个双向循环。

MLLM负责对理解任务,直接输出文本答案;同时对生成和编辑任务,提取 MLLM 最后一层 hidden states,作为 MMDiT 的语义和空间条件。

self gradient forcing 2026.7 arxiv

在进行self forcing的时候,会把当前生成的部分写入kv cache,然后后续chunk读取这些kv cache然后进行后续的denoise。但为了保证梯度链长度有限,一般会对这些kv cache detach,这会导致模型只能学习怎么高效利用历史数据,而不能学习怎么高效写入数据。

也就是把frame->stopgrad(kv cache)->future改成了stopgrad(frame)->kv cache->future。把detach步骤提前。

SANA-Video 2.0

attention因为softmax存在,复杂度为o(n^2),有通过linear attention的方式来对softmax(qk)~=(q)(k)近似。但对于视频生成而言,la明显存在rank bottleneck,这篇文章用la承担大部分atten降低成本,同时用部分softmax来弥补这部分信息的缺失的问题。

4层构成一个循环:la-la-la-fa,训练的时候通过Block AttnRes来避免la累计导致的信息消失。block内直接正常做atten,block之间则通过一个注意力机制来选择怎么把历史信息注入进来(正常的res是x=x+f(x),历史层是累计进来的,现在要通过一个atten来选择每层的注入程度)