OpenVLA:开源视觉—语言—动作模型
原文标题:OpenVLA: An Open-Source Vision-Language-Action Model
作者:Moo Jin Kim、Karl Pertsch、Siddharth Karamcheti 等
arXiv:2406.09246
图:OpenVLA 是使用 Open X-Embodiment 数据集97万段机器人轨迹训练的70亿参数开源视觉—语言—动作模型。
摘要
\(^\ast\):同等贡献
通讯作者:moojink@stanford.edu, pertsch@berkeley.edu, skaramcheti@stanford.edu
$^1$斯坦福大学,$^2$加州大学伯克利分校,$^3$丰田研究院,$^4$Google DeepMind,$^5$Physical Intelligence,$^6$麻省理工学院,$^\dagger$部分工作于任职 Google DeepMind 期间完成
在互联网规模的视觉—语言数据与多样化机器人示范上预训练的大型策略,有望改变机器人技能教学方式:无需从头训练新行为,只需微调视觉—语言—动作模型(Vision-Language-Action Model,VLA),便可得到鲁棒且具泛化能力的视觉运动控制策略。然而,VLA 尚未在机器人领域得到广泛采用,原因有二:1)现有 VLA 大多闭源,公众无法使用;2)以往工作没有研究如何面向新任务高效微调 VLA,而这正是推广应用的关键。为解决这些问题,本文提出 OpenVLA,一个拥有 7B 参数的开源 VLA,使用多样化的97万段真实机器人示范训练。OpenVLA 以 Llama 2 语言模型为基础,并结合融合 DINOv2 与 SigLIP 预训练特征的视觉编码器。得益于更丰富的数据和新的模型组件,OpenVLA 在通用机器人操作上表现出色:面对29项任务和多种机器人本体,其参数量仅为 RT-2-X(55B)的七分之一,任务绝对成功率却高出16.5%。本文还表明,OpenVLA 能够有效微调以适应新环境,在包含多个物体、强调语言落地能力的多任务环境中展现出较强泛化性,并以20.4%的幅度超过从头训练的高表达能力模仿学习方法 Diffusion Policy。 本文还研究了计算效率,并证明通过现代低秩适配方法可在消费级 GPU 上微调 OpenVLA,同时借助量化高效部署,且不降低下游任务成功率。最后,本文发布模型检查点、微调 Notebook 与 PyTorch 代码库,内置对在 Open X-Embodiment 数据集上规模化训练 VLA 的支持。
引言
机器人操作学习策略的一个主要弱点,是无法泛化到训练数据之外。针对单项技能或语言指令训练的现有策略,虽能将行为外推到物体位置、光照等新的初始条件 [rt12022arxiv, chi2023diffusionpolicy],但面对场景干扰物或新物体时鲁棒性不足 [xie2023decomposing, octo_2023],也难以执行未见过的任务指令 [walke2023bridgedata, rt22023arxiv]。机器人领域之外,CLIP [radford2021clip]、SigLIP [zhai2023siglip] 和 Llama 2 [touvron2023llama2] 等视觉与语言基础模型却具备这类乃至更强的泛化能力,这源于其互联网规模预训练数据所蕴含的先验知识。机器人领域仍难以复现如此规模的预训练 --- 即便最大的机器人操作数据集 [open_x_embodiment_rt_x_2023, khazatsky2024droid] 也仅有10万至100万个样本 --- 但这种数据规模失衡也带来了机会:将现有视觉与语言基础模型作为训练机器人策略的核心构件,使策略能够泛化到训练数据之外的物体、场景和任务。
为实现这一目标,已有工作尝试将预训练语言模型和视觉—语言模型用于机器人表征学习 [nair2022r3m, Karamcheti2023LanguageDrivenRL, shridhar2022cliport],或作为模块化任务规划与执行系统的组成部分 [stone2023open, driess2023palm]。近期研究进一步使用这些模型直接学习用于控制的 VLA [rt22023arxiv, open_x_embodiment_rt_x_2023, covariant_ai_2024, wayve_ai_2024]。VLA 是将预训练视觉与语言基础模型用于机器人的一种直接实现:对 PaLI [chen2022pali, chen2023pali3] 等视觉条件语言模型(Visually-Conditioned Language Model,VLM)直接微调,使其生成机器人控制动作。依托互联网规模数据训练的强大基础模型,RT-2 [rt22023arxiv] 等 VLA 展现出较强鲁棒性,并能泛化到新物体和新任务,为通用机器人策略树立了新标准。然而,现有 VLA 难以普及主要有两个原因:1)当前模型 [rt22023arxiv, open_x_embodiment_rt_x_2023, covariant_ai_2024, wayve_ai_2024] 并未开放,模型架构、训练流程与数据混合方案均缺乏透明度;2)已有工作没有提供将 VLA 部署并适配到新机器人、环境和任务的最佳实践,尤其缺乏面向消费级 GPU 等通用硬件的方案。 本文认为,为未来研究与开发奠定充分基础,机器人领域需要支持有效微调和适配的开源通用 VLA,形成类似开源语言模型的生态系统 [wolf-etal-2020-transformers, touvron2023llama, jiang2023mistral, team2024gemma]。
为此,本文提出拥有 7B 参数的开源 VLA OpenVLA,在通用机器人操作策略上刷新了当前最佳性能。(注:OpenVLA 采用多个预训练模型组件:SigLIP [zhai2023siglip] 与 DinoV2 [oquab2023dinov2] 视觉编码器,以及 Llama 2 [touvron2023llama2] 语言模型主干。这三个模型均开放权重,但不开放训练数据或代码。本文发布用于在这些组件上复现 OpenVLA 的训练数据、代码和模型权重。)OpenVLA 由能够捕获多粒度视觉特征的预训练视觉条件语言模型主干构成,并在 Open X-Embodiment [open_x_embodiment_rt_x_2023] 中包含 970k 条机器人操作轨迹的大规模多样化数据集上微调;该数据集涵盖多种机器人本体、任务和场景。得益于更丰富的数据与新的模型组件,OpenVLA 在 WidowX 和 Google Robot 本体的29项评估任务上,绝对成功率比此前最佳的550亿参数 VLA RT-2-X [rt22023arxiv, open_x_embodiment_rt_x_2023] 高16.5%。本文还首次研究面向 VLA 的高效微调策略,覆盖从物体拾放到清洁桌面的7项操作任务。微调后的 OpenVLA 策略显著优于 Octo [octo_2023] 等微调后的预训练策略。与从头训练的扩散策略模仿学习 [chi2023diffusionpolicy] 相比,微调后的 OpenVLA 在多物体、多任务环境中需要将语言落地为行为的任务上提升明显。在此基础上,本文首次证明低秩适配(Low-Rank Adaptation,LoRA) [hu2021lora] 与模型量化 [dettmers2024qlora] 等计算高效微调方法的有效性,使 OpenVLA 无需大型服务器节点即可在消费级 GPU 上适配,且不损失性能。 最后,本文开源全部模型、部署与微调 Notebook,以及用于规模化训练 VLA 的 OpenVLA 代码库,希望这些资源能推动机器人 VLA 的后续研究与适配。
相关工作
视觉条件语言模型
视觉条件语言模型(VLM)在互联网规模数据上训练,根据输入图像与语言提示生成自然语言,已广泛用于从视觉问答 [goyal2017making, hudson2019gqa, singh2019textvqa, bigham2010vizwiz]到物体定位 [kazemzadeh2014refcoco, yu2016refcoco]的众多应用。推动近期 VLM 发展的关键进展之一,是将预训练视觉编码器 [radford2021clip, zhai2023siglip, oquab2023dinov2]的特征与预训练语言模型 [touvron2023llama2, jiang2023mistral, google-gemma, microsoft-phi, bai2023qwen]连接起来的模型架构;这类架构直接结合计算机视觉与自然语言建模的进展,构建出强大的多模态模型。早期工作研究了视觉与语言特征交叉注意的多种架构 [li2022blip, li2023blip2, dai2023instructblip, tan2019lxmert, laurencon2023obelics],而新的开源 VLM [liu2023llava, liu2023llavav15, chen2023pali3, karamcheti2024prismatic]逐渐统一为更简单的“图像块即词元”方法:将预训练视觉 Transformer 输出的图像块特征视为词元,再投影至语言模型输入空间。这种简洁设计使大规模语言模型训练工具能够方便地复用于 VLM 训练。本文使用这些工具扩展 VLA 训练,并选用 [karamcheti2024prismatic] 的 VLM 作为预训练主干。该模型在多分辨率视觉特征上训练,融合 DINOv2 [oquab2023dinov2] 的低层空间信息与 SigLIP [zhai2023siglip] 的高层语义,以增强视觉泛化能力。
通用机器人策略
机器人领域近期的一项趋势,是在大规模、多样化且涵盖多种机器人本体 [devin2017learning,dasari2019robonet, hu2022know,yang2023polybot,reed2022a,salhotra2023bridging,radosavovic2023robot, shahGNMGeneralNavigation2023,bousmalis2023robocat,shah2023vint,open_x_embodiment_rt_x_2023,octo_2023,yang2024pushing]的数据集 [pinto2016supersizing,mandlekar2018roboturk,kalashnikov2018qt, gupta2018robot,dasari2019robonet,cabi2019, jang2022bc,walke2023bridgedata,rt12022arxiv, fang2023rh20t,bharadhwaj2023roboagent,khazatsky2024droid, open_x_embodiment_rt_x_2023]上训练多任务“通用”机器人策略 [kalashnikov2018qt,mtopt2021arxiv,ebert2021bridge,walke2023bridgedata,rt12022arxiv,ehsani2023imitating,bharadhwaj2023roboagent]。其中,Octo [octo_2023] 训练了一种可直接控制多种机器人、并能灵活微调到新机器人配置的通用策略。这些方法与 OpenVLA 的关键差异在于模型架构。Octo 等以往工作通常组合语言嵌入、视觉编码器等预训练组件与从头初始化的额外模型组件 [walke2023bridgedata, rt12022arxiv, octo_2023],在策略训练过程中学习将它们“拼接”起来。 OpenVLA 则采用更端到端的方法:把机器人动作视为语言模型词表中的词元,直接微调 VLM 以生成动作。实验表明,这一简洁且可扩展的流程显著优于以往通用策略的性能与泛化能力。
视觉—语言—动作模型
许多工作探索了 VLM 在机器人领域的应用,例如视觉状态表征 [nair2022r3m, Karamcheti2023LanguageDrivenRL]、物体检测 [gadre2023cows]、高层规划 [driess2023palm]和反馈信号生成 [du2023vision, ma2023liv, zhang2023grounding, sontakke2024roboclip]。另一些工作将 VLM 直接集成到端到端视觉运动操作策略中 [shridhar2022cliport, stone2023open],但在策略架构中加入大量先验结构,或要求相机经过标定,因而限制了适用范围。近期多项研究采用与本文相似的方案,直接微调大型预训练 VLM 以预测机器人动作 [rt22023arxiv,open_x_embodiment_rt_x_2023,huang2023embodied,li2023vision,covariant_ai_2024,wayve_ai_2024,zhen20243dvla]。这类模型将机器人控制动作直接融入 VLM 主干,通常称为视觉—语言—动作模型(VLA)。这一设计有三项主要优势:(1)在互联网规模视觉—语言数据集上对齐预训练视觉与语言组件;(2)采用非专为机器人控制定制的通用架构,从而利用现代 VLM 训练背后的可扩展基础设施 [pytorch_amp,dao2023flashattention,zhao2023pytorch],仅需少量代码修改即可扩展到十亿参数级策略训练;(3)为机器人领域直接利用 VLM 的快速进步提供路径。现有 VLA 工作要么只关注单机器人或仿真配置下的训练与评估 [huang2023embodied,li2023vision, dorka2024matters,zhen20243dvla],缺乏通用性;要么保持闭源,不支持高效微调到新的机器人配置 [rt22023arxiv,open_x_embodiment_rt_x_2023,covariant_ai_2024,wayve_ai_2024]。
与本文最相关的是 RT-2-X [open_x_embodiment_rt_x_2023]:它在 Open X-Embodiment 数据集上训练了拥有550亿参数的 VLA 策略,并在通用操作策略上达到此前最佳性能。不过,本文与 RT-2-X 存在多项重要差异:(1)OpenVLA 将强大的开放 VLM 主干与更丰富的机器人预训练数据集结合,模型规模小一个数量级,却在实验中优于 RT-2-X;(2)本文全面研究将 OpenVLA 微调到新目标配置,而 RT-2-X 未研究微调场景;(3)本文首次证明现代参数高效微调与量化方法对 VLA 的有效性;(4)OpenVLA 是首个开源通用 VLA,可支持后续研究 VLA 的训练、数据混合方案、目标函数与推理。
OpenVLA模型
本文提出OpenVLA模型,这是一个拥有7B参数的视觉—语言—动作模型(Vision-Language-Action Model,VLA),在Open X-Embodiment数据集的970k个机器人演示上训练 [open_x_embodiment_rt_x_2023]。 开发VLA模型的最佳实践仍存在许多尚未充分探索的问题,例如,应选择何种模型主干、数据集和超参数进行训练。 下文将详述OpenVLA的开发方法并总结关键经验。具体而言,首先简要概述构成OpenVLA主干的现代视觉条件语言模型(Vision-Language Model,VLM)([sec:prismatic_preliminaries]);随后介绍基本训练方案和数据集([sec:train_procedure]和[sec:data_mix]);讨论关键设计决策([sec:train_details]);最后说明训练和推理所用的基础设施([sec:infra])。
图:OpenVLA模型架构。 给定图像观测和语言指令,模型预测7维机器人控制动作。该架构包含三个关键组件:(1) 拼接DINO V2 [oquab2023dinov2]与SigLIP [zhai2023sigmoid]特征的视觉编码器;(2) 将视觉特征映射到语言嵌入空间的投影器;(3) 大语言模型主干,即拥有7B参数的Llama 2大语言模型 [touvron2023llama2]。
预备知识:视觉条件语言模型
近期大多数VLM [liu2023llava, liu2023llavav15, chen2023pali3, karamcheti2024prismatic]的架构由三个主要部分组成(见[fig:architecture]):(1) 将图像输入映射为若干“图像块嵌入”的视觉编码器;(2) 接收视觉编码器输出嵌入并将其映射到语言模型输入空间的投影器;(3) 大语言模型(Large Language Model,LLM)主干。训练VLM时,模型在从各类互联网来源整理的配对或交错式 视觉—语言数据上,以预测下一个文本词元为目标进行端到端训练。
本文以Prismatic-7B VLM [karamcheti2024prismatic]为基础。Prismatic采用上述标准架构,包括拥有600M参数的视觉编码器、小型两层MLP投影器,以及拥有7B参数的Llama 2语言模型主干 [touvron2023llama2]。Prismatic采用双组件视觉编码器,由预训练的SigLIP [zhai2023sigmoid]和DINOv2 [oquab2023dinov2]模型组成。输入图像块分别通过两个编码器,所得特征向量沿通道维拼接。相比更常用的CLIP [radford2021learning]或仅使用SigLIP的视觉编码器,加入DINOv2特征已被证明有助于提升空间推理能力 [karamcheti2024prismatic],这对机器人控制尤为有益。
SigLIP、DINOv2和Llama 2均未公开其训练数据细节;这些数据很可能分别包含数万亿个源自互联网的图文、纯图像和纯文本词元。Prismatic VLM在这些组件之上使用LLaVA 1.5数据混合 [liu2023llavav15]进行微调,其中包含来自开源数据集 [sharma2018conceptual, schuhmann2021laion, hudson2019gqa, sidorov2020textcaps, liu2023llava]的约1M个图文和纯文本数据样本。
OpenVLA训练流程
为训练OpenVLA,本文对预训练的Prismatic-7B VLM主干进行微调,使其能够预测机器人动作(见[fig:architecture])。 动作预测被表述为“视觉—语言”任务:将输入观测图像和自然语言任务指令映射为预测机器人动作的字符串 [rt22023arxiv]。为了使VLM的语言模型主干能够预测机器人动作,本文将连续机器人动作映射为该语言模型分词器使用的离散词元,从而在LLM输出空间中表示动作。遵循[rt22023arxiv],每个机器人动作维度分别离散为256个区间之一。对于每个动作维度,区间宽度设为均匀划分训练数据中动作第1st与第99th分位数之间的范围。[rt22023arxiv]使用最小值—最大值边界,而本文采用分位数,因而可以忽略数据中的离群动作;否则这些动作可能大幅扩张离散化区间并降低动作离散化的有效粒度。
通过这种离散化方式,可得到N个离散整数\(\in [0 \dots 255]\),用于表示一个\(N\)维机器人动作。 遗憾的是,OpenVLA语言主干使用的分词器,即Llama分词器 [touvron2023llama2],仅为微调期间新引入的词元预留100个“特殊词元”,不足以容纳动作离散化所需的256个词元。为保持简洁,本文再次沿用[rt22023arxiv]的方法,直接以动作词元覆盖Llama分词器词表中使用频率最低的256个词元(即最后256个词元)。 动作被处理为词元序列后,使用标准的下一词元预测目标训练OpenVLA,且仅在预测的动作词元上计算交叉熵损失。[sec:train_details]讨论了实现该训练流程时的关键设计决策。下文介绍用于训练OpenVLA的机器人数据集。
训练数据
构建OpenVLA训练数据集的目标是覆盖丰富多样的机器人本体、场景和任务,使最终模型既能开箱即用地控制多种机器人,又能高效微调到新的机器人配置。本文以Open X-Embodiment数据集 [open_x_embodiment_rt_x_2023](OpenX)为基础整理训练数据集。截至本文撰写时,完整OpenX数据集由70多个独立机器人数据集组成,包含超过2M条机器人轨迹;大型社区协作将其汇集为统一且易用的数据格式。为了使这些数据上的训练切实可行,本文对原始数据集执行多步数据整理。
整理的目标是确保:(1) 所有训练数据集具有统一的输入与输出空间;(2) 最终训练混合中的本体、任务和场景保持均衡。(注:Octo [octo_2023]展示了如何在具有异构感知输入的数据集上训练。尽管这一方向很有前景,本文将跨异构传感器模态与动作空间的VLA训练留待未来研究。)为实现目标(1),本文遵循[open_x_embodiment_rt_x_2023, octo_2023],将训练数据限制为至少配有一个第3rd人称相机的操作数据集,并采用单臂末端执行器控制。对于目标(2),所有通过首轮筛选的数据集均采用Octo [octo_2023]的数据混合权重。Octo采用启发式方法降低权重或移除多样性较低的数据集,并提高任务和场景更多样的数据集权重;详见[octo_2023]。
本文还尝试将Octo发布后新增至OpenX的少数数据集纳入训练混合,其中包括DROID数据集 [khazatsky2024droid],但为其设置了较为保守的10%混合权重。实践中,DROID上的动作词元准确率在整个训练期间始终较低,表明未来可能需要更高的混合权重或更大模型才能拟合其多样性。为避免损害最终模型质量,本文在最后三分之一训练阶段将DROID从数据混合中移除。[sec:app:data_mix]完整列出了所用数据集及其混合权重。
OpenVLA设计决策
在开发OpenVLA模型时,本文先通过小规模实验探索多项设计决策,再启动最终模型训练。具体而言,为提高迭代速度并降低计算成本,初步实验在BridgeData V2 [walke2023bridgedata]上训练和评估OpenVLA模型,而非使用完整OpenX数据混合。下文总结这些探索所得的关键经验。
VLM主干。 初期实验测试了多个VLM主干。除Prismatic [karamcheti2024prismatic]外,还测试了对IDEFICS-1 [idefics2024]和LLaVA [liu2024visual]进行机器人动作预测微调。 在场景仅包含一个物体的任务上,LLaVA与IDEFICS-1表现相当;但在场景含多个物体、且策略需要操作正确物体时,LLaVA表现出更强的语言定位能力,即,需操作语言指令指定的物体。具体而言,在BridgeData V2水槽环境中的五项语言定位任务上取平均后,LLaVA的绝对成功率比IDEFICS-1高35%。经过微调的Prismatic VLM策略进一步提升了性能:在简单单物体任务和多物体语言定位任务上,其绝对成功率均比LLaVA策略高约10%。本文将这种性能差异归因于融合SigLIP-DINOv2主干带来的更强空间推理能力(见[sec:prismatic_preliminaries])。除性能优势外,Prismatic还提供模块化且易用的代码库,因此最终选择其作为OpenVLA模型的主干。
图像分辨率。 输入图像分辨率显著影响VLA训练的计算需求,因为更高分辨率会产生更多图像块词元,进而增加上下文长度,使训练计算量呈二次增长。本文比较了输入为\(224 \times 224\)px和\(384 \times 384\)px的VLA,评估中未发现性能差异,但后者训练耗时为前者的3倍。因此,最终OpenVLA模型采用\(224 \times 224\)px分辨率。尽管提高分辨率能改善许多VLM基准上的性能 [karamcheti2024prismatic, mckinzie2024mm1, lin2023vila],本文尚未在VLA上观察到这一趋势。
微调视觉编码器。 既往VLM研究发现,在VLM训练期间冻结视觉编码器通常会获得更高性能 [karamcheti2024prismatic]。直观而言,冻结视觉编码器可能更有利于保留其从互联网规模预训练中学到的稳健特征。然而,本文发现,在VLA训练期间微调视觉编码器对获得良好VLA性能至关重要。本文推测,预训练视觉主干可能无法捕获场景重要部分足够精细的空间细节,因而难以实现精确机器人控制。
训练轮数。 典型LLM或VLM训练至多遍历训练数据集一至两轮。相比之下,VLA训练需要显著增加数据集遍历次数;在训练动作词元准确率超过95%之前,真实机器人性能会随训练持续提升。最终训练在训练数据集上完成27轮。
学习率。 本文在多个数量级范围内扫描VLA训练学习率,结果表明固定学习率2e-5效果最佳(与VLM预训练所用学习率相同 [karamcheti2024prismatic])。实验未发现学习率预热带来收益。
训练与推理基础设施
最终OpenVLA模型在由64 张 A100块GPU组成的集群上训练14天,合计21,500个A100小时,批大小为2048。推理时,以bfloat16精度加载(即,不量化)的OpenVLA需要15GB GPU显存,在单块NVIDIA RTX 4090 GPU上的运行频率约为6Hz(未采用编译、推测解码或其他推理加速技巧)。如[sec:quantization_exp]所示,通过量化可进一步降低OpenVLA推理时的内存占用,且不会损害真实机器人任务中的性能。[fig:inference_speed]报告了多种消费级和服务器级GPU上的推理速度。为方便使用,本文实现了远程VLA推理服务器,可将动作预测实时远程流式传输至机器人,因而无需强大的本地计算设备即可控制机器人。该远程推理方案随开源代码一同发布([sec:code])。
OpenVLA代码库
除模型外,本文还发布了OpenVLA代码库,这是用于训练VLA模型的模块化PyTorch代码库(见项目主页)。该代码库既支持在单块GPU上微调VLA,也能在多节点GPU集群上训练拥有数十亿参数的VLA,并支持自动混合精度(Automatic Mixed Precision,AMP;[pytorch_amp])、FlashAttention [dao2023flashattention]和完全分片数据并行(Fully Sharded Data Parallel,FSDP;[zhao2023pytorch])等现代大型Transformer模型训练技术。OpenVLA代码库原生完整支持Open X数据集训练,集成HuggingFace [wolf-etal-2020-transformers]的AutoModel类,并支持LoRA微调 [hu2021lora]和量化模型推理 [dettmers2022gpt3, dettmers2024qlora]。
实验
实验评测旨在检验 OpenVLA 能否直接作为强大的多机器人控制策略,以及能否作为微调至新机器人任务的良好初始化。具体而言,本文试图回答以下问题: - 在多个机器人和多种泛化类型上评测时,OpenVLA 与以往通用机器人策略相比表现如何? - OpenVLA 能否在新的机器人配置和任务上有效微调?与当前最先进的数据高效模仿学习方法相比表现如何? - 能否通过参数高效微调和量化降低 OpenVLA 模型的训练与推理计算需求,使其更易于使用?性能与算力之间存在怎样的权衡?
在多个机器人平台上的直接评测
图:BridgeData V2 WidowX 机器人评测任务与结果。我们在一套涵盖多个泛化维度的综合任务以及专门评估语言条件控制能力的任务上,对 OpenVLA 和以往最先进的通用机器人策略进行评测。OpenVLA 的总体性能最高,除语义泛化外,在所有类别中均优于闭源模型 RT-2-X。每种方法的平均成功率 \(\pm\) 标准误(StdErr)根据总计 170 条试验轨迹计算。详细结果见 [app:tab:bridge_results_detailed]。
机器人配置与任务。我们在两个机器人本体上评估 OpenVLA 的“开箱即用”性能:BridgeData V2 评测所用的 WidowX 机器人 [walke2023bridgedata](见 [fig:teaser] 左图),以及 RT-1 和 RT-2 评测所用的移动操作机器人 [rt12022arxiv,rt22023arxiv](“Google robot”;见 [fig:teaser] 中图)。以往工作广泛使用这两个平台评估通用机器人策略 [rt12022arxiv,rt22023arxiv,open_x_embodiment_rt_x_2023,octo_2023]。本文在每个环境中定义了一套综合评测任务,覆盖多个泛化维度,包括视觉泛化(未见过的背景、干扰物体,以及物体颜色/外观)、运动泛化(未见过的物体位置/朝向)、物理泛化(未见过的物体尺寸/形状)和语义泛化(未见过的目标物体、指令和互联网概念)。此外,本文还在包含多个物体的场景中评估语言条件控制能力,检验策略能否按照用户提示操作正确的目标物体。BridgeData V2 和 Google robot 评测的任务示例图像分别见 [fig:bridge_results] 和 [fig:rt1_results] 的底行。总体而言,在 BridgeData V2 实验中,每种方法评测 170 条试验轨迹(17 个任务,每个任务 10 次试验);在 Google robot 实验中,每种方法评测 60 条试验轨迹(12 个任务,每个任务 5 次试验)。所有任务及其与训练数据差异的详细划分见 [sec:app:detailed_setups]。为确保公平比较,本节及后续章节的所有评测均采用 A/B 评测方式,在相同任务上使用相同的机器人和物体初始状态集合。
对比方法。本文将 OpenVLA 与三种以往的通用操作策略进行比较:RT-1-X [open_x_embodiment_rt_x_2023]、RT-2-X [open_x_embodiment_rt_x_2023] 和 Octo [octo_2023]。RT-1-X(35M 参数)和 Octo(93M 参数)均为在 OpenX 数据集子集上从头训练的 Transformer 策略;Octo 是开源操作策略中当前最先进的模型。RT-2-X(55B 参数)是当前最先进的闭源视觉—语言—动作模型(VLA),采用经互联网数据预训练的视觉和语言骨干网络。
BridgeData V2 和 Google robot 的评测结果分别汇总于 [fig:bridge_results] 和 [fig:rt1_results](各任务的详细结果见附录 [app:tab:bridge_results_detailed] 和 [app:tab:rt1_robot_results_detailed])。RT-1-X 和 Octo 在测试任务上均表现不佳,常常无法操作正确的物体,尤其是在存在干扰物体时;某些情况下,机器人甚至会漫无目的地挥动机械臂。为检验经互联网数据预训练的 VLA 模型,本文评测所考察的泛化程度甚至高于这些以往工作。因此,未经互联网数据预训练的模型性能较低符合预期。RT-2-X 明显优于 RT-1-X 和 Octo,表明大型预训练视觉—语言模型(Vision-Language Model, VLM)有利于机器人控制。
图:Google robot 评测结果。本文在 RT-1 和 RT-2 评测所用的移动操作机器人上 [rt12022arxiv,rt22023arxiv],针对分布内和分布外(OOD)任务评测通用机器人策略。OpenVLA 与 RT-2-X 的性能相当,且总体上显著优于 RT-1-X 和 Octo。每种方法的平均成功率 \(\pm\) 标准误根据总计 60 条试验轨迹计算。详细结果见 [app:tab:rt1_robot_results_detailed]。
尽管 OpenVLA 的规模小一个数量级(7B 参数对 55B 参数),但它在 Google robot 评测中与 RT-2-X 表现相当,在 BridgeData V2 评测中则显著优于 RT-2-X。 从定性结果看,RT-2-X 和 OpenVLA 的行为均明显比其他受测模型更稳健,例如在存在干扰物体时接近正确物体、适当调整机器人末端执行器使其与目标物体朝向对齐,甚至能从抓取不牢等错误中恢复(定性试验轨迹示例见 项目主页)。如 [fig:bridge_results] 所示,RT-2-X 在语义泛化任务上的性能更高。这符合预期,因为它使用了规模更大的互联网预训练数据,并在机器人动作数据和互联网预训练数据上联合微调,从而更好地保留预训练知识;相比之下,OpenVLA 仅在机器人数据上微调。然而,在 BridgeData V2 和 Google robot 评测的所有其他任务类别中,OpenVLA 的表现均相当或更好。性能差异可归因于多项因素:本文为 OpenVLA 整理了包含 970k 条轨迹的更大训练数据集(RT-2-X 为 350k 条);对训练数据集进行了更细致的清洗,例如, 滤除 Bridge 数据集中的全零动作(详见 [sec:app:rt2x_vs_openvla_in_bridge]);此外,OpenVLA 使用融合视觉编码器,结合了预训练的语义与空间特征。这些组件的消融分析见 [sec:app:additional_ablation_experiments]。
数据高效地适配新机器人配置
以往工作主要关注直接评测 VLA 的“开箱即用”能力 [driess2023palm,rt22023arxiv,open_x_embodiment_rt_x_2023],而如何将 VLA 模型有效微调至新任务和机器人配置仍缺乏研究,但这对其广泛应用至关重要。本节研究 OpenVLA 快速适配新的真实世界机器人配置的能力。(仿真环境中的微调实验见 [sec:app:libero_sim_experiments]。)
机器人配置与任务。本文测试一种简单的 OpenVLA 模型微调方案:使用包含目标任务 10--150 个演示的小型数据集,对全部模型参数进行完整微调(见 [fig:finetune_results];参数高效微调方法见 [sec:param_efficient_finetuning])。 本文在两种配置中测试 OpenVLA:Franka-Tabletop,即固定安装于桌面的 Franka Emika Panda 7 自由度机械臂;以及 Franka-DROID,即近期发布的 DROID 数据集 [khazatsky2024droid]中的 Franka 机械臂配置,安装在可移动升降桌上。两种配置分别采用 5Hz 和 15 Hz 非阻塞控制器。Franka 机械臂在机器人学习社区中应用广泛,很可能成为 OpenVLA 微调的目标机器人本体,因此本文选择它作为微调实验的目标本体。通过测试不同控制频率的配置,检验 OpenVLA 对多种使用场景的适用性。
图:适配新机器人配置。本文评测在七个 Franka Emika Panda 任务(每个任务 10--150 个演示)上从头训练的当前最先进 Diffusion Policy,以及在相同数据上微调的通用机器人策略 Octo 和 OpenVLA。Diffusion Policy 在范围较窄的单指令任务上表现强劲,而 Octo 和 OpenVLA 在涉及多条指令和干扰物体的多样化微调任务上表现更好。总体而言,OpenVLA 在两种配置上的综合性能最高,表明它可作为下游任务策略学习的有效默认选择。每种方法的平均成功率 \(\pm\) 标准误根据 129 条试验轨迹计算(Franka-Tabletop 任务 99 条,Franka-DROID 任务 30 条)。详细结果见 [app:tab:detailed_finetune_results]。
对比方法。本文与从头训练的当前最先进数据高效模仿学习方法 Diffusion Policy [chi2023diffusionpolicy] 进行比较。此外,还比较了输入和输出规格与 OpenVLA 一致的 Diffusion Policy (matched) 版本。(注:完整的 Diffusion Policy 使用包含图像和本体感知状态的两步观测历史,并通过预测由 \(T\) 个未来动作组成的动作块执行滚动时域控制:先以开环方式执行前 \(X\) 个动作,再预测下一个动作块(对于 15Hz 控制,与 DROID 以往工作 [khazatsky2024droid]相同,设置 \(T=16, X=8\);对于 5Hz 控制,将动作块大小减小至 \(T=8, X=3\))。它也是 [sec:finetuning_exp] 中唯一通过预测绝对笛卡尔坐标控制机器人的方法;其他所有方法均采用相对位置控制。Diffusion Policy (matched) 以单张图像作为输入,不使用本体感知信息或观测历史,且不采用动作分块,仅预测一个相对位置控制动作。) 此外,本文评测在目标数据集上微调的 Octo [octo_2023],因为它是当前支持微调的最佳通用策略(RT-2-X 的推理 API 不支持微调)。本文也在相同目标数据集上微调 OpenVLA,所得策略记为 OpenVLA。 最后,作为消融实验,本文与 OpenVLA (scratch) 进行比较。该方法直接在目标机器人配置上微调底层基础 Prismatic VLM,而非微调经过 OpenX 预训练的 OpenVLA 模型,以评估大规模机器人预训练的收益。
结果见 [fig:finetune_results](各任务的详细结果见附录 [app:tab:detailed_finetune_results])。 在“将胡萝卜放入碗中”和“将玉米倒入锅中”等范围较窄的单指令任务上,两个版本的 Diffusion Policy 均可与通用策略 Octo 和 OpenVLA 竞争或优于二者;但在场景中包含多个物体且需要语言条件控制的更多样化微调任务上,预训练通用策略表现更好。 对 Octo 和 OpenVLA 进行 OpenX 预训练,使模型能更好地适应这些注重语言落地的多样化任务;OpenVLA (scratch) 较低的性能为此提供了证据。 总体而言,OpenVLA 的平均性能最高。多数以往方法仅在范围较窄的单指令任务或多样化的多指令任务中的一类任务上表现强劲,因而成功率差异很大。OpenVLA 是唯一在所有受测任务上均达到至少 50% 成功率的方法,表明它可作为模仿学习任务的有力默认选择,尤其适合包含多样化语言指令的任务。对于范围较窄但要求高度灵巧操作的任务,Diffusion Policy 的轨迹仍更平滑、更精确;引入 Diffusion Policy 所采用的动作分块和时序平滑,可能帮助 OpenVLA 达到同等灵巧程度,是值得探索的未来方向(当前局限的详细讨论见 [sec:conclusion])。
参数高效微调
上一节中 OpenVLA 的完整微调为每个任务使用 8 块 A100 GPU 训练 5-15 小时(取决于数据集规模),取得了较高性能。尽管所需算力远低于 VLA 预训练,本节仍进一步探索算力和参数效率更高的微调方法,并研究其有效性。
表:参数高效微调评测。LoRA 微调实现了最佳的性能—算力权衡,仅训练模型 1.4% 的参数即可达到完整微调的性能。在选定的 Franka-Tabletop 任务上,每种方法的平均成功率 \(\pm\) 标准误根据 33 条试验轨迹计算(详见 [app:tab:detailed_peft_results])。
\(^\ast\):使用 FSDP [zhao2023pytorch] 分片至 2 块 GPU。
\begin{wraptable}{r}{0.6\textwidth}
\centering
\vspace{-0.3cm}
\caption{\textbf{参数高效微调评测。}LoRA 微调实现了最佳的性能—算力权衡,仅训练模型 1.4\% 的参数即可达到完整微调的性能。在选定的 Franka-Tabletop 任务上,每种方法的平均成功率 $\pm$ 标准误根据 33 条试验轨迹计算(详见 \cref{app:tab:detailed_peft_results})。\newline$^\ast$:使用 FSDP~\citep{zhao2023pytorch} 分片至 2 块 GPU。}
\label{tab:partial_finetune_results}
\resizebox{0.6\textwidth}{!}{\begin{tabular}{lccc}
\toprule
策略 & 成功率 & 训练参数量 ($\times 10^6$) & 显存(批量 16) \\
\midrule
完整微调 & \textbf{69.7 $\pm$ 7.2 \%} & 7,188.1 & 163.3 GB* \\
\midrule
仅最后一层 & 30.3 $\pm$ 6.1 \% & 465.1 & 51.4 GB \\
冻结视觉编码器 & 47.0 $\pm$ 6.9 \% & 6,760.4 & 156.2 GB* \\
夹心式微调 & 62.1 $\pm$ 7.9 \% & 914.2 & 64.0 GB \\
LoRA,秩=32 & \textbf{68.2 $\pm$ 7.5\%} & \textbf{97.6} & \textbf{59.7 GB} \\
\hspace{1.05cm}秩=64 & \textbf{68.2 $\pm$ 7.8\%} & 195.2 & 60.5 GB \\
\bottomrule
\end{tabular}}
\end{wraptable}
具体而言,本文比较以下微调方法:完整微调,即如 [sec:finetuning_exp] 所述,在微调期间更新全部权重;仅最后一层,即仅微调 OpenVLA 的 Transformer 骨干网络最后一层和词元嵌入矩阵;冻结视觉编码器,即冻结视觉编码器并微调其他所有权重;夹心式微调,即解冻视觉编码器、词元嵌入矩阵和最后一层;以及低秩适配(LoRA),即采用 [hu2021lora] 提出的常用低秩适配技术,在模型所有线性层上应用多个秩值 \(r\)。
[tab:partial_finetune_results] 给出了多个 Franka-Tabletop 任务上的微调成功率、训练参数量和 GPU 显存需求。(注:在 [sec:param_efficient_finetuning] 和 [sec:quantization_exp] 中,本文实验使用的 OpenVLA 模型版本采用较小的机器人数据混合进行预训练(与 Octo 使用相同的 OpenX 数据集混合),其架构也略小,仅使用 SigLIP [zhai2023sigmoid] 视觉骨干网络,而非融合的 DinoSigLIP 编码器。实验发现,这一较简单的架构在微调任务和“开箱即用”任务上仍表现强劲。)仅微调网络最后一层或冻结视觉编码器都会导致性能不佳,表明进一步使视觉特征适配目标场景至关重要。相比之下,“夹心式微调”会微调视觉编码器,因此性能更好;由于不微调整个大语言模型(Large Language Model, LLM)骨干网络,其 GPU 显存占用也更少。LoRA 在性能与训练显存占用之间实现了最佳权衡:它优于“夹心式微调”,且仅微调 1.4% 的参数便达到完整微调的性能。LoRA 的秩对策略性能影响可忽略不计,因此建议使用默认秩 \(r=32\)。借助 LoRA,仅用一块 A100 GPU 即可在 10-15 小时内将 OpenVLA 微调至新任务,算力需求较完整微调降低 8 倍。
通过量化实现显存高效推理
图:OpenVLA 在不同 GPU 上的推理速度。bfloat16 和 int4 量化均可实现高吞吐量,在采用 Ada Lovelace 架构的 GPU(RTX 4090、H100)上尤为明显。使用 TensorRT-LLM [tensorrt_llm] 等现代 LLM 推理框架还可进一步提速。\(\spadesuit\):模型分片至两块 GPU 以容纳模型。
表:量化推理性能。4 位量化达到 bfloat16 推理(本文默认方法)的性能,同时将 GPU 显存占用减少一半以上。在 8 个代表性 BridgeData V2 任务 [walke2023bridgedata]上,每种方法的平均成功率 \(\pm\) 标准误根据 80 条试验轨迹计算(详见 [app:tab:detailed_quantized_inference_results])。
\begin{tabular}{lcc}
\toprule
精度 & Bridge 成功率 & 显存 \\
\midrule
bfloat16 & 71.3 $\pm$ 4.8\% & 16.8 GB \\
int8 & 58.1 $\pm$ 5.1\% & 10.2 GB \\
int4 & 71.9 $\pm$ 4.7\% & 7.0 GB \\
\bottomrule
\end{tabular}
OpenVLA 是一个 7B 参数模型,其推理显存占用高于 Octo 等以往开源通用策略;Octo 的参数量为 \(<\)100M。遵循 LLM 服务的最佳实践,本文以 bfloat16 精度保存并加载 OpenVLA 进行推理(默认方法),将显存占用减半,使 OpenVLA 可在仅有 16GB 显存的 GPU 上运行。本节使用为 LLM 服务开发的现代量化技术 [dettmers2022gpt3, dettmers2024qlora],测试能否进一步降低策略推理所需显存并提高 VLA 策略的可用性。这些方法以较低精度加载网络权重,以潜在的推理速度和准确率下降换取更低的显存需求。
具体而言,本文在 8 个代表性 BridgeData V2 任务上研究以 8 位和 4 位精度部署 OpenVLA 模型。显存占用和试验轨迹性能见 [tab:quantized_results];不同消费级和服务器级 GPU 可实现的控制频率见 [fig:inference_speed]。由于额外量化操作带来的开销,8 位量化会降低多数 GPU 上的推理速度。4 位推理的吞吐量更高,因为 GPU 显存传输量的减少抵消了量化开销。
推理速度降低使 8 位量化的性能显著下降:在评测所用的 A5000 GPU 上,模型只能以 1.2Hz 运行;与 BridgeData V2 任务所用 5Hz 非阻塞控制器的训练数据集相比,这显著改变了系统动力学。(注:本文将性能下降归因于较低的推理速度,因为在训练数据上离线评测时,8 位和 4 位量化的词元准确率均与 bfloat16 推理相当。支持性细节见 [sec:app:additional_quantized_inference_experiments]。)尽管 4 位量化所需 GPU 显存不到一半,其性能仍与 bfloat16 半精度推理相近。4 位量化模型可在 A5000 上以 3Hz 运行,因此更接近数据采集时的系统动力学。
讨论与局限性
本文提出了当前最佳的开源视觉—语言—动作模型 OpenVLA,无需额外适配即可在跨本体机器人控制中取得较强性能。本文还证明,参数高效微调技术能够轻松将 OpenVLA 适配到新的机器人配置。
当前 OpenVLA 模型存在若干局限。首先,它仅支持单图像观测,而真实世界中的机器人配置具有异构性,可能包含多种感知输入 [octo_2023]。未来的重要方向是扩展 OpenVLA,使其支持多图像、本体感知输入与观测历史。采用在图像与文本交错数据上预训练的 VLM,或有助于实现这种灵活输入形式的 VLA 微调。
其次,提高 OpenVLA 的推理吞吐量,是将 VLA 用于 ALOHA [zhao2023learning] 等50Hz高频控制平台的关键。这也将支持在比本文任务更灵巧的双臂操作任务上测试 VLA。动作分块或推测解码 [leviathan2023fast] 等推理时优化技术可能解决这一问题。
模型性能仍有提升空间。尽管 OpenVLA 优于以往通用策略,但在测试任务上尚未达到很高的可靠性,成功率通常低于90%。
最后,由于计算资源有限,许多 VLA 设计问题仍未得到充分研究:基础 VLM 的规模如何影响 VLA 性能?在机器人动作预测数据与互联网规模视觉—语言数据上联合训练,能否显著提升 VLA 性能?哪些视觉特征最适合 VLA?本文希望 OpenVLA 模型与代码库的发布能够推动社区共同研究这些问题。
数据混合细节
[tab:data_mix]列出了本文使用的数据混合方案。该方案大体遵循[octo_2023],并增加了少量数据集。
表:OpenVLA训练数据混合方案。数据取自Open X-Embodiment数据集 [open_x_embodiment_rt_x_2023],整体遵循[octo_2023]并加入少量额外数据集。
\begin{table}[th]
\centering
\begin{tabular}{lr}
\toprule
\multicolumn{2}{c}{\textbf{\name{}训练数据集混合方案}}\\
\midrule
Fractal~\citep{brohan2022rt} & 12.7\% \\
Kuka~\citep{kalashnikov2018qt} & 12.7\% \\
Bridge\citep{ebert2021bridge, walke2023bridgedata} & 13.3\% \\
Taco Play~\citep{rosetebeas2022latent,mees2023grounding} & 3.0\% \\
Jaco Play~\citep{dass2023jacoplay} & 0.4\% \\
Berkeley Cable Routing~\citep{luo2023multistage} & 0.2\% \\
Roboturk~\citep{DBLP:journals/corr/abs-1811-02790} & 2.3\% \\
Viola~\citep{zhu2023viola} & 0.9\% \\
Berkeley Autolab UR5~\citep{BerkeleyUR5Website} & 1.2\% \\
Toto~\citep{zhou2023train} & 2.0\% \\
Language Table~\citep{lynch2023interactive} & 4.4\% \\
Stanford Hydra Dataset~\citep{belkhale2023hydra} & 4.4\% \\
Austin Buds Dataset~\citep{zhu2022bottom} & 0.2\% \\
NYU Franka Play Dataset~\citep{cui2022play} & 0.8\% \\
Furniture Bench Dataset~\citep{heo2023furniturebench} & 2.4\% \\
UCSD Kitchen Dataset~\citep{ucsd_kitchens} & <0.1\% \\
Austin Sailor Dataset~\citep{nasiriany2022sailor} & 2.2\% \\
Austin Sirius Dataset~\citep{liu2022robot} & 1.7\% \\
DLR EDAN Shared Control~\citep{quere_shared_2020} & <0.1\% \\
IAMLab CMU Pickup Insert~\citep{saxena2023multiresolution} & 0.9\% \\
UTAustin Mutex~\citep{shah2023mutex} & 2.2\% \\
Berkeley Fanuc Manipulation~\citep{fanuc_manipulation2023} & 0.7\% \\
CMU Stretch~\citep{mendonca2023structured} & 0.2\% \\
BC-Z~\citep{jang2022bc} & 7.5\% \\
FMB Dataset~\citep{luo2024fmb} & 7.1\% \\
DobbE~\citep{shafiullah2023dobbe} & 1.4\% \\
DROID~\citep{khazatsky2024droid} & 10.0\%\footnote{由于学习进展缓慢(见\cref{sec:data_mix}),训练最后三分之一阶段移除DROID,并将其混合权重重新分配给其他所有数据集。} \\
\bottomrule
\end{tabular}%
\caption{\name{}训练数据混合方案。数据取自Open X-Embodiment数据集~\citep{open_x_embodiment_rt_x_2023},整体遵循\citep{octo_2023}并加入少量额外数据集。}
\label{tab:data_mix}
\end{table}
评估任务与详细结果
本节进一步介绍[sec:zero_shot_exp]中的BridgeData V2 WidowX和Google机器人评估,以及[sec:finetuning_exp]中的Franka-Tabletop与Franka-DROID微调评估。
BridgeData V2 WidowX评估细节
本节专门讨论[sec:zero_shot_exp]中的BridgeData V2评估。
BridgeData V2评估任务
如[sec:zero_shot_exp]所述,我们在17项任务上评估各通用机器人操控策略,每项任务进行10次试验。本节介绍任务类别及各项任务的细节。
图:BridgeData V2 WidowX机器人评估任务。我们在四类分布外(Out-of-Distribution,OOD)泛化任务上评估各通用机器人策略:视觉、运动、物理和语义泛化(定义见[sec:zero_shot_exp])。每对图像分别展示起始状态,以及机器人完成任务后的一个示例结束状态。最下方三行任务还严格评估语言落地能力:保持初始状态不变而改变提示,以检验策略能否接近正确的目标物体。
评估共包括5项视觉泛化任务、2项运动泛化任务、3项物理泛化任务、4项语义泛化任务和3项语言落地任务。由于无法获得原始数据集使用的完全相同物体,所有评估任务都引入了某种分布偏移;在不同地点复现实物测试环境时还会自然产生其他分布偏移,详见[sec:app:compare_to_orig_bridge]。全部17项任务如[fig:app:bridge_tasks]所示。每条试验轨迹记为失败(0)或成功(1);部分较难任务还记录部分成功(0.5),其得分条件见下文任务说明。
下面按[fig:app:bridge_tasks]中的顺序介绍17项任务: - 将茄子放入锅中(简单版):机器人需拿起茄子并将其放入锅中。这是一项视觉泛化任务,因为无法取得原始锅具,故使用外观不同于BridgeData V2原始训练数据集所用锅具的手工纸锅。与其余16项任务不同,该任务在运行策略前将机器人末端执行器直接初始化到茄子上方,因此称为“将茄子放入锅中”的“简单版”。 - 将茄子放入锅中:任务与上项相同,但末端执行器并不直接初始化在茄子上方,而是在所有试验轨迹中采用同一固定位置,因此机器人必须先水平伸向茄子才能进行操控(下述所有其他任务同样如此)。基于与上项相同的原因,这是一项视觉泛化任务。 - 将台面上的杯子放入水槽:机器人需从厨房台面或沥水架拿起粉色杯子,并放入右侧水槽。这是一项视觉泛化任务,因为此处使用粉色杯子而非原始BridgeData V2数据集中的蓝色杯子;实验发现所有受评方法都无法可靠操控蓝色杯子,最可能的原因是其颜色与水槽颜色混在一起。 - 将茄子放入锅中(含杂物):任务与“将茄子放入锅中”相同,但多个干扰物体提高了难度。基于普通版本所述原因,这是一项视觉泛化任务;场景中未见过的干扰物进一步加剧了视觉分布偏移。当机器人朝正确目标物体移动时,计部分得分(1分中的0.5分)。 - 将黄色玉米放到粉色盘子上:机器人需拿起黄色玉米并放到粉色盘子上。由于场景中存在未见过的干扰物体,例如水槽后部台面上的绿色恐龙,这是一项视觉泛化任务。当机器人朝正确目标物体移动时,计部分得分(1分中的0.5分)。 - 提起茄子:机器人需抓住茄子并将其提到空中。这是一项运动泛化任务:茄子的初始位置和/或朝向未在训练中出现,机器人必须超出训练位置和/或朝向分布,且常需远距离伸展才能完成任务。原始BridgeData V2示范未在该环境中展示远距离伸展,详见[sec:app:compare_to_orig_bridge]。该任务看似简单,却对许多策略颇具挑战。当机器人接触到茄子时,计部分得分(1分中的0.5分)。 - 将胡萝卜放到盘子上(高度变化):机器人需拿起胡萝卜并放到黄色盘子上。这是一项运动泛化任务,因为盘子从水槽底部的常规位置被抬高,机器人必须调整轨迹,将胡萝卜正确放到抬高的平台上且不能碰倒盘子。当机器人抓住胡萝卜并用其接触盘子时,计部分得分(1分中的0.5分)。 - 将胡萝卜放到盘子上:任务与上项相同,但盘子位于常规位置,即水槽或沥水架底部。由于所用胡萝卜的尺寸和形状不同于原始BridgeData V2数据集中更短、更细的胡萝卜,因此归为物理泛化任务。严格而言,上一个版本因使用相同胡萝卜也属于物理泛化,但其重点是运动泛化,故列入该类别。 - 将锅翻正:机器人需操控锅具,使其在回合结束时直立于水槽中。由于该锅具的尺寸和形状不同于BridgeData V2原始训练示范中的锅具(本文所用锅具更宽、更矮),这是一项物理泛化任务。 - 提起AAA电池:机器人只需抓住AAA电池并将其提到空中。该电池远小于且薄于BridgeData V2在此环境中的训练示范目标物体,因此归为物理泛化任务,详见[sec:app:compare_to_orig_bridge]。该目标物体也未出现在此环境的原始BridgeData V2示范中,因而也属于“语义泛化”,但此处重点是物理属性,故仅归为物理泛化。 - 将骷髅移入沥水架:机器人需抓住骷髅发条玩具,并将其放入水槽左侧的黄色沥水架。骷髅是未见过的目标物体,未出现在BridgeData V2训练示范中,因此这是一项语义泛化任务。 - 提起白色胶带:机器人需抓住白色胶带卷并将其提到空中。白色胶带卷是未见过的目标物体,未出现在BridgeData V2训练示范中,因此这是一项语义泛化任务。由于其形状不同于此环境训练示范中的物体,也可视为物理泛化;多数策略难以抓取这种环状结构,常将末端执行器直接移向中心区域。 - 从锅中取出紫葡萄:机器人需抓住钢锅内的紫葡萄并将其取出,即提起后放到锅外任意位置。由于该语言指令未曾出现,机器人在原始BridgeData V2训练数据集中从未见过此任务,因此这是一项语义泛化任务。 - 将蓝色杯子叠放到粉色杯子上:机器人需抓住蓝色杯子,并将其稳妥放到粉色杯子上。由于这条语言指令未曾出现,机器人在原始BridgeData V2训练数据集的该环境中从未见过此任务,因此这是一项语义泛化任务。当机器人抓住蓝色杯子并用其接触粉色杯子时,计部分得分(1分中的0.5分)。 - 将{茄子、红瓶}放入锅中:这是一项语言落地任务。机器人需将指定目标物体放入锅中,场景中同时存在茄子和红瓶。采用成对评估:在相同初始状态下,一个回合提示策略以茄子为目标,下一个回合则以红瓶为目标。每种方法针对茄子和红瓶各测试5次,两种目标物体使用相同的5个初始状态。当机器人朝正确目标物体移动时,计部分得分(1分中的0.5分)。 - 提起{奶酪、红辣椒}:这是一项语言落地任务。机器人需抓住并提起指定目标物体,采用与上项任务相同的成对评估。当机器人朝正确目标物体移动时,计部分得分(1分中的0.5分)。 - 将{蓝色杯子、粉色杯子}放到盘子上:这是一项语言落地任务。机器人需抓住指定目标物体并放到盘子上,采用与其他语言落地任务相同的成对评估。当机器人朝正确目标物体移动时,计部分得分(1分中的0.5分)。
评估任务与原始BridgeData V2训练数据的比较
评估在原始BridgeData V2数据集[walke2023bridgedata]使用的水槽环境中进行。复现环境时,粗略估计机器人相对于水槽的位置以及相机相对于场景的位置,以匹配BridgeData V2中的原始环境。原始数据集未提供这些位置的精确测量值,因此无法完全复现环境配置;机器人、水槽和相机位置的细微差异会自然产生分布偏移。此外,机器人策略的评估地点不同于训练示范采集地点,也会产生其他自然分布偏移。例如,照明条件和背景(例如, 水槽后方可见区域)必然不同于训练数据集。由于还无法获得原始BridgeData V2数据集所用的完全相同物体,训练与测试所用物体之间也存在分布偏移。
尽管存在这些挑战,OpenVLA和RT-2-X等部分通用策略仍能泛化,并在无需额外调整的情况下较可靠地完成多种任务。RT-1-X和Octo等其他通用策略也能完成部分任务,但面对BridgeData V2评估套件中难度更高的泛化任务时表现不佳。
原始BridgeData V2数据集在该水槽环境中包含以下七项任务的示范:“Flip Pot Upright”“Put Carrot on Plate”“Put Cup from Counter (or Drying Rack) into Sink”“Put Eggplant into Pot”“Put Knife on Cutting Board”“Put Spoon in Pot”和“Turn Lever Vertical to Front”。[fig:app:original_bridge_tasks]展示了原始数据集中这些任务的示例图像。该环境中采集的所有训练示范都将机器人末端执行器初始化在目标物体正上方。不过,BridgeData V2的其他环境并非全部如此;在某些环境中,机器人初始位置离目标物体较远,必须先水平伸向物体再进行操控。
图:原始BridgeData V2水槽环境任务。原始BridgeData V2数据集水槽环境中的示范样例表明,该环境所有示范的初始状态都将机器人末端执行器置于目标物体正上方。这些初始状态不同于[fig:app:bridge_tasks]所示BridgeData V2评估任务所用状态。评估中始终将末端执行器初始化到水槽上方的固定位置,而非目标物体正上方;唯一例外是“Put Eggplant into Pot (Easy Version)”任务。
BridgeData V2评估套件中,仅“Put Eggplant into Pot (Easy Version)”将机器人末端执行器初始化到目标物体正上方;其余16项任务均将末端执行器初始化到水槽上方的固定位置,机器人必须水平伸向物体。该初始条件与评估套件各类OOD泛化所引入的分布偏移共同增加了通用策略的难度,策略需具备较强鲁棒性才能成功完成任务。因此,RT-1-X和Octo等策略的成功率低于先前工作报告值。然而,面对这些分布偏移与挑战,RT-2-X和OpenVLA等策略仍取得相对较强的性能。
BridgeData V2详细评估结果
完整的BridgeData V2 WidowX评估结果见[app:tab:bridge_results_detailed]。表中列出各方法在17项任务各10次试验中的成功次数。OpenVLA在多数任务上表现最佳,并在通用策略中取得最高总体成功率。RT-2-X也表现良好,优于RT-1-X和Octo,但不及OpenVLA;RT-1-X和Octo通常难以应对这些泛化任务。
表:BridgeData V2 WidowX详细评估结果。报告完整17项任务评估套件(见[sec:zero_shot_exp])的性能,包括视觉、运动、物理和语义泛化任务以及语言落地任务。部分任务允许部分成功(0.5分),详见[sec:app:bridge_evaluation_tasks]。OpenVLA在多数任务上表现最佳,总体性能最高,RT-2-X次之;RT-1-X和Octo在评估中表现较弱,多项任务仅成功0--2次。全部任务图示见[fig:app:bridge_tasks]。
\begin{table}[h]
\centering
\caption{\textbf{BridgeData~V2 WidowX详细评估结果。}报告完整17项任务评估套件(见\cref{sec:zero_shot_exp})的性能,包括视觉、运动、物理和语义泛化任务以及语言落地任务。部分任务允许\emph{部分成功}(0.5分),详见\cref{sec:app:bridge_evaluation_tasks}。\name{}在多数任务上表现最佳,总体性能最高,RT-2-X次之;RT-1-X和Octo在评估中表现较弱,多项任务仅成功0--2次。全部任务图示见\cref{fig:app:bridge_tasks}。}
\label{app:tab:bridge_results_detailed}
\resizebox{\textwidth}{!}{%
\begin{tabular}{llccccc}
\toprule
类别 & 任务 & 试验次数 & \makecell{RT-1-X\\成功次数} & \makecell{Octo\\成功次数} & \makecell{RT-2-X\\成功次数} & \makecell{\name{}~(本文)\\成功次数} \\
\midrule
视觉泛化 & Put Eggplant into Pot (Easy Version) & 10 & 1 & 5 & 7 & \textbf{10} \\
视觉泛化 & Put Eggplant into Pot & 10 & 0 & 1 & 5 & \textbf{10} \\
视觉泛化 & Put Cup from Counter into Sink & 10 & 1 & 1 & 0 & \textbf{7} \\
视觉泛化 & Put Eggplant into Pot (w/ Clutter) & 10 & 1 & 3.5 & 6 & \textbf{7.5} \\
视觉泛化 & Put Yellow Corn on Pink Plate & 10 & 1 & 4 & 8 & \textbf{9} \\
运动泛化 & Lift Eggplant & 10 & 3 & 0.5 & 6.5 & \textbf{7.5} \\
运动泛化 & Put Carrot on Plate (w/ Height Change) & 10 & 2 & 1 & \textbf{4.5} & \textbf{4.5} \\
物理泛化 & Put Carrot on Plate & 10 & 1 & 0 & 1 & \textbf{8} \\
物理泛化 & Flip Pot Upright & 10 & 2 & 6 & 5 & \textbf{8} \\
物理泛化 & Lift AAA Battery & 10 & 0 & 0 & 2 & \textbf{7} \\
语义泛化 & Move Skull into Drying Rack & 10 & 1 & 0 & \textbf{5} & \textbf{5} \\
语义泛化 & Lift White Tape & 10 & \textbf{3} & 0 & 0 & 1 \\
语义泛化 & Take Purple Grapes out of Pot & 10 & \textbf{6} & 0 & 5 & 4 \\
语义泛化 & Stack Blue Cup on Pink Cup & 10 & 0.5 & 0 & \textbf{5.5} & 4.5 \\
语言落地 & Put \{Eggplant, Red Bottle\} into Pot & 10 & 2.5 & 4 & \textbf{8.5} & 7.5 \\
语言落地 & Lift \{Cheese, Red Chili Pepper\} & 10 & 1.5 & 2.5 & 8.5 & \textbf{10} \\
语言落地 & Put \{Blue Cup, Pink Cup\} on Plate & 10 & 5 & 5.5 & 8.5 & \textbf{9.5} \\
\midrule
&& 平均成功率 & \cellcolor{lightlightgray}18.5$\pm$2.7\% & \cellcolor{lightlightgray}20.0$\pm$2.6\% & \cellcolor{lightlightgray}50.6$\pm$3.5\% & \cellcolor{lightlightgray}\textbf{70.6$\pm$3.2\%} \\
\bottomrule
\end{tabular}}
\end{table}
此外,[app:tab:detailed_quantized_inference_results]给出了[tab:quantized_results]所概述量化推理实验的完整评估结果。这些评估在8项有代表性的BridgeData V2任务上测试策略,覆盖完整评估套件中的所有任务类别。
表:完整量化推理结果。此处给出[tab:quantized_results]中结果的详细版本。
\begin{table}[h]
\centering
\caption{\textbf{完整量化推理结果。}此处给出\cref{tab:quantized_results}中结果的详细版本。}
\label{app:tab:detailed_quantized_inference_results}
\resizebox{\textwidth}{!}{%
\begin{tabular}{llcccc}
\toprule
类别 & 任务 & 试验次数 & \makecell{bfloat16\\成功次数} & \makecell{int8\\成功次数} & \makecell{int4\\成功次数} \\
\midrule
视觉泛化 & Put Eggplant into Pot (Easy Version) & 10 & \textbf{9} & 7 & \textbf{9} \\
视觉泛化 & Put Eggplant into Pot & 10 & \textbf{7} & \textbf{7} & \textbf{7} \\
视觉泛化 & Put Cup from Counter into Sink & 10 & 5 & 3 & \textbf{7} \\
运动泛化 & Lift Eggplant & 10 & 6 & 4 & \textbf{7.5} \\
物理泛化 & Put Carrot on Plate & 10 & 6 & 5 & \textbf{7} \\
物理泛化 & Lift AAA Battery & 10 & \textbf{7} & 5 & 3 \\
语义泛化 & Take Purple Grapes out of Pot & 10 & 8 & 8 & \textbf{9} \\
语言落地 & Put \{Eggplant, Red Bottle\} into Pot & 10 & \textbf{9} & 7.5 & 8 \\
\midrule
&& 平均成功率 & \cellcolor{lightlightgray}\textbf{71.3 $\pm$ 4.8\%} & \cellcolor{lightlightgray}58.1 $\pm$ 5.1\% & \cellcolor{lightlightgray}\textbf{71.9 $\pm$ 4.7\%} \\
\bottomrule
\end{tabular}}
\end{table}
Google机器人评估细节
本节进一步介绍[sec:zero_shot_exp]中的Google机器人评估。
Google机器人评估任务
图:Google机器人评估任务。在分布内任务和分布外(OOD)泛化任务上评估各通用机器人策略。OOD任务涉及未见过的背景、目标物体、指令/物体关系和语义概念(例如未出现在机器人动作数据中的互联网照片)。
在Google机器人上,每种通用机器人策略均评估12项任务,每项运行5条试验轨迹,共60条。前五项任务测试分布内条件,后七项测试更困难的分布外(OOD)条件。全部任务如[fig:app:rt1_robot_tasks]所示,每条试验轨迹记为失败(0)或成功(1)。
下面介绍12项任务: - 拿起可乐罐(分布内):机器人位于平台前方,平台上放有一罐可乐;目标是抓住并提起可乐罐。 - 将苹果移到绿色罐旁(分布内):平台上放有一个苹果和一个绿色汽水罐;机器人需抓住苹果并将其移到绿色罐旁。 - 将蓝色薯片袋移到苹果旁(分布内):平台上放有蓝色薯片袋和苹果;机器人需抓住薯片袋并将其移到苹果附近。 - 将可乐罐立正(分布内):平台上的可乐罐侧卧;机器人需抓住可乐罐并将其调整为直立姿态。 - 打开中间抽屉(分布内):机器人位于一组三层抽屉前,需抓住中间抽屉的把手并将其拉开。 - 将橙子移到棕色薯片袋旁(OOD):平台上放有棕色薯片袋和橙子,物体下方铺着蓝天白云图案的桌布。机器人需抓住橙子并移到薯片袋旁。该任务属于OOD,因为橙子是训练数据集中未见过的物体,桌布也是未见过的背景。(注:Google机器人评估中OOD条件的详细列表见[rt22023arxiv]附录。) - 拿起百事可乐罐(OOD):平台上放有一罐百事可乐,其下铺着亮黄/棕色图案桌布。机器人需抓住并提起罐子。百事可乐罐和桌布背景均未见过,因此该任务属于OOD。 - 拿起香蕉(OOD):平台上放有苹果、可乐罐和香蕉;机器人需抓住并提起香蕉。香蕉是未见过的目标物体,因此该任务属于OOD。 - 拿起绿色杯子(OOD):平台上放有香蕉、百事可乐罐和绿色杯子;机器人需抓住并提起绿色杯子。场景中所有物体都未出现在训练数据中,因此该任务属于OOD。 - 将苹果放到盘子上(OOD):平台上放有盘子和苹果;机器人需抓住苹果并移到盘子上。该任务使用描述未见物体关系的新指令,因而属于OOD:训练示范只包含将苹果移到盘子附近,而非放在盘子上方。 - 将香蕉放入平底锅(OOD):平台上放有平底锅和香蕉;机器人需抓住香蕉并将其移入锅中。香蕉是未见过的目标物体,且该新指令描述了未见过的物体关系,因此该任务属于OOD。 - 将可乐罐移到Taylor Swift照片旁(OOD):平台上放有可乐罐和三位不同名人的照片,其中包括Taylor Swift。机器人需抓住罐子并移到Taylor Swift的照片旁。名人照片未出现在机器人交互数据中,因此该任务属于OOD。
Google机器人详细评估结果
表:Google机器人详细评估结果。报告[sec:zero_shot_exp]所述Google机器人评估的完整结果。每种通用策略跨12项任务评估60条试验轨迹,涵盖分布内和分布外(OOD)测试条件。底行报告各策略的平均成功率\(\pm\)标准误差。OpenVLA和RT-2-X总体均显著优于RT-1-X和Octo;由于两者误差条重叠,其平均成功率均以粗体标出。全部任务图示见[fig:app:rt1_robot_tasks]。
\begin{table}[h]
\centering
\caption{\textbf{Google机器人详细评估结果。}报告\cref{sec:zero_shot_exp}所述Google机器人评估的完整结果。每种通用策略跨12项任务评估60条试验轨迹,涵盖分布内和分布外(OOD)测试条件。底行报告各策略的平均成功率$\pm$标准误差。OpenVLA和RT-2-X总体均显著优于RT-1-X和Octo;由于两者误差条重叠,其平均成功率均以粗体标出。全部任务图示见\cref{fig:app:rt1_robot_tasks}。}
\label{app:tab:rt1_robot_results_detailed}
\resizebox{\textwidth}{!}{%
\begin{tabular}{llccccc}
\toprule
类别 & 任务 & 试验次数 & \makecell{RT-1-X\\成功次数} & \makecell{Octo\\成功次数} & \makecell{RT-2-X\\成功次数} & \makecell{\name{}~(本文)\\成功次数} \\
\midrule
分布内 & Pick Coke Can & 5 & \textbf{5} & 1 & \textbf{5} & \textbf{5} \\
分布内 & Move Apple near Green Can & 5 & 3 & 3 & 3 & \textbf{5} \\
分布内 & Move Blue Chip Bag near Apple & 5 & 0 & 3 & 4 & \textbf{5} \\
分布内 & Place Coke Can Upright & 5 & 0 & 0 & \textbf{4} & \textbf{4} \\
分布内 & Open Middle Drawer & 5 & 0 & \textbf{4} & 2 & 3 \\
OOD & Move Orange near Brown Chip Bag & 5 & 1 & 2 & \textbf{5} & \textbf{5} \\
OOD & Pick Pepsi Can & 5 & 3 & 0 & \textbf{5} & 4 \\
OOD & Pick Banana & 5 & \textbf{5} & 3 & \textbf{5} & \textbf{5} \\
OOD & Pick Green Cup & 5 & 1 & 0 & \textbf{5} & \textbf{5} \\
OOD & Place Apple on Plate & 5 & 0 & 0 & \textbf{4} & \textbf{4} \\
OOD & Place Banana in Pan & 5 & 0 & 0 & 2 & \textbf{4} \\
OOD & Move Coke Can near Taylor Swift & 5 & 2 & 0 & \textbf{3} & 2 \\
\midrule
&& 平均成功率 & \cellcolor{lightlightgray}33.3$\pm$6.1\% & \cellcolor{lightlightgray}26.7$\pm$5.8\% & \cellcolor{lightlightgray}\textbf{78.3$\pm$5.4\%} & \cellcolor{lightlightgray}\textbf{85.0$\pm$4.6\%}\\
\bottomrule
\end{tabular}}
\end{table}
Google机器人评估的完整结果见[app:tab:rt1_robot_results_detailed]。总体而言,RT-1-X和Octo难以应对评估任务,多项任务在五次试验中一次也未成功。相比之下,RT-2-X和OpenVLA表现较强,每项任务至少在五次试验中成功两次;这两种VLA策略在该评估套件上的表现相当。
数据高效适配实验细节
本节进一步介绍[sec:finetuning_exp]中的数据高效适配实验,考察微调后的OpenVLA策略在Franka-Tabletop和Franka-DROID等新机器人配置上的有效性。
Franka-Tabletop与Franka-DROID任务
针对七项任务分别采集10--150条示范。前六项对应称为“Franka-Tabletop”的机器人配置,即安装在桌面上的Franka Emika Panda机器人;最后一项对应“Franka-DROID”配置。
在Franka-Tabletop配置中,六项任务的前三项是范围较窄的单指令任务,后三项是多指令任务:场景中存在多个物体,机器人必须根据语言指令操控正确物体。
图:Franka-Tabletop微调任务。图中展示[sec:finetuning_exp]数据高效适配实验所用的Franka-Tabletop任务,详细说明见[fig:app:franka_tabletop_tasks]。六项任务的前三项位于上方三行,仅涉及单条指令;后三项位于下方三行,涉及多个物体与多条指令,指令指定目标物体或目标位置。第一列展示符合训练数据分布的初始状态样例,第二列展示分布外(OOD)初始状态(例如, 未见过的背景、目标物体、干扰物以及物体位置/朝向)。[sec:finetuning_exp]中的每种策略均在分布内任务上评估10--12条试验轨迹,在OOD任务上评估5--6条。
下面介绍[fig:app:franka_tabletop_tasks]所示的六项Franka-Tabletop任务: - 将胡萝卜放入碗中(单指令):机器人需抓住胡萝卜并将其放入碗中。训练数据集包含该任务的50条示范,每个回合将胡萝卜和碗随机放在桌面不同位置,且胡萝卜始终初始化在碗左侧。评估时,每次试验记为成功(1)或失败(0),不设部分得分。 - 将玉米倒入锅中(单指令):机器人需抓住红碗、移向钢锅,并将碗中物体(一根黄色玉米)倒入锅中。训练数据集包含该任务的50条示范,每个回合将碗和锅随机放在桌面不同位置,且碗始终初始化在锅右侧。评估时,每次试验记为成功(1)或失败(0),不设部分得分。 - 将锅翻正(单指令):机器人需抓住初始竖置的钢锅,将其旋转至正立姿态并放回桌面。训练数据集仅包含该任务的10条示范,钢锅随机放置在桌面一小块区域内的不同位置。评估时,每次试验记为成功(1)、失败(0)或部分成功(0.5)。抓住锅但未将其翻正,或将其碰倒至正立姿态但未仔细引导,均计为部分成功;回合结束时机器人必须松开锅具才能获得满分。 - 将<物体>移到盘子上(多指令):机器人需根据语言指令指定的目标,从三个物体中抓取一个,并放到桌面右侧的盘子上。训练数据集包含该任务的150条示范,在桌面随机摆放不同的三物体组合并选择其中一个作为目标;盘子始终初始化在桌面右侧。评估时,每次试验记为成功(1)、失败(0)或部分成功(0.5)。如果机器人首先接触的物体是语言指令指定的正确目标,但未完成任务,则记为部分成功。 - 推倒<物体>(多指令):机器人需根据语言指令指定的目标接近三个物体中的一个,并将其推倒。训练数据集包含该任务的70条示范,在桌面随机摆放不同的三物体组合并选择其中一个作为目标。评估时,每次试验记为成功(1)、失败(0)或部分成功(0.5)。如果机器人首先接触的物体是语言指令指定的正确目标,但未完成任务,则记为部分成功。 - 用毛巾覆盖<物体>(多指令):机器人需抓住蓝色毛巾,并根据语言指令指定的目标将其放到三个物体中的一个上。训练数据集包含该任务的45条示范,在桌面随机摆放不同的三物体组合。评估时,每次试验记为成功(1)、失败(0)或部分成功(0.5)。如果毛巾首先接触的是语言指令指定的正确目标,但机器人未完成任务(例如, 将毛巾掉在桌面而非目标物体上),则记为部分成功。只要毛巾任一部分搭在目标物体顶面即可获得满分,无需完全覆盖物体。
对每项Franka-Tabletop任务,各方法均进行10--12次分布内试验和5--6次OOD泛化试验。分布内与OOD测试条件见[fig:app:franka_tabletop_tasks]第二列。
六项任务的OOD测试条件如下: - 将胡萝卜放入碗中(OOD):用未见过的茄子替换胡萝卜。 - 将玉米倒入锅中(OOD):桌面铺上未见过的棕色桌布。 - 将锅翻正(OOD):桌面铺上未见过的白色桌布。 - 将<物体>移到盘子上(OOD):桌面放置三个未见过的物体。 - 推倒<物体>(OOD):在三个已见物体后方放置两个未见干扰物体,即红色塑料杯和棕色盒子。 - 用毛巾覆盖<物体>(OOD):将桌面三个物体倒置并放到未见过的位置。
最后,在Franka-DROID环境中实验一项任务及其变体:擦拭桌面(见[fig:app:droid_wipe_task])。机器人需抓住刷子,将三个棕色小物体全部扫入簸箕。训练数据集包含该任务的70条示范,并改变所有物体的位置。
图:Franka-DROID微调任务。图中的“擦拭桌面”是[sec:finetuning_exp]数据高效适配实验所用的最后一项任务。左图展示分布内试验的初始条件;右图展示桌面存在未见干扰物体的分布外试验。要完全完成任务,机器人必须抓住刷子,将三个物体全部扫入簸箕。
测试同时覆盖与训练数据匹配的分布内条件([fig:app:droid_wipe_task]左)和桌面存在干扰物体的分布外(OOD)条件([fig:app:droid_wipe_task]右)。由于每次试验可能产生多种结果,评分规则如下:每次试验满分2分;机器人将三个物体全部扫入簸箕得2分,成功扫入一个或两个物体得1分,否则得0分。每种策略进行18次分布内试验和12次OOD试验,总分为60分。
Franka-Tabletop与Franka-DROID详细评估结果
Franka-Tabletop和Franka-DROID的完整评估结果见[app:tab:detailed_finetune_results],评估对象为[sec:finetuning_exp]所述方法。Diffusion Policy在单指令Franka-Tabletop任务(例如, “Put Carrot in Bowl”和“Pour Corn in Pot”)上表现较强,优于其他方法;OpenVLA和Octo则在更多样的多指令任务(“Move
表:数据高效适配实验详细结果。此处完整分解[fig:finetune_results]概述的结果。报告在新机器人任务上从头训练的Diffusion Policy,以及使用相同数据微调的通用策略性能。每种策略均在分布内与分布外(OOD)泛化条件下测试;Franka-Tabletop任务见[fig:app:franka_tabletop_tasks],Franka-DROID任务见[fig:app:droid_wipe_task]。没有一种策略在所有任务上都最佳:Diffusion Policy在单指令任务上成功率较高,OpenVLA和Octo在多样的多指令任务上表现良好;但就总体性能而言,OpenVLA在两个环境上的平均成功率最高。
\begin{table}[h!]
\centering
\caption{\textbf{数据高效适配实验详细结果。}此处完整分解\cref{fig:finetune_results}概述的结果。报告在新机器人任务上从头训练的Diffusion Policy,以及使用相同数据微调的通用策略性能。每种策略均在分布内与分布外(OOD)泛化条件下测试;Franka-Tabletop任务见\cref{fig:app:franka_tabletop_tasks},Franka-DROID任务见\cref{fig:app:droid_wipe_task}。没有一种策略在所有任务上都最佳:Diffusion Policy在单指令任务上成功率较高,\name{}和Octo在多样的多指令任务上表现良好;但就总体性能而言,\name{}在两个环境上的平均成功率最高。}
\label{app:tab:detailed_finetune_results}
\resizebox{\textwidth}{!}{\begin{tabular}{llcccccc}
\toprule
&& 试验次数 & Diffusion Policy & \makecell{Diffusion Policy\\(匹配)} & Octo & \makecell{\name{}\\(从头训练)} & \makecell{\name{}\\(本文)} \\
\midrule
Franka-Tabletop (5Hz) & ``Put Carrot in Bowl'' (in-distribution) & 10 & \textbf{90.0\%} & 80.0\% & 40.0\% & 70.0\% & 70.0\% \\
& ``Put Carrot in Bowl'' (OOD) & 5 & 20.0\% & 0.0\% & 20.0\% & 0.0\% & \textbf{40.0\%} \\
& ``Pour Corn into Pot'' (in-distribution) & 10 & \textbf{100.0\%} & 90.0\% & 0.0\% & 10.0\% & 50.0\% \\
& ``Pour Corn into Pot'' (OOD) & 5 & \textbf{80.0\%} & 60.0\% & 0.0\% & 20.0\% & 60.0\% \\
& ``Flip Pot Upright'' (in-distribution) & 10 & \textbf{100.0\%} & 85.0\% & 40.0\% & 85.0\% & \textbf{100.0\%} \\
& ``Flip Pot Upright'' (OOD) & 5 & 50.0\% & 20.0\% & 0.0\% & 40.0\% & \textbf{80.0\%} \\
& ``Move <object> onto Plate'' (in-distribution) & 12 & 25.0\% & 25.0\% & 41.7\% & 8.3\% & \textbf{75.0\%} \\
& ``Move <object> onto Plate'' (OOD) & 6 & 8.3\% & 33.3\% & 8.3\% & 33.3\% & \textbf{58.3\%} \\
& ``Knock <object> Over'' (in-distribution) & 12 & 33.3\% & 25.0\% & \textbf{83.3\%} & 75.0\% & 75.0\% \\
& ``Knock <object> Over'' (OOD) & 6 & 16.7\% & 16.7\% & 33.3\% & 58.3\% & \textbf{83.3\%} \\
& ``Cover <object> with Towel'' (in-distribution) & 12 & 16.7\% & 20.8\% & \textbf{91.7\%} & 41.7\% & 50.0\% \\
& ``Cover <object> with Towel'' (OOD) & 6 & 16.7\% & 33.3\% & \textbf{91.7\%} & 50.0\% & 50.0\% \\
\midrule
& 平均值 & & \cellcolor{lightlightgray} 48.5$\pm$4.9\% & \cellcolor{lightlightgray} 43.4$\pm$4.7\% & \cellcolor{lightlightgray} 43.4$\pm$4.4\% & \cellcolor{lightlightgray} 43.4$\pm$4.6\% & \cellcolor{lightlightgray} \textbf{67.2$\pm$4.0\%} \\
\midrule
Franka-DROID (15Hz) & ``Wipe Table'' (in-distribution) & 18 & 50.0\% & 27.8\% & 52.8\% & 25.0\% & 55.6\% \\
& ``Wipe Table'' + Distractors (OOD) & 12 & 12.5\% & 25.0\% & 16.7\% & 16.7\% & 62.5\% \\
\midrule
& 平均值 & & \cellcolor{lightlightgray} 35.0$\pm$8.0\% & \cellcolor{lightlightgray} 26.7$\pm$7.5\% & \cellcolor{lightlightgray} 38.3$\pm$8.5\% & \cellcolor{lightlightgray} 21.7$\pm$6.6\% & \cellcolor{lightlightgray} \textbf{58.3$\pm$7.2\%} \\
\bottomrule
\end{tabular}}
\end{table}
此外,[app:tab:detailed_peft_results]给出[tab:partial_finetune_results]所概述参数高效微调实验结果的详细版本。实验选取两项有代表性的Franka-Tabletop任务,并同时设置分布内和OOD变体:一项范围较窄的单指令任务(“Put Carrot in Bowl”)和一项多样的多指令任务(“Move
表:参数高效微调实验详细结果。此处给出[tab:partial_finetune_results]所概述的详细任务性能。
\begin{table}[h]
\centering
\caption{\textbf{参数高效微调实验详细结果。}此处给出\cref{tab:partial_finetune_results}所概述的详细任务性能。}
\label{app:tab:detailed_peft_results}
\resizebox{\textwidth}{!}{\begin{tabular}{llcc|ccccc}
\toprule
&& 试验次数 & \makecell{全量微调} & 仅最后一层 & \makecell{冻结视觉编码器} & \makecell{夹心式} & LoRA, r=32 & LoRA, r=64 \\
\midrule
Franka-Tabletop (5Hz) & ``Put Carrot in Bowl'' (in-distribution) & 10 & 90.0 & 40.0 & 40.0 & 90.0 & 60.0 & 90.0 \\
& ``Put Carrot in Bowl'' (OOD) & 5 & 40.0 & 0.0 & 40.0 & 0.0 & 60.0 & 40.0 \\
& ``Move <object> onto Plate'' (in-distribution) & 12 & 79.2 & 33.3 & 50.0 & 75.0 & 75.0 & 62.5 \\
& ``Move <object> onto Plate'' (OOD) & 6 & 41.7 & 33.3 & 58.3 & 41.7 & 75.0 & 66.7 \\
\midrule
& 平均值 & & \cellcolor{lightlightgray}\textbf{69.7$\pm$7.2\%} & \cellcolor{lightlightgray} 30.3$\pm$6.1\% & \cellcolor{lightlightgray} 47.0$\pm$6.9\% & \cellcolor{lightlightgray}62.1$\pm$7.9\% & \cellcolor{lightlightgray} \textbf{68.2$\pm$7.5\%} & \cellcolor{lightlightgray} \textbf{68.2$\pm$7.8\%} \\
\bottomrule
\end{tabular}}
\end{table}
BridgeData V2评估中的RT-2-X与OpenVLA比较
本节补充[sec:zero_shot_exp]中BridgeData V2评估里RT-2-X与OpenVLA比较的细节。如前所述,OpenVLA在比RT-2-X更大的OpenX数据子集上预训练,并使用融合的SigLIP-DinoV2视觉骨干网络而非单一视觉编码器。除这些因素外,OpenVLA在BridgeData V2评估中显著优于RT-2-X(见[fig:bridge_results]),也源于对Bridge数据集更谨慎的预处理。
开发OpenVLA模型时,我们发现原始BridgeData V2数据集包含许多全零(无操作)动作转移。例如,每条示范的第一个时间步都将全零动作记录为真实动作。因此,若不进行数据预处理就直接在原始数据集上训练表达能力很强的VLA模型,策略会频繁预测全零动作并在评估时停滞。训练OpenVLA时只需滤除每条示范的第一个转移,即可在多数情况下缓解停滞行为。
RT-2-X训练时未采用这种数据预处理,因此若不修改模型查询流程便直接部署,常会出现上述停滞行为,严重降低试验轨迹性能。RT-2-X是专有模型,无法用预处理后的BridgeData V2数据集重新训练;为缓解该问题,我们直接查询模型的第二可能动作,因为最可能动作往往全为零,而第二可能动作通常不是。RT-2-X开发者在Open X-Embodiment实验[open_x_embodiment_rt_x_2023]所报告的BridgeData V2评估中也采用了相同的权宜方案。该方案显著增强了RT-2-X在BridgeData V2评估中的性能,但我们认为其仍不如在预处理数据集上重新训练模型。
我们还尝试动态查询RT-2-X:先采样最可能动作;若该动作全为零,再采样第二可能动作。然而实验发现,动态查询的性能不如始终直接查询第二可能动作。原因可能是动态查询改变了机器人动力学:在轨迹中途暂停并重新查询模型时,查询流程不可忽略的延迟会轻微打断机器人运动,进而造成细微的性能下降。因此,与Open X-Embodiment项目 [open_x_embodiment_rt_x_2023]一致,本文报告始终查询第二可能动作时的RT-2-X性能。
其他实验与消融研究
本节进行多项补充实验,分析OpenVLA模型架构与训练方案各组成部分的作用,并为前文观点提供定量证据,旨在回答以下问题: - OpenX训练有多重要,它如何影响OpenVLA性能([sec:app:openx_pretraining_ablation])? - 与仅使用SigLIP视觉编码器相比,融合的SigLIP-DinoV2视觉编码器如何影响OpenVLA性能([sec:app:dual_vs_single_vision_encoder])? - 对OpenVLA而言,微调视觉编码器还是将其冻结更好([sec:app:finetuned_vs_frozen_vision_encoder])? - 将策略性能与模型推理速度解耦后,[sec:param_efficient_finetuning]中的量化推理结果如何变化([sec:app:additional_quantized_inference_experiments])?
下文依次讨论回答上述问题的实验配置与结果。
OpenX训练数据消融实验
如[sec:data_mix]所述,OpenVLA在Open X-Embodiment数据集 [open_x_embodiment_rt_x_2023](OpenX)的大规模机器人本体、场景和任务数据上训练。本节消融OpenX混合数据,仅在单个机器人数据集上训练VLA策略,以评估OpenX训练对策略性能的影响。[sec:finetuning_exp](见OpenVLA (Scratch))已显示在微调条件下移除OpenX训练的负面影响;本节在另一种机器人本体上开展补充实验,以提供更多证据。
实验配置与任务。比较原始OpenVLA模型与OpenVLA-Bridge。后者采用与OpenVLA相同的预训练VLM(Prismatic VLM [karamcheti2024prismatic]),但只在BridgeData V2 [walke2023bridgedata]上微调,而非使用[sec:app:data_mix]中的完整OpenX训练混合数据。在[sec:app:bridge_evaluation_tasks]所述BridgeData V2 WidowX机器人评估套件中,选取8项代表性任务评估OpenVLA与OpenVLA-Bridge,任务见[app:tab:bridge_ablation_results]。
结果。OpenX训练混合数据消融结果见[app:tab:bridge_ablation_results]。与OpenVLA相比,OpenVLA-Bridge性能大幅下降,绝对成功率降低30个百分点,表明OpenX预训练对最终策略性能十分重要。语言落地性能虽未受影响,但所有泛化类别的性能都下降了。这说明OpenX训练混合数据中场景、物体和任务的高度多样性,是释放OpenVLA模型更强泛化能力的关键。
表:BridgeData V2 WidowX消融实验结果。在8项代表性任务子集上评估不同方法,以衡量OpenVLA模型架构与训练方案各组成部分的重要性。OpenVLA-Bridge是不进行OpenX训练的OpenVLA版本,仅在BridgeData V2上训练;OpenVLA-Bridge-SigLIP进一步移除DinoV2编码器以消融融合视觉骨干网络,其视觉骨干仅包含SigLIP编码器。OpenX训练和融合视觉编码器都能提升策略性能,但前者的作用远大于后者。
\begin{table}[h]
\centering
\caption{\textbf{BridgeData~V2 WidowX消融实验结果。}在8项代表性任务子集上评估不同方法,以衡量\name{}模型架构与训练方案各组成部分的重要性。\name{}-Bridge是不进行OpenX训练的\name{}版本,仅在BridgeData V2上训练;\name{}-Bridge-SigLIP进一步移除DinoV2编码器以消融融合视觉骨干网络,其视觉骨干仅包含SigLIP编码器。OpenX训练和融合视觉编码器都能提升策略性能,但前者的作用远大于后者。}
\label{app:tab:bridge_ablation_results}
\resizebox{\textwidth}{!}{%
\begin{tabular}{llcccc}
\toprule
类别 & 任务 & 试验次数 & \makecell{\name{}\\成功次数} & \makecell{\name{}-Bridge\\成功次数} & \makecell{\name{}-Bridge-SigLIP\\成功次数} \\
\midrule
视觉泛化 & Put Eggplant into Pot (Easy Version) & 10 & 10 & 8 & 8 \\
视觉泛化 & Put Eggplant into Pot & 10 & 10 & 2 & 3 \\
视觉泛化 & Put Cup from Counter into Sink & 10 & 7 & 4 & 2 \\
运动泛化 & Lift Eggplant & 10 & 7.5 & 5.5 & 6.5 \\
物理泛化 & Put Carrot on Plate & 10 & 8 & 4 & 1 \\
物理泛化 & Lift AAA Battery & 10 & 7 & 2 & 2 \\
语义泛化 & Take Purple Grapes out of Pot & 10 & 4 & 3 & 3 \\
语言落地 & Put \{Eggplant, Red Bottle\} into Pot & 10 & 7.5 & 8 & 7 \\
\midrule
&& 平均成功率 & \cellcolor{lightlightgray}76.3 $\pm$ 4.8\% & \cellcolor{lightlightgray}45.6 $\pm$ 5.6\% & \cellcolor{lightlightgray}40.6 $\pm$ 5.5\% \\
\bottomrule
\end{tabular}}
\end{table}
双视觉编码器与单视觉编码器实验
OpenVLA模型架构采用融合视觉骨干网络,结合SigLIP [zhai2023siglip]与DinoV2 [oquab2023dinov2]编码器。本节消融DinoV2组件,以评估双视觉编码器的重要性。
实验配置与任务。构建OpenVLA-Bridge-SigLIP模型:该OpenVLA变体仅在BridgeData V2上训练,视觉骨干只含SigLIP编码器。将其与上一节([sec:app:openx_pretraining_ablation])的OpenVLA-Bridge模型比较;后者与原始OpenVLA架构相同,但也只在Bridge机器人数据上训练。因此,OpenVLA-Bridge-SigLIP与OpenVLA-Bridge的唯一区别是前者从视觉骨干中移除了DinoV2编码器。两种模型在上一节所述同一组8项Bridge任务上评估。
结果。双视觉编码器消融结果见[app:tab:bridge_ablation_results]。OpenVLA-Bridge-SigLIP相较OpenVLA-Bridge性能下降,说明在视觉骨干中加入DinoV2编码器可提升策略性能。不过,此处5个百分点的性能降幅远小于移除OpenX训练时的30个百分点。DinoV2所表征的低层空间特征似乎仅在部分情况下有助于泛化。
微调视觉编码器与冻结视觉编码器实验
如[sec:train_details]所述,先前VLM研究发现,冻结视觉编码器比微调其参数的性能更高[karamcheti2024prismatic]。然而,训练OpenVLA时,我们微调了模型全部7B参数,包括SigLIP-DinoV2视觉骨干,因为开发早期发现微调视觉编码器能产生性能更高的VLA;该结论在多种预训练VLM与模型架构上均成立。具体结果如下。
实验配置与任务。本节报告两种VLA策略的性能,它们分别由Prismatic VLMs[karamcheti2024prismatic]仓库中的两个不同预训练模型在BridgeData V2上微调而得。两个预训练模型名为SigLIP ViT-SO 224px和LLaVa v1.5 7B (Reproduction);架构与训练混合数据细节见[karamcheti2024prismatic]。两种策略在[app:tab:frozen_vision_encoder_results]所示的多项Bridge任务上评估。此处评估配置不同于前述Bridge评估,故结果不能与其他类似实验直接比较。
结果。微调与冻结视觉编码器的实验结果见[app:tab:frozen_vision_encoder_results]。对于两种受测VLA,微调视觉编码器都在多项任务上显著提高了成功率。从定性表现看,部署冻结视觉编码器的策略有时会导致明显次优且不稳定的机器人行为。因此,开发早期便决定不再进一步实验冻结视觉编码器。
表:微调与冻结视觉编码器的实验结果。在两种VLA策略中比较微调(“Fine-Tuned”)和冻结视觉编码器(“Frozen Vision”)的性能;两种策略分别基于Prismatic VLMs[karamcheti2024prismatic]仓库中的不同预训练VLM构建。表中BridgeData V2 WidowX任务与本文其他Bridge实验使用同一水槽环境,但初始环境配置不同,因为这些评估在项目早期进行。结果表明,微调视觉编码器对获得良好策略性能至关重要。部分冻结视觉编码器的评估因性能很差(接近零)且机器人行为不稳定而中止。在同时测试冻结和微调方法的评估中,微调视觉编码器的平均成功率为80.0%,冻结时为46.7%。
\begin{table}[h]
\centering
\caption{\textbf{微调与冻结视觉编码器的实验结果。}在两种VLA策略中比较微调(“Fine-Tuned”)和冻结视觉编码器(“Frozen Vision”)的性能;两种策略分别基于Prismatic VLMs\citep{karamcheti2024prismatic}仓库中的不同预训练VLM构建。表中BridgeData V2 WidowX任务与本文其他Bridge实验使用同一水槽环境,但初始环境配置不同,因为这些评估在项目早期进行。结果表明,微调视觉编码器对获得良好策略性能至关重要。部分冻结视觉编码器的评估因性能很差(接近零)且机器人行为不稳定而中止。在同时测试冻结和微调方法的评估中,微调视觉编码器的平均成功率为80.0\%,冻结时为46.7\%。}
\label{app:tab:frozen_vision_encoder_results}
\resizebox{\textwidth}{!}{%
\begin{tabular}{ll|cc|cc}
\toprule
&& \multicolumn{2}{c|}{SigLIP ViT-SO 224px} & \multicolumn{2}{c}{LLaVa v1.5 7B (Reproduction)} \\
\cline{3-4} \cline{5-6}
任务 & 试验次数 & \makecell{冻结视觉编码器\\成功次数} & \makecell{微调\\成功次数} & \makecell{冻结视觉编码器\\成功次数} & \makecell{微调\\成功次数} \\
\midrule
Put Eggplant into Pot & 10 & 7 & 10 & 5 & 9 \\
Put Corn on Plate & 10 & 10 & 9 & 0 & 9 \\
\midrule
& 平均成功率 & \cellcolor{lightlightgray}85 & \cellcolor{lightlightgray}\textbf{95} & \cellcolor{lightlightgray}25 & \cellcolor{lightlightgray}\textbf{90} \\
\midrule
Put \{ Eggplant, Red Bottle \} into Pot & 4 & 2 & 4 & -- & 3 \\
Put \{ Blue Cup, Pink Cup \} on Plate & 4 & 0 & 0 & -- & 0 \\
Lift \{ Cheese, Red Chili Pepper \} & 4 & 0 & 3 & -- & 2 \\
Put \{ Strawberry, Lime \} into Pot & 4 & 1 & 0 & -- & 3 \\
Move \{ Sushi, Grapes \} & 4 & 3 & 4 & -- & 3 \\
\midrule
& 平均成功率 & \cellcolor{lightlightgray}30 & \cellcolor{lightlightgray}\textbf{55} & \cellcolor{lightlightgray}-- & \cellcolor{lightlightgray}55 \\
\bottomrule
\end{tabular}}
\end{table}
其他量化推理实验:解耦策略性能与模型推理速度
在[sec:param_efficient_finetuning]中,我们以不同推理精度评估OpenVLA:半精度(bfloat16)、8位量化和4位量化。8位量化在BridgeData V2上的性能低于另外两种方法;我们推测性能下降源于8位量化操作导致模型推理速度较低。本节通过实验检验该推测。
具体而言,再次以三种精度评估OpenVLA,但改用阻塞式控制。每个动作在机器人上完全执行后,策略才预测下一动作并由控制器执行。该方案控制不同延迟方法的系统动力学,从而可独立于预测速度检验策略动作预测质量。实际效果是迫使吞吐量较高的bfloat16和4位量化以更低速度运行,从而匹配以8位精度部署OpenVLA时的动力学。因此,预计阻塞式控制下8位精度OpenVLA的性能将与bfloat16和4位精度相当。
实验配置与任务。在[sec:app:openx_pretraining_ablation]和[sec:app:dual_vs_single_vision_encoder]使用的同一组8项BridgeData V2任务上,报告OpenVLA采用阻塞式控制与量化推理时的性能。
结果。采用阻塞式控制的量化推理实验结果见[app:tab:blocking_control_results]。[tab:quantized_results]中8位量化因推理速度较低而产生最差的试验轨迹性能;此处使用阻塞式控制消除推理速度差异对任务性能的影响后,8位量化与bfloat16精度和4位量化表现相当。这证实了先前非阻塞式控制实验中关于推理速度影响8位量化性能的推测。与[sec:param_efficient_finetuning]一致,最低的4位精度也未造成明显性能下降。
表:采用阻塞式控制的量化推理实验结果。报告OpenVLA在多项BridgeData V2 WidowX任务上采用bfloat16精度(默认方法)、8位量化(int8)和4位量化(int4)推理时的成功率与标准误差。所有平均成功率的误差条均重叠,说明各方法表现相当。
\begin{table}[h]
\centering
\caption{\textbf{采用阻塞式控制的量化推理实验结果。}报告\name{}在多项BridgeData V2 WidowX任务上采用bfloat16精度(默认方法)、8位量化(int8)和4位量化(int4)推理时的成功率与标准误差。所有平均成功率的误差条均重叠,说明各方法表现相当。}
\label{app:tab:blocking_control_results}
\resizebox{\textwidth}{!}{%
\begin{tabular}{llcccc}
\toprule
类别 & 任务 & 试验次数 & \makecell{bfloat16\\成功次数} & \makecell{int8\\成功次数} & \makecell{int4\\成功次数} \\
\midrule
视觉泛化 & Put Eggplant into Pot (Easy Version) & 10 & 10 & 10 & 10 \\
视觉泛化 & Put Eggplant into Pot & 10 & 9 & 10 & 10 \\
视觉泛化 & Put Cup from Counter into Sink & 10 & 5 & 5 & 3 \\
运动泛化 & Lift Eggplant & 10 & 8 & 7 & 7.5 \\
物理泛化 & Put Carrot on Plate & 10 & 10 & 10 & 10 \\
物理泛化 & Lift AAA Battery & 10 & 3 & 6 & 4 \\
语义泛化 & Take Purple Grapes out of Pot & 10 & 2 & 2 & 2 \\
语言落地 & Put \{Eggplant, Red Bottle\} into Pot & 10 & 9 & 9.5 & 8.5 \\
\midrule
&& 平均成功率 & \cellcolor{lightlightgray}70.0 $\pm$ 5.1\% & \cellcolor{lightlightgray}74.4 $\pm$ 4.9\% & \cellcolor{lightlightgray}68.8 $\pm$ 5.2\% \\
\bottomrule
\end{tabular}}
\end{table}
LIBERO仿真实验
[sec:finetuning_exp]和[sec:param_efficient_finetuning]主要讨论将OpenVLA适配到新的现实世界机器人配置与任务。本节利用LIBERO基准[liu2024libero],探索将OpenVLA适配到仿真机器人配置与任务。仿真实验具有两项主要优势: - 展示通用性:尽管OpenVLA仅在现实世界机器人数据上预训练,仍能有效适配仿真域,克服现实与仿真环境及动力学之间的潜在差异。 - 提高可访问性与可复现性:将OpenVLA集成到公开仿真平台,使其他研究人员更易使用该模型,尤其是无法获得机器人硬件的研究人员;仿真实验也比现实实验更容易复现。
实验配置见[sec:app:libero_sim_setup],结果见[sec:app:libero_sim_results]。复现实验所需材料随OpenVLA代码库一并发布。
LIBERO仿真实验配置
仿真配置与任务。LIBERO基准[liu2024libero]包含四个任务套件,旨在研究机器人操控中的终身学习;原论文因此考察了面向多种任务的前向与后向迁移。本文实验仅关注在目标任务套件上的监督微调,衡量各策略通过行为克隆学习成功任务示范后的性能。
实验使用以下四个任务套件,每个套件包含10项任务,每项任务含50条人类遥操作示范: - LIBERO-Spatial使用相同物体集合但采用不同布局,检验模型对空间关系的理解。 - LIBERO-Object使用相同场景布局但采用不同物体,检验模型对物体类型的理解。 - LIBERO-Goal使用相同物体与布局但采用不同任务目标,检验模型对不同任务导向行为的掌握程度。 - LIBERO-Long(亦称LIBERO-10)包含具有多样物体、布局与任务的长时程任务。
对上述各训练数据集进行以下修改: - 为适应需要较高分辨率图像(如\(256 \times 256\)px或\(224 \times 224\)px)的方法,以\(256 \times 256\)px的更高分辨率重新生成所有示范。基准原始数据集由\(128 \times 128\)px图像组成,简单上采样至\(256 \times 256\)px会导致图像质量较差。因此从高分辨率图像开始,并按需下采样,以满足不同分辨率要求时都能保持较高图像质量。生成高分辨率图像时,使用所提供人类采集示范中存储的动作逐步运行仿真环境,并保存仿真器渲染图像。 - 从数据集中滤除所有“无操作”动作,即平移与旋转分量幅值接近零且不改变机器人夹爪状态的动作。该简单数据清洗步骤对OpenVLA等表达能力很强的单步策略至关重要,否则策略会学习模仿这些无操作动作,并在评估时于某些状态无限停滞。 - 训练和测试时将所有第三人称图像旋转180度,因为LIBERO环境在本文硬件上返回的图像上下颠倒。 - 由于策略通过模仿学习训练,而模仿学习假设示范成功,因此在对应仿真环境中重放所有示范,并根据环境成功判据滤除未完成任务的示范。最终从500条LIBERO-Spatial示范中移除68条,从500条LIBERO-Object示范中移除46条,从500条LIBERO-Goal示范中移除72条,从500条LIBERO-Long示范中移除121条。 - 所有比较方法仅使用固定第三人称相机图像,不使用原始数据集额外提供的腕部相机图像。OpenVLA的视觉输入仅包含第三人称相机图像,这样设置可确保公平比较。
比较方法。比较对象包括从头训练的Diffusion Policy(注:采用DROID数据集论文 [khazatsky2024droid]所述Diffusion Policy实现,其动作生成以任务标签的DistilBERT [sanh2019distilbert]语言嵌入为条件。) [chi2023diffusionpolicy]、在目标数据集上微调的Octo [octo_2023],以及按[sec:param_efficient_finetuning]所述通过LoRA(\(r=32\))在目标数据集上微调的OpenVLA。每种策略分别在各任务套件上独立训练,而非将四个套件合并训练单一策略。所有策略使用同一组示范训练,因此都受益于上述数据清洗步骤。
评估细节。为降低实验结果方差,所有方法在每个任务套件上评估500次试验,报告性能为三个随机种子的平均成功率,即每项统计量共1500次试验。尽管按前述方式修改了训练数据集,但测试环境保持不变,仍使用原始LIBERO基准提供的相同初始环境配置。
LIBERO仿真实验结果
LIBERO实验结果见[app:tab:libero_sim_results_table]。OpenVLA可有效适配LIBERO仿真环境中的任务,在受测方法中取得最高平均成功率和最佳平均排名。不过,此处OpenVLA与其他方法的总体差距小于[sec:finetuning_exp]中的现实世界微调实验。原因可能是OpenVLA仅使用现实世界机器人数据预训练,未使用仿真数据;由于仿真与现实环境及动力学之间存在域差距,在仿真机器人任务上微调的效果可能不如现实任务。Octo的结果也支持这一观点:它同样在大量现实世界机器人数据上预训练,相较从头训练的Diffusion Policy这一简单而强力的基线,总体性能也只获得小幅提升。若将仿真数据加入预训练混合数据,预计预训练后微调的方法会取得更大性能增益。
表:LIBERO仿真基准结果。报告各方法在LIBERO四个任务套件上的成功率(SR)与标准误差;每个结果取三个随机种子、每个种子500次试验的平均值。另给出各方法在每个任务套件内的排名,排名1表示套件内最强方法,排名3表示最弱方法。平均排名表明哪种方法最适合作为多种任务的默认选择,因此值得关注;它比未按各任务套件难度归一化的平均成功率更具信息量。总体而言,微调后的OpenVLA取得最高平均成功率与最佳平均排名,其次是微调后的Octo,最后是从头训练的Diffusion Policy。
\begin{table}[h]
\centering
\caption{\textbf{LIBERO仿真基准结果。}报告各方法在LIBERO四个任务套件上的成功率(SR)与标准误差;每个结果取三个随机种子、每个种子500次试验的平均值。另给出各方法在每个任务套件内的排名,排名1表示套件内最强方法,排名3表示最弱方法。平均排名表明哪种方法最适合作为多种任务的默认选择,因此值得关注;它比未按各任务套件难度归一化的平均成功率更具信息量。总体而言,微调后的\name{}取得最高平均成功率与最佳平均排名,其次是微调后的Octo,最后是从头训练的Diffusion Policy。}
\label{app:tab:libero_sim_results_table}
\resizebox{\textwidth}{!}{\begin{tabular}{l|cc|cc|cc|cc|cc}
\toprule
& \multicolumn{2}{c|}{LIBERO-Spatial} & \multicolumn{2}{c|}{LIBERO-Object} & \multicolumn{2}{c|}{LIBERO-Goal} & \multicolumn{2}{c|}{LIBERO-Long} & \multicolumn{2}{c}{平均值} \\
\cline{2-3} \cline{4-5} \cline{6-7} \cline{8-9} \cline{10-11}
& 成功率($\uparrow$) & 排名($\downarrow$)& 成功率($\uparrow$) & 排名($\downarrow$)& 成功率($\uparrow$) & 排名($\downarrow$)& 成功率($\uparrow$) & 排名($\downarrow$)& 成功率($\uparrow$) & 排名($\downarrow$)\\
\midrule
从头训练的Diffusion Policy & 78.3 $\pm$ 1.1\% & 3 & \textbf{92.5 $\pm$ 0.7\%} & 1 & 68.3 $\pm$ 1.2\% & 3 & 50.5 $\pm$ 1.3\% & 3 & 72.4 $\pm$ 0.7\% & 2.5 \\
微调后的Octo & 78.9 $\pm$ 1.0\% & 2 & 85.7 $\pm$ 0.9\% & 3 & \textbf{84.6 $\pm$ 0.9\%} & 1 & 51.1 $\pm$ 1.3\% & 2 & 75.1 $\pm$ 0.6\% & 2 \\
微调后的OpenVLA(本文) & \textbf{84.7 $\pm$ 0.9\%} & 1 & 88.4 $\pm$ 0.8\% & 2 & 79.2 $\pm$ 1.0\% & 2 & \textbf{53.7 $\pm$ 1.3\%} & 1 & \textbf{76.5 $\pm$ 0.6\%} & \textbf{1.5} \\
\bottomrule
\end{tabular}}
\end{table}
参考文献
\begin{thebibliography}{117}
\providecommand{\natexlab}[1]{#1}
\providecommand{\url}[1]{\texttt{#1}}
\expandafter\ifx\csname urlstyle\endcsname\relax
\providecommand{\doi}[1]{doi: #1}\else
\providecommand{\doi}{doi: \begingroup \urlstyle{rm}\Url}\fi
\bibitem[{Open X-Embodiment Collaboration} et~al.(2023){Open X-Embodiment Collaboration}, Padalkar, Pooley, Jain, Bewley, Herzog, Irpan, Khazatsky, Rai, Singh, Brohan, Raffin, Wahid, Burgess-Limerick, Kim, Schölkopf, Ichter, Lu, Xu, Finn, Xu, Chi, Huang, Chan, Pan, Fu, Devin, Driess, Pathak, Shah, Büchler, Kalashnikov, Sadigh, Johns, Ceola, Xia, Stulp, Zhou, Sukhatme, Salhotra, Yan, Schiavi, Su, Fang, Shi, Amor, Christensen, Furuta, Walke, Fang, Mordatch, Radosavovic, Leal, Liang, Kim, Schneider, Hsu, Bohg, Bingham, Wu, Wu, Luo, Gu, Tan, Oh, Malik, Tompson, Yang, Lim, Silvério, Han, Rao, Pertsch, Hausman, Go, Gopalakrishnan, Goldberg, Byrne, Oslund, Kawaharazuka, Zhang, Majd, Rana, Srinivasan, Chen, Pinto, Tan, Ott, Lee, Tomizuka, Du, Ahn, Zhang, Ding, Srirama, Sharma, Kim, Kanazawa, Hansen, Heess, Joshi, Suenderhauf, Palo, Shafiullah, Mees, Kroemer, Sanketi, Wohlhart, Xu, Sermanet, Sundaresan, Vuong, Rafailov, Tian, Doshi, Martín-Martín, Mendonca, Shah, Hoque, Julian, Bustamante, Kirmani, Levine, Moore,
Bahl, Dass, Song, Xu, Haldar, Adebola, Guist, Nasiriany, Schaal, Welker, Tian, Dasari, Belkhale, Osa, Harada, Matsushima, Xiao, Yu, Ding, Davchev, Zhao, Armstrong, Darrell, Jain, Vanhoucke, Zhan, Zhou, Burgard, Chen, Wang, Zhu, Li, Lu, Chebotar, Zhou, Zhu, Xu, Wang, Bisk, Cho, Lee, Cui, hua Wu, Tang, Zhu, Li, Iwasawa, Matsuo, Xu, and Cui]{open_x_embodiment_rt_x_2023}
{Open X-Embodiment Collaboration}, A.~Padalkar, A.~Pooley, A.~Jain, A.~Bewley, A.~Herzog, A.~Irpan, A.~Khazatsky, A.~Rai, A.~Singh, A.~Brohan, A.~Raffin, A.~Wahid, B.~Burgess-Limerick, B.~Kim, B.~Schölkopf, B.~Ichter, C.~Lu, C.~Xu, C.~Finn, C.~Xu, C.~Chi, C.~Huang, C.~Chan, C.~Pan, C.~Fu, C.~Devin, D.~Driess, D.~Pathak, D.~Shah, D.~Büchler, D.~Kalashnikov, D.~Sadigh, E.~Johns, F.~Ceola, F.~Xia, F.~Stulp, G.~Zhou, G.~S. Sukhatme, G.~Salhotra, G.~Yan, G.~Schiavi, H.~Su, H.-S. Fang, H.~Shi, H.~B. Amor, H.~I. Christensen, H.~Furuta, H.~Walke, H.~Fang, I.~Mordatch, I.~Radosavovic, I.~Leal, J.~Liang, J.~Kim, J.~Schneider, J.~Hsu, J.~Bohg, J.~Bingham, J.~Wu, J.~Wu, J.~Luo, J.~Gu, J.~Tan, J.~Oh, J.~Malik, J.~Tompson, J.~Yang, J.~J. Lim, J.~Silvério, J.~Han, K.~Rao, K.~Pertsch, K.~Hausman, K.~Go, K.~Gopalakrishnan, K.~Goldberg, K.~Byrne, K.~Oslund, K.~Kawaharazuka, K.~Zhang, K.~Majd, K.~Rana, K.~Srinivasan, L.~Y. Chen, L.~Pinto, L.~Tan, L.~Ott, L.~Lee, M.~Tomizuka, M.~Du, M.~Ahn, M.~Zhang, M.~Ding, M.~K. Srirama,
M.~Sharma, M.~J. Kim, N.~Kanazawa, N.~Hansen, N.~Heess, N.~J. Joshi, N.~Suenderhauf, N.~D. Palo, N.~M.~M. Shafiullah, O.~Mees, O.~Kroemer, P.~R. Sanketi, P.~Wohlhart, P.~Xu, P.~Sermanet, P.~Sundaresan, Q.~Vuong, R.~Rafailov, R.~Tian, R.~Doshi, R.~Martín-Martín, R.~Mendonca, R.~Shah, R.~Hoque, R.~Julian, S.~Bustamante, S.~Kirmani, S.~Levine, S.~Moore, S.~Bahl, S.~Dass, S.~Song, S.~Xu, S.~Haldar, S.~Adebola, S.~Guist, S.~Nasiriany, S.~Schaal, S.~Welker, S.~Tian, S.~Dasari, S.~Belkhale, T.~Osa, T.~Harada, T.~Matsushima, T.~Xiao, T.~Yu, T.~Ding, T.~Davchev, T.~Z. Zhao, T.~Armstrong, T.~Darrell, V.~Jain, V.~Vanhoucke, W.~Zhan, W.~Zhou, W.~Burgard, X.~Chen, X.~Wang, X.~Zhu, X.~Li, Y.~Lu, Y.~Chebotar, Y.~Zhou, Y.~Zhu, Y.~Xu, Y.~Wang, Y.~Bisk, Y.~Cho, Y.~Lee, Y.~Cui, Y.~hua Wu, Y.~Tang, Y.~Zhu, Y.~Li, Y.~Iwasawa, Y.~Matsuo, Z.~Xu, and Z.~J. Cui.
\newblock Open {X-E}mbodiment: Robotic learning datasets and {RT-X} models.
\newblock \url{https://arxiv.org/abs/2310.08864}, 2023.
\bibitem[Brohan et~al.(2022)Brohan, Brown, Carbajal, Chebotar, Dabis, Finn, Gopalakrishnan, Hausman, Herzog, Hsu, Ibarz, Ichter, Irpan, Jackson, Jesmonth, Joshi, Julian, Kalashnikov, Kuang, Leal, Lee, Levine, Lu, Malla, Manjunath, Mordatch, Nachum, Parada, Peralta, Perez, Pertsch, Quiambao, Rao, Ryoo, Salazar, Sanketi, Sayed, Singh, Sontakke, Stone, Tan, Tran, Vanhoucke, Vega, Vuong, Xia, Xiao, Xu, Xu, Yu, and Zitkovich]{rt12022arxiv}
A.~Brohan, N.~Brown, J.~Carbajal, Y.~Chebotar, J.~Dabis, C.~Finn, K.~Gopalakrishnan, K.~Hausman, A.~Herzog, J.~Hsu, J.~Ibarz, B.~Ichter, A.~Irpan, T.~Jackson, S.~Jesmonth, N.~Joshi, R.~Julian, D.~Kalashnikov, Y.~Kuang, I.~Leal, K.-H. Lee, S.~Levine, Y.~Lu, U.~Malla, D.~Manjunath, I.~Mordatch, O.~Nachum, C.~Parada, J.~Peralta, E.~Perez, K.~Pertsch, J.~Quiambao, K.~Rao, M.~Ryoo, G.~Salazar, P.~Sanketi, K.~Sayed, J.~Singh, S.~Sontakke, A.~Stone, C.~Tan, H.~Tran, V.~Vanhoucke, S.~Vega, Q.~Vuong, F.~Xia, T.~Xiao, P.~Xu, S.~Xu, T.~Yu, and B.~Zitkovich.
\newblock Rt-1: Robotics transformer for real-world control at scale.
\newblock In \emph{arXiv preprint arXiv:2212.06817}, 2022.
\bibitem[Chi et~al.(2023)Chi, Feng, Du, Xu, Cousineau, Burchfiel, and Song]{chi2023diffusionpolicy}
C.~Chi, S.~Feng, Y.~Du, Z.~Xu, E.~Cousineau, B.~Burchfiel, and S.~Song.
\newblock Diffusion policy: Visuomotor policy learning via action diffusion.
\newblock In \emph{Proceedings of Robotics: Science and Systems (RSS)}, 2023.
\bibitem[Xie et~al.(2023)Xie, Lee, Xiao, and Finn]{xie2023decomposing}
A.~Xie, L.~Lee, T.~Xiao, and C.~Finn.
\newblock Decomposing the generalization gap in imitation learning for visual robotic manipulation.
\newblock \emph{arXiv preprint arXiv:2307.03659}, 2023.
\bibitem[{Octo Model Team} et~al.(2023){Octo Model Team}, Ghosh, Walke, Pertsch, Black, Mees, Dasari, Hejna, Xu, Luo, Kreiman, Tan, Sadigh, Finn, and Levine]{octo_2023}
{Octo Model Team}, D.~Ghosh, H.~Walke, K.~Pertsch, K.~Black, O.~Mees, S.~Dasari, J.~Hejna, C.~Xu, J.~Luo, T.~Kreiman, Y.~Tan, D.~Sadigh, C.~Finn, and S.~Levine.
\newblock Octo: An open-source generalist robot policy.
\newblock \url{https://octo-models.github.io}, 2023.
\bibitem[Walke et~al.(2023)Walke, Black, Lee, Kim, Du, Zheng, Zhao, Hansen-Estruch, Vuong, He, Myers, Fang, Finn, and Levine]{walke2023bridgedata}
H.~Walke, K.~Black, A.~Lee, M.~J. Kim, M.~Du, C.~Zheng, T.~Zhao, P.~Hansen-Estruch, Q.~Vuong, A.~He, V.~Myers, K.~Fang, C.~Finn, and S.~Levine.
\newblock Bridgedata v2: A dataset for robot learning at scale, 2023.
\bibitem[Brohan et~al.(2023)Brohan, Brown, Carbajal, Chebotar, Chen, Choromanski, Ding, Driess, Dubey, Finn, Florence, Fu, Arenas, Gopalakrishnan, Han, Hausman, Herzog, Hsu, Ichter, Irpan, Joshi, Julian, Kalashnikov, Kuang, Leal, Lee, Lee, Levine, Lu, Michalewski, Mordatch, Pertsch, Rao, Reymann, Ryoo, Salazar, Sanketi, Sermanet, Singh, Singh, Soricut, Tran, Vanhoucke, Vuong, Wahid, Welker, Wohlhart, Wu, Xia, Xiao, Xu, Xu, Yu, and Zitkovich]{rt22023arxiv}
A.~Brohan, N.~Brown, J.~Carbajal, Y.~Chebotar, X.~Chen, K.~Choromanski, T.~Ding, D.~Driess, A.~Dubey, C.~Finn, P.~Florence, C.~Fu, M.~G. Arenas, K.~Gopalakrishnan, K.~Han, K.~Hausman, A.~Herzog, J.~Hsu, B.~Ichter, A.~Irpan, N.~Joshi, R.~Julian, D.~Kalashnikov, Y.~Kuang, I.~Leal, L.~Lee, T.-W.~E. Lee, S.~Levine, Y.~Lu, H.~Michalewski, I.~Mordatch, K.~Pertsch, K.~Rao, K.~Reymann, M.~Ryoo, G.~Salazar, P.~Sanketi, P.~Sermanet, J.~Singh, A.~Singh, R.~Soricut, H.~Tran, V.~Vanhoucke, Q.~Vuong, A.~Wahid, S.~Welker, P.~Wohlhart, J.~Wu, F.~Xia, T.~Xiao, P.~Xu, S.~Xu, T.~Yu, and B.~Zitkovich.
\newblock Rt-2: Vision-language-action models transfer web knowledge to robotic control.
\newblock In \emph{arXiv preprint arXiv:2307.15818}, 2023.
\bibitem[Radford et~al.(2021)Radford, Kim, Hallacy, Ramesh, Goh, Agarwal, Sastry, Askell, Mishkin, Clark, Krueger, and Sutskever]{radford2021clip}
A.~Radford, J.~W. Kim, C.~Hallacy, A.~Ramesh, G.~Goh, S.~Agarwal, G.~Sastry, A.~Askell, P.~Mishkin, J.~Clark, G.~Krueger, and I.~Sutskever.
\newblock Learning transferable visual models from natural language supervision.
\newblock In \emph{International Conference on Machine Learning (ICML)}, volume 139, pages 8748--8763, 2021.
\bibitem[Zhai et~al.(2023)Zhai, Mustafa, Kolesnikov, and Beyer]{zhai2023siglip}
X.~Zhai, B.~Mustafa, A.~Kolesnikov, and L.~Beyer.
\newblock Sigmoid loss for language image pre-training.
\newblock In \emph{International Conference on Computer Vision (ICCV)}, 2023.
\bibitem[Touvron et~al.(2023)Touvron, Martin, Stone, Albert, Almahairi, Babaei, Bashlykov, Batra, Bhargava, Bhosale, et~al.]{touvron2023llama2}
H.~Touvron, L.~Martin, K.~Stone, P.~Albert, A.~Almahairi, Y.~Babaei, N.~Bashlykov, S.~Batra, P.~Bhargava, S.~Bhosale, et~al.
\newblock Llama 2: Open foundation and fine-tuned chat models.
\newblock \emph{arXiv preprint arXiv:2307.09288}, 2023.
\bibitem[Khazatsky et~al.(2024)Khazatsky, Pertsch, Nair, Balakrishna, Dasari, Karamcheti, Nasiriany, Srirama, Chen, Ellis, Fagan, Hejna, Itkina, Lepert, Ma, Miller, Wu, Belkhale, Dass, Ha, Jain, Lee, Lee, Memmel, Park, Radosavovic, Wang, Zhan, Black, Chi, Hatch, Lin, Lu, Mercat, Rehman, Sanketi, Sharma, Simpson, Vuong, Walke, Wulfe, Xiao, Yang, Yavary, Zhao, Agia, Baijal, Castro, Chen, Chen, Chung, Drake, Foster, Gao, Herrera, Heo, Hsu, Hu, Jackson, Le, Li, Lin, Lin, Ma, Maddukuri, Mirchandani, Morton, Nguyen, O'Neill, Scalise, Seale, Son, Tian, Tran, Wang, Wu, Xie, Yang, Yin, Zhang, Bastani, Berseth, Bohg, Goldberg, Gupta, Gupta, Jayaraman, Lim, Malik, Martín-Martín, Ramamoorthy, Sadigh, Song, Wu, Yip, Zhu, Kollar, Levine, and Finn]{khazatsky2024droid}
A.~Khazatsky, K.~Pertsch, S.~Nair, A.~Balakrishna, S.~Dasari, S.~Karamcheti, S.~Nasiriany, M.~K. Srirama, L.~Y. Chen, K.~Ellis, P.~D. Fagan, J.~Hejna, M.~Itkina, M.~Lepert, Y.~J. Ma, P.~T. Miller, J.~Wu, S.~Belkhale, S.~Dass, H.~Ha, A.~Jain, A.~Lee, Y.~Lee, M.~Memmel, S.~Park, I.~Radosavovic, K.~Wang, A.~Zhan, K.~Black, C.~Chi, K.~B. Hatch, S.~Lin, J.~Lu, J.~Mercat, A.~Rehman, P.~R. Sanketi, A.~Sharma, C.~Simpson, Q.~Vuong, H.~R. Walke, B.~Wulfe, T.~Xiao, J.~H. Yang, A.~Yavary, T.~Z. Zhao, C.~Agia, R.~Baijal, M.~G. Castro, D.~Chen, Q.~Chen, T.~Chung, J.~Drake, E.~P. Foster, J.~Gao, D.~A. Herrera, M.~Heo, K.~Hsu, J.~Hu, D.~Jackson, C.~Le, Y.~Li, K.~Lin, R.~Lin, Z.~Ma, A.~Maddukuri, S.~Mirchandani, D.~Morton, T.~Nguyen, A.~O'Neill, R.~Scalise, D.~Seale, V.~Son, S.~Tian, E.~Tran, A.~E. Wang, Y.~Wu, A.~Xie, J.~Yang, P.~Yin, Y.~Zhang, O.~Bastani, G.~Berseth, J.~Bohg, K.~Goldberg, A.~Gupta, A.~Gupta, D.~Jayaraman, J.~J. Lim, J.~Malik, R.~Martín-Martín, S.~Ramamoorthy, D.~Sadigh, S.~Song, J.~Wu, M.~C. Yip, Y.~Zhu,
T.~Kollar, S.~Levine, and C.~Finn.
\newblock Droid: A large-scale in-the-wild robot manipulation dataset.
\newblock 2024.
\bibitem[Nair et~al.(2022)Nair, Rajeswaran, Kumar, Finn, and Gupta]{nair2022r3m}
S.~Nair, A.~Rajeswaran, V.~Kumar, C.~Finn, and A.~Gupta.
\newblock R3m: A universal visual representation for robot manipulation.
\newblock In \emph{CoRL}, 2022.
\bibitem[Karamcheti et~al.(2023)Karamcheti, Nair, Chen, Kollar, Finn, Sadigh, and Liang]{Karamcheti2023LanguageDrivenRL}
S.~Karamcheti, S.~Nair, A.~S. Chen, T.~Kollar, C.~Finn, D.~Sadigh, and P.~Liang.
\newblock Language-driven representation learning for robotics.
\newblock \emph{ArXiv}, abs/2302.12766, 2023.
\newblock URL \url{https://api.semanticscholar.org/CorpusID:257205716}.
\bibitem[Shridhar et~al.(2022)Shridhar, Manuelli, and Fox]{shridhar2022cliport}
M.~Shridhar, L.~Manuelli, and D.~Fox.
\newblock Cliport: What and where pathways for robotic manipulation.
\newblock In \emph{Conference on robot learning}, pages 894--906. PMLR, 2022.
\bibitem[Stone et~al.(2023)Stone, Xiao, Lu, Gopalakrishnan, Lee, Vuong, Wohlhart, Zitkovich, Xia, Finn, et~al.]{stone2023open}
A.~Stone, T.~Xiao, Y.~Lu, K.~Gopalakrishnan, K.-H. Lee, Q.~Vuong, P.~Wohlhart, B.~Zitkovich, F.~Xia, C.~Finn, et~al.
\newblock Open-world object manipulation using pre-trained vision-language models.
\newblock \emph{arXiv preprint arXiv:2303.00905}, 2023.
\bibitem[Driess et~al.(2023)Driess, Xia, Sajjadi, Lynch, Chowdhery, Ichter, Wahid, Tompson, Vuong, Yu, et~al.]{driess2023palm}
D.~Driess, F.~Xia, M.~S. Sajjadi, C.~Lynch, A.~Chowdhery, B.~Ichter, A.~Wahid, J.~Tompson, Q.~Vuong, T.~Yu, et~al.
\newblock Palm-e: An embodied multimodal language model.
\newblock \emph{arXiv preprint arXiv:2303.03378}, 2023.
\bibitem[et~al.(2024)]{covariant_ai_2024}
A.~S. et~al.
\newblock Introducing rfm-1: Giving robots human-like reasoning capabilities, 2024.
\newblock URL \url{https://covariant.ai/insights/introducing-rfm-1-giving-robots-human-like-reasoning-capabilities/}.
\bibitem[Wayve(2024)]{wayve_ai_2024}
Wayve.
\newblock Lingo-2: Driving with natural language.
\newblock 2024.
\newblock URL \url{https://wayve.ai/thinking/lingo-2-driving-with-language/}.
\bibitem[Chen et~al.(2022)Chen, Wang, Changpinyo, Piergiovanni, Padlewski, Salz, Goodman, Grycner, Mustafa, Beyer, Kolesnikov, Puigcerver, Ding, Rong, Akbari, Mishra, Xue, Thapliyal, Bradbury, Kuo, Seyedhosseini, Jia, Ayan, Riquelme, Steiner, Angelova, Zhai, Houlsby, and Soricut]{chen2022pali}
X.~Chen, X.~Wang, S.~Changpinyo, A.~J. Piergiovanni, P.~Padlewski, D.~M. Salz, S.~Goodman, A.~Grycner, B.~Mustafa, L.~Beyer, A.~Kolesnikov, J.~Puigcerver, N.~Ding, K.~Rong, H.~Akbari, G.~Mishra, L.~Xue, A.~V. Thapliyal, J.~Bradbury, W.~Kuo, M.~Seyedhosseini, C.~Jia, B.~K. Ayan, C.~Riquelme, A.~Steiner, A.~Angelova, X.~Zhai, N.~Houlsby, and R.~Soricut.
\newblock Pali: A jointly-scaled multilingual language-image model.
\newblock \emph{ArXiv}, abs/2209.06794, 2022.
\newblock URL \url{https://api.semanticscholar.org/CorpusID:252222320}.
\bibitem[Chen et~al.(2023)Chen, Wang, Beyer, Kolesnikov, Wu, Voigtlaender, Mustafa, Goodman, Alabdulmohsin, Padlewski, Salz, Xiong, Vlasic, Pavetic, Rong, Yu, Keysers, Zhai, and Soricut]{chen2023pali3}
X.~Chen, X.~Wang, L.~Beyer, A.~Kolesnikov, J.~Wu, P.~Voigtlaender, B.~Mustafa, S.~Goodman, I.~M. Alabdulmohsin, P.~Padlewski, D.~M. Salz, X.~Xiong, D.~Vlasic, F.~Pavetic, K.~Rong, T.~Yu, D.~Keysers, X.-Q. Zhai, and R.~Soricut.
\newblock {PaLI}-3 vision language models: Smaller, faster, stronger.
\newblock \emph{arXiv preprint arXiv:2310.09199}, 2023.
\bibitem[Wolf et~al.(2020)Wolf, Debut, Sanh, Chaumond, Delangue, Moi, Cistac, Rault, Louf, Funtowicz, Davison, Shleifer, and ...]{wolf-etal-2020-transformers}
T.~Wolf, L.~Debut, V.~Sanh, J.~Chaumond, C.~Delangue, A.~Moi, P.~Cistac, T.~Rault, R.~Louf, M.~Funtowicz, J.~Davison, S.~Shleifer, and ...
\newblock Transformers: State-of-the-art natural language processing.
\newblock In \emph{Proceedings of the 6th International Conference on Learning Representations}, 2020.
\newblock URL \url{https://arxiv.org/abs/1910.03771}.
\bibitem[Touvron et~al.(2023)Touvron, Lavril, Izacard, Martinet, Lachaux, Lacroix, Rozi{\`e}re, Goyal, Hambro, Azhar, et~al.]{touvron2023llama}
H.~Touvron, T.~Lavril, G.~Izacard, X.~Martinet, M.-A. Lachaux, T.~Lacroix, B.~Rozi{\`e}re, N.~Goyal, E.~Hambro, F.~Azhar, et~al.
\newblock Llama: Open and efficient foundation language models.
\newblock \emph{arXiv preprint arXiv:2302.13971}, 2023.
\bibitem[Jiang et~al.(2023)Jiang, Sablayrolles, Mensch, Bamford, Chaplot, Casas, Bressand, Lengyel, Lample, Saulnier, et~al.]{jiang2023mistral}
A.~Q. Jiang, A.~Sablayrolles, A.~Mensch, C.~Bamford, D.~S. Chaplot, D.~d.~l. Casas, F.~Bressand, G.~Lengyel, G.~Lample, L.~Saulnier, et~al.
\newblock Mistral 7b.
\newblock \emph{arXiv preprint arXiv:2310.06825}, 2023.
\bibitem[Team et~al.(2024)Team, Mesnard, Hardin, Dadashi, Bhupatiraju, Pathak, Sifre, Rivi{\`e}re, Kale, Love, et~al.]{team2024gemma}
G.~Team, T.~Mesnard, C.~Hardin, R.~Dadashi, S.~Bhupatiraju, S.~Pathak, L.~Sifre, M.~Rivi{\`e}re, M.~S. Kale, J.~Love, et~al.
\newblock Gemma: Open models based on gemini research and technology.
\newblock \emph{arXiv preprint arXiv:2403.08295}, 2024.
\bibitem[Oquab et~al.(2023)Oquab, Darcet, Moutakanni, Vo, Szafraniec, Khalidov, Fernandez, Haziza, Massa, El-Nouby, et~al.]{oquab2023dinov2}
M.~Oquab, T.~Darcet, T.~Moutakanni, H.~Vo, M.~Szafraniec, V.~Khalidov, P.~Fernandez, D.~Haziza, F.~Massa, A.~El-Nouby, et~al.
\newblock Dinov2: Learning robust visual features without supervision.
\newblock \emph{arXiv preprint arXiv:2304.07193}, 2023.
\bibitem[Hu et~al.(2021)Hu, Shen, Wallis, Allen-Zhu, Li, Wang, Wang, and Chen]{hu2021lora}
E.~J. Hu, Y.~Shen, P.~Wallis, Z.~Allen-Zhu, Y.~Li, S.~Wang, L.~Wang, and W.~Chen.
\newblock Lora: Low-rank adaptation of large language models.
\newblock \emph{arXiv preprint arXiv:2106.09685}, 2021.
\bibitem[Dettmers et~al.(2024)Dettmers, Pagnoni, Holtzman, and Zettlemoyer]{dettmers2024qlora}
T.~Dettmers, A.~Pagnoni, A.~Holtzman, and L.~Zettlemoyer.
\newblock Qlora: Efficient finetuning of quantized llms.
\newblock \emph{Advances in Neural Information Processing Systems}, 36, 2024.
\bibitem[Goyal et~al.(2017)Goyal, Khot, Summers-Stay, Batra, and Parikh]{goyal2017making}
Y.~Goyal, T.~Khot, D.~Summers-Stay, D.~Batra, and D.~Parikh.
\newblock Making the {V} in {VQA} matter: Elevating the role of image understanding in visual question answering.
\newblock In \emph{Computer Vision and Pattern Recognition (CVPR)}, 2017.
\bibitem[Hudson and Manning(2019)]{hudson2019gqa}
D.~A. Hudson and C.~D. Manning.
\newblock {GQA}: A new dataset for real-world visual reasoning and compositional question answering.
\newblock In \emph{Computer Vision and Pattern Recognition (CVPR)}, 2019.
\bibitem[Singh et~al.(2019)Singh, Natarajan, Shah, Jiang, Chen, Batra, Parikh, and Rohrbach]{singh2019textvqa}
A.~Singh, V.~Natarajan, M.~Shah, Y.~Jiang, X.~Chen, D.~Batra, D.~Parikh, and M.~Rohrbach.
\newblock Towards {VQA} models that can read.
\newblock In \emph{Computer Vision and Pattern Recognition (CVPR)}, 2019.
\bibitem[Bigham et~al.(2010)Bigham, Jayant, Ji, Little, Miller, Miller, Miller, Tatarowicz, White, White, and Yeh]{bigham2010vizwiz}
J.~P. Bigham, C.~Jayant, H.~Ji, G.~Little, A.~Miller, R.~C. Miller, R.~Miller, A.~Tatarowicz, B.~White, S.~White, and T.~Yeh.
\newblock {VizWiz}: nearly real-time answers to visual questions.
\newblock In \emph{User Interface Software and Technology (UIST)}, pages 333--342, 2010.
\bibitem[Kazemzadeh et~al.(2014)Kazemzadeh, Ordonez, Matten, and Berg]{kazemzadeh2014refcoco}
S.~Kazemzadeh, V.~Ordonez, M.~Matten, and T.~Berg.
\newblock {ReferItGame}: Referring to objects in photographs of natural scenes.
\newblock In \emph{Empirical Methods in Natural Language Processing (EMNLP)}, pages 787--798, 2014.
\bibitem[Yu et~al.(2016)Yu, Poirson, Yang, Berg, and Berg]{yu2016refcoco}
L.~Yu, P.~Poirson, S.~Yang, A.~C. Berg, and T.~L. Berg.
\newblock Modeling context in referring expressions.
\newblock In \emph{European Conference on Computer Vision (ECCV)}, 2016.
\bibitem[Mesnard et~al.(2024)Mesnard, Hardin, Dadashi, Bhupatiraju, Pathak, Sifre, Rivière, Kale, Love, Tafti, Hussenot, Sessa, Chowdhery, Roberts, Barua, Botev, Castro-Ros, Slone, Héliou, Tacchetti, Bulanova, Paterson, Tsai, Shahriari, Lan, Choquette-Choo, Crepy, Cer, Ippolito, Reid, Buchatskaya, Ni, Noland, Yan, Tucker, Muraru, Rozhdestvenskiy, Michalewski, Tenney, Grishchenko, Austin, Keeling, Labanowski, Lespiau, Stanway, Brennan, Chen, Ferret, Chiu, Mao-Jones, Lee, Yu, Millican, Sjoesund, Lee, Dixon, Reid, Mikuła, Wirth, Sharman, Chinaev, Thain, Bachem, Chang, Wahltinez, Bailey, Michel, Yotov, Chaabouni, Comanescu, Jana, Anil, McIlroy, Liu, Mullins, Smith, Borgeaud, Girgin, Douglas, Pandya, Shakeri, De, Klimenko, Hennigan, Feinberg, Stokowiec, hui Chen, Ahmed, Gong, Warkentin, Peran, Giang, Farabet, Vinyals, Dean, Kavukcuoglu, Hassabis, Ghahramani, Eck, Barral, Pereira, Collins, Joulin, Fiedel, Senter, Andreev, and Kenealy]{google-gemma}
T.~Mesnard, C.~Hardin, R.~Dadashi, S.~Bhupatiraju, S.~Pathak, L.~Sifre, M.~Rivière, M.~S. Kale, J.~Love, P.~Tafti, L.~Hussenot, P.~G. Sessa, A.~Chowdhery, A.~Roberts, A.~Barua, A.~Botev, A.~Castro-Ros, A.~Slone, A.~Héliou, A.~Tacchetti, A.~Bulanova, A.~Paterson, B.~Tsai, B.~Shahriari, C.~L. Lan, C.~A. Choquette-Choo, C.~Crepy, D.~Cer, D.~Ippolito, D.~Reid, E.~Buchatskaya, E.~Ni, E.~Noland, G.~Yan, G.~Tucker, G.-C. Muraru, G.~Rozhdestvenskiy, H.~Michalewski, I.~Tenney, I.~Grishchenko, J.~Austin, J.~Keeling, J.~Labanowski, J.-B. Lespiau, J.~Stanway, J.~Brennan, J.~Chen, J.~Ferret, J.~Chiu, J.~Mao-Jones, K.~Lee, K.~Yu, K.~Millican, L.~L. Sjoesund, L.~Lee, L.~Dixon, M.~Reid, M.~Mikuła, M.~Wirth, M.~Sharman, N.~Chinaev, N.~Thain, O.~Bachem, O.~Chang, O.~Wahltinez, P.~Bailey, P.~Michel, P.~Yotov, R.~Chaabouni, R.~Comanescu, R.~Jana, R.~Anil, R.~McIlroy, R.~Liu, R.~Mullins, S.~L. Smith, S.~Borgeaud, S.~Girgin, S.~Douglas, S.~Pandya, S.~Shakeri, S.~De, T.~Klimenko, T.~Hennigan, V.~Feinberg, W.~Stokowiec, Y.~hui
Chen, Z.~Ahmed, Z.~Gong, T.~Warkentin, L.~Peran, M.~Giang, C.~Farabet, O.~Vinyals, J.~Dean, K.~Kavukcuoglu, D.~Hassabis, Z.~Ghahramani, D.~Eck, J.~Barral, F.~Pereira, E.~Collins, A.~Joulin, N.~Fiedel, E.~Senter, A.~Andreev, and K.~Kenealy.
\newblock Gemma: Open models based on gemini research and technology.
\newblock \emph{arXiv preprint arXiv:2403.08295}, 2024.
\bibitem[Li et~al.(2023)Li, Bubeck, Eldan, Giorno, Gunasekar, and Lee]{microsoft-phi}
Y.~Li, S.~Bubeck, R.~Eldan, A.~D. Giorno, S.~Gunasekar, and Y.~T. Lee.
\newblock Textbooks are all you need ii: phi-1.5 technical report.
\newblock \emph{arXiv preprint arXiv:2309.05463}, 2023.
\bibitem[Bai et~al.(2023)Bai, Bai, Chu, Cui, Dang, Deng, Fan, Ge, Han, Huang, et~al.]{bai2023qwen}
J.~Bai, S.~Bai, Y.~Chu, Z.~Cui, K.~Dang, X.~Deng, Y.~Fan, W.~Ge, Y.~Han, F.~Huang, et~al.
\newblock Qwen technical report.
\newblock \emph{arXiv preprint arXiv:2309.16609}, 2023.
\bibitem[Li et~al.(2022)Li, Li, Xiong, and Hoi]{li2022blip}
J.~Li, D.~Li, C.~Xiong, and S.~C.~H. Hoi.
\newblock {BLIP}: Bootstrapping language-image pre-training for unified vision-language understanding and generation.
\newblock In \emph{International Conference on Machine Learning (ICML)}, 2022.
\bibitem[Li et~al.(2023)Li, Li, Savarese, and Hoi]{li2023blip2}
J.~Li, D.~Li, S.~Savarese, and S.~C.~H. Hoi.
\newblock {BLIP}-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.
\newblock In \emph{International Conference on Machine Learning (ICML)}, 2023.
\bibitem[Dai et~al.(2023)Dai, Li, Li, Tiong, Zhao, Wang, Li, Fung, and Hoi]{dai2023instructblip}
W.~Dai, J.~Li, D.~Li, A.~M.~H. Tiong, J.~Zhao, W.~Wang, B.~A. Li, P.~Fung, and S.~C.~H. Hoi.
\newblock Instruct{BLIP}: Towards general-purpose vision-language models with instruction tuning.
\newblock \emph{arXiv preprint arXiv:2305.06500}, 2023.
\bibitem[Tan and Bansal(2019)]{tan2019lxmert}
H.~H. Tan and M.~Bansal.
\newblock {LXMERT}: Learning cross-modality encoder representations from transformers.
\newblock In \emph{Empirical Methods in Natural Language Processing (EMNLP)}, 2019.
\bibitem[Laurençon et~al.(2023)Laurençon, Saulnier, Tronchon, Bekman, Singh, Lozhkov, Wang, Karamcheti, Rush, Kiela, Cord, and Sanh]{laurencon2023obelics}
H.~Laurençon, L.~Saulnier, L.~Tronchon, S.~Bekman, A.~Singh, A.~Lozhkov, T.~Wang, S.~Karamcheti, A.~M. Rush, D.~Kiela, M.~Cord, and V.~Sanh.
\newblock {OBELICS}: An open web-scale filtered dataset of interleaved image-text documents.
\newblock In \emph{Neural Information Processing Systems Track on Datasets and Benchmarks (NeurIPS Datasets and Benchmarks)}, 2023.
\bibitem[Liu et~al.(2023{\natexlab{a}})Liu, Li, Wu, and Lee]{liu2023llava}
H.~Liu, C.~Li, Q.~Wu, and Y.~J. Lee.
\newblock Visual instruction tuning.
\newblock In \emph{Advances in Neural Information Processing Systems (NeurIPS)}, 2023{\natexlab{a}}.
\bibitem[Liu et~al.(2023{\natexlab{b}})Liu, Li, Li, and Lee]{liu2023llavav15}
H.~Liu, C.~Li, Y.~Li, and Y.~J. Lee.
\newblock Improved baselines with visual instruction tuning.
\newblock \emph{arXiv preprint arXiv:2310.03744}, 2023{\natexlab{b}}.
\bibitem[Karamcheti et~al.(2024)Karamcheti, Nair, Balakrishna, Liang, Kollar, and Sadigh]{karamcheti2024prismatic}
S.~Karamcheti, S.~Nair, A.~Balakrishna, P.~Liang, T.~Kollar, and D.~Sadigh.
\newblock Prismatic vlms: Investigating the design space of visually-conditioned language models.
\newblock \emph{arXiv preprint arXiv:2402.07865}, 2024.
\bibitem[Kalashnikov et~al.(2018)Kalashnikov, Irpan, Pastor, Ibarz, Herzog, Jang, Quillen, Holly, Kalakrishnan, Vanhoucke, et~al.]{kalashnikov2018qt}
D.~Kalashnikov, A.~Irpan, P.~Pastor, J.~Ibarz, A.~Herzog, E.~Jang, D.~Quillen, E.~Holly, M.~Kalakrishnan, V.~Vanhoucke, et~al.
\newblock {QT}-{O}pt: Scalable deep reinforcement learning for vision-based robotic manipulation.
\newblock \emph{arXiv preprint arXiv:1806.10293}, 2018.
\bibitem[Kalashnkov et~al.(2021)Kalashnkov, Varley, Chebotar, Swanson, Jonschkowski, Finn, Levine, and Hausman]{mtopt2021arxiv}
D.~Kalashnkov, J.~Varley, Y.~Chebotar, B.~Swanson, R.~Jonschkowski, C.~Finn, S.~Levine, and K.~Hausman.
\newblock Mt-opt: Continuous multi-task robotic reinforcement learning at scale.
\newblock \emph{arXiv}, 2021.
\bibitem[Ebert et~al.(2021)Ebert, Yang, Schmeckpeper, Bucher, Georgakis, Daniilidis, Finn, and Levine]{ebert2021bridge}
F.~Ebert, Y.~Yang, K.~Schmeckpeper, B.~Bucher, G.~Georgakis, K.~Daniilidis, C.~Finn, and S.~Levine.
\newblock Bridge data: Boosting generalization of robotic skills with cross-domain datasets.
\newblock \emph{arXiv preprint arXiv:2109.13396}, 2021.
\bibitem[Ehsani et~al.(2023)Ehsani, Gupta, Hendrix, Salvador, Weihs, Zeng, Singh, Kim, Han, Herrasti, et~al.]{ehsani2023imitating}
K.~Ehsani, T.~Gupta, R.~Hendrix, J.~Salvador, L.~Weihs, K.-H. Zeng, K.~P. Singh, Y.~Kim, W.~Han, A.~Herrasti, et~al.
\newblock Imitating shortest paths in simulation enables effective navigation and manipulation in the real world.
\newblock \emph{arXiv preprint arXiv:2312.02976}, 2023.
\bibitem[Bharadhwaj et~al.(2023)Bharadhwaj, Vakil, Sharma, Gupta, Tulsiani, and Kumar]{bharadhwaj2023roboagent}
H.~Bharadhwaj, J.~Vakil, M.~Sharma, A.~Gupta, S.~Tulsiani, and V.~Kumar.
\newblock Roboagent: Generalization and efficiency in robot manipulation via semantic augmentations and action chunking.
\newblock \emph{arXiv preprint arXiv:2309.01918}, 2023.
\bibitem[Pinto and Gupta(2016)]{pinto2016supersizing}
L.~Pinto and A.~Gupta.
\newblock Supersizing self-supervision: Learning to grasp from 50k tries and 700 robot hours.
\newblock In \emph{2016 IEEE international conference on robotics and automation (ICRA)}, pages 3406--3413. IEEE, 2016.
\bibitem[Mandlekar et~al.(2018)Mandlekar, Zhu, Garg, Booher, Spero, Tung, Gao, Emmons, Gupta, Orbay, et~al.]{mandlekar2018roboturk}
A.~Mandlekar, Y.~Zhu, A.~Garg, J.~Booher, M.~Spero, A.~Tung, J.~Gao, J.~Emmons, A.~Gupta, E.~Orbay, et~al.
\newblock Roboturk: A crowdsourcing platform for robotic skill learning through imitation.
\newblock In \emph{Conference on Robot Learning}, pages 879--893. PMLR, 2018.
\bibitem[Gupta et~al.(2018)Gupta, Murali, Gandhi, and Pinto]{gupta2018robot}
A.~Gupta, A.~Murali, D.~P. Gandhi, and L.~Pinto.
\newblock Robot learning in homes: Improving generalization and reducing dataset bias.
\newblock \emph{Advances in neural information processing systems}, 31, 2018.
\bibitem[Dasari et~al.(2019)Dasari, Ebert, Tian, Nair, Bucher, Schmeckpeper, Singh, Levine, and Finn]{dasari2019robonet}
S.~Dasari, F.~Ebert, S.~Tian, S.~Nair, B.~Bucher, K.~Schmeckpeper, S.~Singh, S.~Levine, and C.~Finn.
\newblock Robonet: Large-scale multi-robot learning.
\newblock \emph{CoRL}, 2019.
\bibitem[Cabi et~al.(2019)Cabi, Colmenarejo, Novikov, Konyushkova, Reed, Jeong, Zolna, Aytar, Budden, Vecerik, Sushkov, Barker, Scholz, Denil, de~Freitas, and Wang]{cabi2019}
S.~Cabi, S.~G. Colmenarejo, A.~Novikov, K.~Konyushkova, S.~Reed, R.~Jeong, K.~Zolna, Y.~Aytar, D.~Budden, M.~Vecerik, O.~Sushkov, D.~Barker, J.~Scholz, M.~Denil, N.~de~Freitas, and Z.~Wang.
\newblock Scaling data-driven robotics with reward sketching and batch reinforcement learning.
\newblock \emph{RSS}, 2019.
\bibitem[Jang et~al.(2022)Jang, Irpan, Khansari, Kappler, Ebert, Lynch, Levine, and Finn]{jang2022bc}
E.~Jang, A.~Irpan, M.~Khansari, D.~Kappler, F.~Ebert, C.~Lynch, S.~Levine, and C.~Finn.
\newblock Bc-z: Zero-shot task generalization with robotic imitation learning.
\newblock In \emph{Conference on Robot Learning}, pages 991--1002. PMLR, 2022.
\bibitem[Fang et~al.(2023)Fang, Fang, Tang, Liu, Wang, Wang, Zhu, and Lu]{fang2023rh20t}
H.-S. Fang, H.~Fang, Z.~Tang, J.~Liu, C.~Wang, J.~Wang, H.~Zhu, and C.~Lu.
\newblock Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot.
\newblock \emph{Towards Generalist Robots: Learning Paradigms for Scalable Skill Acquisition@ CoRL2023}, 3:\penalty0 5, 2023.
\bibitem[Devin et~al.(2017)Devin, Gupta, Darrell, Abbeel, and Levine]{devin2017learning}
C.~Devin, A.~Gupta, T.~Darrell, P.~Abbeel, and S.~Levine.
\newblock Learning modular neural network policies for multi-task and multi-robot transfer.
\newblock In \emph{Proceedings of IEEE International Conference on Robotics and Automation}, 2017.
\bibitem[Hu et~al.(2022)Hu, Huang, Rybkin, and Jayaraman]{hu2022know}
E.~S. Hu, K.~Huang, O.~Rybkin, and D.~Jayaraman.
\newblock Know thyself: Transferable visual control policies through robot-awareness.
\newblock In \emph{International Conference on Learning Representations}, 2022.
\bibitem[Yang et~al.(2023)Yang, Sadigh, and Finn]{yang2023polybot}
J.~H. Yang, D.~Sadigh, and C.~Finn.
\newblock Polybot: Training one policy across robots while embracing variability.
\newblock In \emph{7th Annual Conference on Robot Learning}, 2023.
\newblock URL \url{https://openreview.net/forum?id=HEIRj51lcS}.
\bibitem[Reed et~al.(2022)Reed, Zolna, Parisotto, Colmenarejo, Novikov, Barth-maron, Gim{\'e}nez, Sulsky, Kay, Springenberg, Eccles, Bruce, Razavi, Edwards, Heess, Chen, Hadsell, Vinyals, Bordbar, and de~Freitas]{reed2022a}
S.~Reed, K.~Zolna, E.~Parisotto, S.~G. Colmenarejo, A.~Novikov, G.~Barth-maron, M.~Gim{\'e}nez, Y.~Sulsky, J.~Kay, J.~T. Springenberg, T.~Eccles, J.~Bruce, A.~Razavi, A.~Edwards, N.~Heess, Y.~Chen, R.~Hadsell, O.~Vinyals, M.~Bordbar, and N.~de~Freitas.
\newblock A generalist agent.
\newblock \emph{Transactions on Machine Learning Research}, 2022.
\newblock ISSN 2835-8856.
\bibitem[Salhotra et~al.(2023)Salhotra, Liu, and Sukhatme]{salhotra2023bridging}
G.~Salhotra, I.-C.~A. Liu, and G.~Sukhatme.
\newblock Bridging action space mismatch in learning from demonstrations.
\newblock \emph{arXiv preprint arXiv:2304.03833}, 2023.
\bibitem[Radosavovic et~al.(2023)Radosavovic, Shi, Fu, Goldberg, Darrell, and Malik]{radosavovic2023robot}
I.~Radosavovic, B.~Shi, L.~Fu, K.~Goldberg, T.~Darrell, and J.~Malik.
\newblock Robot learning with sensorimotor pre-training.
\newblock In \emph{Conference on Robot Learning}, 2023.
\bibitem[Shah et~al.(2023)Shah, Sridhar, Bhorkar, Hirose, and Levine]{shahGNMGeneralNavigation2023}
D.~Shah, A.~Sridhar, A.~Bhorkar, N.~Hirose, and S.~Levine.
\newblock Gnm: A general navigation model to drive any robot.
\newblock In \emph{2023 IEEE International Conference on Robotics and Automation (ICRA)}, pages 7226--7233. IEEE, 2023.
\bibitem[Bousmalis et~al.(2023)Bousmalis, Vezzani, Rao, Devin, Lee, Bauza, Davchev, Zhou, Gupta, Raju, et~al.]{bousmalis2023robocat}
K.~Bousmalis, G.~Vezzani, D.~Rao, C.~Devin, A.~X. Lee, M.~Bauza, T.~Davchev, Y.~Zhou, A.~Gupta, A.~Raju, et~al.
\newblock Robocat: A self-improving foundation agent for robotic manipulation.
\newblock \emph{arXiv preprint arXiv:2306.11706}, 2023.
\bibitem[Shah et~al.(2023)Shah, Sridhar, Dashora, Stachowicz, Black, Hirose, and Levine]{shah2023vint}
D.~Shah, A.~Sridhar, N.~Dashora, K.~Stachowicz, K.~Black, N.~Hirose, and S.~Levine.
\newblock Vi{NT}: A foundation model for visual navigation.
\newblock In \emph{7th Annual Conference on Robot Learning}, 2023.
\newblock URL \url{https://arxiv.org/abs/2306.14846}.
\bibitem[Yang et~al.(2024)Yang, Glossop, Bhorkar, Shah, Vuong, Finn, Sadigh, and Levine]{yang2024pushing}
J.~Yang, C.~Glossop, A.~Bhorkar, D.~Shah, Q.~Vuong, C.~Finn, D.~Sadigh, and S.~Levine.
\newblock Pushing the limits of cross-embodiment learning for manipulation and navigation.
\newblock \emph{arXiv preprint arXiv:2402.19432}, 2024.
\bibitem[Gadre et~al.(2023)Gadre, Wortsman, Ilharco, Schmidt, and Song]{gadre2023cows}
S.~Y. Gadre, M.~Wortsman, G.~Ilharco, L.~Schmidt, and S.~Song.
\newblock Cows on pasture: Baselines and benchmarks for language-driven zero-shot object navigation.
\newblock In \emph{Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition}, pages 23171--23181, 2023.
\bibitem[Du et~al.(2023)Du, Konyushkova, Denil, Raju, Landon, Hill, de~Freitas, and Cabi]{du2023vision}
Y.~Du, K.~Konyushkova, M.~Denil, A.~Raju, J.~Landon, F.~Hill, N.~de~Freitas, and S.~Cabi.
\newblock Vision-language models as success detectors.
\newblock \emph{arXiv preprint arXiv:2303.07280}, 2023.
\bibitem[Ma et~al.(2023)Ma, Kumar, Zhang, Bastani, and Jayaraman]{ma2023liv}
Y.~J. Ma, V.~Kumar, A.~Zhang, O.~Bastani, and D.~Jayaraman.
\newblock Liv: Language-image representations and rewards for robotic control.
\newblock In \emph{International Conference on Machine Learning}, pages 23301--23320. PMLR, 2023.
\bibitem[Zhang et~al.(2023)Zhang, Ding, Amiri, Yang, Kaminski, Esselink, and Zhang]{zhang2023grounding}
X.~Zhang, Y.~Ding, S.~Amiri, H.~Yang, A.~Kaminski, C.~Esselink, and S.~Zhang.
\newblock Grounding classical task planners via vision-language models.
\newblock \emph{arXiv preprint arXiv:2304.08587}, 2023.
\bibitem[Sontakke et~al.(2024)Sontakke, Zhang, Arnold, Pertsch, B{\i}y{\i}k, Sadigh, Finn, and Itti]{sontakke2024roboclip}
S.~Sontakke, J.~Zhang, S.~Arnold, K.~Pertsch, E.~B{\i}y{\i}k, D.~Sadigh, C.~Finn, and L.~Itti.
\newblock Roboclip: One demonstration is enough to learn robot policies.
\newblock \emph{Advances in Neural Information Processing Systems}, 36, 2024.
\bibitem[Huang et~al.(2024)Huang, Yong, Ma, Linghu, Li, Wang, Li, Zhu, Jia, and Huang]{huang2023embodied}
J.~Huang, S.~Yong, X.~Ma, X.~Linghu, P.~Li, Y.~Wang, Q.~Li, S.-C. Zhu, B.~Jia, and S.~Huang.
\newblock An embodied generalist agent in 3d world.
\newblock In \emph{Proceedings of the International Conference on Machine Learning (ICML)}, 2024.
\bibitem[Li et~al.(2023)Li, Liu, Zhang, Yu, Xu, Wu, Cheang, Jing, Zhang, Liu, et~al.]{li2023vision}
X.~Li, M.~Liu, H.~Zhang, C.~Yu, J.~Xu, H.~Wu, C.~Cheang, Y.~Jing, W.~Zhang, H.~Liu, et~al.
\newblock Vision-language foundation models as effective robot imitators.
\newblock \emph{arXiv preprint arXiv:2311.01378}, 2023.
\bibitem[Zhen et~al.(2024)Zhen, Qiu, Chen, Yang, Yan, Du, Hong, and Gan]{zhen20243dvla}
H.~Zhen, X.~Qiu, P.~Chen, J.~Yang, X.~Yan, Y.~Du, Y.~Hong, and C.~Gan.
\newblock 3d-vla: 3d vision-language-action generative world model.
\newblock \emph{arXiv preprint arXiv:2403.09631}, 2024.
\bibitem[PyTorch()]{pytorch_amp}
PyTorch.
\newblock Automatic mixed precision.
\newblock URL \url{https://pytorch.org/docs/stable/amp.html}.
\bibitem[Dao(2023)]{dao2023flashattention}
T.~Dao.
\newblock Flashattention-2: Faster attention with better parallelism and work partitioning.
\newblock \emph{arXiv preprint arXiv:2307.08691}, 2023.
\bibitem[Zhao et~al.(2023)Zhao, Gu, Varma, Luo, Huang, Xu, Wright, Shojanazeri, Ott, Shleifer, et~al.]{zhao2023pytorch}
Y.~Zhao, A.~Gu, R.~Varma, L.~Luo, C.-C. Huang, M.~Xu, L.~Wright, H.~Shojanazeri, M.~Ott, S.~Shleifer, et~al.
\newblock Pytorch fsdp: experiences on scaling fully sharded data parallel.
\newblock \emph{arXiv preprint arXiv:2304.11277}, 2023.
\bibitem[Dorka et~al.()Dorka, Huang, Welschehold, and Burgard]{dorka2024matters}
N.~Dorka, C.~Huang, T.~Welschehold, and W.~Burgard.
\newblock What matters in employing vision language models for tokenizing actions in robot control?
\newblock In \emph{First Workshop on Vision-Language Models for Navigation and Manipulation at ICRA 2024}.
\bibitem[Zhai et~al.(2023)Zhai, Mustafa, Kolesnikov, and Beyer]{zhai2023sigmoid}
X.~Zhai, B.~Mustafa, A.~Kolesnikov, and L.~Beyer.
\newblock Sigmoid loss for language image pre-training.
\newblock In \emph{Proceedings of the IEEE/CVF International Conference on Computer Vision}, pages 11975--11986, 2023.
\bibitem[Radford et~al.(2021)Radford, Kim, Hallacy, Ramesh, Goh, Agarwal, Sastry, Askell, Mishkin, Clark, et~al.]{radford2021learning}
A.~Radford, J.~W. Kim, C.~Hallacy, A.~Ramesh, G.~Goh, S.~Agarwal, G.~Sastry, A.~Askell, P.~Mishkin, J.~Clark, et~al.
\newblock Learning transferable visual models from natural language supervision.
\newblock In \emph{International conference on machine learning}, pages 8748--8763. PMLR, 2021.
\bibitem[Sharma et~al.(2018)Sharma, Ding, Goodman, and Soricut]{sharma2018conceptual}
P.~Sharma, N.~Ding, S.~Goodman, and R.~Soricut.
\newblock Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning.
\newblock In \emph{Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)}, pages 2556--2565, 2018.
\bibitem[Schuhmann et~al.(2021)Schuhmann, Vencu, Beaumont, Kaczmarczyk, Mullis, Katta, Coombes, Jitsev, and Komatsuzaki]{schuhmann2021laion}
C.~Schuhmann, R.~Vencu, R.~Beaumont, R.~Kaczmarczyk, C.~Mullis, A.~Katta, T.~Coombes, J.~Jitsev, and A.~Komatsuzaki.
\newblock Laion-400m: Open dataset of clip-filtered 400 million image-text pairs.
\newblock \emph{arXiv preprint arXiv:2111.02114}, 2021.
\bibitem[Sidorov et~al.(2020)Sidorov, Hu, Rohrbach, and Singh]{sidorov2020textcaps}
O.~Sidorov, R.~Hu, M.~Rohrbach, and A.~Singh.
\newblock Textcaps: a dataset for image captioning with reading comprehension.
\newblock In \emph{Computer Vision--ECCV 2020: 16th European Conference, Glasgow, UK, August 23--28, 2020, Proceedings, Part II 16}, pages 742--758. Springer, 2020.
\bibitem[Face(2024)]{idefics2024}
H.~Face.
\newblock Introducing idefics: An open reproduction of state-of-the-art visual langage model.
\newblock \emph{Hugging Face Blog}, 2024.
\bibitem[Liu et~al.(2024)Liu, Li, Wu, and Lee]{liu2024visual}
H.~Liu, C.~Li, Q.~Wu, and Y.~J. Lee.
\newblock Visual instruction tuning.
\newblock \emph{Advances in neural information processing systems}, 36, 2024.
\bibitem[McKinzie et~al.(2024)McKinzie, Gan, Fauconnier, Dodge, Zhang, Dufter, Shah, Du, Peng, Weers, et~al.]{mckinzie2024mm1}
B.~McKinzie, Z.~Gan, J.-P. Fauconnier, S.~Dodge, B.~Zhang, P.~Dufter, D.~Shah, X.~Du, F.~Peng, F.~Weers, et~al.
\newblock Mm1: Methods, analysis \& insights from multimodal llm pre-training.
\newblock \emph{arXiv preprint arXiv:2403.09611}, 2024.
\bibitem[Lin et~al.(2023)Lin, Yin, Ping, Lu, Molchanov, Tao, Mao, Kautz, Shoeybi, and Han]{lin2023vila}
J.~Lin, H.~Yin, W.~Ping, Y.~Lu, P.~Molchanov, A.~Tao, H.~Mao, J.~Kautz, M.~Shoeybi, and S.~Han.
\newblock Vila: On pre-training for visual language models.
\newblock \emph{arXiv preprint arXiv:2312.07533}, 2023.
\bibitem[Dettmers et~al.(2022)Dettmers, Lewis, Belkada, and Zettlemoyer]{dettmers2022gpt3}
T.~Dettmers, M.~Lewis, Y.~Belkada, and L.~Zettlemoyer.
\newblock Gpt3. int8 (): 8-bit matrix multiplication for transformers at scale.
\newblock \emph{Advances in Neural Information Processing Systems}, 35:\penalty0 30318--30332, 2022.
\bibitem[NVIDIA()]{tensorrt_llm}
NVIDIA.
\newblock Tensorrt-llm.
\newblock URL \url{https://github.com/NVIDIA/TensorRT-LLM}.
\bibitem[Zhao et~al.(2023)Zhao, Kumar, Levine, and Finn]{zhao2023learning}
T.~Z. Zhao, V.~Kumar, S.~Levine, and C.~Finn.
\newblock Learning fine-grained bimanual manipulation with low-cost hardware.
\newblock \emph{arXiv preprint arXiv:2304.13705}, 2023.
\bibitem[Leviathan et~al.(2023)Leviathan, Kalman, and Matias]{leviathan2023fast}
Y.~Leviathan, M.~Kalman, and Y.~Matias.
\newblock Fast inference from transformers via speculative decoding.
\newblock In \emph{International Conference on Machine Learning}, pages 19274--19286. PMLR, 2023.
\bibitem[Brohan et~al.(2022)Brohan, Brown, Carbajal, Chebotar, Dabis, Finn, Gopalakrishnan, Hausman, Herzog, Hsu, et~al.]{brohan2022rt}
A.~Brohan, N.~Brown, J.~Carbajal, Y.~Chebotar, J.~Dabis, C.~Finn, K.~Gopalakrishnan, K.~Hausman, A.~Herzog, J.~Hsu, et~al.
\newblock Rt-1: Robotics transformer for real-world control at scale.
\newblock \emph{arXiv preprint arXiv:2212.06817}, 2022.
\bibitem[Rosete-Beas et~al.(2022)Rosete-Beas, Mees, Kalweit, Boedecker, and Burgard]{rosetebeas2022latent}
E.~Rosete-Beas, O.~Mees, G.~Kalweit, J.~Boedecker, and W.~Burgard.
\newblock Latent plans for task agnostic offline reinforcement learning.
\newblock In \emph{Proceedings of the 6th Conference on Robot Learning (CoRL)}, 2022.
\bibitem[Mees et~al.(2023)Mees, Borja-Diaz, and Burgard]{mees2023grounding}
O.~Mees, J.~Borja-Diaz, and W.~Burgard.
\newblock Grounding language with visual affordances over unstructured data.
\newblock In \emph{Proceedings of the IEEE International Conference on Robotics and Automation (ICRA)}, London, UK, 2023.
\bibitem[Dass et~al.(2023)Dass, Yapeter, Zhang, Zhang, Pertsch, Nikolaidis, and Lim]{dass2023jacoplay}
S.~Dass, J.~Yapeter, J.~Zhang, J.~Zhang, K.~Pertsch, S.~Nikolaidis, and J.~J. Lim.
\newblock {CLVR} jaco play dataset, 2023.
\newblock URL \url{https://github.com/clvrai/clvr_jaco_play_dataset}.
\bibitem[Luo et~al.(2023)Luo, Xu, Geng, Feng, Fang, Tan, Schaal, and Levine]{luo2023multistage}
J.~Luo, C.~Xu, X.~Geng, G.~Feng, K.~Fang, L.~Tan, S.~Schaal, and S.~Levine.
\newblock Multi-stage cable routing through hierarchical imitation learning.
\newblock \emph{arXiv preprint arXiv:2307.08927}, 2023.
\bibitem[Mandlekar et~al.(2018)Mandlekar, Zhu, Garg, Booher, Spero, Tung, Gao, Emmons, Gupta, Orbay, Savarese, and Fei{-}Fei]{DBLP:journals/corr/abs-1811-02790}
A.~Mandlekar, Y.~Zhu, A.~Garg, J.~Booher, M.~Spero, A.~Tung, J.~Gao, J.~Emmons, A.~Gupta, E.~Orbay, S.~Savarese, and L.~Fei{-}Fei.
\newblock {R}obo{T}urk: {A} crowdsourcing platform for robotic skill learning through imitation.
\newblock \emph{CoRR}, abs/1811.02790, 2018.
\newblock URL \url{http://arxiv.org/abs/1811.02790}.
\bibitem[Zhu et~al.(2023)Zhu, Joshi, Stone, and Zhu]{zhu2023viola}
Y.~Zhu, A.~Joshi, P.~Stone, and Y.~Zhu.
\newblock Viola: Imitation learning for vision-based manipulation with object proposal priors, 2023.
\bibitem[Chen et~al.()Chen, Adebola, and Goldberg]{BerkeleyUR5Website}
L.~Y. Chen, S.~Adebola, and K.~Goldberg.
\newblock Berkeley {UR5} demonstration dataset.
\newblock \url{https://sites.google.com/view/berkeley-ur5/home}.
\bibitem[Zhou et~al.(2023)Zhou, Dean, Srirama, Rajeswaran, Pari, Hatch, Jain, Yu, Abbeel, Pinto, Finn, and Gupta]{zhou2023train}
G.~Zhou, V.~Dean, M.~K. Srirama, A.~Rajeswaran, J.~Pari, K.~Hatch, A.~Jain, T.~Yu, P.~Abbeel, L.~Pinto, C.~Finn, and A.~Gupta.
\newblock Train offline, test online: A real robot learning benchmark, 2023.
\bibitem[Lynch et~al.(2023)Lynch, Wahid, Tompson, Ding, Betker, Baruch, Armstrong, and Florence]{lynch2023interactive}
C.~Lynch, A.~Wahid, J.~Tompson, T.~Ding, J.~Betker, R.~Baruch, T.~Armstrong, and P.~Florence.
\newblock Interactive language: Talking to robots in real time.
\newblock \emph{IEEE Robotics and Automation Letters}, 2023.
\bibitem[Belkhale et~al.(2023)Belkhale, Cui, and Sadigh]{belkhale2023hydra}
S.~Belkhale, Y.~Cui, and D.~Sadigh.
\newblock Hydra: Hybrid robot actions for imitation learning.
\newblock \emph{arxiv}, 2023.
\bibitem[Zhu et~al.(2022)Zhu, Stone, and Zhu]{zhu2022bottom}
Y.~Zhu, P.~Stone, and Y.~Zhu.
\newblock Bottom-up skill discovery from unsegmented demonstrations for long-horizon robot manipulation.
\newblock \emph{IEEE Robotics and Automation Letters}, 7\penalty0 (2):\penalty0 4126--4133, 2022.
\bibitem[Cui et~al.(2022)Cui, Wang, Shafiullah, and Pinto]{cui2022play}
Z.~J. Cui, Y.~Wang, N.~M.~M. Shafiullah, and L.~Pinto.
\newblock From play to policy: Conditional behavior generation from uncurated robot data.
\newblock \emph{arXiv preprint arXiv:2210.10047}, 2022.
\bibitem[Heo et~al.(2023)Heo, Lee, Lee, and Lim]{heo2023furniturebench}
M.~Heo, Y.~Lee, D.~Lee, and J.~J. Lim.
\newblock Furniturebench: Reproducible real-world benchmark for long-horizon complex manipulation.
\newblock In \emph{Robotics: Science and Systems}, 2023.
\bibitem[Yan et~al.(2023)Yan, Wu, and Wang]{ucsd_kitchens}
G.~Yan, K.~Wu, and X.~Wang.
\newblock {ucsd kitchens Dataset}.
\newblock August 2023.
\bibitem[Nasiriany et~al.(2022)Nasiriany, Gao, Mandlekar, and Zhu]{nasiriany2022sailor}
S.~Nasiriany, T.~Gao, A.~Mandlekar, and Y.~Zhu.
\newblock Learning and retrieval from prior data for skill-based imitation learning.
\newblock In \emph{Conference on Robot Learning (CoRL)}, 2022.
\bibitem[Liu et~al.(2023)Liu, Nasiriany, Zhang, Bao, and Zhu]{liu2022robot}
H.~Liu, S.~Nasiriany, L.~Zhang, Z.~Bao, and Y.~Zhu.
\newblock Robot learning on the job: Human-in-the-loop autonomy and learning during deployment.
\newblock In \emph{Robotics: Science and Systems (RSS)}, 2023.
\bibitem[Quere et~al.(2020)Quere, Hagengruber, Iskandar, Bustamante, Leidner, Stulp, and Vogel]{quere_shared_2020}
G.~Quere, A.~Hagengruber, M.~Iskandar, S.~Bustamante, D.~Leidner, F.~Stulp, and J.~Vogel.
\newblock Shared {Control} {Templates} for {Assistive} {Robotics}.
\newblock In \emph{2020 {IEEE} {International} {Conference} on {Robotics} and {Automation} ({ICRA})}, page~7, Paris, France, 2020.
\bibitem[Saxena et~al.(2023)Saxena, Sharma, and Kroemer]{saxena2023multiresolution}
S.~Saxena, M.~Sharma, and O.~Kroemer.
\newblock Multi-resolution sensing for real-time control with vision-language models.
\newblock In \emph{7th Annual Conference on Robot Learning}, 2023.
\newblock URL \url{https://openreview.net/forum?id=WuBv9-IGDUA}.
\bibitem[Shah et~al.(2023)Shah, Mart{\'\i}n-Mart{\'\i}n, and Zhu]{shah2023mutex}
R.~Shah, R.~Mart{\'\i}n-Mart{\'\i}n, and Y.~Zhu.
\newblock {MUTEX}: Learning unified policies from multimodal task specifications.
\newblock In \emph{7th Annual Conference on Robot Learning}, 2023.
\newblock URL \url{https://openreview.net/forum?id=PwqiqaaEzJ}.
\bibitem[Zhu et~al.(2023)Zhu, Tian, Xu, Ding, Zhan, and Tomizuka]{fanuc_manipulation2023}
X.~Zhu, R.~Tian, C.~Xu, M.~Ding, W.~Zhan, and M.~Tomizuka.
\newblock Fanuc manipulation: A dataset for learning-based manipulation with fanuc mate 200id robot.
\newblock 2023.
\bibitem[Mendonca et~al.(2023)Mendonca, Bahl, and Pathak]{mendonca2023structured}
R.~Mendonca, S.~Bahl, and D.~Pathak.
\newblock Structured world models from human videos.
\newblock \emph{CoRL}, 2023.
\bibitem[Luo et~al.(2024)Luo, Xu, Liu, Tan, Lin, Wu, Abbeel, and Levine]{luo2024fmb}
J.~Luo, C.~Xu, F.~Liu, L.~Tan, Z.~Lin, J.~Wu, P.~Abbeel, and S.~Levine.
\newblock Fmb: a functional manipulation benchmark for generalizable robotic learning.
\newblock \emph{arXiv preprint arXiv:2401.08553}, 2024.
\bibitem[Shafiullah et~al.(2023)Shafiullah, Rai, Etukuru, Liu, Misra, Chintala, and Pinto]{shafiullah2023dobbe}
N.~M.~M. Shafiullah, A.~Rai, H.~Etukuru, Y.~Liu, I.~Misra, S.~Chintala, and L.~Pinto.
\newblock On bringing robots home, 2023.
\bibitem[Liu et~al.(2024)Liu, Zhu, Gao, Feng, Liu, Zhu, and Stone]{liu2024libero}
B.~Liu, Y.~Zhu, C.~Gao, Y.~Feng, Q.~Liu, Y.~Zhu, and P.~Stone.
\newblock Libero: Benchmarking knowledge transfer for lifelong robot learning.
\newblock \emph{Advances in Neural Information Processing Systems}, 36, 2024.
\bibitem[Sanh et~al.(2019)Sanh, Debut, Chaumond, and Wolf]{sanh2019distilbert}
V.~Sanh, L.~Debut, J.~Chaumond, and T.~Wolf.
\newblock Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.
\newblock \emph{arXiv preprint arXiv:1910.01108}, 2019.
\end{thebibliography}