EZ.AI Daily
每日 AI 新闻与论文精选
VPP2:让机器人精准预测并行动
正在播放 1/10
0:000:00
2026年10月8日
在机器人领域,世界动作模型(WAMs)正成为通用机器人策略的重要类别,其核心目标是将视频预测的先验知识迁移到动作学习中。然而,研究人员发现,现有的WAMs在开放环境中经常产生错误的运动预测,进而导致错误的动作执行。这一局限性主要归因于两个因素:首先,基础视频模型并未针对操作任务进行优化;其次,将动作组件简单地融入视频模型中,会显著降低其泛化能力。为了解决这些问题,研究团队推出了Video Prediction Policy 2(VPP2),这是一种能够在视频预测和动作生成方面实现强大零样本泛化的WAM。VPP2的创新之处在于其独特的训练策略。首先,研究团队精心构建了一个大规模、多样化的操作视频数据集,用于继续预训练基础视频基础模型。他们为视频片段添加了详细的字幕,并执行了事件级别的视频预训练,以促进在开放式操作任务中的泛化能力。其次,他们对视频模型进行后训练和蒸馏,将其转化为具有固定预测时域的单步视觉规划器。最后,通过引入混合Transformer(MoT)架构的动作模块,VPP2学习了隐式逆动力学模型。实验结果展示了VPP2的卓越性能。在开放式任务的视频预测指令遵循成功率方面,VPP2-14B比Cosmos3-64B高出11.0个百分点。在真实世界的零样本ALOHA操作任务中,VPP2的成功率比最强基线高出18.5个百分点。此外,经过针对特定基准的后训练,VPP2在具有挑战性的LIBERO-Pro、LIBERO-OOD和RoboDojo基准测试中,取得了评估方法中最高的成功率。这些结果表明,通过优化视频预测和动作生成的结合方式,VPP2不仅提升了机器人的预测准确性,还显著增强了其在复杂环境中的实际操作能力。这一进展为机器人技术的进一步发展提供了新的方向,展示了视频预测与动作学习深度融合的巨大潜力。
2026年10月8日
在人工智能领域,训练一个能够自主完成复杂编程任务的智能体(Coding-Agent)往往需要耗费巨大的计算资源。然而,并非所有基础模型(Base Model)都具备成为优秀智能体的潜力。如何在不进行昂贵后训练(Post-Training)的情况下,提前预测哪些基础检查点(Checkpoint)值得投入资源?这正是研究团队在《Before They Can Solve》一文中试图解决的核心问题。
传统的评估方法存在明显的局限性。端到端的 pass@$K$ 测试虽然能验证模型是否具备成功行为,但对于智能体编码任务而言并不适用。许多基础模型无法可靠地生成格式正确的工具调用指令,导致它们在任务初期就陷入失败,根本无法完成端到端的流程。另一方面,单步或短周期任务虽然通过固定提示词和单次补丁避免了工具调用失败,但它们回避了智能体编码的核心能力:在仓库不断演化的过程中,维持多步骤交互中的一致性状态。
为了填补这一空白,研究人员提出了一种新颖的方法:将成功训练后的智能体轨迹视为基础模型潜力的“前瞻信号”。具体而言,他们重放每条成功的轨迹,并在每个代码修改步骤后重新运行测试,以识别“决定性步骤”。所谓决定性步骤,是指累积补丁首次使仓库从测试失败转变为通过的那一步。这一步骤证明了在给定先前上下文的情况下,记录的动作确实解决了任务。
基于对智能体轨迹覆盖原则的动机,研究团队构建了三个无需基础检查点从冷启动驱动测试框架的筛选器(Screens):
第一,决定性动作 BPB(Decisive-Action BPB,每字节比特数)。它衡量基础模型对已认证动作的概率质量,即模型在特定上下文中生成该关键动作的可能性。
第二,补丁多选测试(Patch MCQ)。该测试要求检查点在已认证动作与被同一验证器拒绝的替代方案之间做出选择,从而评估模型对正确路径的辨别能力。
第三,前缀条件 pass@$K$(Prefix-conditioned pass@$K$)。它评估模型对功能正确生成的支持度,只要测试接受任何延续,即给予信用,从而更灵活地衡量模型在特定前缀下的表现。
在十个公开的基础模型与后训练模型配对中,这三种筛选器的排名与后训练模型在 SWE-bench Verified 基准上的 pass@$1$ 表现高度一致。这一结果验证了该方法的有效性。
这项研究的深远意义在于,它仅需基准测试的成功轨迹和验证器即可实施。这意味着未来的智能体编码基准测试可以被转化为基础模型评估工具,极大地降低了筛选潜在优秀智能体候选者的成本。在算力日益成为稀缺资源的今天,这种“先预测,后训练”的策略不仅提高了研发效率,也为智能体架构的优化提供了新的视角。或许,真正的智能并非完全诞生于训练之后,而是早已潜伏在基础模型的分布之中,只待被正确的信号唤醒。
2026年10月8日
在机器人技术的广阔版图中,仿真环境一直是低成本获取海量训练数据的利器。然而,一个长期困扰研究者的难题始终横亘在虚拟与现实之间:在仿真中训练得再完美的策略,一旦部署到真实世界,往往因为视觉上的巨大差异而频频失效。这种“视觉仿真到现实”的差距,如同一道无形的墙,阻碍了机器人技术的真正落地。现有的解决方案大多依赖中间表示,但这往往会导致丰富的语义信息丢失,或者在部署阶段需要额外的感知模块,增加了系统的复杂性。为了打破这一僵局,研究团队提出了名为RoboRender的全新框架,旨在通过生成逼真的视频来弥合这一视觉鸿沟。
RoboRender的核心创新在于其机器人导向的视频生成模型。该模型并非凭空创造,而是以仿真深度视频、语言指令以及机器人RGB掩码视频为条件进行训练。这一设计巧妙地保留了仿真器中的几何结构、机器人运动轨迹以及动作标签,同时合成了逼真的纹理、背景以及可能干扰机器人判断的干扰物。换句话说,RoboRender将原本枯燥的仿真轨迹转化为了具有照片级真实感的RGB视频,既保留了物理逻辑的准确性,又赋予了视觉上的真实感。这些生成的RGB视频随后与仿真器提供的状态和动作配对,用于训练策略,最终实现零样本的真实世界部署。
在机器人视频测试集上的表现证明了这一方法的有效性。RoboRender的视频模型在生成质量上超越了基于深度条件的视频生成基线模型。更令人振奋的是真实世界实验的结果。在涵盖抓取放置、铰接物体操作以及移动操作等多种任务中,基于RoboRender生成数据训练的策略取得了71%的平均成功率。这一成绩不仅显著优于原始仿真渲染,更比传统的视觉域随机化方法高出约3.6倍,甚至达到了原始仿真渲染效果的7.1倍。这一巨大的性能飞跃表明,生成式视频渲染在缓解视觉仿真到现实差距方面具有强大的潜力。
此外,研究还揭示了一个有趣的趋势:策略性能会随着每条仿真轨迹生成的视频数量增加而提升。例如,在开门任务中,增加生成视频的数量使得成功率提升了65个百分点。这意味着,通过生成更多样化的视觉数据,可以进一步丰富策略的鲁棒性,使其在面对真实世界的复杂变化时更加从容。
RoboRender的出现,不仅为机器人视觉策略训练提供了一条新路径,更展示了生成式AI在解决物理世界难题中的巨大价值。当虚拟的像素能够精准映射现实的纹理,机器人或许真的能像人类一样,无缝地穿梭于数字与物理世界之间。这不仅是技术的进步,更是对“虚实融合”这一终极愿景的深刻回应。
2026年10月8日
在具身智能的探索之旅中,人类第一视角的交互数据正成为物理监督的关键源泉。然而,传统的视频数据虽然丰富,却遗漏了物理交互中至关重要的接触与压力信息。尽管近期的视触数据集填补了这一空白,但其同步触觉数据的规模远小于人类视频数据,且现有资源往往混合了不同传感器或标注流程的记录,导致难以孤立评估数据规模带来的实际效果。为了解决这一难题,研究人员推出了TouchScale,一个包含500小时富含接触信息的人类交互数据集。该数据集采用单一统一的穿戴式设置进行记录,涵盖了约2000个预定义的任务描述,既包括日常活动,也涉及结构化操作。每条记录都将第一视角RGB-D视频、手腕RGB视频以及密集的全手双手触觉测量在时间上进行了精确对齐。
TouchScale的引入带来了显著的性能提升。与以往的触觉数据相比,在完整的TouchScale上进行训练,使得在未见过的触觉传感器数据上的零样本接触IoU从0.134大幅提升至0.383。此外,在TouchScale上预训练视觉编码器,在三个基准测试中取得了相比其他视触数据集最高的动作识别准确率。更令人振奋的是,当TouchScale被用于机器人策略的视触中期训练时,在四个富含接触的操作任务中,真实世界的平均成功率从22.5%跃升至57.5%。由于传感器和采集协议保持不变,随着TouchScale数据量的增加,零样本触觉预测和机器人成功率均呈现出整体上升趋势。这些结果有力地表明,以一致传感方式大规模收集的人类视触数据,能够同时惠及感知和机器人操作领域。研究人员计划公开释放TouchScale,包括所有同步的视触记录和重建的物体模型,以支持未来关于可扩展视触学习的研究。这一举措不仅为学术界提供了宝贵的资源,也为具身智能的发展指明了方向,证明了数据规模与一致性在提升机器人物理交互能力中的核心价值。
2026年10月8日
在视频生成领域,如何平衡模型效率与生成质量始终是一个核心挑战。传统的视频扩散模型依赖于自编码器将视频压缩为潜在表示,而高度压缩的自编码器虽然能显著减少计算量,却往往带来重建质量下降和模型收敛困难的问题。更棘手的是,压缩后的潜在空间分布往往与预训练扩散Transformer(DiT)所学习的分布不一致,导致预训练模型需要高昂成本进行重新训练或适配。
为了解决这一痛点,研究团队提出了名为GRACE(Generation-Aware Latent Compression for Efficient Video Generation)的两阶段框架。GRACE的核心创新在于“生成感知的潜在压缩”,它旨在压缩预训练视频自编码器的同时,保持其与预训练DiT的兼容性。具体而言,该框架保留了一个来自预训练编码器的冻结基础潜在表示,并学习一个残差潜在表示来补偿强压缩下丢失的信息。关键在于,GRACE在冻结DiT的特征空间中对压缩潜在表示与预训练潜在表示进行对齐,从而确保自编码器是面向生成任务而非单纯的重建任务进行优化的。
在适配阶段,GRACE采用轻量级微调和非对称去噪策略,其中基础潜在表示优先于残差潜在表示进行去噪。这种设计不仅降低了计算负担,还有效维持了生成质量。实验数据显示,GRACE在Wan2.1-I2V-14B模型上实现了显著的性能提升:在480x832x81分辨率下,Token数量减少了8倍,延迟降低了11.1倍,同时在VBench基准测试中,其生成质量与压缩前的预训练流水线保持一致。
这一成果表明,通过精心设计的潜在空间对齐和分阶段去噪策略,我们可以在不牺牲生成质量的前提下,极大提升视频生成的效率。GRACE为高效视频生成提供了一条新路径,证明了在保持模型兼容性的同时实现深度压缩是可行的。随着视频生成技术的普及,如何在有限算力下实现高质量、低延迟的实时生成,将成为未来研究的重要方向。GRACE的出现,或许正是这一方向上的关键一步,它提醒我们,效率与质量并非不可兼得,关键在于找到正确的平衡点。
2026年10月8日
随着通用智能体在数字领域展现出编写代码、使用工具及完成复杂任务的能力,一个核心问题随之浮现:这些能力能否顺利迁移至物理世界?为探究这一命题,研究团队推出了名为RobotWorld的高难度模拟测试平台。该平台旨在评估智能体如何通过机器人接口,将指令与观测转化为实际的物理任务执行。RobotWorld涵盖了84项任务,广泛涉及操作、移动操作、运动控制、驾驶及空中控制等多个维度,并设定了明确的交互预算和可执行的成功检查标准。通过对任务结果与执行轨迹的深入分析,研究者不仅识别了哪些能力可以成功迁移,更揭示了阻碍可靠完成任务的关键差距。研究发现,当前智能体能够构建复杂的感知与控制工作流,包括图像分割、相机校准、空间估计以及基于动力学的计算。然而,这些能力并未一致地组合成成功的行为模式。智能体在到达指定姿态后往往会丢失与任务相关的物体状态,无法纠正无效动作,恢复时机过晚,甚至将未完成的任务误判为已完成。这种不均衡的能力迁移在不同模型间表现各异:Astra在空间及受限接触目标上成功率更高,而Opus 5.5则在连续平衡及定时交互目标上表现更优。通过将结果与执行行为相关联,RobotWorld不仅提供了一个严格的验证场,更从实证角度阐述了剩余的能力差距,从而为训练和设计更可靠的物理世界智能体确立了具体目标。这一研究揭示了数字智能向物理实体跨越时的复杂性与局限性,提醒我们尽管算法在虚拟环境中表现优异,但在真实物理世界的交互中,状态保持、错误纠正及任务完整性判断仍是亟待突破的技术瓶颈。
2026年10月8日
在人工智能领域,一场关于“最优解”的博弈正在悄然改变格局。埃隆·马斯克近日宣布,SpaceX旗下的Grok Bot智能体平台将不再固守自家模型,而是正式向竞争对手开放路由权限。这意味着,当用户向Grok Bot下达任务时,系统可能会将请求发送给Anthropic的Claude模型,甚至是图像生成领域的佼佼者Midjourney。马斯克对此的解释简单而直接:平台将路由至“最有可能给出最佳结果”的模型。这一举动打破了以往AI助手通常只依赖单一自家模型的传统,标志着xAI在战略上的一次重大转向。
具体而言,对于处理简单、低负载的查询,Grok Bot仍将使用即将发布的“闪电般快速”的Grok 4.8版本,以确保响应速度。然而,面对复杂或特定领域的任务,系统将智能地调用第三方模型及“领先的API”。这一策略不仅提升了用户体验,更在商业层面产生了一个有趣的反转:xAI实际上成为了Anthropic的客户。颇具讽刺意味的是,Anthropic自春季以来一直通过xAI的Colossus 1数据中心租用算力,如今双方形成了双向依赖的微妙关系。
这一变革发生在竞争白热化的背景下。Grok Bot于八月推出,定位为拥有独立计算机的24/7全天候助手。然而,OpenAI的dots和Meta的Muse等 rival 智能体正迅速崛起,构成了强有力的挑战。OpenAI的dots凭借GPT-6 Astra模型吸引了大量用户,而Meta的Muse也在个人助手领域占据一席之地。面对这些强劲的对手,马斯克此前在让Grok成为前沿竞争者方面投入了巨额资金,但此次允许Claude进入Grok Bot,被外界视为一种近乎“让步”的战略调整。
分析认为,引入排名靠前的Opus 5.5模型,将有助于Grok Bot从个人智能体竞争对手那里分流用户。通过整合业界最强的模型能力,Grok Bot试图在保持自身品牌特色的同时,提供超越单一模型局限的综合服务。这种“混合路由”策略不仅是对技术实力的自信,也是对市场现实的务实回应。在AI助手日益同质化的今天,谁能提供真正“最好”的结果,谁就能赢得用户的青睐。马斯克的这一决策,或许预示着未来AI竞争的核心不再是单一模型的参数比拼,而是生态整合与智能调度的能力。当边界被打破,真正的赢家将是那些能够灵活组合资源、为用户创造最大价值的平台。
2026年10月8日
在人工智能刚刚攻克数学难题的余温未散之际,科技巨头们已将目光投向了下一个更宏大、也更充满人文关怀的领域:生命科学。马克·扎克伯格与普莉希拉·陈创立的非营利科学组织Biohub,正联手美国国家卫生研究院(NIH)、谷歌DeepMind以及Meta,将原本5亿美元的“虚拟生物学计划”大幅扩展至18亿美元。这一巨额投资旨在收集足够规模的数据,训练出能够模拟人体细胞反应的AI模型。
这项被称为“通用虚拟细胞”的终极目标,听起来像科幻小说,但其核心逻辑却极具现实意义。Biohub希望开发出一款AI软件,能够在实验室测试之前,精准预测细胞对药物或其他环境变化的反应。如果这一愿景成真,新药研发和疾病治疗的周期将被彻底颠覆,科学家无需再依赖漫长且昂贵的试错过程,而是通过计算模拟来筛选最佳方案。
为了实现这一“登月计划”,各方资源正在以前所未有的速度汇聚。美国国家卫生研究院将共享过去500多亿美元联邦支出所积累的宝贵数据集;美国能源部承诺在未来五年内投入超过500亿美元;而谷歌DeepMind、Meta以及制药初创公司Isomorphic Labs则共同注资3亿美元。值得注意的是,这些参与方约定在数据发布前保持一年的保密期,以确保竞争优势和研发节奏。
然而,挑战依然巨大。Biohub科学负责人Alex Rives指出,要构建真正准确的细胞模型,所需的数据量是天文数字般的“万亿”级别,而目前全球最大规模的数据集仅包含数亿个细胞的数据。这意味着现有的数据基础还远远不够,需要海量的新数据来填补空白。
为什么生物学会成为AI的下一个前沿?当公众对AI在娱乐、办公等领域的渗透逐渐习以为常时,一个旨在“治愈或预防所有疾病”的项目,无疑更容易获得大众的共鸣与支持。这不再仅仅是关于代码和算法的竞争,而是一场关于人类健康与生存质量的科技豪赌。从数学到生物学,AI的边界正在不断拓展,而这一次,它试图触碰的是生命最核心的密码。当硅基智能开始理解碳基生命,我们或许正站在医学史上一个全新纪元的门槛上。
2026年10月8日
在自回归视频生成的前沿探索中,研究者们发现了一个长期困扰领域的核心矛盾:模型在“去噪当前帧”与“为未来预测写入上下文”这两个关键角色上,往往被迫共享同一套参数。这种看似高效的架构设计,实则隐藏着深层的优化障碍。研究发现,这两种角色产生的梯度呈现出截然不同的模式,并存在系统性的负向对齐。这种冲突直接阻碍了视觉质量与时间一致性的联合优化,导致生成的视频往往难以兼顾画面的精美与长时序的连贯。
为了解决这一痛点,研究团队提出了名为SGF+(Self Gradient Forcing Plus)的新方法。其核心创新在于“解耦”:将上下文写入与去噪过程分配给独立的参数集,同时通过因果注意力机制保留两者之间的必要交互。这一设计巧妙地避免了参数共享带来的梯度冲突,使得两个角色可以在原始生成目标下进行联合优化,无需引入任何辅助损失函数。其中,上下文写入的监督信号直接来源于其对未来预测的贡献,形成了一种自然且高效的闭环。
实验结果令人振奋。这种看似简单的架构调整,在逐帧生成和块状生成两种模式下,均显著提升了视觉质量和长程一致性,超越了所有评估的基线模型。更令人惊叹的是,SGF+并未依赖额外的视频训练数据或更长的训练周期。仅使用5秒的滚动训练数据,该模型便支持长达24小时的连续视频生成,且无需针对长视频进行微调。这一成果不仅证明了角色特定参数化是高质量自回归视频生成的有效设计原则,更为原生长程外推提供了全新的技术路径。当算法学会将“记忆”与“创造”分开处理,时间的边界便不再是由数据长度决定,而是由架构的智慧所拓展。
2026年10月8日
在人工智能与机器人学的交叉领域,潜在世界模型(Latent World Models)一直被视为赋予机器预测未来状态和进行真实世界规划的关键技术。然而,长期以来,该领域面临一个核心痛点:我们缺乏一种原则性的方法来评估这些模型的能力如何随着模型规模、数据量和计算资源的增加而扩展。这一未解之谜不仅阻碍了研究的深入,也让开发者难以准确预测模型在更大规模下的表现。
为了解决这一难题,研究团队推出了 RoboJEPA。这是一个基于联合嵌入预测架构(JEPA)构建的世界模型,其训练数据涵盖了12种不同的机器人形态(robotic embodiments),旨在通过大规模、多样化的真实机器人数据来探索通用性。RoboJEPA 拥有80亿(8B)参数,据称是目前为止训练过的最大规模的 JEPA 预测模型。
这项研究最引人注目的发现在于确立了“规模定律”(Scaling Laws)。研究人员发现,RoboJEPA 的“想象误差”(imagination error,即潜在滚动过程中的误差)与计算量之间遵循二阶幂律关系。这意味着,一旦确定了这一规律,研究人员就可以准确预测远超当前拟合规模的模型质量。这种可预测性为未来开发更大、更强大的机器人世界模型提供了坚实的理论基础和工程指南。
除了理论上的突破,RoboJEPA 在下游任务中也展现了卓越的性能。研究表明,随着计算量的增加,下游机器人规划性能呈现出可预测的提升。更重要的是,研究发现“想象误差”与实际的机器人规划性能之间存在强相关性。这一发现具有巨大的实用价值:它意味着“想象误差”可以作为一个可靠的代理指标(proxy),用于替代耗时且昂贵的真实机器人评估。开发者无需每次都让机器人在物理世界中反复试错,只需通过监测模拟环境中的想象误差,即可推断其在真实硬件上的表现。
此外,研究还展示了潜在世界模型的零样本(zero-shot)部署能力。RoboJEPA 能够直接作为机器人智能体部署,通过规划朝向单一目标图像的路径,解决需要长时程规划(long-horizon planning)的复杂任务。这种能力表明,经过大规模预训练的世界模型具备强大的泛化能力,无需针对特定任务进行额外微调即可在真实硬件上执行复杂操作。
为了促进社区的进一步研究,研究团队公开了所有的模型检查点以及训练和机器人部署代码。这是首个在真实机器人数据上训练的多形态机器人世界模型确立规模定律的工作。RoboJEPA 的出现不仅填补了该领域的理论空白,更为构建能够自主理解、预测和规划复杂物理世界的下一代机器人系统铺平了道路。当算法的误差变得可预测,机器人的进化便不再是一场盲目的赌博,而是一次有迹可循的攀登。