优秀论文
收录 449 篇 2025-2026 年人工智能与机器人领域最新论文,涵盖机器人、世界模型、VLA、无人驾驶、大模型、强化学习等前沿方向。
世界-动作模型(World-Action Models, WAM)从视频生成先验中继承世界知识,并通过具身经验将其转化为可执行的控制信号。然而,现有系统是单体式的:生成骨干、视觉表示、架构、信息流、推理过程和训练数据紧密耦合,掩盖了哪些设计选择重要以及为什么重要。本文引入 OpenWAM,一个开放研究栈,将世界-动作预训练转化为受控实验程序。OpenWAM-Infra 将 WAM 设计空间分解为可组合模块,提供统一的训练、推理、部署和评估。在此基础上,OpenWAM-Study 通过受控实验研究三个问题:继承什么、世界学习与动作学习如何交互、以及它们的协同如何扩展;并提炼出三条原则。基于这些原则构建的 OpenWAM-α 在约 6,400 小时的自我中心人类和机器人数据上预训练,在八个仿真基准和真实机器人实验中展现出持续优异的性能。
Stable Video Diffusion scales latent video diffusion to large datasets.
Octo is a generalist robot policy trained on Open X-Embodiment dataset.
ACT uses action chunking and transformer backbone for bimanual manipulation.
Diffusion Policy uses diffusion models for robot action generation.
Classifier-Free Guidance enables conditional generation without a separate classifier.
DINOv2 produces strong visual features that generalize across domains.
DiT replaces the U-Net backbone in diffusion models with a Transformer, achieving superior performance.
DIAMOND introduces a diffusion-based action model for decision making.
Genie is a framework for creating generative interactive environments from uncurated online videos.
UniSim is a universal simulator for robot learning that supports diverse robot morphisms and tasks.
视觉-语言-动作(VLA)模型已成为构建通用机器人智能体的有前景的范式。然而,VLA 领域仍然高度碎片化和复杂:现有方法在架构、训练数据、具身配置和特定基准工程方面差异很大。本文引入 StarVLA-α,一个简单但强大的基线,旨在在受控条件下研究 VLA 设计选择。StarVLA-α 刻意最小化架构和流程复杂性,以减少实验混杂因素并实现系统性分析。具体而言,作者重新评估了几个关键设计轴,包括动作建模策略、机器人特定预训练和接口工程。在 LIBERO、SimplerEnv、RoboTwin 和 RoboCasa 的统一多基准训练下,同一个简单基线仍然具有高度竞争力,表明强大的 VLM 骨干结合最小设计已经足以实现强大性能,而无需依赖额外的架构复杂性或工程技巧。值得注意的是,该单一通用模型在公开的真实世界 RoboChallenge 基准上比 π₀.₅ 高出 20%。
We introduce Show-Harness, demonstrating that a Vision-Language Model agent can directly control robots through demonstration-based interaction. Our approach eliminates the need for specialized robot training by harnessing the general capabilities of VLMs for perception, planning, and action execution.
语言条件操控需要精确的接触丰富控制与对语言、场景和长程任务的鲁棒推理。端到端VLA模型提供强大的局部视觉运动技能,但在部署扰动下往往性能下降。本文提出 Harness VLA,一种记忆增强的智能体框架,将冻结的VLA暴露为可重试的接触丰富原语,并与少量固定分析原语库组合。该框架无需微调即可将预训练VLA扩展到原始轨迹分布之外。在LIBERO-Pro和RoboCasa365上分别比最强基线提升38.6和25.4个百分点,在RoboTwin C2R上达到58.4%。