优秀论文

收录 449 篇 2025-2026 年人工智能与机器人领域最新论文,涵盖机器人、世界模型、VLA、无人驾驶、大模型、强化学习等前沿方向。

共 449 篇论文 · 第 1/30 页
Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao新加坡国立大学、清华大学、北京大学、香港大学、浙江大学、香港中文大学、上海交通大学

世界-动作模型(World-Action Models, WAM)从视频生成先验中继承世界知识,并通过具身经验将其转化为可执行的控制信号。然而,现有系统是单体式的:生成骨干、视觉表示、架构、信息流、推理过程和训练数据紧密耦合,掩盖了哪些设计选择重要以及为什么重要。本文引入 OpenWAM,一个开放研究栈,将世界-动作预训练转化为受控实验程序。OpenWAM-Infra 将 WAM 设计空间分解为可组合模块,提供统一的训练、推理、部署和评估。在此基础上,OpenWAM-Study 通过受控实验研究三个问题:继承什么、世界学习与动作学习如何交互、以及它们的协同如何扩展;并提炼出三条原则。基于这些原则构建的 OpenWAM-α 在约 6,400 小时的自我中心人类和机器人数据上预训练,在八个仿真基准和真实机器人实验中展现出持续优异的性能。

World-Action ModelDiffusion PolicyFlow-MatchingModular DesignVideo GenerationEmbodied AI
Andreas Blattmann, ...

Stable Video Diffusion scales latent video diffusion to large datasets.

Octo Model Team

Octo is a generalist robot policy trained on Open X-Embodiment dataset.

Tony Zhao, ...

ACT uses action chunking and transformer backbone for bimanual manipulation.

Cheng Chi, ...

Diffusion Policy uses diffusion models for robot action generation.

Jonathan Ho, Tim Salimans

Classifier-Free Guidance enables conditional generation without a separate classifier.

Maxime Oquab, ...

DINOv2 produces strong visual features that generalize across domains.

William Peebles, Saining Xie

DiT replaces the U-Net backbone in diffusion models with a Transformer, achieving superior performance.

Alonso Capone, ...

DIAMOND introduces a diffusion-based action model for decision making.

Jake Bruce, ...

Genie is a framework for creating generative interactive environments from uncurated online videos.

Xi Chen, ...

UniSim is a universal simulator for robot learning that supports diverse robot morphisms and tasks.

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya JiastarVLA Team

视觉-语言-动作(VLA)模型已成为构建通用机器人智能体的有前景的范式。然而,VLA 领域仍然高度碎片化和复杂:现有方法在架构、训练数据、具身配置和特定基准工程方面差异很大。本文引入 StarVLA-α,一个简单但强大的基线,旨在在受控条件下研究 VLA 设计选择。StarVLA-α 刻意最小化架构和流程复杂性,以减少实验混杂因素并实现系统性分析。具体而言,作者重新评估了几个关键设计轴,包括动作建模策略、机器人特定预训练和接口工程。在 LIBERO、SimplerEnv、RoboTwin 和 RoboCasa 的统一多基准训练下,同一个简单基线仍然具有高度竞争力,表明强大的 VLM 骨干结合最小设计已经足以实现强大性能,而无需依赖额外的架构复杂性或工程技巧。值得注意的是,该单一通用模型在公开的真实世界 RoboChallenge 基准上比 π₀.₅ 高出 20%。

VLAVision-Language-ActionMinimal DesignStrong BaselineQwen3-VLAction ModelingRobot Pretraining
Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng, Kevin Qinghong Lin, Yiqi Lin, Guoqiang Liang, Kevin Yuchen Ma, Qiming Huang, Mike Zheng Shou et al.Show Lab, National University of Singapore2026年1月arXiv preprint

We introduce Show-Harness, demonstrating that a Vision-Language Model agent can directly control robots through demonstration-based interaction. Our approach eliminates the need for specialized robot training by harnessing the general capabilities of VLMs for perception, planning, and action execution.

VLM agentrobot controlharnessplaymanipulation
Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu2026arXiv

语言条件操控需要精确的接触丰富控制与对语言、场景和长程任务的鲁棒推理。端到端VLA模型提供强大的局部视觉运动技能,但在部署扰动下往往性能下降。本文提出 Harness VLA,一种记忆增强的智能体框架,将冻结的VLA暴露为可重试的接触丰富原语,并与少量固定分析原语库组合。该框架无需微调即可将预训练VLA扩展到原始轨迹分布之外。在LIBERO-Pro和RoboCasa365上分别比最强基线提升38.6和25.4个百分点,在RoboTwin C2R上达到58.4%。

VLA视觉语言动作模型机器人操控智能体框架记忆增强冻结模型
...
京ICP备2026064258号-1