Pi 0.7: Improved Foundation Policy Model for Generalist Robots
摘要
Pi 0.7 is an improved version of the Pi foundation policy model, featuring enhanced generalization across robot embodiments and tasks through larger-scale pre-training and improved architecture.
技术细节
Pi-0.7
论文解读
Physical Intelligence 发布 π0.7:首个具备组合泛化能力的通用机器人基础模型
一、核心突破:从专用到通用的范式转变
π0.7 代表了机器人基础模型的一个重要里程碑。与之前的模型不同,π0.7 展现出了真正的通用能力:
核心能力
- 通用性能:能够以与微调专用模型相同的性能执行广泛的灵巧任务
- 语言理解:能够遵循新的语言指令,执行训练数据中从未见过的任务
- 组合泛化:能够重新组合来自各种任务的技能来解决新问题
- 跨平台迁移:能够跨机器人平台、场景和任务进行有效泛化
二、组合泛化:机器人基础模型的关键能力
泛化一直被认为是机器人基础模型的关键优势,但迄今为止实际展示的模型尚未展现出像大语言模型那样的广泛组合泛化能力。大语言模型能够以新的方式组合训练数据中的概念:如果大语言模型知道如何将英语翻译成法语,并且知道如何生成 JSON 输出,它就可以提供 JSON 格式的翻译。VLA(视觉-语言-动作)模型能够理解多样化的语义概念,但尚未被证明能够以新的方式组合技能,例如使用新工具或新厨房设备。
即使是训练中出现过的技能,通常也需要通过微调来获得最佳结果,就像早期语言模型需要针对特定问题领域进行微调一样。真正的通用模型应该能够开箱即用地执行所有技能,并能够重新组合它们来解决新任务。π0.7 展示了这种通用能力的初步迹象:
- 能够执行灵巧操作技能,具有与之前通过强化学习微调的 π*0.6 专用模型相同的速度和鲁棒性
- 能够组合和重新组合学到的技能来解决新任务
- 能够比之前的模型更有效地跨机器人平台、场景和任务进行泛化
三、多样化数据:泛化的关键
基础模型泛化的关键在于使用广泛而多样的数据。在 π0.7 的案例中,这包括来自许多不同机器人的数据、人类数据,甚至通过运行各种策略收集的自主情节数据。然而,简单地合并所有这些数据来源并不会带来好的结果。
数据来源
- 来自多种不同机器人的数据
- 人类演示数据
- 通过运行各种策略收集的自主情节数据
四、多模态提示:实现组合泛化的关键技术
研究发现,使用所有这些数据来源实现组合泛化的关键在于向提示中添加多样化的上下文:训练模型时使用多种多模态提示结构,不仅指定机器人应该做什么,还指定它应该如何做。提示不仅可以包含任务的文本描述,还可以包含各种其他注释和模态。
提示模态
- 文本描述:任务的自然语言描述
- 视觉子目标:定义精确的物体空间布局
- 情节长度:指定任务完成的速度
- 其他注释:消歧行为的多样化信息
例如,为模型提供视觉子目标可以定义精确的物体空间布局。提供期望的情节长度可以指定任务完成的速度。关键的是,所有这些信息都可以消歧行为,使得具有不同策略、行为和熟练程度的多样化数据可以包含在训练中。在测试时,模型接受标准提示。
五、实验结果:开箱即用的通用能力
以下示例展示了 π0.7 的能力广度,从精细操作到长程家庭行为,所有这些都使用一个模型,开箱即用:
六、技术意义与未来展望
π0.7 的发布标志着机器人基础模型从"专用微调"向"通用泛化"的重要转变。这一突破具有以下技术意义:
- 验证了组合泛化的可行性:证明了机器人基础模型可以像大语言模型一样实现组合泛化
- 提出了多模态提示方法:通过多样化上下文实现组合泛化的关键技术
- 展示了通用模型的潜力:一个模型可以替代多个专用模型,降低部署成本
- 为未来研究指明方向:组合泛化是机器人基础模型的关键能力
未来,研究团队计划继续扩展 π0.7 的能力,包括更多样的任务、更复杂的场景、以及更强的组合泛化能力。这一研究方向有望推动机器人技术从"专用工具"向"通用助手"的转变。
引用信息
BibTeX:
@article{pi07_2026,
title={π0.7: a Steerable Model with Emergent Capabilities},
author={Bo Ai and Ali Amin and Raichelle Aniceto and Ashwin Balakrishna and Greg Balke and Kevin Black and George Bokovsky and Shihao Cao and Thomas Charbonnier and Vedant Choudhary and Foster Collins and Ken Conley and Grace Connors and James Darpinian and Karan Dhabalia and Maitrayee Dhaka and Jared DiCarlo and Danny Driess and Michael Equi and Adnan Esmail and Yunhao Fang and Chelsea Finn and Catherine Glossop and Thomas Godden and Ivan Goryachev and Lachlan Groom and Haroun Habeeb and Hunter Hancock and Karol Hausman and Gashon Hussein and Victor Hwang and Brian Ichter and Connor Jacobsen and Szymon Jakubczak and Rowan Jen and Tim Jones and Gregg Kammerer and Ben Katz and Liyiming Ke and Mairbek Khadikov and Chandra Kuchi and Marinda Lamb and Devin LeBlanc and Brendon LeCount and Sergey Levine and Xinyu Li and Adrian Li-Bell and Vladislav Lialin and Zhonglin Liang and Wallace Lim and Yao Lu and Enyu Luo and Vishnu Mano and Nandan Marwaha and Aikys Mongush and Liam Murphy and Suraj Nair and Tyler Patterson and Karl Pertsch and Allen Z. Ren and Gavin Schelske and Charvi Sharma and Baifeng Shi and Lucy Xiaoyang Shi and Laura Smith and Jost Tobias Springenberg and Kyle Stachowicz and Will Stoeckle and Jiaming Tang and Jimmy Tanner and Shalom Tekeste and Marcel Torne and Kyle Vedder and Quan Vuong and Anna Walling and Haohuan Wang and Jason Wang and XuDong Wang and Chris Whalen and Samuel Whitmore and Blake Williams and Charles Xu and Sukwon Yoo and Lili Yu and Wuming Zhang and Zhuoyang Zhang and Ury Zhilinsky},
journal={Physical Intelligence Technical Report},
year={2026},
month={April},
url={https://physicalintelligence.company/blog/pi07}
}
版权声明:本报告中的图片演绎自原论文,版权归原作者及机构所有。本报告仅用于学术解读和技术交流,如有侵权请联系删除。