本文来源:时代周报
9月2日,字节跳动前强化学习专家、腾讯Robotics X智能体中⼼前负责⼈孙鹏正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。
孙鹏长期深耕强化学习(RL)、智能体(Agent)及多智能体强化学习(MARL),拥有横跨机器人强化学习、大规模分布式 RL 系统与大模型强化学习的研究与产业实践经历。据了解,孙鹏加入星尘智能后,将继续扩充机器人强化学习团队,推动相关技术能力提升和应用部署。
从成立之初,星尘智能就坚持Design for AI,认为机器人身体、数据与AI模型不应被割裂设计。过去几年,这套思路已经逐步形成覆盖基座模型和商用模型、前端共生Agent、强化学习后训练的完整闭环。
星尘智能的基座模型Lumo系列,持续推进机器人对环境与动作的理解、预测和生成,其中Lumo-1让机器人理解动作背后的“为什么”,Lumo-2作为首个家庭隐式世界动作模型,率先引入 Latent World Dynamics,在隐空间中先预测未来世界,再生成动作;前端的Agent Philia,面向长期记忆、任务管理、多机器人协同与自然交互;而强化学习作为基础模型走向规模化真实部署的重要环节,承担了机器人如何从真实环境中的持续交互与任务反馈中学习,并不断优化自身的行为策略的关键命题。