新闻动态

  

设想一下,,, ,,,,你买了一台家庭服务机械人,,, ,,,,但它每次脱离客厅后,,, ,,,,就会健忘沙发在哪里,,, ,,,,只能沉新满屋子乱找。。。。。不足持续利用汗青经验的能力,,, ,,,,是当前很多具身智能面子对的沉要挑战。。。。。

近日,,, ,,,,z6首页 具身智能中心关于 StateLinFormer 的论文被 IROS 2026 接管。。。。。钻研团队通过“状态化训练(Stateful Training)”与线性把稳力机造的结合,,, ,,,,突破固定高低文窗口限度,,, ,,,,大幅提升长时程导航机能与在线环境适应能力。。。。。

  • 论文标题:StateLinFormer: Stateful Training Enhancing Long-term Memory in Navigation
  • 论文链接:https://arxiv.org/abs/2603.23571 

 

1.具身智能体的"健忘" 困境

目前主流的导航系统往往面对两难:

  • 传统建图(如 SLAM):固然可能实现精确定位与地图构建,,, ,,,,但通常依赖显式地图暗示和复杂模???????樯杓,,, ,,,,难以像端到端模型一样通过大规模数据获得强泛化能力。。。。。
  • 基于 Transformer 的端到端模型:靠大规模预训练获得了不错的泛化能力,,, ,,,,却受限于固定的高低文窗口 —— 就像影象力只有几十秒的人,,, ,,,,功夫一长就忘了之前往过哪里,,, ,,,,容易沉复索求,,, ,,,,也没法在持续运行中慢慢熟悉环境。。。。。

     

2.StateLinFormer 的“影象接力”

为了让具身智能体过目不忘,,, ,,,,钻研人员引入了 StateLinFormer 模型。。。。。它的主题黑科技在于:回绝“阅后即焚”的训练方式。。。。。

在传统的序列模型训练中,,, ,,,,模型每学完一幼段数据(Batch),,, ,,,,内部影象就会被清零(Stateless Training),,, ,,,,这就好比你每天上学都把昨天学的知识全忘掉,,, ,,,,始终从零基础起头学新内容。。。。。这样训练出来的模型,,, ,,,,只习惯 "从零起头" 的影象状态,,, ,,,,却从来没学过若何在 "已经堆集了大量汗青信息" 的状态下做决策。。。。。比及真实部署时,,, ,,,,智能体必要陆续运行几幼时甚至更久,,, ,,,,训练和推理的场景齐全错位,,, ,,,,影象能力天然阐扬不出来。。。。。

StateLinFormer 创新性地选取了状态化训练(Stateful Training):模型在训练时保留了上一段数据的影象状态,,, ,,,,并直接传递给下一段。。。。。这让具身智能体在训练过程中持续经历长功夫运行所产生的影象状态,,, ,,,,而不是每隔几分钟就被强杏装洗脑”一次。。。。。共同线性把稳力机造恒定的影象大幼,,, ,,,,突破了长序列的推算瓶颈。。。。。

 

3.主题亮点

  1. 无限续航的长时影象:将模型训练与现实部署时的陆续性对齐,,, ,,,,赋予了线性模型真正的长时影象能力。。。。。
  2. 涌现的“高低文进建(ICL)”能力:尝试发现了一个惊艳的景象——随着具身智能体在统一环境中不休执行工作,,, ,,,,其后续工作成功率显著提升!无需更新任何参数,,, ,,,,纯靠堆集的经验就能进行在线环境适应。。。。。
  3. 全新陆续导航基准(CON):提出了 Continual Object Navigation 测试,,, ,,,,专门考验具身智能体在统一个环境中持续接管新工作、复用汗青经验的能力,,, ,,,,切近真实的“平生进建”场景。。。。。

 

4.尝试阐发

在基础的 MAZE 迷宫和高度真切的 ProcTHOR 3D 室内环境中,,, ,,,,StateLinFormer 的阐发都极为亮眼:

  • 在一样的 2 亿参数量下,,, ,,,,全面超过了每次都清空影象的传统线性模型。。。。。
  • 对迸椎有 4000 万数据预训练的壮大 SPOC 架构模型,,, ,,,,仅用 1000 万数据训练的 StateLinFormer 依然实现了成功率的反超,,, ,,,,且达到指标所需的均匀步数更短!

影象状态更不变:钻研还发现,,, ,,,,有状态训练下的模型影象状态颠簸更幼,,, ,,,,相对尺度差更低。。。。。这注明模型的影象动力学更趋近于不变的稳态散布,,, ,,,,而非无状态训练下那种从零起头又急剧消散的瞬态影象。。。。。

图1 高低文进建能力更好;;;;;;图2 导航成功率更高;;;;;;图3 影象状态更不变

 

5.不止导航:为具身智能的持久影象打开新思路

从前我们总在架构上设法子扩大影象,,, ,,,,却忽略了训练时的影象陆续性。。。。。而 StateLinFormer 证明,,, ,,,,只有让影象在训练中真正 "流动" 起来,,, ,,,,模型就能天然天生长时程适应能力,,, ,,,,甚至涌现出更强的高低文进建能力。。。。。对于将来的具身智能而言,,, ,,,,无论是家庭服务机械人、工业巡检机械人,,, ,,,,还是持久运行的智能体,,, ,,,,都必要在统一个环境中持续工作、不休堆集经验。。。。。有状态训练的思路,,, ,,,,刚好为这类真实场景落地提供了关键的技术支持。。。。。

StateLinFormer 的价值,,, ,,,,远不止于提升导航工作的指标,,, ,,,,也带来了更宽泛的启发:要让智能体占有持久影象,,, ,,,,不定肯定要堆更大的模型、更长的高低文窗口,,, ,,,,优化训练范式、让训练对齐真实部署的陆续场景,,, ,,,,同样是一条高效的蹊径。。。。。

 

6.作者简介

第一作者

  • 陈致远:z6首页(z6首页)高级工程师,,, ,,,,曾任百度高级研发工程师。。。。。持久从事人为智能与交叉学科钻延祝。。。。重要钻研方向蕴含In-Context Learning、World Model以及AI for Science。。。。。其有关钻研成就已屡次颁发于国际驰名会议及期刊,,, ,,,,并持有十余项国内表主题专利。。。。。
  • 钟雨轩:z6首页助理工程师,,, ,,,,重要钻研方向蕴含具身VLA模型、In-Context Learning以及World Model等。。。。。

通讯作者

  • 王凡:z6首页具身智能中心钻研员,,, ,,,,王凡博士曾任百度卓越架构师,,, ,,,,重要钻研领域和钻研兴致蕴含端到端机械人模型,,, ,,,,天然说话大模型,,, ,,,,AI for Science等。。。。。王凡在Nature Machine Intelligence等顶刊和顶会上颁发超过30篇Paper,,, ,,,,在天生式大说话模型,,, ,,,,生物分子表征大模型,,, ,,,,Human-In-The-Loop强化进建,,, ,,,,元进建等领域颁发过大量前沿论文,,, ,,,,并获得蕴含吴文俊人为智能科技进取奖特等奖等荣誉。。。。。
  • 刘少山:z6首页具身智能中心主任,,, ,,,,ACM科技政策委员会成员、IEEE国际设备和系统路线图(IRDS)机械人推算方向主席。。。。。钻研方向为具身智能、推算系统、科技政策。。。。。

主题团队:俞波(z6首页钻研员)、邵鹏韬(z6首页工程师)、丁宁(z6首页常务副院长)