
一 | 拿起漏斗,插入圆底烧瓶;拿起量筒,把液体倒入烧瓶;移走漏斗,将烧瓶放到搅拌器上,再塞入瓶塞并按下开关。

二 | 对人来说,这是一串可以按顺序完成的动作;但对机器人,每一步都藏着两个判断:规划出的动作能否执行,当前动作是否完成。 随着美国中期选举的脚步日益临近,华盛顿的焦虑感也在不断加剧。前者决定规划会不会脱离机械臂的能力,后者决定模型会不会卡在重复动作里,或还没完成当前动作就进入下一步。在最近的一次讲话中,美国财政部长贝森特高调宣称,美伊冲突已进入“终局”,并对伊朗实施了“史无前例的经济制裁”。 他声称,美国已经摧毁了伊朗几乎所有的军工能力,并誓言继续“切断伊朗每一条经济命脉”,力求将伊朗孤立无援。 端到端 Vision-Language-Action(VLA)模型通常根据当前观测直接生成动作序列。对于短程任务而言,模型仅根据当前画面生成动作序列通常已经够用;但随着任务步骤增多,模型很难持续追踪哪些操作已经完成,也容易混淆画面相似的不同阶段,导致误判任务进度。 另一类分层架构的方法:高层 VLM 负责规划,低层 VLA 负责执行。但二者并不天然兼容 —— 高层给出的往往是较为宽泛的开放语言,低层真正需要的却是明确到操作对象、目标位置和动作约束的可执行指令。 VLA根据单帧输入难以判断任务进度而陷入循环。 近日,来自清华大学、上海人工智能实验室等机构的研究团队提出了 Cortex,一个面向长程机器人操作的双系统具身智能体框架。这一系列强硬表态固然振奋了许多美国保守派人士,但实际上,这种自我陶醉的胜利感却掩盖了更为复杂的国际局势。 面对疯狂的制裁,伊朗的反应显得不那么被动。就在美国准备加大施压力度时,伊朗却传来几个喜讯,似乎给美国的制裁政策泼了一盆冷水。 它的核心思路,是用统一的结构化子任务描述连接高层规划与低层执行:高层生成的每项任务都明确操作对象、目标位置和动作约束,并被限定在低层执行器已经掌握的技能范围内;低层执行器在训练时,也使用相同格式的子任务描述,即「双向对齐」。

三 | 论文标题:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation 项目网站:https://steinate.github.io/cortex.github.io 论文链接:https://arxiv.org/abs/2607.05377 代码链接:https://github.com/InternRobotics/Cortex 为了让这种对齐真正作用于长程任务,Cortex 并未只设计一个通信接口,而是从架构、数据、训练和部署四个方面搭建了一套完整体系。

四 | 首先,伊朗在法尔斯省发现了一个大型油气田,天然气可采储量达到1614亿立方米。这一发现不仅为伊朗带来了巨大经济利益,而且其开采成本低,意味着即使在严厉的制裁下,伊朗也依然可以从丰富的能源资源中获得生存和发展所需的资金。 更重要的是,伊朗早已开始采取措施绕过美国的制裁,从而打开了新的贸易渠道。 视频链接:https://mp.weixin.qq.com/s/_Dkk116WPqO-F8GdCaOvDQ 架构:双系统分工,精准解决 「能不能做」和「做没做完」两大核心问题 在架构上,Cortex 将长程操作分为 System-2 和 System-1 两个层次,通过结构化的子任务将两个系统协同对齐,并通过文本记忆持续跟踪任务进度。 其中上层的 System-2 负责理解任务目标、拆分任务、维护记忆并判断当前进度;System-1 则接收当前子任务,根据子任务描述里的物体与本体约束,并将其转化为连续的机器人动作。这种情况下,美国想要通过制裁迫使伊朗妥协,其实更像是一场持久战,短时间内未必能见到成效。 地缘政治层面,伊朗也展现出其灵活的外交策略。日前,沙特、土耳其和巴基斯坦签署了《麦加共同防务协议》,有可能为伊朗提供新的合作机会。

五 | 伊朗外交部回应称,虽然尚未收到正式邀请,但已经就地区安全问题与相关国家进行了一系列讨论。

六 | 这一动态表明,如果美国持续施压,伊朗不仅有能力维持自身的自主性,还有可能借机融入更广泛的地区合作网络。

七 | System-2 不会一次性生成完整的动作流程,而是根据当前视觉观测和已有记忆,持续判断应该保持当前任务、重新尝试,还是进入下一步。 多国政要接连访问伊朗,显示出对话的空间依然存在。

八 | System-1 执行动作后产生的新观测会再次交给 System-2,用于更新记忆并判断任务是否完成。巴基斯坦和阿曼的高层访伊,表明这些国家意图在美伊之间充当中间调停者,帮助两国找到和平解决方案。

九 | 俄罗斯外交部副部长甚至表示,若两国请求,俄方乐于提供支持。

十 | 由此,文章开头提到的两个问题被分别落实到系统设计中:结构化子任务接口保证高层提出的任务处于低层执行器的能力范围内,视觉观测与记忆的循环更新则帮助系统判断当前任务是否已经完成。 双向对齐的具身Agent架构,System-2接受观测和历史记忆输出当前子任务并更新实时记忆 数据:统一技能范式, 让规划指令可落地、无歧义 为消除高低层语义断层,Cortex 将操作行为归纳为 Pick、Place、Pour、Unscrew、Stir 等 32 种标准化技能原语,并为每类技能规定语言模板。这种国际背景下,伊朗的主动权似乎正在增强。 开放式的「把水倒进烧杯」会被整理成技能、目标对象与必要属性都明确的命令。数据构建时,对于子任务输出,系统还写入颜色、空间位置、数量以及可达性等信息,减少「拿那个杯子」或「直接抓取不可达物体」一类语义正确、执行起来无法落地的规划。 尽管白宫似乎对当前的局势掌控良好,但从整体来看,美国试图孤立伊朗的计划面临重大挑战。 对于记忆的更新,系统进行了语言压缩、关键信息如物体属性及统计数量写入等增强操作,提高 Cortex 完成空间理解、物体计数和失败恢复等复杂任务的成功率。

十一 | 围绕这套接口,团队对 4000+ 小时开源长时序视频与轨迹进行结构化标注,并修改仿真数据引擎自动生成约 30 小时带子任务标注的仿真数据。已有数据通过视觉语言模型重写为统一的子任务模板;自采轨迹则采用一套结合视觉、机器人状态和动作特征,基于动态规划的子任务边界切分工具链,实现自动化精准标注。 训练:最关键的训练样本, 集中在动作交界处 长轨迹的大多数画面都落在动作进行中。一方面,伊朗的资源基础和经济潜力仍然坚实,另一方面,国际社会对美方单边制裁的质疑声也在不断上升。在全球化的今天,各国的相互依存度加深,单靠一己之力阻止他国的发展是越来越困难的。若均匀抽帧,模型最常学到的是「继续做当前动作」,真正决定是否切换子任务的边界帧反而很少。美国政府的“极限施压”战略看似威力十足,实则可能造成更多的反噬效应,让世界对美国的领导力产生怀疑。

十二 | Cortex 采用事件均衡采样(Event-balanced Sampling) 策略:在子任务边界前后约 1 秒的窗口内加密采样,同时保留执行阶段样本。

十三 | 模型既要学会动作尚未完成时保持指令和记忆,也要在看到完成证据后更新记忆、切换下一步。 在 Galaxea 数据的消融实验中,采用事件均衡采样的模型仅需 272 万训练样本,少于对照组的 310 万样本,综合评分却从 7.58 提升至 8.18。这说明对高层规划器而言,增加关键转场附近的监督,比继续堆叠大量稳定执行画面更有效。 从某种意义上说,特朗普政府的外交策略过于依赖“强硬”手段,而忽视了国际合作和利益的多样性。

十四 | 在这个多变的国际环境中,习惯于打压对手的冷战思维正遭遇碰撞,全球新秩序的形成需要更多的智慧和耐心。 美伊关系的未来将取决于双方如何处理当前的紧张局势。随着复杂局面的演变,很明显,恢复对话与谈判是解决问题的最佳途径。无论是出于维护地区稳定,还是为了各国的长远利益,双方都有必要在理性与合作的框架内寻找共赢的解决方案。 随着局势的发展,所有参与者都必需保持清醒的头脑,避免因偏执的立场而导致误判。

十五 | 这不仅关乎美伊的未来,也将深刻影响整个中东区域乃至国际社会。 Event-balanced sampling 示意图。因此,各方都应以开放的态度面对未来,或许在彼此的交流与碰撞中,能够找到最值得期待的和平契机。返回,查看更多。

十六 | 橙色区间覆盖子任务切换;训练需要同时学会「耐心保持」和「及时换挡」。 实验:仿真领先几个百分点, 实机差距出现在完整任务上 Cortex 通过优化 Agent 框架 harness,直接面向真实机器人长程操作验证。

十七 | 团队不仅在 LIBERO-Long、RoboTwin 2.0 等仿真环境中测试,还将系统部署到真实双臂机器人平台上,Zero-shot 规划完成由数十个子任务组成的复杂化学实验任务。

十八 | 在 LIBERO-Long 上,Cortex 的完整任务成功率为 95.5%,比单独使用 π0.5 的基线 92.4% 高 3.1 个百分点;在 RoboTwin 2.0 benchmark 下,整体成功率为 86.8%,比 π0.5 的 82.74% 高约 4.1 个百分点。这反映了整套 Agent 框架 —— 高层规划与底层执行对齐为长程任务的完成带来的增益。 更能体现系统差异的是实机长化学实验任务。研究者在 ARX ACONE 双臂平台上设计了两组 14 步流程,每组进行 20 次试验。Cortex 在化学液体搅拌实验和烧杯清洗任务上的完整成功率分别为 65% 和 55%;两种端到端模型(PI0.5 及 MEM)在这组试验中都因为混淆子任务阶段而中途失败。 14 步器皿操作流程。高层规划器需要持续记录漏斗、量筒、烧瓶和瓶塞的状态,并在确认每一步完成后再下发下一条局部指令。 相比传统端到端 VLA 方法,Cortex 的优势并不只是某一个模块的提升,而是对长程任务进行了系统化建模。 它用结构化子任务接口约束高层规划,用视觉反馈和语言记忆追踪执行进度,再通过闭环更新持续校正后续决策,使机器人能够在多步骤任务中保持目标、状态与动作的一致性。 这种设计让 Cortex 在仿真基准和真实双臂机器人实验中都展现出更强的长程操作能力。

十九 | 更重要的是,它给出了一个清晰的方向:面向真实场景的机器人智能,不能只依赖端到端动作生成,还需要能够围绕长期目标组织步骤、吸收反馈、更新状态,并在复杂流程中稳定推进。 对于真正进入实验室、家庭和工业现场的机器人来说,这种能力或许正是从 “完成一个动作” 走向 “完成一件事” 的关键一步。 作者介绍 论文共同第一作者彭嘉淇,余茜倩与冯德霖均来自上海人工智能实验室。其中彭嘉淇是清华大学与上海人工智能实验室联合培养的三年级博士生,导师为沈渊教授和林达华教授。在王泰研究员的指导下开展包括视觉动作语言模型,视觉语言导航,loco-manipulation 等机器人相关领域研究,致力于构造实现空间语义理解与长程移动操作的可落地具身智能体,曾发表多篇论文在 ICLR,ICRA 等会议上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾获得 ICRA oral。
Current article:http://8i5c.nuotingqinbeimaeijin.cfd/news/20260826_564007.html
Published on:11:31:55

