借助GPT-6 Astra掌控机器人并非易事

更新时间: 2026-09-23 浏览:4697

编辑|冷猫:随着GPT-6的问世,许多人没预料到通用人工智能(AGI)会如此迅速到来。GPT-6 Astra以其卓越的基础通用模型能力引起了广泛关注,模型的实时语音交互(RSI)表现出乎意料的强大。发布后的第二天,Robocurve便将其直接应用于机器人任务,结果发现,GPT-6 Astra在机器人控制方面表现得极为出色,且Token消耗量显著低于预期。在某项机器人操作的测试中,其成功率高达95%,与Fable 5.1的40%相比,表现优异,同时输出Token的数量仅为后者的约1/6.2,而成本约为1/2.3。这样的成绩使得更多案例纷纷涌现,使用GPT-6来执行复杂的机器人操作的趋势开始显现。

然而,这一创新也引发了我在具身智能领域的焦虑。越来越多的讨论将通用人工智能模型置于具身智能的核心,甚至出现了“GPT-6将主宰具身智能”的说法。某知名具身智能企业的创始人指出,目前的具身智能并未形成真正的护城河,而通用模型公司在人才、计算能力及资金方面具备明显优势,“未来一两年将是注定的关键期”。Robocurve甚至提到,如果这一趋势持续下去,语言模型最早有望在今年年底实现对机械臂的实时控制,最迟在2029年。

不过,这样的单项成绩并不能说明基础模型已然能够在真实环境中安全、稳定地控制机器人。RoboDojo团队在官方测试中指出,“Astra在实际测试中多次产生不合理或不安全的动作,甚至造成了硬件损坏。”出于安全方面的考虑,他们提前结束了测试,因此Astra未能完成原定的18项任务。这提醒我们:基础模型的能力提升只是一个起点,更加迫切需要解决的是如何限制动作、处理失败以保证机器人能够安全、稳定地进行工作。

尽管基础模型不断变强,却依旧面临双刃剑的问题。如同为智能体构建支持系统一样,具身智能缺乏一整套能够丰富经验、实现持续发展的系统。最近,有研究团队发布了RoboRSI,这是一个针对复杂真实场景的机器人多智能体自我进化框架。这个框架的核心问题便是,在基础模型具备强大的理解与推理能力后,如何在系统层面建立一个能够持续执行、诊断、修订与复用的闭环。

这一系统的设计围绕两个关键挑战展开:首先,谁来管理执行过程中的各种异常情况?机器人一旦出现错误停顿、抓取失败或位置偏移后,需要进行结果检查、异常恢复和安全决策。这些任务过去依赖工程师手动跟进,而大模型虽然能够理解任务目标,却无法负责现场恢复决定执行是否成功,或从何处继续进行。其次,如何实现历史经验的有效沉淀与再利用?若每次任务都依赖Agent参考完整的历史记录,Token会持续增加,模型反而难以集中精力;而如果每次遇到局部失败就重写流程,系统则难以收敛。研究团队发现一个重要现象:编程模型擅长局部细节处理,但在不断修改中可能偏离全局目标,而缺乏结构性约束的修改往往会导致越来越混沌。

在这个新时代,Context管理成为了核心挑战。以往机器人系统的主要难题是编写正确的控制代码,而在Agent时代,代码生成与迭代的瓶颈则转移到了如何管理Agent在持续运行中产生的海量上下文,包括轨迹、日志、视频、代码版本和失败记录。若管理失当,系统会在迭代中变得混乱。穹彻智能的设计哲学因此展开,可以概述为:为人和Agent各自提供适当的接口。对人来说,提供“高层引导”,无需深入底层实现,聚焦于目标设定、专业判断和安全边界,而将日常执行交由多智能体负责;对Agent,则需提供“清晰结构”,通过层级化技能树,明确修改范围、成功标准及失败反馈路径,以确保局部修订围绕全局目标进行。

因此,无论基础模型的能力多强盛,都需要一个系统级的支持框架,使其能够顺应具身智能的需求。RoboRSI正是应对这两个核心问题而构建的具身智能支持系统。