GPT-6 Astra 在早期基准测试中显现空间推理的“阶跃变化”

2026-09-12

GPT-6 Astra 似乎在空间推理方面迈出了一大步。

一项名为 StationeryBench 的新机器人基准测试让 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 在五个桌面物体任务中展开较量,比如打开记号笔的笔帽、倒出回形针,或在两个机械臂之间传递一把尺子。

两个模型在 200 次试验中控制相同的双臂 YAM 机器人。

Astra 在 100 个任务中完全完成了 7 个;MolmoAct2 完成数为零。

Astra 的中位进度得分为 100 分中的 46 分,MolmoAct2 为 12 分。

所有结果、视频和代码都在 GitHub 上。

OpenAI 有长期计划打造自己的消费级机器人。

康奈尔大学和 Google DeepMind 的 AI 研究员 Yoav Artzi 称 Astra 是“空间推理的阶跃变化”。

在尚未发布的 REMAP 基准测试中,GPT-Astra 的准确率接近人类水平,不过 Artzi 指出,“即使是 ASTRA 在其他场景中也达不到人类的表现。”

他怀疑 OpenAI 用大量 3D 数据(如 Blender 场景)训练了该模型。

这与 Astra 在 3D 任务上的特别提升相符。

订阅 THE DECODER 可享受无广告阅读、每周 AI 新闻通讯、我们每年六期的独家“AI Radar”前沿报告、完整档案访问以及评论区访问权限。

GPT-6 Astra 在新机器人基准 StationeryBench 上展现空间推理的“阶跃变化”,完全完成 7/100 任务,远超 MolmoAct2 的 0 完成;中位进度 46 对 12。专家 Yoav Artzi 称其为空间推理的阶跃变化,并推测 OpenAI 使用了大量 3D 数据训练。OpenAI 有长期消费机器人计划。

这是什么信号

GPT-6 Astra 在两项空间推理测试中表现出突破。StationeryBench 机器人基准上,Astra 完全完成 7/100,中位进度 46;MolmoAct2 完全完成 0,中位进度 12。Yoav Artzi 称其为“空间推理的阶跃变化”。REMAP 未发布,但据称接近人类水平。OpenAI 有消费机器人长期计划。Artzi 怀疑训练用了大量 3D 数据(如 Blender 场景)。这些信号共同指向:大模型正从语言智能向物理世界空间智能延伸。

为什么重要

空间推理是具身智能和机器人的核心瓶颈。过去模型在虚拟任务上表现好,但难以处理三维操作。如果 Astra 的进步可复现,意味着模型可通过 3D 数据规模化获得物理常识,加速机器人从实验室走向真实场景。同时,OpenAI 的机器人计划表明其可能将模型能力产品化,形成新的硬件入口。对 Ai2 等竞争对手,基准差距显示模型规模和数据策略的重要性。

对谁有价值

AI 研究者、机器人公司、具身智能创业者、投资机构、以及关注 OpenAI 战略的人。做机器人操作、工业自动化、家庭服务、仓储物流的团队,可从中判断技术拐点。开发多模态模型的团队可关注 3D 合成数据训练策略。战略和投资人员可将空间推理能力作为评估机器人项目的关键指标。

可以怎么行动

1) 跟踪 StationeryBench 和 REMAP 的后续发布,查看 GitHub 上的结果、视频与代码,尝试复现或测试自己模型。2) 若从事机器人学习,评估引入大规模 3D 合成数据(如 Blender)训练策略。3) 关注 OpenAI 机器人相关招聘、合作与产品动向。4) 在投资或战略规划中,把空间推理基准表现纳入技术尽调。5) 建立内部评测任务,测试模型在桌面物体操作上的完成率与进度分。

风险与限制

基准尚新,任务规模有限(100 个任务、200 次试验),Astra 完全完成率仅 7%,中位进度 46 分,说明离可靠部署很远。REMAP 未发布,无法独立验证。Artzi 指出模型在其他场景仍不如人类。训练数据猜测未证实。测试限于桌面物体任务,与开放真实环境差距大。MolmoAct2 表现差可能受模型规模、资源或方法影响,不能简单判定技术路线优劣。因此,应视为早期信号,而非机器人已解决的证据。

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《GPT-6 Astra 在早期基准测试中显现空间推理的“阶跃变化”》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。