新浪新闻

Jetson Thor算力叠加GR00T大模型,真能让人形机器人学会自主思考吗?

BigNews 06.06 07:52

英伟达Jetson Thor芯片叠加GR00T大模型,能让人形机器人实现接近“自主决策与行动”的能力,但离人类式的“自主思考”——即拥有自我意识、主观体验和真正的理解——仍有本质差距,当前的技术路径更准确地说是赋予了机器人强大的端侧实时推理与情境适应能力。

为何说这是“自主决策”而非“自主思考”?

一、 硬件与模型如何构成“智能核心”?

Jetson Thor与GR00T模型构成了一个闭环系统,旨在让机器人在本地实时处理复杂信息,从而摆脱对云端的依赖。

Jetson Thor:提供“即时应答”的算力基础

Jetson Thor基于Blackwell GPU,AI算力高达2070 FP4 TFLOPS,并配备128GB内存。相比前代Jetson Orin,AI性能提升7.5倍,能效提升3.5倍。

它能以极低延迟并行处理多达16个传感器输入,例如在运行Llama 3B模型时,生成首个token的时间不超过200毫秒,每秒可输出超过25个token,确保机器人对环境的快速响应。

这意味着机器人无需“上传下达”至云端,可在本地完成感知、推理与决策,大幅降低网络延迟导致的操作延迟。

GR00T模型:提供“理解与执行”的智能框架

GR00T是一个人形机器人通用基础模型,它通过语言、视频和人类演示进行训练,旨在理解自然语言并模仿人类动作。

最新版本(如GR00T N1)采用“双系统架构”:

快思考系统:每秒刷新120次,负责实时、流畅的运动控制,确保动作的平滑与精准。

慢思考系统(视觉-语言模型VLM):负责理解复杂指令、感知环境并推理出行动逻辑。例如,当听到“倒一杯水”时,能理解并分解为“识别杯子->规划路径->执行取水、倒水”等一系列动作。

二、 为何这不算“自主思考”?核心局限在哪?

尽管性能强大,但当前的“自主决策”本质仍是高级的模式匹配与概率预测,与人类意识驱动的思考有本质区别。

缺乏真正的“理解”与“意识”:机器人处理信息并执行任务,本质是基于训练数据中的统计规律,而非对世界或语言含义的真实理解。它知道“杯子里有水”的物理关系,但无法像人类一样真正感受“口渴”或欣赏“杯中水”的清澈。

泛化能力受限:GR00T在训练场景下表现优秀,但在面对从未见过的奇异、非结构化环境时,失败率高企。它缺乏人类从零推理和创造性地解决新问题的能力,遇到超出“经验”范畴的情况会陷入僵局。

数据依赖与真实性问题:GR00T的训练高度依赖第一人称视角数据进行仿真训练,而这类数据的质量和真实性仍是产业瓶颈。依赖AI生成的合成数据可能存在偏差,导致机器人在真实世界中出现意料之外的错误。

软硬件解耦的长期风险:平台由英伟达提供“大脑”,宇树科技等提供“身体”。这种模块化合作虽然降低了研发门槛,但也可能导致硬件厂商逐渐丧失底层算法研发的动力,长期来看可能陷入对英伟达生态的依赖。

三、 实际成效与行业影响

从实验结果和行业反馈看,这套组合显著提升了机器人的实用能力,但主要体现在效率和执行层面。

效率的飞跃:英伟达声称,Isaac GR00T平台能让人形机器人的研发效率提升3-10倍不等。对于初创公司而言,开箱即用的软硬件方案可节省60%以上的硬件适配成本。

应用场景的拓展:Jetson Thor的端侧算力足以支持机器人运行复杂的VLA(视觉-语言-动作)模型,使其能在工业装配、仓库物流甚至手术室中做出更精准的实时的复杂决策,例如进行精细的抓取和操作。

生态整合效应:该平台已被波士顿动力、宇树、优必选、银河通用等多家顶级具身智能公司采用,形成了事实上的行业标准。这种“三台计算机(DGX训练+Omniverse仿真+Jetson部署)”的闭环,将加速机器人技能的迭代速度。 (以上内容均由AI生成)

加载中...