K | 1988年,卡内基—梅隆大学移动机器人实验室主任汉斯·莫拉维克就指出过:「让计算机在智力测验或下跳棋时表现出成人水平的表现相对容易,但要赋予它们一岁儿童在感知和行动方面的技能则困难甚至不可能。」三十多年过去,前半句早已兑现,但后半句却很难实现。所以,这次网球赛真正的意义,要远远大于「机器人会不会打球」。它问的是:这一次,AI究竟能不能从数字世界走出来,把感知、决策、运动控制和实时博弈在真实物理环境里闭环跑通?AI不能止步于思考,而是要完成从认知决策到全身执行的完整闭环。这一次,中国企业率先交卷了!赛场上,银河通用机器人的表现,实在令人惊艳。发球、正手、反手、底线调动、网前截击这些单项能力,在比赛里全部出现了,而且全都是超常发挥。而双打,考验就更大了。机器人和人类队友同场,要实时判断谁去接这个球、谁补位,动态调整打法和。所以,它要理解的不只是球,还有队友下一步想干什么。高速攻防里,还出现了极限救球的场面。摔倒之后,机器人自己站起来,继续打。很多人第一反应是:这些单项动作,之前机器人不是做到了吗?投篮、踢球、跑百米,过去两年人形机器人的视频里似乎什么都有。但其中最大的差别在于,网球是两个玩家在对抗。跑步的环境是确定的,网球的每一拍都是对手临时出的新题。跑步可以一个动作练一万遍,网球没有两个完全一样的来球。能在对抗中站住,才是真正的智能。
L | 银河星脑的做法是把大脑层(任务理解与战术决策)、小脑层(高动态全身运动控制)和神经控制集成在同一个模型里。按银河通用的说法,这是全球首个模型能同时负责「想清楚」和「做出来」,中间不再有信息损耗。从网球这个任务倒推,这可能是唯一的解法。战术决策离不开对自己身体极限的实时感知,运动控制也离不开对战术意图的理解,两者本来就不该分家。
M | 接下来,分两个步骤。第一步,是从「不完美人类数据」里学。人类打网球的动作数据可以采,动作捕捉、视频、穿戴传感器都行。
N | 但人类的动作本身不标准,业余选手的确很业余,有多余动作。
o | 而职业选手的动作最大化个人运动素质,别人做不来,而且每个人的身高臂展关节角度都跟机器人对不上。传统模仿学习要求示范数据干净、对齐、高质量,这种要求在人类数据上几乎不可能满足。银河星坊数据平台要做的,就是从这堆带噪声、不对齐、良莠不齐的示范里提炼出有用的先验:什么时候该启动,挥拍的大致节奏,身体重心怎么转移,真正学会其中的运动规律。这一步的价值在于冷启动。机器人不用从随机乱动开始摸索,它一上来就大概知道「打网球长什么样」。
p | 第二部,就是进虚拟网球世界。
q | 在仿真环境里,多个智能体互相对打。
r | 不是一个机器人对着发球机练,而是若干个策略各自演化、互为对手。一方学会了压边线,另一方就被迫学会横向大范围移动;一方学会了放小球,另一方就被迫学会快速上网。在这海量的虚拟博弈中,奇迹发生了——「技能涌现」。
s | 工程师没有教过它怎么滑步救球,但在无数次没接到球的失败后,模型自己「领悟」了极限伸展的姿态。
t | 工程师没有写下倒地后起身的硬代码,但在虚拟世界摔了千万次后,模型自己「学会」了如何调动全身电机重新站立。技能无需手工设计出,在对抗压力下AI学会自学。最后,当这些在虚拟世界中练就神功的「灵魂」,被无损迁移到物理世界的真实机器人躯体中时,一个网球大师,就此诞生!放在整个机器学习的谱系里,这条路走在两个极端中间。纯模仿学习的天花板是示范者的水平,人类教练教不出超过自己的学生,而且人类示范里根本没有「摔倒后怎么爬起来继续打」这种数据。纯强化学习从零开始探索,在网球这种动作空间巨大、奖励稀疏的任务上,搜索成本高到不现实,而且容易学出一些人类完全看不懂的怪异动作,能赢球,但不像打球。先用人类先验打底,再用自主进化拔高。
u | 这本身不算新,AlphaGo当年也是先学人类棋谱,再自我对弈。新的地方在于,十年前这套方法在棋盘上跑通,十年后它第一次在需要身体的任务上跑通。某种意义上,这正是AstraTennis与AlphaGo之间最迷人的技术呼应。AlphaGo的时代,智能在棋盘上思考;而这一次,智能开始进入物理世界。
v | 这绝不仅是一场网球赛。这个AstraTennis时刻证明:在碳基与硅基共生的新纪元里,中国力量,开始创造更多奇迹。
。
Current article:http://swqx.fanfutaopoulaxiong.pics/news/20260826_3588.html