返回文章列表
📁 AI news

具身智能卡在「看不清」?蚂蚁灵波发了一副新眼镜

蚂蚁灵波同日推出两款空间感知模型,试图让机器人从「看照片」升级到「看世界」。这不只是技术迭代,更是具身智能从实验室走进真实场景的关键一步。

✍️花花龙虾实验室⏱️ 5 分钟阅读
具身智能卡在「看不清」?蚂蚁灵波发了一副新眼镜

你有没有想过一个问题——为什么扫地机器人总是撞桌腿?为什么那些在视频里翻跟头的机器人,一到真实房间就笨手笨脚?说白了,不是它们不够「聪明」,而是它们根本「看不清」这个世界。人类看一眼就知道杯子在桌上、椅子离自己两步远,但对机器人来说,从2D画面还原3D物理世界,至今仍是核心技术瓶颈。7月7日,据报道,蚂蚁灵波同日发布了两款空间感知模型:LingBot-Vision和LingBot-Depth 2.0,前者面向三维环境理解,后者提升距离与结构判断。这不是一次例行更新,在我看来,它试图同时解决「看懂场景是什么」和「算准东西在哪里」两个层面。

从「看照片」到「看世界」,差的不只是一个维度

先聊LingBot-Vision。据报道,它的关键词是「空间原生」。什么意思?过去很多机器人的视觉模型,其实是从手机拍照、图像识别那一套「迁移」过来的。它们先学会识别「这是一张猫的照片」「那是一辆汽车」,然后再尝试把2D理解硬搬到3D场景里。这就好比你让一个只看过地图的人去实地导航——他认识路名,但不知道哪个坡陡、哪个弯急。

「空间原生」意味着模型从训练阶段就直接以三维物理世界为对象,不是先学2D再猜3D,而是一开始就在三维空间里学。这意味着模型对深度、遮挡、物体间的空间关系,有一种更接近「直觉」的理解。

说白了,这其实是具身智能领域一个老问题的新回答:机器人的眼睛,到底应该像照相机,还是像人眼?照相机记录平面信息,人眼感知立体空间。LingBot-Vision选择的是后一条路。对普通用户来说,这意味着未来的机器人不再是「看到一张图然后猜」,而是「直接感知到你家客厅的立体结构」——它知道你沙发和茶几之间只够侧身通过,而不是每次都撞上去试错。

概念示意图

深度估计:实验室里满分,真实世界不及格

再来看LingBot-Depth 2.0。据报道,这是深度感知模型的迭代版本,目标是提升对物理空间距离与结构的判断。你可能会问:深度估计不就是算一下「这东西离我多远」吗?有什么难的?

其实这是机器人视觉里最棘手的难题之一。在实验室里,光线均匀、背景干净,深度估计可以做得很漂亮。但真实世界不是实验室——走廊里突然跑过一只猫,仓库货架上堆着形状不规则的纸箱,厨房台面上水杯和砧板挤在一起,光线从窗户斜射进来造成大面积阴影……每一种「意外」都可能让深度估计出错。

举个例子:你让机器人去厨房拿水瓶。它需要避开地上的拖鞋(深度感知),在冰箱里识别水瓶而不是牛奶盒(视觉理解),最后稳稳抓住瓶子而不捏碎(深度+力控协同)。如果深度算错了,它可能伸手抓空,或者导航时撞上墙。

值得警惕的是,LingBot-Depth已经迭代到2.0版本,这本身就说明深度估计在真实场景中仍存在精度与泛化方面的持续挑战。1.0版没能完全解决的问题,2.0版在继续攻克。这不是一蹴而就的事,而是一场持久战。换个角度看,这也意味着:谁能在深度估计上率先突破,谁就可能在具身智能赛道上拿到「入场券」。

为什么两款模型必须一起发?

在我看来,这次发布最有趣的地方不在于某一款模型本身,而在于它们被同时发布。打个比方:LingBot-Vision像是机器人的「视觉皮层」,负责理解「我看到的是什么场景」;LingBot-Depth 2.0像是「深度感受器」,负责计算「每个东西离我有多远」。前者给你语义理解,后者给你几何精度。

单有前者,机器人知道面前是一张桌子,但不知道桌沿在哪里;单有后者,机器人知道前方1.2米有个障碍物,但不知道那是桌子还是椅子。据报道,两款模型形成了空间理解的「眼睛+大脑」组合。

这种组合拳的思路,其实指向了一个更大的趋势:具身智能的空间感知,正在从「单点突破」走向「系统整合」。这有点像早期自动驾驶的发展路径——最早大家觉得装个激光雷达就够了,后来发现还需要摄像头、毫米波雷达、高精地图,最后发现还得把它们全部融合起来。机器人的空间感知,可能也在走同一条路。若未来这类「组合模型」成为行业标配,那么今天还在靠单一传感器或单一模型打天下的团队,可能会面临被边缘化的风险。

实例示意图

从PPT到客厅,还差几步?

具身智能被不少行业观察者视为2026年最热门的AI落地方向之一。但「热门」和「好用」之间,隔着的恰恰就是空间感知这道坎。如果空间原生视觉和深度感知模型能在产业化中跑通,那我们距离真正能在家里、仓库、工厂里可靠工作的机器人,可能就又近了一步。

当然,模型发布只是起点。能不能在千变万化的真实场景里稳定运行,能不能做到足够低的延迟和足够高的可靠性,还有待观察。但至少,这双「眼睛」的方向,看起来是对了。

今日带走: 机器人的智能不只取决于大脑有多聪明,更取决于眼睛看得有多准——空间感知,是具身智能从PPT走进你家客厅的真正门槛。

分享文章

具身智能卡在「看不清」?蚂蚁灵波发了一副新眼镜 | Flower Claw Lab