拓冰建站拓冰建站
首页 / 资讯中心 / 正文

蚂蚁灵波募资15亿押注具身大脑,机器人竞争转向智能中枢

蚂蚁灵波拟募资 15 亿的消息出来之后关注具身智能的人基本都会多看两眼。“蚂蚁也做机器人了”是多数人的第一反应但更准确的判断是蚂蚁不是去造一台能走的机器人而是想押注机器人背后的“具身大脑”。“具身大脑”这个说法对应的英文是 Embodied AI Brain 或 Robot Foundation Model核心思路是把机器人的“智能中枢”和“机械本体”拆开看。如果把机器人比作人身体是骨骼、关节、电机、传感器组成的机械本体大脑就是负责看见、听懂、决定先做什么后做什么、并把这些决定翻译成运动指令的那套智能系统。具身大脑不是某个开源模型也不是某块开发板而是一整套端云协同的软件与算法体系。为什么这件事值得单独拿出来聊因为过去几年机器人创业公司主要拼机械结构和整机集成很多产品外观接近但真正拉开体验差距的是“同一台机器在不同环境里能不能自己适应”。资本开始把注意力从“本体”转向“大脑”本质上是“软件定义机器人”的信号越来越明显。这篇文章不做宏大叙事只拆四件事具身大脑到底由什么构成、为什么它能拿到这么多钱、如果你想做技术判断该从哪里入手、以及落地时最容易被低估的坑。适合三类读者机器人相关工程师、大模型应用开发者以及需要做技术选型或投资分析的决策者。1. 具身大脑核心能力速览先给一张能力速览表把“具身大脑”这个抽象概念落到可讨论的技术维度上。需要说明的是这里整理的是一般意义上的方向性能力不是某个具体开源项目的功能清单因为目前行业内还没有出现公认的唯一标准。维度说明定义负责机器人感知、规划、决策、控制的智能中枢核心能力多模态感知、语义理解、任务分解、运动规划、记忆与学习运行形态端云协同端侧保证实时控制云侧承担复杂推理核心技术VLA 模型、多模态大模型、世界模型、模仿学习、强化学习交付形态软件平台、API 服务、预训练模型、内置大脑的整机方案与硬件本体的关系同一套大脑可以适配不同机器人形态当前成熟度偏早期标准未定研发投入大关键瓶颈真实数据不足、泛化能力弱、端侧算力受限从这张表能看到具身大脑的价值在于“可复用”和“可迭代”。硬件本体卖出去之后功能基本固定大脑不一样模型更新后机器人可以通过 OTA 获得新能力。这种属性让资本市场愿意给出更高的估值容忍度也让“15 亿募资”看起来不那么夸张。2. 适用场景与使用边界具身大脑不是万能钥匙它有自己的适用场景、明显短板和使用边界。2.1 当前比较看好的场景从公开技术讨论和行业落地案例来看以下几个方向最容易被优先验证工业柔性制造上下料、分拣、装配辅助、质检辅助。场景相对封闭ROI 容易计算。仓储物流移动抓取、码垛、包裹分拣、园区巡检。环境可控传感器部署成本较低。商业服务展厅导览、餐厅配送、商超清洁。对人机交互要求高适合测试语言理解能力。家庭辅助物品整理、床铺整理、养老陪伴。市场空间大但对安全性要求极高。特种作业电力巡检、危险区域排查、灾害现场辅助探测。用机器人替代人政策意愿强。2.2 现阶段不适合的场景高节拍、高精度的工业流水线例如需要零点几毫米重复定位精度的装配环节目前更适合传统工业机器人加视觉伺服方案而不是依赖大模型规划的具身大脑。长期无人值守、可靠性要求达到军工级别的场景也需要更严格的验证周期。2.3 使用边界与合规提醒具备感知能力的机器人必然涉及数据采集。摄像头拍摄到人脸、麦克风采集到语音、机械臂记录操作日志这些都属于敏感数据处理必须遵守个人信息保护要求在采集前获得明确授权。在部署环境中要设置物理急停、速度限制、区域隔离等安全措施。涉及人脸识别、声音克隆、肖像生成等能力时合法授权和用途边界必须前置确认不能等上线后再补。3. 技术栈拆解具身大脑由哪些模块组成把具身大脑拆开看至少包含四层感知层、认知与规划层、运动控制层、学习与数据层。每一层都有相对独立的技术栈。层级输入输出常见技术感知层RGB-D 图像、激光点云、IMU、力觉传感器、音频场景语义地图、目标位姿、状态估计2D/3D 目标检测、语义分割、多传感器融合认知与规划层用户自然语言指令、场景语义地图子任务序列、操作计划大语言模型、VLA 模型、决策大模型运动控制层子任务序列、目标位姿关节轨迹、力控指令逆运动学、模型预测控制、强化学习策略学习与数据层遥操作数据、仿真数据、失败案例策略模型、奖励模型模仿学习、强化学习、世界模型3.1 感知层感知层解决的是“机器人现在看到了什么”。它不只做图像识别还要把 RGB-D 图像、激光雷达点云、IMU 数据融合成带语义的场景表示。难点在于遮挡、光照变化、透明物体和反光物体识别这些仍然没有完全解决。3.2 认知与规划层这一层是“具身大脑”区别于传统机器人最明显的部分。传统机器人用状态机和规则做规划具身大脑则用自然语言接口和大模型做任务分解。例如用户说“把桌上的水杯拿到厨房水槽”模型要理解“水杯”在哪个位置、“厨房水槽”在哪里、“拿”的动作顺序是什么。业内常用 VLAVision-Language-Action模型统一处理视觉、语言和动作输出同时保留大语言模型抽象推理的能力做高层规划。3.3 运动控制层控制层负责把规划结果变成电机能执行的指令。这里的关键问题是“关节角度怎么变才能完成抓取”以及在抓取失败、碰撞即将发生时如何快速重规划。控制闭环要求很高的实时性通常会跑在端侧算力平台上。3.4 学习与数据层数据是具身大脑最重要的燃料也是最难解决的问题。常用数据来源包括人工遥操作采集、仿真环境生成、真实场景日志回放。训练时通常会构造一个“感知-规划-控制”的联合流水线下面这一段是通用的逻辑示意可以直接作为系统设计参考。# 示意代码具身大脑任务处理主流程 # 说明不同平台的具体实现差异很大这里只展示通用骨架 def process_task(user_command, sensor_stream): # 1. 构建当前场景状态 scene_state build_scene_graph(sensor_stream) # 2. 将自然语言指令拆成可执行的子任务序列 subtasks plan_subtasks(user_command, scene_state) # 3. 逐个子任务执行控制失败则重新规划 for subtask in subtasks: trajectory generate_trajectory(subtask, scene_state) execute_result robot_controller.execute(trajectory) if not verify_success(execute_result): scene_state update_scene(sensor_stream) replanned plan_subtasks(user_command, scene_state) execute_replanned(replanned) break这段代码想表达的关键点是感知、规划、控制并不是一次性串行流程而是带反馈的闭环。真正落地时每个环节可能由不同的独立服务负责通过消息中间件通信。4. 硬件平台与软件框架具身大脑在哪里跑具身大脑的部署涉及端侧和云侧两套计算环境。云侧负责训练大模型端侧负责实时推理和控制中间通过低延迟通信链路连接。4.1 端侧算力与传感器端侧通常使用嵌入式 GPU、专用 NPU 或其他 AI 加速卡。业内常见的平台包括 NVIDIA Jetson 系列、地平线征程系列、高通机器人平台等。传感器方面常见组合是 RGB-D 深度相机、激光雷达、IMU、六维力传感器和麦克风阵列。千万不要只看算力数字还要考虑整机功耗、散热、接口带宽和实时性。4.2 软件中间件与仿真环境软件层面机器人领域最常用的是 ROS 2负责模块间通信和设备驱动仿真训练常用 Isaac Sim、MuJoCo 等环境。模型部署层常见 ONNX Runtime、TensorRT、TensorFlow Lite 这类推理框架。具身大脑的工程复杂度远高于普通 AI 应用因为它同时涉及实时系统、数据管线、模型服务和安全机制。下面是一个示意性的系统配置用来描述一套典型具身大脑的工程骨架。字段结构不是任何官方标准落地时一定要按实际项目替换。{ robot: { model: humanoid-v1, actuators: 43, sensors: [rgbd, lidar, imu, force] }, brain: { cloud_model: vla-base, edge_model: vla-quantized, inference_mode: edge-cloud-hybrid }, simulation: { engine: isaac_sim, episode_count: 10000 }, safety: { sim2real_gap_check: true, emergency_stop: true, joint_limit: true } }从工程角度看“具身大脑”不是一个单体系统而是一组服务的集合。感知服务、规划服务、控制服务可以独立启动、独立升级这给后续运维和接口标准化留下了空间。5. 商业价值逻辑为什么资本开始盯上“大脑”蚂蚁灵波拟募资 15 亿放在 2025 年的机器人赛道里金额不算特别惊人但传递的信号值得关注。为什么资本愿意在“大脑”上下重注5.1 硬件同质化智能成为差异点机器人本体的核心零部件比如电机、减速器、传感器供应链已经相对成熟。厂商之间很难靠硬件拉开代差最终拼的是同样的硬件在不同场景里能不能干活。具身大脑决定了机器人的泛化能力这恰好是当前最大的差距。5.2 跨本体复用边际成本更低一套传统机器人方案通常绑定一个硬件型号换一种机械臂就要重新调参。具身大脑如果训练得当可以在不同本体之间迁移核心能力前期研发投入高后期复用成本低。这种资产属性更接近软件公司而不是制造企业。5.3 数据飞轮的双刃剑具身大脑的核心壁垒最终会落在数据上。机器人越用越聪明这是数据飞轮的正循环但反过来冷启动阶段没有足够真实数据模型能力就上不来这是所有新入局者都要面对的问题。蚂蚁的优势在于拥有云平台、算法团队和多个消费场景理论上能把数据采集和场景验证结合起来。不过从公开信息看这条路径还未形成大规模商业闭环。5.4 15 亿募资的行业坐标对蚂蚁灵波来说15 亿如果最终落地意味着它要同时投入模型研发、数据团队建设、云平台和多个机器人适配项目。这笔钱更像是一个“入场费”和“研发弹药”而不是短期内商业化盈利的保证。愿意给出这个量级资金的投资人大概率是看中了团队在大模型、云基础设施和产业场景上的组合能力。5.5 平台化还是项目制具身大脑的商业化路径目前有两条一条是平台化把“大脑”做成标准 API向机器人厂商输出能力按调用量或年费收费另一条是项目制直接做行业解决方案交付整机加软件。平台化估值高但难度大需要标准化接口和大量真实数据项目制现金流更稳但可复制性差。蚂蚁灵波的具体路线还没有完全公开但从蚂蚁既有业务结构看平台化方向会更符合长期逻辑。以下分析仅代表技术视角不构成投资建议。6. 落地验证如何判断一个具身大脑可用对工程师来说最重要的不是概念而是验证方法。一套具身大脑到底行不行可以从感知、规划、控制、泛化和稳定性五个维度做测试。6.1 建议测试链路仿真环境单任务测试验证基础控制链路是否打通。仿真环境多任务测试验证任务切换和资源调度。真机单场景测试开始积累 Sim2Real 差距数据。真机多场景泛化测试换物体、换位置、换光照记录成功率。长时稳定性测试让机器人持续运行 8 小时以上观察故障率和恢复能力。6.2 核心评估指标指标说明建议测试方式任务成功率每次任务完成的成功率固定 50 轮以上测试取平均平均完成时长从指令到完成的总耗时对同一任务计算均值与方差干扰恢复率人为打断后机器人能否恢复随机加入障碍物和推挤长时无故障时间系统持续稳定运行时长8 小时以上连续运行指令泛化率未训练过的指令能否理解准备 20 条全新自然语言指令6.3 部署检查清单确认端侧算力余量模型服务不能与底层控制抢占 CPU。确认传感器时间同步多路数据时间戳不一致会直接破坏感知结果。确认安全急停链路独立于算法系统之外。确认通信中间件稳定性断连后要能自动重连。确认数据采集授权环境内有人脸、语音数据时必须有合规方案。6.4 接口调用示例目前很多具身大脑平台会预留任务层接口方便上层应用直接下发自然语言指令。不同平台接口设计差异很大下面的代码只是通用传输演示实际请求路径、字段名、超时时间要以具体系统为准。import requests # 示意接口地址和方法以实际具身大脑平台为准 BASE_URL http://127.0.0.1:8080/api def send_task(task_description: str): payload { task: task_description, sync: True } resp requests.post( f{BASE_URL}/execute, jsonpayload, timeout30 ) if resp.status_code 200: data resp.json() return data.get(status), data.get(log) return failed, resp.text if __name__ __main__: status, log send_task(把桌上的水杯拿到厨房水槽) print(status, log)接口能跑通只代表通路没问题真正的验证要看任务完成率和长时稳定性。7. 资源占用与性能约束端侧推理才是最需要抠细节的地方具身大脑对资源的要求比普通大模型应用更苛刻因为延迟直接跟物理世界相关。7.1 延迟分层感知、规划、控制三个环节的延迟需求完全不同。感知层可以接受一百毫秒级延迟规划层可以容忍数百毫秒甚至秒级延迟但控制层必须达到几十毫秒以内甚至更低否则机器人就会出现抖动或碰撞风险。这就是为什么控制策略往往要放在端侧不能完全依赖云端大模型。7.2 端侧与云侧分工一个常见做法是云侧大模型负责复杂语义理解、长程任务规划端侧量化模型负责实时目标检测、轨迹生成和应急避障。云侧掉线时端侧要能降级到安全模式至少保证不撞人、不损坏设备。7.3 如何降低资源开销模型量化INT8、INT4 量化是最直接的显存和算力压缩手段。模型蒸馏用大模型蒸馏出适合端侧的小模型。结构化剪枝去掉低贡献网络分支。Token 缓存相同指令重复出现时直接复用规划结果。传感器降频非关键场景降低激光雷达和图像帧率。7.4 性能观察方法在没有统一监控体系之前建议至少记录四类数据端侧 GPU 利用率、内存占用、端云通信延迟、任务级时延分布。用日志工具把每条任务的指令、模型版本、传感器时间戳、输出动作串关联起来出问题时才能快速定位。显存占用没有统一答案不同模型、不同传感器配置差异很大必须按实际测试数据来评估。8. 常见风险与排查思路具身大脑项目失败往往不是单一原因而是多个问题叠加。下面把常见风险按“现象 - 原因 - 对策”列一张排查表。风险/现象可能原因排查方式应对思路仿真能跑真机频繁失败Sim2Real 差距大对比仿真与真机的感知输入差异增加 Domain Randomization回填真机数据同一任务成功率不稳定采样随机性、环境变化固定随机种子多次测试增加评估轮次约束动作采样范围机器人反应迟钝端侧推理延迟过高查看端侧 GPU 占用与推理耗时模型量化、降分辨率、端云按需分载自然语言指令经常理解错大模型提示词或场景上下文不足记录指令和模型输出日志优化 Prompt增加场景状态输入多传感器时间不同步没有统一时钟源检查传感器时间戳引入时间同步模块或硬件同步信号长时间运行后报警内存泄漏或通信断连监控内存曲线和日志增加心跳机制和服务自动重启数据合规风险采集了未授权的人脸或语音数据审查数据集构成脱敏处理、授权管理、删除非必要敏感数据最后还有一类风险不在技术层面募资计划本身存在不确定性。“拟募资”意味着还在推进阶段投资方、到账时间和最终估值都可能有变化。技术判断归技术判断商业交割是另一套逻辑。9. 最佳实践与下一步观察具身大脑还处在快速迭代的早期对从业者来说现在入场的关键不是重复造轮子而是找到能持续积累数据的场景。9.1 给开发者和企业的建议先聚焦 1 到 2 个高价值封闭场景不要一上来就做通用机器人。在真实场景里建立固定评估集没有基准测试就没有迭代方向。每个失败案例都要回收数据失败数据比成功数据更有训练价值。安全冗余要优先于智能表现任何情况下都要有物理急停和心跳监测。关注开源模型和标准化接口避免绑定某一家私有方案。涉及人脸、语音、个人行为数据的采集必须提前完成授权和合规审查。9.2 给技术选型和观察者的建议判断一家公司或一个团队的“具身大脑”实力建议看三个能验证的指标是否能在多个不同机器人本体上运行同一套模型是否积累了可持续增长的真实操作数据是否建立了完整的安全测试流程。PPT 上的演示不能代表系统稳定连续运行一周的任务完成率才能说明问题。9.3 接下来 6 到 12 个月观察什么对蚂蚁灵波和整个具身大脑赛道来说最值得关注的信号有三个第一是否出现真实外部客户和商业化订单第二是否形成可对外输出的标准接口或开放平台第三同一个模型是否能覆盖多类机器人形态。募资充其量是入场券真正的考验在后面。如果只看一句话具身大脑的价值不在融资数字本身而在它能不能被反复交付到真实环境中。拿得到钱是第一步跑得通场景才是门槛。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门