找回密码
 立即注册
查看: 834|回复: 0

用3万小时触觉数据补齐具身智能「手感」,新智具身联合复旦大学统一触觉「 ...

[复制链接]

27

主题

15

回帖

130

积分

注册会员

积分
130
发表于 2026-7-27 04:32:59 | 显示全部楼层 |阅读模式
新智具身联合复旦大学发布N₀系列技术报告:用 3 万小时触觉数据补齐具身智能 “手感”。
* J5 o1 e6 R! f4 |- w先来看一段现场实景录制的视频:- l  J* I5 c9 O* |
Re7EbrUmrbQmqpsu.jpg
$ O! }  {( x9 e% O' V) I) X* k  Ohttps://mp.wEIxin.qq.com/s/dJlmI9wromZWL-c8T9d7Mw
6 ~, m+ h) @; C4 v& n! ]' \& @+ A7 e3 d' Y4 p1 H
& @. ~" }7 _! w1 V' }

$ f. K, D1 m9 u# [: V$ N! X4 a视频里机器人能干的活儿特别多:煮鸡蛋面、调柠檬水这些居家料理,还有收纳整理,它样样拿手;就连工厂流水线装配、精细零件组装、线材缠绕梳理这些精细活也全都不在话下。这正是 N₀系列模型展现出的强大实操能力。
, f, B# P, X9 ^* `! d: r! u. z+ [不知道大家有没有见过机器人实操翻车的名场面:插头边缘反复摩擦却难以插入、抓取塑料瓶时力道失控导致瓶身瘪陷、叠好的毛巾在松手瞬间散落…… 在具身智能的落地进程中,这类 “视觉系统判定无误,但物理交互瞬间翻车” 的现象屡见不鲜。+ U) \3 s' d! c" s' f
这些失败指向了一个行业共识:决定机器人能否在真实物理世界中生存的关键,往往不只在于视觉感知的精度,而更在于接触瞬间的触觉反馈。摄像头能确认空间位置,却无法感知 “是否接触”、“顶到边缘”、“夹力过载” 或 “发生滑移” 等,缺失这层反馈,正是阻碍机器人跨越 “最后一厘米” 的核心痛点。
+ @1 Y1 u( o4 W0 g0 E近日,上海新智具身智能科技有限公司(NeoteAI)联合复旦大学可信具身智能研究院,正式发布了N₀系列三份技术报告,把触觉从 “辅助模态” 跃升为 “核心基建”。 三份报告合起来看,恰好拼出一张蓝图 —— 一套触觉数据底座,搭配两条不同侧重的技术路线。4 |. o/ ^6 E5 w. V3 F; L. r1 Q' T
更具行业价值的是,项目的数据和模型会进行开源,可以直接查看项目的完整链接:
& _( k8 N, i; V3 P; O! d" Ehttps://research.neoteai.com
/ X" x7 S# Q# N2 M! @1 c) n0 |7 IN₀-Foundation:统一触觉 “方言”,构建 3 万小时交互语料库" P& v2 T( v+ z% k, J+ m
触觉数据的规模化应用长期受制于各类触觉设备输出的数据格式互不兼容。不同传感器输出的凝胶形变图、电容矩阵或六维力向量,犹如缺乏统一语法的方言,难以在同一模型中融合。9 q4 F! ^) W) F9 H) ]$ u6 Q. s
为此,NeoteAI 搭建的 NeoData 数据集旨在打破这一壁垒:0 ~& {! n1 D0 l& p
5 b( U; e) Y: ?7 C

    " V$ y4 N) P6 K/ p
  • 包含超 3 万小时视觉 - 触觉交互视频;
    6 j3 n6 z" n/ m3 k+ J, W
  • 约 140 万条操作片段,33 亿个时间步;4 _1 E" f0 M/ U/ i% ?
  • 对应 80 亿帧 RGB 画面与 100 亿帧触觉图像;
    % ]. {6 h+ u4 ?# V3 {$ m
  • 动用 Franka、Piper、UR5e 等 6 种机器人本体;
      O5 p! w0 V% t) O. s) k. \
  • 覆盖 450 项真实长程任务(如叠衣、插拔接头、倒液体等),由 90 位操作员采集;& l& C- W/ b% T% S; ]
  • 已开源 5 千小时视觉-触觉交互视频。
    + q# `3 r. l4 {

5 o7 r, q9 }: `; k! d: n' L, ]" x zT6z3JRJR6Tnz65r.jpg + c2 r0 G" e3 D- W& e& f6 W7 J. O4 e
) u; W# W" z# G* ?3 ~9 ^. J1 q1 t

) M) N' l  j8 H8 s另外,团队还提出了 NeoForce 统一表征模型。无论底层传感器硬件如何,都能够学习到具备迁移能力、时序结构化的触觉表征,以供下游具身智能策略使用:哪里被按?按多大力?有没有横向拉扯?这种 “触觉普通话” 有效解决了跨设备数据融合难题。" K  z) p6 ^4 Y3 `. M
为了更直观地理解,下面的视频完整介绍了 N₀-Foundation 的各项核心功能,包含硬件、数据样例、全面评测等。
8 `) T  C' F  _2 c% k+ { qKPUOAC3LkkAkLwC.jpg 0 X1 E4 ~! u& C9 j! W2 Q- \5 X/ O3 C
https://mp.weixin.qq.com/s/dJlmI9wromZWL-c8T9d7Mw
7 E+ q, j4 r# @' h1 e8 P  y! D: T% B- m) a. w

, C" ]  P) k; G9 R! X. I

( P" x# |  }8 s8 O& BN₀-VTLA:以 “触觉预判” 赋能轻量级 VLA
# \- b. U! l& u* c数据底座夯实后,团队接下来思考的是如何将触觉真正融入到 VLA 技术路线之中。
2 N4 Y) }4 \8 A8 @* F在现有的多模态融合实践中,直接将触觉图像与 RGB 视觉信号进行简单拼接往往面临挑战:由于触觉信号仅在物理接触瞬间产生高频响应,大部分时间处于 “静默” 状态,极易被海量视觉 Token 淹没。更为关键的是,即便模型成功提取了当前触觉特征,其本质上仍是对已发生动作的滞后反馈 —— 这种 “后视镜” 式的感知机制,使得在动态交互中始终慢半拍。1 h$ Z. y0 m* ]7 Q1 H
DkCcxWpKcr877vH8.jpg
1 ^* f: e8 }( b# z' v9 z* b/ u2 K) z) p; g2 f

, j! g! g/ x) D! V2 xN₀-VTLA 提出了一种全新的方案:不依赖滞后的当前触觉,而是预测未来 50 步内的触觉演变。该模型将当前触觉编码为紧凑的潜在 Token,结合视觉上下文预判滑移、受力等趋势,从而指导动作模块提前调整。不同任务上显示:N₀-VTLA 在插插头任务中成功率达 85%,而同类视觉方案仅 60%;在拔钥匙的任务成功率达 99%,而视觉方案为 35%。
$ N- p4 L* u) v$ j1 j4 D( i此外,N₀-VTLA 还突破了传统模仿学习仅依赖专家成功轨迹的局限,让机器人从失败数据中实现自主进化。模型结合触觉信息利用部署后数据以及 human in the loop 的数据训练了一个进度评估模型,使其能够识别任务执行阶段,甚至识别出 “退步” 与 “救场” 等复杂行为。通过结合离线强化学习,机器人在毛巾折叠、书包收纳、纸箱折叠等长程任务上的成功率,分别从 50%、35%、20% 大幅跃升至 95%、80%、75%,真正实现了从失败经验中汲取教训的持续进化。
6 m# v7 j! j. m1 F. | aUf2TTzqB6OfEks2.jpg
$ K2 }! |( S- h* B4 n
, F, b" A- Q( o# Q9 o( f; K7 I9 L3 a2 o( V/ K0 u
下面的视频直观的展示了 N₀-VTLA 在精细化操作方面的强大能力。1 G6 ~3 y( H) O" {
WLcKkKDcYIeI2zL9.jpg 0 o% i6 r3 |* P
https://mp.weixin.qq.com/s/dJlmI9wromZWL-c8T9d7Mw- W* G  F" |' k

7 i( O, P0 @% A! V3 Z; y
  y8 O, s- h/ r0 G5 p& j1 I

+ n: C! ^7 a, n  W# S3 \N₀-TWAM:在世界模型中重构 “触觉想象”
/ O' L! `( I" z, O9 i如果说N₀ -VTLA 是加装预判雷达,N₀-TWAM 则是对机器人 “认知中枢” 的重构:它把触觉放进世界模型,让机器人在动手之前,先在自己的 “想象” 里完整的推演一遍操作视角和手感。
. }3 Y8 u" t# s1 w2 f1 E+ n现有世界模型大多局限于未来视觉图像的生成,在驱动真实机器人时面临严峻的物理对齐挑战:画面里杯子被抓住了,但手指夹没夹稳?画面里插头对齐了,但下一秒会不会卡住?这些触感信息完全缺失。
8 z' ^) K  b4 @) yN₀-TWAM 要做的是同时预测未来的视频、触觉和动作这三个相互耦合的序列。N₀-TWAM 采用混合专家架构,内置视频、触觉、动作三个异步专家网络,视频专家从预训练模型热启动,触觉和动作专家用更窄的结构,最终总参数量 72 亿,仅相当于全宽方案的一半。
5 N9 r) G) S: M& |+ |5 n$ U' |  F F5l5VgT4Llyl5Rg6.jpg 1 J# I/ D5 X* b2 D- r6 ]& @  K

- I3 S: ~2 Q! x: Q8 O* s0 F# T* q" Z
在仿真与真机测试中,N₀-TWAM 展现出显著优势:仿真平均成功率达 84.5%(而世界模型最强基线为 36%);真机 8 项任务平均成功率 46.3%(LingBot-VA 为 21.9%)。消融实验进一步证实,去除 “未来触觉预测” 或 “当前触觉条件” 均会导致性能显著下降,确立了触觉在世界模型中的不可或缺性。
8 V: {( W0 Q" Y. J) R8 q, U pvz57MZgYl72MT6t.jpg ; K" Q1 x- e) f9 _, J

; }3 C) n3 W6 |+ ^8 x
5 n; V: \; i, M, Q' v3 j. i8 k+ T, d以下视频展示了 N₀-TWAM 的模型实际操作能力。" ^0 y5 c$ |$ L4 k) }$ a- h
Mp6t6vXu0kvppz00.jpg
+ b' G3 Y$ R7 d( N2 E0 Jhttps://mp.weixin.qq.com/s/dJlmI9wromZWL-c8T9d7Mw
  U% |/ Y( E9 x) ]- e1 X5 u1 T& [  B) A& H& a9 \& U

7 f- U/ k0 `! r9 g
0 F* A# q7 t$ S
触觉:具身智能的下一个 Scaling Law?
- ]/ n: l* D% D; A: e4 c7 U纵观N₀系列三份报告,NeoteAI 释放了明确的行业信号:N₀-Foundation 验证了触觉模态具备类似视觉的 Scaling 潜力;N₀-VTLA 证明了触觉可以自然的接入现有 VLA 架构;N₀-TWAM 确立了触觉在世界模型顶层设计中的核心地位,使其与视觉模态真正平起平坐。
) @" r, v/ ~0 S2 b! ~这意味着,机器人的认知范式正从单一的 “视觉驱动” 向 “视触融合” 演进。它们不再仅仅通过 “看” 来理解世界,而是开始像婴儿一样,通过主动的触觉探索来验证假设并规划下一步动作。“看得见杯子不等于拿得稳,认得出插座不等于插得进”—— 这一物理世界的常识,终于被写入了机器人的底层逻辑。
, z- U8 Q3 ~2 Z0 N! F7 K7 o尽管距离 “随手一摸即知轻重” 的通用具身智能仍有长路要走,真实场景下的数据采集成本、跨本体泛化能力以及推理实时性仍是亟待攻克的工程难题,但 NeoteAI 的这组工作已实质性地推动触觉从 “小众研究方向” 跃升为 “具身智能核心基建”。
1 K3 [* A" o2 ?3 J D8RCG5BllbIrn7cB.jpg
- ^1 w) d/ e. x5 v
2 e" n$ w5 `! y9 k3 B8 b( F& a# J7 i2 R' a$ U' G6 ]" B: K
具身智能的下一篇章,或许不再仅仅是 “让机器人看懂世界”,而是真正 “让机器人摸透世界”。. h" l5 \8 W. a

  ~: u1 Y/ h* B- e: f$ W

    ' Z2 ^) m3 ?7 S. n
  • 项目链接:https://research.neoteai.com0 `3 Q$ \' Q$ y! i! I$ u
  • 公司官网:https://www.neoteai.com
    - L! ^$ @" u  `# v: c( W
集群智慧云科服专利申请服务
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则


快速回复 返回顶部 返回列表