|
|
0 {! o2 B) O: ?+ b
* O3 x% X7 e- B' G& h3D空间数据的瓶颈,从来不是算法,而是标注。
& @1 Y- q/ n5 k* f) Y0 q7 a作者丨张 璐4 G- A; s) C6 Y. Z! u# v8 m8 I* G
编辑丨齐铖湧
( {$ E; F/ u4 M( W一段普通的室内视频,让以前的AI识别,十样东西能认错八样;现在再看,准确率直接飙升到81.06%。$ G1 b( U' @ s2 \
这种飞跃,没靠激光雷达,也没靠人工标注,全凭AI自己开悟。
) J( \! I! J3 m8 I3 U W这是Holi-Spatial在ScanNet++上的实测结果。该项工作由全华人顶尖团队打造,论文已入选ICML 2026 Oral9 z O4 r5 }4 {% K% n$ o
- b3 r; @, q( y) O: r( f+ y* r: x* u. G [! A& _' H1 J; X/ j
Holi-Spatial与现有方法的核心指标对比。无需人工标注,3D检测AP50在ScanNet上提升64%。2 t+ B6 e5 I; O! k
% [) P1 d8 C; `
: K8 l: r' t' r# m* chttps://openreview.net/forum?id=UGAP2F6FfV" D, n8 `8 B* R6 `. D( c
传统的3D空间数据,获取成本高得惊人。# q7 p! o! j) f1 e
硬件上依赖昂贵的激光雷达,标注上更是个体力活——标注员必须在复杂的3D点云里,人眼识别、手动调整每一个物体的三维边界框(Bounding Box)。% o* I8 X/ _" p# u$ g' l+ C
工序极其繁琐,错标、漏标更是家常便饭。
, t* s9 s$ Z7 X8 U9 p" s' Y这是整个行业卡了十年的硬伤。Holi-Spatial用纯软件管线绕开了这堵墙。
$ ^+ p2 p( s7 q" ^5 C2 ?! t- e01+ z% V* Y. d5 G2 v6 r! s& O
; ?) c+ b2 i" o# Q$ U% S2 ~/ a
4 M7 a) o2 m( G, y+ I. |3D标注为什么卡了整个行业十年?
) e2 ?) U% S6 B8 U/ K; x& N+ N( F) J f! f- a& V8 `
长期以来,业内在训练多模态大模型(VLM)时,大多是投机取巧。比如以伪深度信息替代真实几何信息,或者直接在2D图像上生成“伪3D”的问答对。) p5 {0 s" c" }/ \' Q- ]. D
这种方法训练出来的AI,根本无法理解三维空间中的拓扑结构、视角转换和相对距离。所以你问他问题,它只能瞎猜。
# g9 O: J0 Q3 |# J想要培养出真正的3D上帝视角,就必须拥有大规模的3D真值(Ground Truth)数据。然而,3D标注的成本高得令人发指。
+ M+ Y7 F7 L9 _/ B9 i6 J1.设备门槛高:需要利用专业的三维扫描仪(如iPad Pro的LiDAR或更专业的工业扫描仪)在房间里四处走动扫描,光是数据采集阶段就卡死了大部分普通开发者。
) q) G! k, {+ |8 D7 u. _$ o! k, E2.人工标注难:在三维点云(Point Clouds)或网格(Meshes)中拉3D包围框(Bounding Box),不仅需要标注员在三维软件里上下左右不断调整切面,而且极其容易产生视觉疲劳,漏标、错标是家常便饭。
5 I- L+ i$ O/ W# u+ T% g! K3.语义范围窄:ScanNet数据集折腾了几年,最终也只敢提供50个常见物体的类别标注,一旦遇到冷门物体,AI的识别能力直接生效。3 P0 e8 s# C/ C. d! J% v
学术界曾尝试用现成的“前向传播算法(Feed-forward Models)”直接预测物体的三维包围框。但在没有几何约束的前提下,这些模型生成的包围框往往飘在半空中或者陷进地板里,完全违背了基本的物理定律。0 C# z" q) R2 p6 L: G8 K, l* L5 j
既然人工标注走不通,而单纯靠AI算法直接盲猜又不够准,我们为什么不把这两者的优势结合起来,用几何物理规律去纠正AI的猜测,打造一个完全自动化的数据飞轮?
* e$ W0 z/ d/ }% S) @2 F这就是Holi-Spatial的诞生契机。通过组合目前最先进的3D几何重构算法与大语言模型,它成功用纯软件的方式,将海量的2D网页视频流(Web Videos),高效且低成本地进化为结构化的3D空间智能数据。
9 Q" x" s! g% F6 m
% s3 f2 a! ]4 ~ L+ s2 K
S: ?. L* H- D- {Holi-Spatial三阶段数据精炼管线:几何优化→图像级感知→场景级精炼,视频进,3D标注出。7 N' A8 @/ A4 j, P4 S0 O
02* s+ u) R- U* i0 L( P
9 W- U# C; B; b, u- ~
( D* [) e/ i* |- g
拆解Holi-Spatial:3步,7 a& P R1 E- E
把普通视频变成精确的3D场景1 Q, \8 Q- m( y3 }. L( D, |
1 Y0 H) d t% Z, Y* T
Holi-Spatial之所以能做到“零人工干预”,全凭其设计精妙的三阶段数据精炼管线。3 X" r4 B; x0 y6 \" l! e8 S4 R
▎Stage 1:几何级优化(Geometric Optimization)
, f) @9 p8 J& g) r7 w在处理视频时,管线首先利用运动恢复结构(Structure-from-Motion)计算出相机的精确内参和外参。紧接着,算法引入了单目深度估计模型Depth-Anything-V3作为深度先验。5 @ Y8 m) R) j" K! [
& o; g4 [" y+ i% V' z0 X
4 A9 c3 S. A" k+ D; E/ f单目深度估计(DA3)与GS优化深度的对比。DA3深度图存在明显鬼影,GS优化后边界清晰。: |( P u0 k9 S2 U6 }: {
但单目模型估计出的深度往往充斥着噪声和突变,不同视角之间的深度甚至无法对齐。为了消除这些不确定性,Holi-Spatial在此处引入了三维高斯泼溅(3D Gaussian Splatting, 3DGS)技术。
2 F. U5 _2 l" y2 M. k2 e算法将前向深度图与多视角渲染深度进行几何一致性约束,在连续的视频帧中优化数百万个具有不透明度和颜色特征的“高斯点”。这一步优化,几乎完全消除了边缘的“虚影”和半空中的飘浮物,为后续的3D投影打下了坚实的物理地基。
- A% Y1 K3 T5 Y
& o# l3 t+ R3 P9 y
, j/ b" e$ P( i+ }! V
多视角反投影点云对比。左为DA3直出,右为GS优化后——漂浮物几乎消失。& K$ x+ c, z0 H
▎Stage 2:图像级感知与2D-to-3D升维(Image-level Perception & Lifting)
- j5 N3 \$ ~( a% ^有了干净的几何深度后,管线开始进行图像级的语义感知。
- M* g. o5 ^! M* E# a2 v6 ?4 q4 G1.帧级图像描述:算法在视频中均匀抽取关键帧,利用Gemini3-Pro这类强大的2D多模态模型对画面进行细致描述。. p# x: }5 o9 `8 g6 k
2.构建动态类名记忆库(Dynamic Class-label Memory):为了防止AI在第1帧把桌子认成“写字台”,在第5帧又认成“餐桌”,Holi-Spatial设计了一个动态记忆链条,强制各帧在类别命名上保持一致。
+ n5 e3 H1 e' h8 y. ~3.2D分割与3D投影:在类名指引下,2D分割界的新星SAM3生成极高质量的实例面具(Mask),然后顺着第一阶段计算出的几何深度,将每一个2D像素“反向投影(Back-project)”回3D空间中,生成初始的三维定向包围框(OBB)。
( d* R# d1 g6 `& r
1 i: i% w C2 a) o" r; ]% A! P1 y/ A
2D Mask到3D包围框的四步流程:深度投影→边缘腐蚀→离群点过滤→OBB估计) a/ Z# W" v1 d. V4 v. g" F% g
在这项将2D面具提升到3D的过程中,SAM3容易产生边缘锯齿,进而引发3D包围框的严重偏差。% b1 S, S# d7 ^- f/ z* w
为了攻克这一顽疾,Holi-Spatial设计了一套独特的“边缘腐蚀”策略:在投影前,自动将2D面具向内收缩若干像素,只保留最置信的核心区域。同时,结合多视角生成的点云一致性滤网,彻底过滤掉突兀的离群点, 将3D包围框的边缘误差压缩到亚像素级别。
; R" u; u- I2 `8 k
$ N9 N: B) I/ L' T
+ v9 b' p$ q" C# S9 g+ L, [4 _( `开放词汇2D实例分割对比。Holi-Spatial在遮挡场景下边界更完整,远处镜子等难例也能正确分割。
* i: f5 K& ]: q# _0 C& ]9 ], N( v▎Stage 3:场景级精炼与AI Agent“监考制”(Scene-level Refinement)
; ?9 v, p2 X' d9 y5 D6 N2 d9 J多视角投影出来的3D包围框,不可避免地会存在重叠和碎片化(例如一个沙发因为被部分遮挡,被错判成了两个不相连的组件)。% [5 E5 V' {/ Z% E' `& c4 \
为了解决这个问题,管线首先利用3D交并比(3D IoU)阈值(τmerge=0.2)将空间重叠度高的同类候选框合并。接着,算法祭出了极具新意的三级决策过滤器(Tri-level Decision Rule):
! h ?6 @, Q$ m7 O3 F @! Z
4 M/ D# d* L' J# N: P( I E9 f3 o, b$ z
置信度高于0.9的,直接保留;低于0.8的,直接丢弃。而对于介于两者之间、模糊不清的,Holi-Spatial会调用一个由强大多模态大模型担任的AI Agent进行人工式的核查。: ?4 W8 Q. r; D- ?* U/ y
这个智能体配备了“局部图像缩放”和“重新分割”工具对细节进行二次确认,极大拉升了数据的准确率与召回率。: Q6 [+ [. B- r. r9 |
& a9 s2 U! a6 T. E8 W% ~9 H B3 @% Z& k4 z: `) s0 b& C
场景级精炼的逐步效果。从原始DA3深度到置信度过滤再到Agent召回,精度和召回率同步提升。
! u# |5 c' i2 `* E( M5 o4 U! |最后,确定下来的3D实体会被送进Qwen3-VL-30B中,自动生成对应的长文本描述,并基于模板批量合成空间QA问答对。
' G0 r# ?* G* d7 J; S' x$ X
9 b5 d6 s5 Z( t0 o* S
4 b5 t2 P9 G, T, UScanNet++上3D检测结果对比。Holi-Spatial的包围框更紧,类别标注更准,前三行基线方法漏检明显。
5 G: [8 W+ V8 M, k) b- m A其他方法要么缺深度、要么缺 3D Det、要么缺 Grounding,只有 Holi-Spatial 一行全是 ✓,优势一目了然。
9 H. g# C0 Q: ]9 w( \6 Y& h7 w9 l6 z
N- e6 Y" P' c4 m0 ]6 n
1 s1 O- k. A4 c" v7 v! ?* ?& x各方法输入输出能力对比。只有Holi-Spatial同时覆盖深度、3 U4 i; y/ A% h$ L
2D分割、3D检测、Grounding和空间QA五项任务。( n5 t( W" c6 _, F2 k& [1 N
03
3 d, u k6 c/ I) t( B
4 X$ p+ D" p+ Z+ m6 q+ L. N% j& S) o5 W% C5 _, c1 j- O4 O
无硬件、无标注,( y; c9 f8 T- B5 f
Holi-Spatial重新定义了3D数据的获取方式
/ a* w: M$ d- b/ W" ~5 X: J" ~$ L+ R6 b N+ p
Holi-Spatial之所以能引发如此大的关注,是因为它同时回应了两个长期悬而未决的行业判断。* O2 |9 }" @3 T& ]+ m. t
第一个来自斯坦福大学教授、World Labs联合创始人李飞飞。( e* w5 r& U& t+ l/ J' w
2025年11月,李飞飞发表长文《From Words to Worlds: Spatial Intelligence is AI's Next Frontier》,文中明确提出:真正的智能不能只停留在语言层面,AI必须理解并驾驭三维物理世界——感知物体的位置、推理空间关系、预测物理交互。" l( E0 F6 L% n" j/ k. A; i2 C
在她看来,空间智能是通往具身智能的必经之路,也是当前AI系统普遍缺失的核心能力。0 n2 U; b& ^ ]: ^6 P
Holi-Spatial正好在数据层面回应了这个判断。它证明了AI不需要依赖昂贵的硬件扫描仪,只靠普通的2D视频输入,就能自动生成大规模、高精度的3D空间标注数据——这恰恰是空间智能研究长期缺少的原料。9 K0 u9 w- W% [
第二个来自Karpathy,Tesla前AI负责人。+ E% P7 V' W2 q0 f. H
在2021年Tesla AI Day上,Karpathy公开谈到:人工标注成本极高且难以扩展,Tesla不得不建立一套用车队数据自动生成标注的闭环机制来代替人工。他的判断是,自动标注不是权宜之计,而是AI大规模扩展的必要条件。2 t9 Y5 H& W$ L) @4 g
Holi-Spatial的逻辑与这套判断完全一致。区别只在于,Tesla解决的是2D驾驶场景的标注瓶颈,Holi-Spatial解决的是3D室内空间的标注瓶颈——而后者的难度和价值,要高出一个量级。
a* w; Y* } X6 Y6 d04
: z* E5 {" E4 R" v
, X' @: D0 y4 g- U
1 h9 r1 g. b( O2 F) k6 l: b3D检测精度断层领先,8 m' h1 K) F( ]. S
但是只能处理静止画面 N! T( R. r4 K7 N; R% ~9 `& S" u
: I" ]" W$ x+ f4 g w3 R那么,这套全自动管线提炼出来的数据,成色究竟如何?
^: A. K4 {2 k- {; U联合团队在ScanNet++等多个最权威的3D空间智能基准上进行了严苛的量化测试。实验数据呈现出了近乎断层的领先:8 i+ F- X$ }4 G
在最核心的3D目标检测任务中,此前最先进的3D多模态模型LLaVA-3D在ScanNet++上的AP25仅为12.2%,AP50仅为4.80%。
8 |( g& I: O+ n# b3 L1 z, J而经过Holi-Spatial自动管线训练出来的模型,其AP25飙升到了惊人的 81.06%,AP50达到了 70.05%!在没有人工标注参与的前提下,其感知精度相比前代技术暴涨了5倍以上。0 _5 G% z: m* L
不仅如此,在空间推理问答任务中,利用Holi-Spatial-4M数据集微调后的Qwen3-VL-8B,在MindCube基准上的准确率从29.4%暴涨至49.1%,提升了近20个百分点;在3D Grounding任务上,AP50也直接实现了翻倍增长。
( j# l; j9 G0 E# k& f6 j' Z然而,在这份近乎完美的成绩单背后,我们也需要保持客观冷静的学界思考。4 s$ g }/ L" m3 i2 M
Holi-Spatial的数据生成管线目前建立在一个非常温和的“静态乌托邦”假设之上——静态室内环境(Static Indoor Environment)。
_! Q0 i: S0 s) W: `0 L F3 h整个管线底层的SfM运动恢复和3DGS几何重建,均假定画面中的沙发、茶几、墙面等所有物体在视频拍摄期间是绝对静止不动的。这意味着:4 {) ^0 O- Z, o1 x ^" V2 H
1.无法处理动态画面:如果输入的视频中包含走动的人、奔跑的宠物,或者正在移动的车辆,底层的3DGS就会产生严重的“重影(Ghosting)”和半空虚影,导致投影出的3D包围框彻底变形。
& y1 B0 b7 _ L& h4 K2.算力开销巨大:由于每个视频场景都需要从头训练一次3DGS(Per-scene Optimization),其算力成本和处理时间极高,目前还无法做到实时、移动端的在轨标注。1 V. P* H% s$ _+ n+ o0 l& I
但这并不妨碍Holi-Spatial成为空间智能领域的里程碑式工作。随着4D高斯(4D-GS)以及动态变形场技术在学术界的快速演进,当算法能够自动将“运动的猫咪”与“静止的客厅”完美剥离时,Holi-Spatial所描绘的“数据飞轮”必将爆发出更恐怖的能量。& C0 N- B9 {7 P8 G) [# M$ f
大模型在2D纸上谈兵的时代正在终结,一个能够真正看懂、听懂并走入三维物理世界的“具身AI”时代,正在加速向我们走来。7 Y6 y0 _$ w4 N9 R' S' m1 [% ?
05( y" \; Z p( n1 y1 s, r. _
' R- C' J+ e7 M+ q4 r. x4 Q2 t; J; j4 K! L. `4 r$ W- V5 Z
对话Holi-Spatial团队:
0 n8 C$ F# s/ c5 z5 r用AI超越人类标注的灵感与野心
8 M$ Q. X- b/ S% @! v
- M3 |6 H/ q1 A. E9 o在这项入选ICML 2026 Oral的重磅工作背后,是一支充满活力的年轻科研力量。5 e) }# Z6 }$ r7 Z1 g
为了进一步探寻Holi-Spatial诞生的台前幕后,以及空间智能的未来演进,我们与上海交通大学人工智能学院副教授、Holi-Spatial团队负责人钟志航展开了一场深度对话。
7 V# |/ c2 }9 q" X9 R: q) b8 H▎Q:论文提到,目前空间智能严重受限于场景单一和数据稀缺。为什么这次会想到让AI和各种工具进行系统性结合,甚至去挑战超越人类的自动标注?这个灵感的源头是什么?' c9 A8 K# \' U& ^; Y8 o
A:这个灵感并不是凭空出现的,更多是源于我们团队长期的技术积累。我们下面有一个Team原本就是专门做3D和4D重建的。可以发现,这两年的CVPR Best Paper几乎都颁给了前向3D或4D重建相关的工作。但这一类几何重建工作,跟基于大模型的空间智能之间,过去的隔阂很大,几乎没有什么交集。
7 e3 q2 K5 x( B# [: N {' F7 N直到去年和今年,我们突然意识到,随着3D/4D重建管线的发展,再加上SAM3等语义处理工具的日趋成熟,这些工具的能力其实已经跨过了某个临界点。它们已经足够强大到可以串联起来,反过来去为多模态大模型“造”数据——特别是造出带有3D语义的高质量数据,去培养AI的空间感知和规划能力。在动手做之前我们其实也只有八成把握,但实际跑完整个管线后发现,在Agent的辅助下,这些零散的工具组合起来,在很多场景下产出的数据质量确实大于等于人类标注的水平。' p, |) G) C* C$ _) Z
▎Q:作为一个复杂的系统工程,在构建这个“数据飞轮”的过程中,有没有遇到什么出乎意料的挑战?
8 x; `* d! ?% M7 N& R0 tA:坦白讲,因为这是一个偏系统工程的项目,碰到的很多挑战其实是“分布式”的,比如怎么hold住如此庞大的海量数据、怎么提升重建管线的整体效率等等,里面充斥着大量细枝末节的工程问题,并没有某一个特别卡脖子的绝对难点。
7 F7 z# n$ J5 q [* U- Y R. q如果说有什么最让人意外的,那就是现在“Vibe Coding(氛围编码)”的工具和Agent能力太强了。我们这个工作从去年底开始做,整个研发过程中Vibe Coding的占比成分非常大。那些原本需要耗费大量精力去啃的工程细节和零碎的dirty work,Agent都能很好地辅助我们完成。这极大地释放了生产力,也是我们能高效拼出这条完整管线的重要原因。
' N1 g! ?$ f |9 X+ v# E▎Q:论文的局限性部分提到,这种开放词汇的语义标注可能会继承基座模型本身的偏见和错误。如果把它应用到更垂直的场景,这种偏见会如何表现?未来该怎么克服?
3 C* B% h: X) s3 _- b7 k+ q/ u6 XA:我们文章里说的bias(偏见),准确地说是指在某些偏长尾的垂直领域,现有的通用基座模型会直接“抓瞎”或者识别错误。: ?. m6 m% o9 v7 C8 ^
举个例子,比如在我们做化学或生物实验的实验室环境里,里面会有各种各样特定型号、特定名称的烧杯。你如果把这种高度专业的画面交给SAM3或者通用的多模态大模型,它们是根本搞不定的。所以,现有的管线在客厅、卧室这种General(通用)的场景下非常work,但到了垂直细分领域确实存在难度。不过,现在大家也在如火如荼地搞工业大模型、自动化实验室模型,随着这些垂直模块的成熟,把它们嵌进管线里,这种长尾语义的偏见和识别瓶颈就会被逐步克服。
/ e! k3 i/ ]. k$ I6 N▎Q:目前Holi-Spatial主要基于静态室内视频。如果未来想把这套管线扩展到更宏大的室外开放世界(比如有行人、车辆的高动态场景),现有的技术架构需要做出哪些攻坚?. U, W8 L9 f* |# S1 a3 X. n
A:这是一个非常好的科研和技术问题,实际上我们团队已经在朝着这两个方向布局了。
6 N" r$ t* ^# ?; l/ L5 [首先是观测条件的“非完美”问题。现实中往往存在动作模糊、天气不好有烟雾、或者光照太暗的情况。针对这种降级的鲁棒性问题,我们已经做了一项新工作挂在ArXiv上了,专门让管线去模拟各种不完美的模糊观察,以此来训练大模型的空间鲁棒性。
% z" y4 `5 @$ V9 J! R! j& Y# ?- S其次是室外的大场景和动态4D环境。室外环境非常开放,做过3D高斯的人都知道,前期的点云处理和深度估计在室外极其困难,而且网络视频的拍摄视角往往很稀疏,拍一圈根本覆盖不到所有角落。对此,我们正在尝试将重建手段与生成式模型结合,来攻克室外的稀疏难题。同时,针对行人和车辆,我们的学生也正在尝试搭建4D高斯的管线。只有当数据从静态走向物理意义上的“可交互”,批量产出可交互的4D空间数据,才能真正意义上全面赋能具身智能。! G! G5 {4 x! i2 l, C$ I$ L
▎Q:论文的影响声明中特别提到了隐私保护。如果未来全自动3D重建的门槛和算力成本进一步降低,一段无意间流传的视频就可能把个人的私密空间摸得一清二楚。您如何看待大规模重建与用户隐私之间的界限?
! s0 u! c7 O( I9 }7 }1 UA:这确实是一个很有意思的话题。一个人的房间布局、物品摆放,其实能反映出很多个人信息,甚至能看出你的性格和“家装MBTI”。+ b, M% M3 G9 I) ^6 z3 G$ D9 A
如果是用户自己拍摄并上传的视频,大家自然会从自身角度保护好隐私。但我认为更值得思考的,是未来的具身设备,比如无时无刻不在陪伴你的家庭服务机器人、扫地机器人或者室内无人机。它们在服务你的同时,确实有可能主动获取一些不该获取的场景隐私。如何防范这种主动式的设备泄密,将是未来的具身智能硬件厂商和公司需要深度思考与限制的端侧底线问题。& _5 g5 y. L$ K) U/ G: F8 v. Y
▎Q:在你们的设想中,当这样具备强大空间智能的大模型,真正装进智能机器人的身体里,它为社会带来的第一个应用场景会是什么?1 Q3 V. ?( n0 ]0 Z* L; t' H& v0 F( l
A:如果空间智能的基座模型真的训得足够好了,第一应用场景绝对是机器人。不过,目前第一版的Holi-Spatial所做的事情还远远不够,它现在能实现的,更多是不需要物理交互的空间规划、判断或理解。
0 o# _+ K2 G# `8 P0 I如果只基于现阶段的能力,它能装进设备里帮我们做些什么?也许是把你整个家扫一圈后,Maybe它能突然提醒你:“有一把钥匙或者玩具掉在某个平时看不见的角落里了”,帮你把找不着的东西揪出来。但要真正走向具身智能,它必须学会和环境交互——比如我渴了,它能走过去打开冰箱,精准地拿出一杯冰可乐。这就需要我们正在攻坚的“物理意义上可交互的空间数据”。
V" r0 g0 u C8 {7 v* `3 n▎Q:最后,作为这篇优秀工作背后的掌舵人,有什么想对关注空间智能领域的年轻后浪们说的吗?: k# k% R, s. S
A:空间智能和世界模型这两年之所以这么火,是因为以前做不到,缺了太多基础工具。如今随着3DGS、4D高斯等新表达的出现,工具链慢慢全了,大家自然而然都会着手往这个方向涌入。
7 W% u% h% ?2 I0 r我们团队非常年轻,我是2026年3月刚入职上海交通大学人工智能学院的。谁会拒绝更优秀的硕士和博士生呢?(笑)我们在这个方向上还有很大的野心和很多好玩的Idea,非常欢迎对空间智能、三维多模态感兴趣的优秀同学联系我,无论是实习还是申请硕博,我们一起去探索真正的具身世界。: Q- m2 y. n) t$ w0 E( g
一个人读论文太孤单,一群人刷顶会才好玩。
5 ^. x, D0 R5 v$ ~& _3 g% l1 sICML 2026召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪与硬核技术探讨,拒绝灌水。
$ t8 I5 @2 c8 S# E' @$ [. y进群传送门:扫码进群或添加微信Vin_Vivid,备注:论文群 + 关注的 AI 方向。
8 O# V3 ^. e1 m" S
; O% @% S: q O+ j5 Y) _9 Q! M d1 F! R0 |, ~4 F* G
搞科研/搞技术,信息差很重要。, E0 Q% G! ]4 c7 r( m2 @0 b
来,一起快人一步!. c- L! E& h; a( {3 Z8 y' |! F
H% ]- r' W9 |
! h5 y" d4 o9 [- |4 ^2 M1 t; C
" C; J8 Q; Y/ W. J
+ Z* y+ J0 p, Z a
上车,带你看遍全球 AI 顶会精华- h- g, @9 u* p- y
可独家畅览:
5 G3 Q9 [4 K$ v' }) ~1 m, u+ i1 [+ K专家演讲PPT
1 B& c) L* I& v6 l- r大会报告全文* M* H4 b2 B6 x, S9 r4 @5 t6 X
热门论文解读, K8 a ]0 z u9 ~5 R) {: q
学术新星访谈4 p' F( U% G: D) O1 o" s1 L1 [& }
e/ b" K$ Z$ H+ e' i, a* y' ^
3 h* a& c9 R6 a; Z7 ]6 B& K未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!4 R) s; n" g; B( x& e- w/ k. E
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。 |
|