|
|
1 u% L: x7 \8 s5 f
7 O; O6 _: E& F) l0 m, D7 d
! k# v% m) u& _3 Z7 c还在用 DragGAN、DragDiffusion 拖拽修图?点选拖拽容易变形、边界割裂、细节丢失的时代落幕了!ECCV 2026 ICRDrag 首创上下文区域拖拽模型,用掩码精准定位局部区域,移动、缩放、变形全都丝滑自然,兼顾精准度与画面真实感。
* p; L8 k- \; r: `% D+ V
8 s. }" z7 h. K
* G& K6 e7 D* l+ p5 e) G
5 k, }# j$ `* }% o1 p" {8 D* [; C: ~4 ?3 x ^$ l/ C2 d
( b1 V. p O- N1 l8 q$ M- Paper: https://arxiv.org/pdf/2606.25907
5 s6 Z% F/ \, @0 n2 S+ V - GitHub: https://github.com/bcmi/ICRDrag-Region-Drag-Editing0 `: s9 s1 I2 u
- Demo: https://drag.ustcnewly.com/
6 \6 i6 i' @3 o& \' y0 ~2 `. o0 d# k
4 s3 e- Z0 V+ ^0 f! {* N6 m( @效果展示
7 h0 t8 ], F t3 a' B C, B先看编辑效果,每一组图像左边蓝色掩码是源区域,右边红色掩码是目标区域。拖拽编辑旨在把源区域拖拽到目标区域,其他区域除了必要的跟随性改动 (比如嘴巴动了,下巴也要跟着动) 之外,细节尽量保持不变。可以看出 ICRDrag 对于各种类型图片的姿态和形状调整都能轻松拿捏。2 ]: f2 g6 }& q, E' ~1 T; f
" O% r+ p( ~' D+ H6 W! X5 b- E4 f8 n2 m. x7 T$ ]9 n/ `; f
9 S% t4 A2 Y1 N0 D- I下面视频是 demo 展示,用户可以用不同颜色画出多对源区域和目标区域 (目前最多支持 5 对),把多个源区域拖拽到对应的目标区域。如果其他区域出现了不想要的改动,可以在其他区域增加类似锚点的源区域和目标区域,锁定其他区域。
# ]: _ V( K8 E; @9 G: k体验链接:5 Y# D8 ^; ?) T4 q& L, Y" k
https://drag.ustcnewly.com/
: @" k9 I' e6 Z. p' ]& _' d8 }! T: Z0 s+ p+ N8 \
直击痛点
# t0 e3 i1 w+ `. f传统拖拽修图,到底有多难用?玩过 AI 拖拽编辑的朋友一定踩过这些坑:- a& \" g' t$ I
4 r% O, H- k& U' {* `# j$ V
! A h8 |7 i1 ]! h/ a6 {
- 基于单点拖拽:主流点拖拽模型比如 DragGAN, DragDiffusion 仅靠少量点对控制画面。点对信息模糊,AI 经常猜不透你的想法。点越少歧义越大,想要精准调整物体形态基本靠碰运气,很难严格对齐目标位置。
) `& W; H5 {+ [6 d: t! l- | - 现有区域拖拽:后来出现的 RegionDrag, DragFlow 等模型改用掩码控制区域,但缺陷依旧明显:物体拖拽后边缘断层,和背景融合生硬;复杂的形状姿态调整完全 hold 不住。
! Y% v' k0 t0 `5 D0 Z9 r# Y
- `3 P% y4 ~% b' O- P, x: G
! p3 X5 ^: d: V' L( B# {
; U; s- J, [# W9 b0 [4 G/ x% s) Y8 z- g. r
上下文区域拖拽
% C% u {8 U: u本次 ECCV2026 提出的 ICRDrag(In-Context Region-based Drag)全新解法:上下文区域拖拽,真正实现「选啥改啥」。3 f! ?+ I6 F l) ^6 `
; X `* r! A2 b5 G y. Q+ Z( D
; Z7 x, U* G0 M7 o. m1 Y- 上下文学习框架:基于 DiT 上下文学习框架,一次性输入原图、源区域掩码、目标区域掩码,直接输出编辑完成的图片,从底层解决拖拽编辑的控制难题。
, U5 a( d# ]* X& h! n; t* w6 l - 图像 - 掩码注意力一致性约束:目标图像在借鉴原图信息时,注意力分布必须和目标掩码匹配源掩码的分布保持一致。AI 不再割裂看图片和选区,生成画面严格贴合掩码划定的空间轮廓。
( z y+ | |5 d4 I1 G - 源 - 目标双向注意力对应约束:目标物体看向原图对应区域,原图区域也反向关注目标物体,建立编辑前后物体的对应关系。 e4 h; h2 S; R& G5 X: Z
- 图片 / 掩码专属模态 LoRA:图像富含纹理细节,掩码仅存储空间轮廓,二者的性质差别很大。ICRDrag 为图像、掩码分支使用独立 LoRA。! \5 v8 q7 c* j3 J5 C
- 分阶段课程式训练:现实使用中,用户勾勒的掩码往往比较粗糙。模型采用两阶段渐进式训练:第一阶段用完整语义掩码训练,让模型学会区域变换逻辑;第二阶段用稀疏不完整掩码训练,随机膨胀模拟手绘粗糙选区,大幅提升模型容错率。哪怕掩码画得潦草,AI 依旧能精准理解你的编辑意图。+ \% C5 d, Q+ n7 K5 v4 z# r
) | w4 r% c6 t9 N0 @. q9 k
2 X6 d8 M$ {* L2 n
; P6 M t/ |) G! B' H/ ^
7 ?1 v/ M; X1 h* m) A. s区域拖拽大规模数据集
- d1 X5 ?. B2 g3 O$ }为了训练 ICRDrag 模型,该工作基于百万级视频数据集 OpenVid,打造了首个大规模区域拖拽数据集 PRD (Paired Region Dataset),补齐领域空白:
; y+ {0 M& x3 [- g# B- d( \. G) B- J2 }& P6 U; [; _4 V
# V" K( H7 H2 x" K! K2 O
- 训练集:28.7 万组「原图 + 源掩码 + 目标图 + 目标掩码」配对样本,如下图所示。下图中,左栏是原图、源掩码、从源掩码采样的部分区域,右栏是目标图、目标掩码、从目标掩码采样的部分区域。
9 B7 O; C1 X! U% D$ }" Y& }+ j - 评测基准 PRDBench:1000 组人工校验高质量样本,同时标注掩码 + 关键点,可公平对比点拖拽、区域拖拽两类模型。
# j3 q# d u3 [* ?' b - f- `$ C, x0 g- w4 f( \8 q
; }- ~3 m3 r! ?9 q5 T- b& q
! n8 A6 P/ C& M* J) [: p
+ S* o/ ^! f" M# r+ I应用场景' O- D1 @4 s' s! I6 h6 X( N+ p; C+ Y
图像拖拽编辑覆盖多个落地场景,是广大设计师和摄影爱好者的福音。
+ D( D! C* ?6 G. G, [7 P' `: ^' k- k. a- {
4 U( `' Z/ x$ U2 K: H- 人像修图:框选人脸、四肢,随意调整身材比例、姿态、五官位置,不变形不失真;" _* _( F1 l1 ^0 e! I4 `3 B
- 静物 / 产品设计:拖拽商品调整摆放位置、缩放大小,无需重绘光影;
0 g4 G: A/ z, s" H% f% j3 c# x) ^ - 场景构图优化:移动画面中人物、花草、建筑,自动填充背景,画面无缝融合;0 a% Z4 M3 G: ~* w
- 创意设计:自由扭曲物体轮廓,实现复杂创意形变,告别生硬拼接。' |- _* g0 z) G* L* D/ O3 ]" O
: ^* G# s# M5 o' r
实验室简介. T8 B3 w9 ]# j( Y$ e6 R: \
ICRDrag 出自上海交通大学牛力实验室。该实验室近几年主要工作集中在图像生成和编辑领域,代表性子领域是图像合成 / 物体插入 (image composition/object insertion) 和少样本图像生成 (few-shot image generation),也涉猎过图像填充、图像分层、风格迁移、拖拽编辑等其他子领域。近两年在关注生成模型的后训练和理解生成一体化模型。 |
|