找回密码
 立即注册
查看: 757|回复: 5

谷歌北大联手学术版Banana爆火,论文图表100%精确生成

[复制链接]

4072

主题

535

回帖

1万

积分

论坛元老

积分
13076
发表于 2026-2-16 17:37:05 | 显示全部楼层 |阅读模式
效果好到刷屏的Nano Banana,学术特供版热乎出炉!* W$ j" l7 v* Y) c% s- {) |
名字就是如此直观——PaperBanana,给你每天都在头痛的Paper用上Banana。(试图押韵skr)
& m2 Y- B) s( [+ N3 F$ I/ A+ R9 i而且这一次是由谷歌北大强强联手打造。
. A. K, \1 y: W3 c1 g
6 r; u, E3 ?* G4 F7 k9 e: @
知道你想马上看效果,别急,三个官方案例这就给大家搬上桌。* J4 K; o0 p& W, m1 o9 w
在相同输入下,人类绘制、原版Nano Banana与PaperBanana生成的论文插图对比如下:4 X& t$ n) W0 b
综合评估显示,PaperBanana在美观性、简洁性与逻辑清晰度上均全面优于原版。% v+ P. Q. ^3 F- y: B! P6 Y

  X$ ?/ L; q, V. k, q- B而且它还能直接优化人工绘制的插图,瞅瞅右边,是不是高级感一下就上去了。
  j( e1 G2 X1 U3 M* l* k+ }
; @5 ^; ~7 S. r. W7 |4 v6 g
此外,由于PaperBanana还提供代码出图功能 (即利用Gemini-3-Pro自动生成并执行Python可视化代码出图),所以它还能用来生成需要数值100%精准的各种图表。6 k; q5 J4 t/ Y1 A2 r7 q" ~
  Z+ y& p: Q* i; [2 D
好好好,既能拿捏高级感,又不忘精准度,应该没有学术人不爱吧~* ]1 m0 e' a' E. `$ I( N0 P9 H
8 D& |  }# S/ j4 }3 w( d
论文作者表示,PaperBanana为全自动生成可用于出版的插图铺平了道路。3 K+ d* G! a% E' @: k
我们希望这个框架能成为连接复杂科学概念与高效视觉叙事的桥梁,赋能每一位研究者,用专业级的视觉语言清晰呈现其发现。8 g, t- r& M, s0 Y- M+ U/ p. d. Z3 H
而在看到其效果之后,一众网友也纷纷感叹“学术插图”这个老大难总算是要被攻克了。+ v9 E7 z- q$ `. x! K
想想以前的日子,真真是要落泪了~
, M; t6 n! S, d7 w  Z; `! h
研究人员花费4个小时在Figma中绘制一张图,简直令人难以置信。
8 c) G8 n9 K- ?" T

1 E3 C( O/ A1 M; i( ~9 J, u6 g那么,学术版PaperBanana是如何炼造的呢?
4 l: D1 A- k: h' [( @一个不够,那就5个!
, H0 k8 G  p4 \* p* _5 \4 m. O) {4 K6 [) b3 T% |9 d4 q: v  X
用一个模型生图怎么够,现在都是多智能体齐上阵了。" R# c( h3 l2 y4 |/ Y# K
没错,PaperBanana背后就是5个分工明确的智能体在起作用。
% j  I3 r- K# b# t; Y- s6 Z6 F# L
    * ]9 n( c. g- g1 t. z8 C
  • Retriever Agent(检索智能体):从顶会论文库中,找到与你要画的图领域、结构最相似的参考案例。! R$ e' Q6 i6 D+ L. N) f1 u' B" X
  • Planner Agent(规划智能体):把论文文字描述,转化为包含所有模块、逻辑的详细绘图说明书。) e3 }% f$ b+ v3 Q. N% u* i  y9 k
  • Stylist Agent(风格智能体):总结学术审美规范,给说明书加上配色、排版等“美颜”标准。. u6 _, o1 e: [) N: \
  • Visualizer Agent(可视化智能体):根据说明书,直接画图或写代码出图,产出初稿。6 W: R) V( s( r% E9 _" Y
  • Critic Agent(批判智能体):检查图的对错与美观度,提出修改意见,循环迭代3轮优化。/ F' b" x8 `3 R. M: Q7 X
下面这张图清晰展示了它们的工作流程:
. A3 r% G9 T0 B2 E, M划重点,连这张图也是PaperBanana自己生成的。
, P6 l( i3 W& R. m  x  Z
& J7 f: M2 U, P) \4 w* Z
论文作者表示,这一过程参考了人类制作论文插图的流程。
+ F% v9 l5 t* V, [$ S1 D; z以制作一个模型架构图为例,通常研究人员会先去看看顶会里类似工作的图是怎么画的,找找灵感和规范。, b% t, X/ C2 Z
这一步就对应了检索智能体的工作。
; w8 h# k/ G: r8 I9 E" {$ S然后就需要根据参考来规划自己的图该怎么画,“我的方法有几个关键模块?”、“数据流和逻辑顺序是怎样的?”,在想清所有关键问题后,脑子里大概就有一幅架构蓝图了。
% }' Q5 z5 X: P6 Y* D& e而到这一步还不是真正动笔的时候,因为还需要结合自己的图以及之前看过的“顶会审美”标准,来给蓝图加点设计感。, _! @* \4 j- c  F! L
有了这两样东西(蓝图+审美),现在就可以真正出图了。
9 [! b( w0 U- n: m3 D  J: w  c并且出完之后,研究人员往往还需要检查一番,以确保出图正确无误。
7 g8 @/ C: }* V& [. A: s$ g. k" H
6 H3 ]2 x* f% {* I' t
怎么样?是不是一环扣一环、且全都一一对应上了。
2 _. l" Y% H9 _$ A2 k而在了解完PaperBanana的工作方式后,接下来的问题在于:! w+ X% P3 Z. T' S2 N" P+ F
怎么评估PaperBanana的生图效果?
5 Q' |# H' t0 r) l实验方法及结果
" D$ a% n- J) U: {" Y( o1 e5 i$ v. J0 i8 k. i/ W
对此,团队还专门构建了一个PaperBananaBench。该基准内容源自NeurIPS 2025——
8 L5 c0 C7 K- b( f他们从5275篇论文中随机采样2000篇,经过滤、人工校验后,得到584个有效样本,然后将其均分为292个测试样本和292个参考样本。
! T. |/ [- f( O4 v- ~) L这292个参考样本,每一个都提取了完整的(S, C, I)三元组:% k( w, H- w; h* B) b

    9 S& A# J; l1 X
  • S(源上下文):描述方法的文本,如论文方法论章节;
    3 A3 C* S0 R* }1 ^+ m- C0 P7 _
  • C(传达意图):图的标题/说明,如“我们的框架概述”;
    - o( }# t3 r0 D' Y" b
  • I(参考图像):论文中实际使用的、高质量的对应图表。# e/ m; s& c' K9 M" a2 V/ H
参考样本集构成了一个高质量的“学术插图数据库”,主要供检索智能体进行查询和匹配。( v$ v  f4 ?/ \2 o5 u8 r
而与之对应的292个测试样本,在评估时则仅提供S、C作为输入。其对应的I作为隐藏的标准答案,不参与生成过程,仅用于最终的质量比对与评分。
1 U- A! m5 U; I9 O准备到这里,接下来就是具体生成和评估了。4 B7 ^" u: g3 N2 p& Z
裁判方面,他们采用了“VLM-as-a-Judge”(大模型当裁判)的评估范式——
& K/ k9 k: c& p! l1 r让强大的视觉语言模型(如Gemini-3-Pro)作为评委,将PaperBanana生成的图与测试集中隐藏的标准答案I进行逐项对比。9 _2 q3 j- G0 C4 A
对比的维度主要有四个:忠实性、简洁性、可读性、美观性# U+ E. U- B$ E5 \, G6 _
若PaperBanana表现优于标准图得100分,劣于得0分,持平得50分,最终计算总分。
$ }2 g  h- |4 E, \; k' ~而实验结果表明,PaperBanana在所有维度上全面超越了传统的单模型直接生成(Vanilla)等基线方法。
' s- ]& }/ [% K7 o
) d7 O3 l& _3 y9 O" u6 @! i
    & ]" d* i! K  m) }' i+ w
  • 整体性能碾压:总分相对基线提升了17.0%。其中,简洁性提升最为显著,高达37.2%,说明它生成的图逻辑更干净、重点更突出;可读性(+12.9%)和美观性(+6.6%)也有大幅领先。) Z$ u/ }, [3 z( k
  • 获得人类盲测认可:在匿名的人类盲测中,研究员有72.7%的情况认为PaperBanana生成的图比基线模型更好。# ~# F+ m7 H0 o( C- d4 p$ W* t
  • 统计图表表现优异:在需要高精度的统计图表任务中,PaperBanana的“代码生成模式”在数值忠实性上与人类水平相当,而简洁性和美观性甚至略胜一筹。
    ; f4 f9 x- J2 T: y1 r# Y5 q
+ f# p  r$ Y) s2 O* d# i) B
这里需要说明,在生成图表方面,PaperBanana有两种模式:
3 t6 L& n# ^7 c# U. g* G  ~一种是代码生成模式(默认)。让Gemini-3-Pro这类模型自动写Python可视化代码(如Matplotlib),再运行代码出图。优点是可以保证数值绝对准确,适合需要严格精度的场景。
  ~2 f: `+ ~/ G% [: j* C# L3 j另一种是直接生图模式(可选方式)。跳过代码,让图像生成模型直接根据文本描述生成图表。优点是视觉效果更顶,但数值容易出现幻觉问题。4 k, G; `: G6 Q" U/ j0 a
左图直接生图模式下,红框圈选出来的就是一些错误问题,而右侧的代码生图模式明显无误,但美观度略逊。+ U5 v8 ]6 T" \# P( i/ O

4 U: @& S. a& N! [最后的消融实验证明,检索参考、风格优化、批判迭代这三个环节缺一不可,它们共同保证了最终图像的“准确”与“好看”。
6 M. S. m- l4 Z0 L$ A1 T. l不过也需要提醒,PaperBanana目前仍有一些局限性,比如它作为生图还无法编辑,同时在很多细节忠实度方面仍比不上人类手工作业。0 \) X) Q# P* V+ `
所以,更保险的做法或许是,让它帮你优化以前绘制过的图。% E; E- V8 R& K) d# `6 q, x
在下面这套“手图蜕变”流程下,很多图都能变得更美观、更高级……当然也更容易入顶会的眼(doge)。
  u2 k6 y5 M( P( h& B

8 d4 ?/ ~: x! @( X4 N7 \谷歌x北大联手打造9 P1 P* I* m  k4 ?' w; M$ o- B
" M' a# E" c( E2 j: k8 K: n, ^% I
最后介绍下PaperBanana背后的团队。
* z- [* `; a2 g  D& q( p& m) Y  p一共7人,可以清晰分成两拨——
; j- m7 }" |  e0 H. Z3 L一拨来自北大,主要提供NLP与多模态理解的学术根基;另一拨来自Google Cloud AI Research,负责多模态系统与工业化视角。$ P$ ?/ _7 B$ m
. E# `# b# ]' n1 n) Z2 ^
署名第一的DawEI Zhu(兼通讯作者),本硕博均就读于北大,现为北大四年级博士生。
) {0 H5 F2 `. {3 _, ^0 ^! c他重点研究长上下文建模和多模态数据,之前在微软亚洲研究院实习过,目前是Google Cloud AI Research学生研究员,PaperBanana也是他在谷歌期间参与的项目。
4 g3 I$ R6 T5 E2 f+ D9 j
1 B* k3 L% P$ o: O9 j, c
借着北大这条线,另外两位来自北大的分别是Xiyu Wei和Sujian Li(兼通讯作者)。( \7 ]: R% P5 X7 F! h. R  }) ~
Sujian Li目前是北大计算机学院长聘副教授,也是Dawei Zhu的博导,主要研究自然语言处理、信息抽取等。/ C9 ?: @* B7 N' s% E% u9 h+ N2 z
而Xiyu Wei可能还是学生,目前只能看到TA和Dawei Zhu合作过一篇关于拓展上下文的论文。; m# P) o7 \4 N8 {% |) G
0 f: K% j* O3 e% A( |& I
而其他几位来自Google Cloud AI Research的分别是:) p, r) ^$ y3 V- e
负责人Tomas Pfister、高级研究科学家Yale Song、研究科学家Rui Meng和Jinsung Yoon(兼通讯作者)。1 a: h5 r: K/ _; e3 u3 z' q
截至目前,PaperBanana已在开源社区GitHub揽获上千star,感兴趣可以继续关注。
% S/ P: D7 _2 z+ ^  I
& }$ A- `% A+ b- m1 M1 s
项目主页:" u* [" T* {% i2 J9 R# `  D
https://dwzhu-pku.github.io/PaperBanana/$ A7 R7 W" v' i6 m: Y9 E
论文:6 {1 J) Y& S$ u
https://arxiv.org/abs/2601.23265& A* ^+ ]; _1 K5 M# o
GitHub地址:+ o9 s/ _7 _' Z. e1 l8 `2 z
https://github.com/dwzhu-pku/PaperBanana
集群智慧云科服专利申请服务

74

主题

2196

回帖

6841

积分

论坛元老

积分
6841
发表于 2026-2-16 17:49:26 | 显示全部楼层
不支持后期编辑是唯一的短板,如果后续可以像 Figma 那样接入手动修改,就几乎完美
集群智慧云科服SCI/SSCI/EI期刊发表服务

74

主题

2196

回帖

6841

积分

论坛元老

积分
6841
发表于 2026-2-16 18:00:47 | 显示全部楼层
说好的100%精准呢,我瞅着那代码生图模式的美观度还是差了点,就像打印店赶工出来的图,细节处总差点意思

74

主题

2196

回帖

6841

积分

论坛元老

积分
6841
发表于 2026-2-16 18:13:21 | 显示全部楼层
学术插图神器来了,AI解放科研狗不是梦!

74

主题

2196

回帖

6841

积分

论坛元老

积分
6841
发表于 2026-2-16 18:25:03 | 显示全部楼层
不支持后期编辑是唯一的短板,如果后续可以像 Figma 那样接入手动修改,就几乎完美

74

主题

2196

回帖

6841

积分

论坛元老

积分
6841
发表于 2026-2-16 18:37:20 | 显示全部楼层
说好的100%精准呢,我瞅着那代码生图模式的美观度还是差了点,就像打印店赶工出来的图,细节处总差点意思
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则


快速回复 返回顶部 返回列表