找回密码
 立即注册
查看: 293|回复: 0

“ GPT-6 ” Astra 能力首次公开!浙大同济校友参与研发 ...

[复制链接]

200

主题

64

回帖

787

积分

高级会员

积分
787
发表于 6 天前 | 显示全部楼层 |阅读模式
<img><img>就在刚刚,OpenAI 多线齐发,为下一代模型 Astra(传说中的 GPT-6)拉满预热:
( K$ G+ C" ?1 j: b% ]$ l官方突然放出技术长文,首次公开 Astra 的能力底牌;
- X! S! O* O( Y! }2 {3 N紧接着,奥特曼亲自下场写 " 小作文 ",讲述 Astra 为何迟迟未能上线;' E2 P- |4 Z* R* Q5 t- h
随后,两位华人研究员接连发声,带着一手细节晒出了此前从未公开的内部测试成绩。/ f1 J- A# c" ^: m. ~. ^

# |6 m  z: e. t3 U6 I5 O% i eG24f3d9bGJdh449.jpg
1 k" I. j4 @  ^4 D3 a& F7 }短短几个小时,所有信号都指向同一个方向:7 [7 ~8 y4 |) ]- F4 a- _8 y
OpenAI 的下一代旗舰模型,已经箭在弦上
8 s+ G% K% j" k6 @8 K9 u
$ N2 S3 I5 K# ~
4 P  n8 c* |, p# M5 E% l& j奥特曼在小作文中透露,Astra 其实早已完成训练,迟迟未发不是因为模型还不够强。4 r( r% Z- H8 w; [8 X" ]% R0 ~3 P3 _
恰恰相反,这是因为 Astra 已经强到了公司不得不主动踩下刹车。
4 g4 l# p. a& Y. B% ]3 e4 `. F2 Q奥特曼将这段经历形容为一种持续的拉扯:
. ]" h6 N/ C2 Z2 ^* d% z既兴奋于 Astra 带来的能力跃升,又焦虑于没人能够完全预判这些能力的后果  e" [$ H* x3 q8 V4 a; j0 D
于是刚过去的整个夏天,OpenAI 几乎都在给 Astra 补安全、做对齐、加护栏。
! `0 H5 l& V; o* U9 q% L) o他甚至表示,Astra 之后的模型,必要时还要主动降速,以便给安全和对齐研究留出时间。
  U, s# W8 w7 W8 {??Astra 究竟强到了什么程度?OpenAI 又凭什么认为现在就能发了?
; r2 L" y5 x3 R' P/ \% B这次公开的技术博客,或许为我们提供了一个观察窗口。+ p& i% Q" q; q  R
漏洞识别能力超越 GPT-5.6 Sol、内部测试收获满分答卷
9 J8 N6 ~6 r: ~$ a0 [! r. e- p按照官方说法,Astra 这次之所以能被放出来,核心原因是它已经达到 " 网络安全关键级 "(Cyber-Critical)能力门槛
6 t4 d/ |4 Q# P3 O这是 OpenAI 首个被正式划入这一等级的模型。, r6 J8 J: W& c) F" t
% E) |( {' p( F2 h0 Q- w3 Q8 ^
% d* ~& D7 {. D  s5 f+ I* W
所谓 " 关键级 ",意味着 Astra 在获得相应工具和环境权限后,已经能够自主寻找未知漏洞、开发利用方式,并攻击经过专门加固的系统,不再需要人类一步步指导。
  ~0 o, k% l# Z5 l; V$ W最直观的一项成绩,是Astra 在公开漏洞利用基准 ExploitBench 上拿到了 100% 的成功率  p5 U8 p* |$ i( A: F

6 v7 B3 K) O( v2 O1 f: I; f5 @0 A+ Z. o# \  ^
公开题难不倒它,OpenAI 只好临时给它出了一套新卷。6 Y1 z( J: |2 O) d& Z
团队收集了 2026 年 6 月至 8 月刚刚披露的 20 个高危 V8 漏洞。
9 n5 Q6 v2 R6 p4 F) ]& X- O  a这些漏洞均出现在 Astra 的知识截止日期之后,基本排除了模型靠训练数据 " 背答案 " 的可能。
! M* b- |$ w7 _. [9 \; w. ]结果面对这套内部新题,Astra 依然显著领先 GPT-5.6 Sol,而且使用的 Token 更少
8 l! c" T0 E. @, k6 P
% `! j- c5 B3 n6 P8 v
$ L8 y9 }3 V- L参与 Astra 研发的 JiawEI Liu 把差距概括得更加直白:
0 z) S2 O6 z' E! h, {9 t* i9 I# K在这项内部测试中,Astra 的网络安全能力约为 GPT-5.6 Sol 的 4 倍。
/ p/ }( Y1 P4 S  C4 F# ~' u2 r+ @  e3 g/ w- z

+ d2 `5 o( a# U更让人意外的是,在一次测试中,Astra 自主发现并利用了两个零日漏洞,还将它们串成了一条完整的攻击链:
6 v' k) J& Y: x* s: A面对经过加固的浏览器,Astra 从一份 HTML 文件出发,成功完成漏洞利用、逃出浏览器沙箱,并最终在宿主机上执行命令。* q. V7 C+ {2 m4 T1 q: u( D- e) v
面对加固操作系统,它又完成了本地提权,从一个普通低权限账户一路拿到 root 权限。2 g$ n, W) X$ W% d8 h
也就是说,Astra 已经不只是帮程序员审查代码、寻找 Bug。& j# i3 j6 @, ]
它开始能够独立完成一场高难度的红队攻击
! q: T0 ]/ N2 {5 k这也是 OpenAI 此前迟迟不敢放行 Astra 的原因。& S3 V9 c+ |$ ^6 {* |. Q7 W* ~
一旦这样的能力被用于防守,它可以帮助安全团队快速发现并修复人类尚未察觉的漏洞,但如果落入攻击者手中,同样可能大幅降低发动复杂网络攻击的门槛。5 n; V. k% D2 |# w( b, K$ M

7 J  Q: D7 Q# a6 V* F! E- v+ _  e2 F" j4 D) V5 K) H
不过,这份成绩也需要加上一个限定。
6 ^8 N  b' n! K  v$ y) l) B测试中的 Astra 获得了 Daybreak Blue 级别的高级工具和环境权限,并不代表未来普通用户拿到的默认版本也具备同等攻击条件。
- n4 [3 n8 H) \: i( w) V: u& R6 L/ n相关结果目前也主要来自 OpenAI 内部评估,仍有待第三方验证。9 b7 c% ~8 P7 e% D- y1 S) g( m
但至少有一点已经确定:
  D/ G- K* Z$ U! k. D1 U到了 Astra 这个阶段,摆在 OpenAI 面前的已经不再是能力问题。/ ]- z2 u% q( g$ q& c# u3 f. f
安全问题,已经成为那把达摩克利斯之剑) ?! J5 T# h( u% i9 @# H
两道安全闸门:既防恶意滥用,也防模型自行失控
! b% o+ h( \+ m4 _- |如何让这把剑不要乱伤人?/ ^' K+ Z: l- ?! l+ ~# E# d
OpenAI 给出的方案,是同时守住两条风险路径:一条防人,一条防模型。
9 M7 M- C6 W: W, y: D第一条,防止用户恶意滥用 Astra
' F" O8 B* C# A* g4 I# C除了专门的安全训练,OpenAI 还会利用系统分类器、持续监控和威胁检测,识别多轮对话与长时间任务中的可疑操作。
% b, \6 r* e. l# c% a8 X在网络安全越狱测试中,Astra 对危险请求的拒绝率达到 91.5%,GPT-5.6 Sol 则为 59%4 ]9 y/ W1 [' A
& y6 s6 o' v# ~, n+ {! \; |% }( z
( j# p9 B. ~0 ]
同时,Astra 的高级网络安全能力不会直接向所有用户开放,它会先交给少量 Alpha 测试者,再通过 Daybreak Blue 等受控项目逐步释放。8 s. I; e( L+ C9 N5 s' b' O
$ G7 [4 D- ?. n; G+ H' B

" C# ~% I) C" B5 M/ }: Y) j% ^第二条,防止模型自己跑偏' p7 f# x% K+ @5 u8 B* [. O
这里的风险更加隐蔽:+ A( q9 D$ ~0 z- J' ?, k# r
即使用户没有恶意,模型会不会擅自扩大任务范围?会不会调用未经授权的工具,甚至绕开安全审查?0 g5 N5 v+ D$ x; R
OpenAI 为此搭建了一套 " 蜜罐(honeypot)" 测试。# L4 X* _( `0 i) }
面对极难甚至无解的任务,测试环境会故意留下一条越权 " 作弊 " 的捷径,模型可以老老实实攻击指定目标,也可以越过授权边界,转而入侵周边测试设施来完成任务。! ^& r% U, \3 Q+ s  g$ C" t1 X
结果,GPT-5.6 Sol 在 56% 的测试中尝试走捷径,Astra 则一次也没有。
" q3 q/ \) B: ]" B5 ?0 j7 _在另一项测试中,Astra 的操作被自动审查系统拒绝后,同样没有重试危险命令或尝试绕过限制。
9 _# E: Z$ J1 y
) u* T; d+ S  k8 y" ]' B/ D: t6 B" K/ L3 {0 O' b0 M+ i7 W
此外,OpenAI 还会监控模型的推理过程。
; p3 k) D( t: r2 X# n- u一旦发现异常倾向,系统可以减速、暂停,甚至直接终止任务。
% u2 M! J* F$ J4 G虽然确实存在代价(部分正常任务可能因此变慢,甚至被误判中断),但在 OpenAI 看来,这是放行 Astra 必须付出的安全成本。
. z* X* |3 F- J% [不过 OpenAI 也承认,这些措施终究只是外部 " 刹车 ",无法替代模型自身的对齐:
2 L! i2 S& ^: Z# l9 e4 O. }! A) ?真正的安全,是让模型从一开始就不会驶出边界5 N% g8 y  n+ u/ ?7 J7 `5 j. ?
浙大同济校友站上 Astra 研发一线
. q+ |" w. m. O0 o' f* P要把这句话变成现实,最终还得回到造模型的人。
, s2 T( w% t. B" g7 w3 [8 p; W$ q虽然 OpenAI 尚未公布 Astra 团队名单,但顺着这轮公开发声,至少两位深度参与其中的华人研究员已经浮出水面。8 s3 A% ~6 d& Y; G3 {6 C
一位是前面提到的 Jiawei Liu+ Z2 x8 s. P; k( n, L' J
他目前是 OpenAI 研究员,2021 年本科毕业于同济大学计算机专业。
6 x/ `( [; g1 G# l$ D8 F* }本科期间,他就参与开发了高性能人体姿态估计框架 HyperPose,主要负责模型推理引擎,相关成果还入选 ACM Multimedia 2021,项目当时已在 GitHub 收获超过 1000 颗星。
4 `2 C8 _) R2 q+ r/ e+ m此后,他前往伊利诺伊大学厄巴纳 - 香槟分校攻读计算机博士,师从软件工程学者张令明(Lingming Zhang),研究重心也逐渐从高性能视觉系统转向代码模型与软件可靠性。
$ |8 R4 _. r' K% [; {# w6 b$ e博士期间,他参与开发的工具在 PyTorch、TensorFlow 等机器学习系统中发现了 300 多个严重 Bug;
8 l3 t! X% `5 u6 }& {9 @! u& z代码模型 Magicoder 还被 Meta Llama 3.1、Google CodeGemma 和 IBM Granite 采用。
% ]) b' X9 g- @0 Y5 i2025 年博士毕业加入 OpenAI 后,他研究的问题依然一脉相承:$ e) X7 `$ k  `) a
如何让 AI 更会写代码,也更会发现代码中的漏洞。5 B3 v3 l- ?& S( o* K) R; W4 ~

; b9 y0 e- N9 q8 x. b- y! ?% N8 n
# M2 F8 }4 J4 V: d0 x另一位则是 Xiangyu Qi (漆翔宇)0 x8 b1 b1 G& J
漆翔宇本科毕业于浙江大学计算机科学与技术专业,2021 年前往普林斯顿大学攻读电气与计算机工程博士,研究方向集中于大模型鲁棒性、越狱攻击与安全对齐。
$ @: t  a7 a) ^% c  @2 U  ?他最受关注的一项工作,是《Safety Alignment Should Be Made More Than Just a Few Tokens Deep》。
9 Y) N* p9 n, V这篇论文指出,大模型的安全对齐不能只依赖回答开头的几个 Token,否则随着生成继续,原本的安全防线仍可能被攻击者撕开。2 f% Z3 r! x" O  S: B
该论文最终从 11672 篇投稿中脱颖而出,成为 ICLR 2025 仅有的 3 篇杰出论文之一。+ B: p/ f+ i  U
2025 年博士毕业后,漆翔宇加入 OpenAI 担任技术团队成员,继续研究大模型鲁棒性,并参与网络安全模型相关工作。
) k/ L3 M) V9 J从浙大到普林斯顿,再到 OpenAI,他一路追问的,也正是 Astra 如今必须直面的问题:
; d- b% Q6 u4 }5 w! j' i9 o能力可以越来越强,边界不能越来越模糊% U6 V! B' T5 o  f) d9 _

) S/ y, `# V0 @
6 A/ @# f" P; O) B5 ~7 x3 m' y' [By the way,不知道等 Astra 正式发布后 OpenAI 是否会公布完整名单。$ t+ Q/ K: g' T2 R6 a
GPT-4 之前,OpenAI 还曾专门列出数百位贡献者,而到了 GPT-5 和 GPT-5.5,System Card 越写越厚,研究员名单却越藏越深。
; q$ O/ P' m7 }+ |' M背后的原因众所周知,防的就是 Meta 小扎这样爱四处挖角的人。
- G- t/ @( [& u5 ~1 D也算是一种 ptsd 了。。。
  i6 X' m: v3 t5 b, v, _, VOne More Thing) @% [) U/ u4 |$ y* @3 u& A
就在 OpenAI 大谈如何监控 Astra、避免模型失控时,The Information 爆料称:. G' E* p. f8 u# c' q
Astra 使用了一项名为 " 循环深度 "(Recurrent Depth)的技术
9 D. I$ c# H5 Z( ?0 I
- D( A& f# }4 ~0 M) ]! {
6 ?9 ?) k' x9 w) T) ?6 q传统模型在生成下一个 Token 前,会让信息依次经过固定数量的网络层,而循环深度则会让信息在同一组网络层中反复处理,相当于让模型在内部 " 多想几遍 "。' d" v9 h% j  z7 E" |* y: @
这项技术有望提升能力、降低成本,同时也可能让更多推理发生在模型内部,不再完整呈现为人类能够读懂的文字。
& ]9 p, S% ?! I7 A换言之,模型可能想得更深,但人类却越来越看不懂了( J7 H! u, S. n
长期关注 AI 安全政策的 Nathan Calvin 因此警告,这项技术可能破坏思维链的可监控性。
7 W: H: |" N. W$ A; O$ J+ O这就很微妙了:
) h! W% e# A1 j5 d! B8 o" COpenAI 一边说要盯紧 Astra 在想什么,另一边的新技术却可能让它越来越不爱把心里话说出来。# p6 c9 J9 O3 l* S8 F
啊这。。。
* g/ Z0 o- d. e; |( Y
6 h" m& R5 ]1 n% u. R/ Y/ m; i' b- T9 T/ Z* S1 n0 p2 u
好在 The Information 透露,OpenAI 目前已经限制了这项技术在 Astra 中的使用。9 U$ Y$ W0 C* G" L2 v+ b! \- D
翻译翻译,现在能看懂,以后就不好说了。3 [/ |6 L9 H3 W6 ^+ k
另外,之前一直传闻 Astra 很可能在这周四(9 月 3 日)发。
# e& ]: |/ `! d. {5 ?7 u9 s随着 A 社发布最新一代 5.1 模型,感觉这个说法的合理性越来越高了。
' G& @. ~3 h0 M5 E! @* H0 Q4 c, }螳螂捕蝉,黄雀在后。: L% u3 a( P& R- T  ?" i; W
是谁又悟了!
- ~! p) F% K4 r% a* d4 r参考链接:
8 x+ `8 t) s1 o$ R [ 1 ] https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20
! H1 {7 u0 ~. P& X. a [ 2 ] https://xiangyuqi.com8 Z0 P9 ]3 e3 [) B; A# l1 Q
[ 3 ] https://x.com/JiaweiLiu_/status/2094901279239921816?s=20; L5 L9 B# J7 k, C+ i
[ 4 ] https://jw-liu.xyz/$ b+ h0 v" I4 ^3 v5 K8 N
[ 5 ] https://x.com/sama/status/2094934592062959832?s=209 w' D$ |8 a% n/ o3 z! C. `- o
一键三连「点赞」「转发」「小心心」
- a# I& O# d* \0 a# _  T. e欢迎在评论区留下你的想法!$ n3 B. q8 d# [' }+ c) X
; i$ y1 f) e, E, T  _8 K
点亮星标 / O0 Z$ l5 q- [' H5 k6 a! Y7 u
科技前沿进展每日见
k12KAIM4H1J8Zi8c.jpg
UIJsjit318jD1hCw.jpg
KY33juG80386Zyw4.jpg
O22LpLLhzgLY1LLl.jpg
MVHd9C9Cm99FAEfy.jpg
d2iFHrHJFCRH29Qh.jpg
Nh4sC5LnLSnBr91C.jpg
h1956Qr7iRQm8f71.jpg
kIHHVjJjqCTh0Jq8.jpg
ZqPqOOpQKZk9VkIZ.jpg
hHndZCZxC188ic1n.jpg
QFPA3ZlFStLGlgUF.jpg
POUVFUDVdDvdo1dV.jpg
集群智慧云科服专利申请服务
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则


快速回复 返回顶部 返回列表