找回密码
 立即注册
查看: 898|回复: 0

你的 AI 助理一闭嘴就在「发呆」?上交大 ProAct:把 Agent 的空闲时间变成 ...

[复制链接]

214

主题

70

回帖

869

积分

高级会员

积分
869
发表于 2026-5-28 16:05:17 | 显示全部楼层 |阅读模式
O6c6Ch2zoC29k43o.jpg
4 f$ Y9 r4 D% V8 o/ k3 h0 q6 f) }+ K6 P# a
ProAct,一种将对话间的空闲时间转化为主动准备机会的新架构。) B8 B3 B& t7 r! m- Q. J' ]2 h9 e
"帮我把明天上午10点的项目评审会安排一下。" 你刚对 AI 助理下达了指令。
7 X' e$ P+ I  h: D"会议已安排。" 然后呢?然后它就原地“下班”了。
  ?4 d- U8 h" {8 V, O直到半小时后,你突然想起来:"对了,还得准备10页的项目进展汇报 PPT,要有风险评估、下一步计划和演讲备注。"- h8 t+ x1 P$ T7 l& A# ?
这时,传统 Agent 才如梦初醒,开始翻阅历史记录、梳理项目进展、组织材料结构。但一个真正靠谱的人类助理,在你提了一嘴“明天开评审会”的时候,早就在脑海里过了一遍——你肯定需要进度摘要,大概率还要看风险点,甚至连 PPT 大纲都已经在后台默默帮你搭好了。9 A1 K+ b! W2 a  C% [' s
上海交通大学 APEX 实验室提出了ProAct,一种将对话间的空闲时间转化为主动准备机会的新架构。它不再等你把每一个需求都像挤牙膏一样说出口,而是在你沉默的时间里,默默为你“偷偷备课”。4 S- ~$ z/ P2 I! _6 n/ s' g2 a
JrZracZjceDJomDA.jpg , f5 G2 H2 y- E8 l
9 W2 F- @4 d" s. H/ j/ @5 U
图 1:传统 Reactive Agent(上)vs ProAct(下)的交互时间线对比。传统 Agent 在完成任务后进入休眠,用户提出新需求时才从零开始准备;ProAct 则利用空闲窗口预判可能的后续需求(如评审材料),提前检索证据并组织内容,在用户开口前就已准备就绪。7 F& B5 D; b9 g" `6 T
论文标题:Anticipate and Learn: Unleashing Idle-Time Compute in Proactive Agents, R3 x8 k# g2 ]9 S
作者:Haoyi Hu, Qirong Lyu, Xianghan Kong, WEIwen Liu, Jianghao Lin, Zixuan Guo, Yan Xu, Yasheng Wang, Weinan Zhang, Yong Yu
  `% {  l& M/ ~1 M; g+ r单位:上海交通大学、腾讯0 a) Q2 f$ J/ P' s
论文链接:https://arxiv.org/abs/2605.25971, U. g- J( |; B/ ~' ]/ b: j
项目地址:https://github.com/AgentACE-AI/ProAct
$ o5 W+ {9 g: a2 F+ {Demo 页面:https://agentace-ai.github.io/proact-showcase/
3 H0 i1 }$ Z+ R& B7 m' j$ G- v01
/ }, i+ L# a! s  d
0 s! ^+ d% H8 J1 f+ H
6 e- _. Z: p6 H* Y
Agent 为什么总像“客服”?
) l8 H9 i- t: U3 X心理学中有一个概念叫前摄应对(Proactive Coping):人在预判到未来需求时,会提前积攒资源、预做准备,而非等到火烧眉毛才行动。
3 |, h) K3 w1 D4 `然而今天绝大多数大模型 Agent,本质上依然是 Reactive Agent:你拨一下,它转一下;你不问,它就休眠。它们把用户两次交互之间的空闲时间当成纯粹的空白。5 A7 G; e; g& z2 b
ProAct 的核心主张:空闲时间不是空白,而是被浪费的算力窗口。把一部分工作提前搬到空闲窗口,让 Agent 在你沉默的时间里主动学习和准备。/ j  h/ n8 ?% h; b* m8 D) X
025 G! e( ]4 f% q( Q
8 L( H8 A* E1 l" P* E
9 g! {% ^5 A, v8 F/ s& l0 C
ProAct 架构:& T2 ?2 F" F2 B, [
从“瞎忙”到“神预判”的三级流水线
9 K8 v+ p9 U1 N. g如果随便给 Agent 塞一个后台搜索的权限,它大概率会变成“智能骚扰”——一有空就疯狂弹窗,推一堆没用的信息。ProAct 不是在后台盲目乱搜,而是设计了一条严谨的主动计算流水线:预测 → 筛选 → 交付。& g7 W& c% ]; N
Hv2nM2HKnDnixK2D.jpg & |# W( L' K' Z; j( p: C
) L& L1 N. x; Z. i
图 2:ProAct 系统总览。前台交互完成后,系统更新持久记忆(用户画像、知识库、对话轨迹),随即进入空闲期主动计算:Future-State Prediction 预测未来需求,Idle-Time Acquisition 对高价值候选执行定向证据检索与知识合成,最终由 Utility-Aware Delivery Policy 决定推送、排队还是静默存储。, U3 a7 M. y  V
Future-State Prediction:精准锚定未来需求1 i' K  }4 {5 `- w) p9 k: f
预测模块从两个源头生成候选需求:& l% g3 U  Y% K7 G2 A' b, f: S: j4 X
! _" W; h2 w2 V: W" X% S& k

    3 G7 D6 G9 R  A8 M0 x  {

  • ( R+ i5 i! G+ {. o$ I9 v本地场景推断:从最近几轮对话中直接推断可能的后续需求(如安排评审会 → 大概率需要评审材料)* n, Y7 K+ G+ n/ U3 C, c
    ! U  h5 v9 K3 g" h* b

( Y, A! i4 ~. [, E* X" M

    - @; |, a6 J0 R$ W1 n3 D2 S  i5 \
  • " P8 q- j5 {3 A/ q6 [
    关联扩展:从持久记忆中的用户画像、历史摘要、未完成目标中扩展相关方向
    7 d1 o! r  R& j* Y+ [, B% m1 N. v7 R7 h* b9 G. A  M4 y% S

% h/ h5 @* E/ a( {% ?此外,当记忆层检测到过时、不完整或证据薄弱的知识条目时,这些记忆缺口也会被转化为候选需求——让记忆维护直接驱动信息获取,而非被动等待查询。候选经过置信度过滤和去重后,输出一组紧凑的预测集合。
% b) o+ }  Y- B$ ~' ^回到开头的例子:你刚说完“安排明天的评审会”,预测模块已经推断出“需要项目进展材料”和“可能要看风险点”两个高置信候选。- ?% s- x5 @/ @  g: X0 B) f
Idle-Time Acquisition:算力花在刀刃上* ?$ Z$ @9 M. A' ^- M
每一个候选需求,都要经过四维价值打分:
5 z* s7 N1 h$ f( g  @1.用户相关性(Relevance):和当前目标关联多大?2 {- M! H& ^4 x$ i+ I
2.知识缺口(Gap):记忆里是不是已经有答案了?/ @, q. H3 ]* \+ \
3.增量价值(Value):现在准备能省去用户多少未来的麻烦?
, |8 r9 M) B* O# W4.时效性(Timeliness):现在准备时机对吗?2 T- q: A7 c: D9 \
只有总分超过阈值 θ_val 的候选才真正获得算力执行。而执行时,系统还做了增量搜索优化:已有的证据直接复用,部分覆盖的只补缺口,完全没有的才启动迭代搜索。这使得空闲计算不是从零开始的全量搜索,而是增量拼图。! _' A$ u. v8 C+ }& y
回到评审会的例子:你的项目进展数据上周刚更新过,直接复用;风险评估是空白,系统才启动定向搜索补上这块缺口。3 q0 N* w$ T+ |
Utility-Aware Delivery:推还是不推,这是个问题; k: V1 K' a; ?" y- e* }4 j+ x" v
准备好材料后,ProAct 绝不会无脑弹窗。交付策略基于一个效用公式做决策:' v) ?: ~: s7 u6 S

# h. n) p" R1 |% t' R4 C) F( v
U(x) = E[V(x)] − C(t)
/ D  R$ Y" R( e
V 是预期信息价值,C 是打断用户的成本。只有当 U 超过自适应阈值 τ 时,系统才决定交付。交付方式分三档:1 H; d; d1 T; ]* N0 j( w
; R( k( c+ {+ j" k  K- I
    3 l6 ]1 h2 j5 f0 ?4 m
  • 2 I+ Z* j7 B: g% k- A# U7 _- U5 Q
    Push(主动推送):价值极高、时机刚好,直接通知(如:"我已经把评审材料大纲整理好了,需要展开吗?")
    , l2 ]/ z& R$ m( u  _6 E$ V7 m. r: n

* G- ^6 G( t, S* k

    ) Q, O5 T4 L, Q. c# O1 v
  • 6 h* x8 w) Q0 i% S% U
    Queue(排队等待):有用但不紧急,等用户下次提问时自然融入回复
    ! C% ~% Z6 F, R8 W' {+ @6 o) t1 I! W9 w, |( u% n
3 L3 }8 u! {2 p8 K6 P. `( D

    ) t% Z; X6 q3 J

  • 5 v: h% U+ \. C9 W1 k! ]Store(静默存储):大概率有用但现在不宜打扰,存入长期记忆,等用户需要时瞬间调出6 L/ C3 f# _6 t
    9 E8 ~* G' W5 Y$ n$ G0 s  O
3 {! S  W# e6 E, F6 p
03
0 G! V! \6 Z9 `
  z/ P+ J& n" r5 M% V) e5 b' h

: ^8 E5 {7 R- RProActEval:200 个场景的硬核评测) C5 a( D) D% W7 L: q

% u8 a- ?, T) ^" r' S; Z. w6 g" q  @9 p0 ~评估一个主动式 Agent,不能只考“记忆力”,还要考它能不能在你开口前就把活儿干了。为此,论文构建了全新评测基准ProActEval
# g* k, N4 U  ^
9 ^! x% _5 \# p+ S; z

      g$ g# [8 L5 p
  • 0 |( S: A" O1 P6 Z
    200 个场景,覆盖 40 个领域(金融规划、软件发布、网络安全、搬家、税务申报……)# `9 I% A, ?/ x7 \

    : R: S- N4 T6 s+ s; d# S
6 W4 e0 g  z" A1 Q" ?& L

    1 C2 S7 U( W' C$ {& G9 K

  • " G2 m6 Y2 f" e0 [每个场景自带Fact Sheet(12-37 条原子化可验证事实,全部虚构实体)
    0 u( F7 E4 T4 L; j7 j% j$ k4 Z
    & W7 ~2 Q" Q0 P/ c5 z7 i
! S9 i3 B; t6 G: ]. u$ u$ f" f2 e

    ' `2 m6 g) d3 t

  • ! x* v1 i4 Q% s; b. r) r: G3 J每个场景包含5-15 条用户需求,标注了重要性等级、依赖链和可预测性关系; y* P) E5 G- W, Q+ s: ^: Z/ ?

    % h! z7 T$ `  T9 G, V

9 ^/ W4 ^5 r; Z* t3 `% S9 g( w6 [
    $ z! a! k7 y3 L, d0 R
  • . a' i' ~* A- ]& |: e/ X$ k
    Agent运行时看不到gold label——不能偷看未来需求,只能走一步看一步, c7 O8 g' T& q1 `6 d& ^, d% o

    & a$ [' E9 ]3 u6 y

5 G# b' c# x+ l) T9 ]( ]实验设置了三个对比条件:" v- j  x4 R$ d7 m3 |
UTGZ1M8MnX5grG8r.jpg $ Z. m/ }+ G$ }9 U7 L: j& i
% s% j8 l6 k* c- j0 [9 D) [3 M
主实验结果* H# V% i  ?, D2 z' o) J9 W; ]7 X
yaUA5Fa30TU9IU0O.jpg
% R: L3 b2 V& g1 V$ ?: O( R0 q% o8 }: W4 C6 J; C+ O
关键观察:原本需要来回拉扯 8 轮才能完成的任务,现在不到 7 轮搞定;幻觉率暴降近三成——因为有充足的后台时间做事实检索,Agent 回答得更准了。8 i& o7 g1 K6 Q! ?. V' r
对比 ProactiveAgent 基线6 D% a7 R" y5 f' K
论文还将 ProAct 与公开的 ProactiveAgent (Lu et al., 2024) 决策协议做了对比。ProactiveAgent 虽然在 69.6% 的 turn 上都尝试了主动任务,但方向不对:
3 {+ ~! L: Q5 C GmNIiEI77hh2I728.jpg
4 h* p3 Q( z! i9 J# J0 }$ C* S9 L" }4 p' N9 W5 R+ W
这说明:光有主动尝试的意愿远远不够——方向对了才有价值。ProactiveAgent 做了大量主动尝试但几乎全部打偏,ProAct 的预测精度使得每一次主动准备都落在用户真正会问的方向上。
! e4 h5 o" u  B+ _, T04
# D4 Y/ s+ N4 z, c" N, ]: B
; N" [9 Y; o- H5 N2 i! h0 I( h5 D! x
- D, ~+ V# w, h" v( Q
关键发现:) [+ T7 L0 b. ~/ B
算力花在哪,比花多少更重要
# T; k" m5 D( ^% Y# V

& @: U: R" K- |- o" y论文中设置了一个非常有意思的对照组——Undirected Idle。这个条件同样在后台消耗算力(平均每个场景 69.8k active tokens),但因为没有 Future-State Prediction 的引导,像个无头苍蝇一样乱搜。/ h" g; s* l2 v! _+ E
结果:它的 T100 仅比纯 Reactive 下降 0.07 turns,几乎没有改善。而 ProAct 虽然多花了 60% 的 token(111.8k),但换来了 T100 下降 1.2 turns、覆盖率提升 7.2%、幻觉率下降 28.1% 的全面收益。, b) T- ^  q! Q% Y
空闲时间计算的价值不在于多算,而在于算对地方
- L" X9 u: f, t7 B( L) d进一步的搜索预算扫描(k = 4, 8, 12, 16)验证了这一点。随着 k 增加,Anticipation Recall 从 0.253 单调上升至 0.432;但 User Effort 并不单调下降——一旦主要的可预测需求被覆盖,追加搜索追的是边际越来越低的长尾需求,active-token 成本却持续攀升。! h* i5 D7 @$ ]4 |, Q
yINRtFgrnRcGCR5G.jpg
. {6 W* ~' L4 _; u6 |6 ?5 N) U9 w4 ?. F8 t+ S- T
图3:搜索预算分析(50 场景子集)。横轴为搜索预算 k,四个面板分别展示 T100、User Effort、Anticipation Recall 和 Active Token 成本。灰色区段标注了相同预算下 Directed Idle 与 Undirected Idle 的差距——在每一个预算点上,有预测引导的定向搜索都优于无方向的盲目搜索。但随着预算增加,效率收益趋于平缓而成本持续攀升。- L/ b& u' _7 X5 L- D# C
主动计算是一个需要精心设计的操作点权衡(operating-point trade-off),而非越多越好的暴力堆算力。
# I4 Y# q4 u2 a' b& s" g# a05
3 e5 _. q" ~% O% T. x. I. e* b
  g- o- u$ b: R( G
: y/ M- Y8 i8 u$ s1 t
MemBench:
5 H! |$ e* K: l3 \2 C, A; y预测建立在坚实的记忆底座上
1 R2 @- J/ g  C, N8 z) f
1 H2 s0 i$ `$ x% a0 D; I
在 MemBench 记忆基准测试的反思参与设定中,ProAct 展现了稳健的记忆能力:
  b( X7 ]2 M. h% D v1jqWuB17LU1qSbj.jpg + M: H, r2 u" H4 S
4 i5 Y' A& h% t
这证明 ProAct 的未来预测绝不是凭空猜测,而是建立在对长期用户偏好和情感状态的准确推断之上的。
$ ~# ]: h7 V4 F/ z$ \06
! r# B% x$ \) H0 Z
1 J# X6 {( D5 W' O# [- [

. A+ Z2 C+ `) i2 `6 m  e结论
9 l5 ^5 G. ~) r: U  P- K

. P! y( a- o1 {0 NProAct 之所以能做到主动预判,不是靠猜,它通过持久记忆持续积累用户画像、历史偏好、实体事实和情感状态。当这些信息被系统性地组织和推理之后,Agent 在某些维度上甚至比用户自己更清楚“你下一步会问什么”。1 s- V7 [, i5 j( G3 N* f
从 ChatGPT 到目前市面上的各类 Agent,交互范式基本停留在“你问我答”。但人类真实的协作从来不是回合制答题。如果说 RAG 让 Agent 学会了“现查现答”,长期记忆让 Agent 学会了“铭记过去”,那么 ProAct 试图补全最后一块拼图——面向未来做准备。
! o; Q" L! e5 z( @. j  e# q6 _回到开头的场景:当你说完“安排明天的评审会”,一个真正主动的 Agent 就已经在为你准备 PPT 了——不是因为你吩咐了,而是因为它知道你一定会需要。; s' ]5 E; _% C* g9 D8 b1 g+ w* ^& T
更好的 Agent 不只是回答得更快,而是在你开口之前就已经在正确的方向上做好了准备。* ?* y9 g9 z. D$ B2 ^
想亲眼看看主动式 Agent 的效果?0 P% y1 D6 }, E+ W) R$ r
访问 ProAct Demo 页面:& Q3 x) q- [( Y! f6 D
https://agentace-ai.github.io/proact-showcase/
9 W0 A3 z) e( U" B未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
% A& u0 z" c, C/ W% g4 x" l公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
集群智慧云科服专利申请服务
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则


快速回复 返回顶部 返回列表