% _$ n$ m; d! b4 m
5 |+ n8 ]* Y$ v& O% F
& F. \* q! ~1 J( e2 H 7月17日,当中国工程院院士、之江实验室主任王坚在WAIC2026 主论坛喊出“让科学数据成为基础模型的原住民(First-claSSCItizen)”时,会场另一端,一家来自北京的企业正用专利数据给出具体答案。
* e+ G: m3 z' S: A在2026世界人工智能大会静安人工智能应用创新示范区,北京八月瓜科技有限公司展出的擎策全球科技情报检索分析平台引发关注——它把全球专利、科技文献与产业信息,转化为驱动科研创新的“科学数据燃料”,让科研人员得以“看准路、走稳路”。7 C& {! O/ h7 f: i2 w
为创新装上“导航地图”
! u; x( I" p' p7 O; _# S% T! Q3 O“创新主体做科研、做产品,最怕两件事:一是重复研发,二是踩到别人的专利‘雷区’。”八月瓜科技董事长李长青介绍,平台汇聚全球178个国家和地区的专利数据、科技文献和产业信息,利用AI和自研大模型进行清洗、标引、关联和分析,“本质上解决的是‘少走弯路’和‘安全走路’的问题”。
7 g+ c2 a& v) R6 r C5 s% v; e据了解,该平台采用五层递进式架构,从底层的科创全息数据层到上层的用户应用层,覆盖研发前情报检索、研发中专利导航、研发后成果转化与评价的全流程。目前,平台已构建超2亿条专利数据、总量26亿条的多维科技数据体系,服务超万家科技企业及高校科研院所等头部机构。* m+ C8 K+ a$ s) w/ Y3 z: l
妙算大模型啃下“硬骨头”& s6 U- S. w. c+ Y& f
谈及技术难点,李长青表示,最具挑战的环节是把“难读得懂”的专利文本变成“机器算得准”的结构化数据。“专利是法律文书,术语化程度高,权利要求层层嵌套,还有大量结构式、附图这类非文本信息。”# R# ~3 ]: Z3 F
他介绍,团队自主研发的“妙算大模型”和“擎策”产品,采用“机器+专家”两级模式:机器负责规模化清洗、去重和多维度标引,专家负责深度标注,将专利拆解到技术问题、技术方案、创新点等精细颗粒度。“妙算大模型”是专注于知识产权领域的垂直大模型,获科技部“新一代人工智能国家科技重大专项”支持,解决了通用模型在专利场景中“不懂行、不精准”的痛点。5 W& B6 `6 b' O
“正是这样的高投入,形成了八月瓜在专业数据服务上的差异化能力。”李长青说。
; }4 u0 j9 @0 ?1 L4 ^7 E5 x9 {( }专利数据,AIfor SCIence 的“浓缩铀”
8 r1 n0 x) U) g2 W5 u: {当前,高质量数据集建设受到高度关注。王坚院士在同日主论坛指出,未来真正重要的“不是训练一个更大的语言模型,而是让科学数据成为基础模型的原住民”。在八月瓜看来,以专利为主的科技数据,正是赋能AIfor Science的核心燃料。在李长青看来,专利数据正是这类科学数据中最具“燃料”属性的一种,他将其比喻为科技创新的“浓缩铀”:“全球90%以上的技术情报首先通过专利公开,专利数据兼具技术属性与法律属性,在来源可信、质量可信、应用可信三个维度上都有天然优势。”7 P( {! A) n. p- m* j
关于为何选择落地静安参与此次展示,李长青表示,静安区是数据智能产业高度集聚、应用场景丰富的区域,“八月瓜作为北京企业,非常高兴能把‘AI+知识产权数据’的服务能力带到静安、带到上海,与区域内的创新主体一起,把专利数据这种‘战略资源’转化为实实在在的科研成果和产业竞争力。”8 d5 m$ d8 C+ q, }/ S
李长青透露,八月瓜下一步将打造“专利数据+期刊论文数据”融合图谱,并加深与静安、与上海的合作。公司近期已完成超4亿元新一轮融资,由北京市人工智能基金等国有资本领投,资金将重点用于全球数据资源整合与“妙算大模型”持续迭代。
: a7 E2 q* C6 Q5 F) v据八月瓜平台测算,该平台可帮助创新主体降低约40%研发成本、缩短约60%研发时间,研发效率最高提升3倍以上。
6 h' i/ d& a2 x& D0 `2 y1 i从主论坛的“科学数据成为基础模型原住民”,到展台上的专利数据智能引擎,八月瓜的实践,恰是这一前沿论断在知识产权领域的一次具体化尝试——当科学数据真正走入模型、走向产业,每一次创新都将拥有更坚实的数据基石。) }9 m2 B" k, J' n/ E
4 G r/ T# }/ T2 v$ s) X# y
( X( k6 U( ^6 ~ O$ Q+ F0 C5 ]
|