大旗号
科技 汽车 财经 数码 时尚 旅游 美文 美食 其它

大语言模型≠大模型:让科学数据成为“原住民”,一场正在发生的范式革命

观自在 2026-07-24

2024年底,《美国天文学杂志》发表了一篇论文。论文只有一位作者不是资深教授,不是博士后,而是一名18岁的高中生。他利用一颗已退役的小行星观测卫星留下的旧数据重新分析,最终发现了近150万个此前从未被编目的天体。而那颗卫星最初的设计用途,甚至不是为了寻找这些天体。

这是阿里云创始人王坚在2026年世界人工智能大会上讲述的一个真实案例。

开篇这个故事,跟大多数人理解的AI”似乎没什么关系——不涉及大模型、不涉及算力、不涉及任何我们熟悉的AI标签。但正是这看似不相干的故事,指向了当前人工智能发展中最容易被忽视、也最可能引发下一轮变革的关键方向。

 

一、惊人速度:但AI远未触及“智能”本质

今天,讨论人工智能几乎不会让任何人感到陌生。它可以回答问题、创作内容、编写代码、辅助办公。

CNNIC数据显示,截至2025年12月,国生成式人工智能用户已达6.02亿人,普及率42.8%。从2023年ChatGPT引爆公众认知到42%的普及率,只用了约2年。在国内,从DeepSeek-R1模型问世算起,这个时间跨度更短,仅仅1年。

 

回顾科技演进史,尽管革命性技术从问世到普遍应用的周期持续缩短,但同样42%的普及率,中国从1997年正式接入互联网到2012年达到这一水平,用了整整15年。

AI的普及速度不可谓不惊人。

然而,一个值得正视的问题摆在面前:我们如今日常使用的AI,真的“智能”吗?

答案恐怕没那么乐观。

多数人接触和使用的AI,并非真正意义上的“大模型”,更准确说应叫“大语言模型”——一个搭建在文本数据之上的基础模型。它在做的事情,本质上是让机器更高效地处理人类已经写好的文字。

文本处理并非AI时代的新生事物。古代汉语没有标点符号,文字之间也没有空格,这给阅读带来极大挑战。后来人们给文本加上标点、在适当位置予以分隔这就是文本处理的原始形态。

今天的AI模型以文本数据为根基,它处理任务的上限,仍停留在人类已有的知识体系之内。它通过电算加快了处理速度,却难以主动探究那些尚未被人类用文字描述过的信息。

 

二、边界显现:大语言模型的“已知”困境

回到开篇的案例。

NASA用那颗卫星进行近地天体广域红外巡天探测,扫描全域天空。而那名高中生用同样的数据、不同的分析方向,发现了海量未被编目的天体。类似情形并非孤例伽利略当年使用的观测数据,大多来自前人的整理留存,他并未专门采集全新数据。

 

面对这类“原生数据”,今天的大语言模型并不能自主产生探究方向。除非人类给它一个清晰的任务指令、一个明确的筛选依据,否则它只会停留在“处理已知”的层面,无法跨越到“发现未知”

这就是当前AI的智能上限,也是将需要被打破的能力边界

王坚在2026WAIC演讲中指出的,正是当前AI需要直面的挑战与革新方向。他称之为“范式变革”。

在他看来,过去的基础模型只把语言和代码作为核心训练素材,科学数据长期被边缘化。未来真正重要的不是训练更大的语言模型,而是让科学数据成为基础模型里的“原住民”,与文本、代码平权,地位同等。

这意味着AI将不再局限于“阅读人类写好的知识”,而是能够直接理解那些从未被文字记录过的信息:光谱、地震波、基因序列、天文观测信号、地层化石记录……

 

三、科学数据:应纳入大模型的“原住民”

举例来说。

古生物学领域长期面临一个难题:地层中的化石记录永远无法做到完整,我们能观测到的化石出现与消失区间,与物种真实的存续范围之间存在天然偏差。过去,科学家主要依赖人工统计和地层对比来推算物种灭绝时间,精度长期停留在“百万年”量级。

中国科学家团队通过模型整合了10万个生物属、近2万个物种的化石数据,做出了目前世界上最完整、最精确的地质时间轴,将时间标定的精度从百万年级别提升到了万年级别。这项工作刚刚入选了联合国“科学促进可持续发展十年”的政策清单。

 

“万年”与“百万年”之别,不是简单的误差修正,而是两个数量级的跨越

科学数据的归纳与分析远比想象中复杂。这类碎片化的原生数据往往不完整、不连续,存在数据断层和噪声干扰。涉及多个维度的碎片化信息处理,传统人工分析难以理清,当今的大语言模型也不具备这个能力。

如果将科学数据同文本、代码纳入同一语义空间的通用基础模型,让科学拥有同等核心地位——答案或许会不同。

事实上,一些前沿实践已经开始验证这个方向的可行性。2026年3月的一场“AI+天文学”研讨会,已经印证了这种范式转移的可能性。之江实验室也已启动了“科学基础模型”项目,内部代号“021”(Zero to One),寓意从0到1的突破。

 

四、人工智能:从“变革”到“革命”的可期

如果“范式变革”如预期获得突破,我们将迎来一个全然不同的AI时代。这并非渐进式改良,而是从根目录出发的重新定义。

届时,在同一逻辑框架下,AI将有能力直接处理深空无线信号、大气环流数据、古生物化石记录、基因序列信息,从中发现人类肉眼无法识别的隐藏关联

王坚在演讲结尾做出一个极有分量的判断:人工智能已经到了一个非常不一样的转折点——它变得跟数学一样基础。数学在人类科学史上起了多大的基础性作用,接下来五十年里,AI对人类科学研究所起的作用就会有多大

当一名18岁的高中生能够用退役卫星的数据做出顶级科研发现,当AI开始替代人类完成高维数据空间中“肉眼无法看见”的模式识别一场涉及科研方法、教育模式、产业逻辑乃至社会结构的深层次变革,已然开始发酵。

 

一段时间后再回溯AI的革新进程,这或许可以被称之为——“范式革命”。

 

五、展望未来:AI应是具备主动“思考”的大脑

再回到文章的起点。

那个18岁高中生的故事之所以震撼,不仅因为他做出了重大发现,更因为他揭示了一个正在发生的结构性变化:当数据本身蕴含的信息量超越人类已有的文字描述,知识发现的门槛将从“学富五车”转向“数据穿透力”

当这场“范式革命”真正到来时,人类对“智能”的理解将被彻底刷新,它不再是快速执行命令的工具,而是能够主动思考和探索未知的“大脑”

到那时,我们再回头看今天的大模型竞赛,或许就像今天回头看当年的功能机之争,声势浩大,却远不是终局。

阿里开源0.8B文档解析模型,端到端模型首次超越流水线方法
7月 24 日,阿里巴巴正式开源发布文档解析模型OvisOCR2。该模型以96.58的综合得分刷新OmniDocBench v1.6榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,这是文档解析领域迎来技术路线的重要突破。图 OvisOCR2 在 OmniDocBench v1.6 上的综合及分

2026-07-24

2027亚洲消费电子展(赛逸展)
2027北京电子科技展

2026-07-23