揭秘科学机器学习:知识嵌入与知识发现全教程
本文基于第八届中国机器人峰会张东晓院士的报告整理而成,旨在系统介绍科学机器学习中两大核心方向——知识嵌入与知识发现。通过本教程,你将深入了解人工智能从单一数据驱动走向知识+数据双驱动模型的技术路径,以及这些技术如何在能源、工业等真实场景中落地。
▍一、站在起点:人工智能的三种驱动模式
人工智能自1956年提出以来,经历了三个关键发展阶段(见图1)。理解这些阶段,有助于看清“知识嵌入与知识发现”为何成为当前突破瓶颈的关键。
1.1 人工智能的三次迭代
- 第一代AI(知识驱动):依赖明确且完备的规则。优点是符合人类逻辑,缺点是无法处理规则之外的复杂状况(如日常对话)。
- 第二代AI(数据驱动):以AlphaGo、ChatGPT为代表,需要大数据、大模型、大算力。能自主学习,但对数据质量要求极高,且易被攻击、决策过程不透明。
- 第三代AI(知识+数据双驱动):融合第一代和第二代的优势,成为当前学界和产业界探索的核心方向。

图1 人工智能的发展
1.2 模型驱动方法:经典但受限
模型驱动方法(见图2)的本质是:在给定“输入”的条件下,通过施加特定“条件或算法”,得到最终的“输出”。
- 关键难点:如何获得输入与输出之间的精准映射关系(即方程或公式)。
- 需要依赖:观测值、反问题建模、数据同化等手段来确定模型参数。

图2 模型驱动方法
1.3 数据驱动方法:当前主流但隐患重重
数据驱动方法(见图3)在数据和模型的天平上更侧重数据。它通过大量数据直接学习输入与输出之间的映射,无需提前知道物理规律。常见的机器学习模型包括:
- 人工神经网络(ANN)
- 支持向量机(SVM)
- 卷积神经网络(CNN)
- 循环神经网络(RNN)

图3 数据驱动方法
案例:光伏发电预测
以人工神经网络为例(见图4),利用历史发电量、地表光照辐射量、温度、湿度等天气数据,建立映射关系,结合天气预报数据预测未来光伏发电值。基于两个独立光伏电站的数据进行试验:
- 输入变量:17个与光伏相关的天气变量。
- 数据预处理:采用最大最小归一化(min-max normalization)将数据限制在0~1之间。
- 数据集:730天训练数据 + 91天测试数据。
- 结果:预测准确率高达97%(见图5)。

图4 基于ANN预测光伏发电值

图5 不同预测模型结果对比(预测时长7天)
1.4 数据驱动的三大局限性
虽然数据驱动已广泛应用,但它在真实工业场景中暴露出诸多问题,促使我们寻找更好的方案。
1.4.1 现实场景数据极度稀缺
许多工业场景(如农业、能源勘探)中,数据获取成本极高:
- 打一口井测量侧井曲线需数千万元。
- 做吸附解析实验耗时漫长,难以获得足够样本。
- 而ChatGPT等大模型动辄1750亿参数,依赖海量数据,无法直接应用于稀缺数据场景。
1.4.2 均方误差(MSE)等指标的局限性
MSE对误差的物理过程没有区分。例如:
- 系统熵增与熵减在MSE中可能相同,但物理本质截然不同。
- 污染扩散预测中,一个区域浓度增加、另一个区域浓度减少,平均浓度可能不变,但实际情况完全不同。
1.4.3 易被攻击与误导
数据驱动模型缺乏常识。例如对抗样本问题(图6):
- 图片原本是一只熊猫,加上轻微噪音后,模型可能错误识别为长臂猿——而人类不会犯这种错误。

图6 数据驱动模型的局限性
【小提示】 早期的专家系统如DENDRAL(有机化学分析)、MYCIN(传染病诊断)、Deep Blue(国际象棋)都是知识驱动模型,它们能解决规则明确的问题,但无法应对复杂现实。这正是为什么我们需要两者融合。
▍二、破解之道:构造知识与数据双驱动模型
为了克服数据驱动的短板,张东晓院士提出构建知识与数据双驱动模型——既有人工智能技术,也有领域知识,还有观测数据。具体包含两个核心动作:
- 知识嵌入:将物理规律、领域知识融入AI模型,使其具有“物理常识”。
- 知识发现:利用AI从数据中自动提炼出新的物理知识。
当知识嵌入与知识发现形成闭环,就能在仿真、反问题求解、模型可解释性等方面大幅提升性能(见图7)。

图7 智慧能源系统——知识与数据双驱动
▍三、知识嵌入:把物理常识“教”给AI
理论指导的数据驱动模型(知识嵌入)的核心,是在建模全流程中融入先验知识(见图8)。
- 嵌入方式:可在数据预处理、模型结构设计、模型效果评估等环节进行。
- 核心挑战:复杂控制方程的嵌入、通用知识的嵌入、不规则物理场的嵌入、正则项权重的自动调整。

图8 机器学习建模全流程的知识嵌入方法
3.1 数据预处理环节嵌入领域知识
案例:电网负荷预测
使用集合神经网络(ENN)和长短期记忆神经网络(LSTM)进行负荷预测(图9)。在数据预处理中引入电力负荷比值分解方法:
- 将电力负荷数据分解为大的趋势(反映能源结构、人口密度等内在模式,由专家经验确定)和局部扰动(天气等外驱力引起的变化,由数据驱动模型预测)。
- 最终将二者结合预测。
基于北京12个区1362天小时级真实数据测试,即使只使用周边区域的数据训练,也能准确预测丰台区电力负荷(图10)。

图9 电网负荷预测模型

图10 北京市丰台区电力负荷预测结果(红色为预测值)
3.2 模型效果评估阶段嵌入领域知识
3.2.1 嵌入概率分布信息
案例:风功率预测
风力发电具有强随机性和波动性。团队研发了融合风功率曲线物理知识的预测模型(图11):
- 将风速与发电功率之间的概率关系(而非一一映射)作为先验知识。
- 通过改造损失函数,将概率分布信息嵌入到模型训练中。
- 结合天气预报与气象观测站,形成软硬件结合的预测产品。
预测准确率高于90%(图12)。

图11 融合概率分布的风功率预测模型

图12 风功率预测数据对比
3.2.2 嵌入控制方程(偏微分方程)
核心方法:基于改进损失函数,将控制方程作为软约束嵌入AI模型。以TgNN(Theory-guided Neural Network)替代模型为例(图13):
- 将物理规律、工程控制、专家经验融入深度学习模型。
- 在仅有30个训练数据的情况下,仍能获得足够精度(图14)。
- 用于不确定性量化(图15):传统蒙特卡罗方法求解10000个实现约需1.74小时,TgNN替代模型仅需约9分钟。

图13 基于TgNN的替代模型

图14 TgNN/PINN替代模型预测不同渗透率场解

图15 基于TgNN的不确定性量化
复杂场景:两相流问题(油-水、油-气)同时预测压力和饱和度(图16、17),借助控制方程同样可以高效预测。

图16 两相流问题

图17 两相流问题预测结果
3.3 模型结构设计+效果评估:硬约束嵌入
软约束(如修改损失函数)只能保证平均意义上符合物理,而硬约束通过投影矩阵将模型输出严格映射到符合物理机理的值域(图18、19、20)。
- 优势:局部严格满足物理约束、收敛速度更快、数据需求更低。

图18 硬约束映射

图19 投影矩阵构建

图20 硬约束效果评估
【常见问题】 嵌入复杂方程(如分式结构、复合函数)时,自动微分机制难以求梯度怎么办?
答案:张院士团队开发了自动化知识嵌入框架及工具包(图21、22),能够自动处理复杂方程的嵌入问题。

图21 自动化知识嵌入工具包(1)

图22 自动化知识嵌入工具包(2)
▍四、知识发现:让AI自己“发现”物理定律
知识发现是知识嵌入的逆过程——从观测数据中自动提炼物理知识。核心挑战包括:控制方程的灵活表示、复杂结构与系数的挖掘、稀缺嘈杂数据下的挖掘、全新控制方程的发现。
4.1 历史启示:从行星运动到牛顿定律
- 第谷耗时38年观测火星轨迹数据,未找到规律。
- 开普勒又花17年研究,总结出三大定律。
- 牛顿在此基础上发现万有引力定律。
- 如今AI技术可大大加速这一过程,直接从事数据中挖掘控制方程。
4.2 从“黑盒”到“白盒”的转变
神经网络传统上是黑盒模型(图23),可解释性差。通过模型挖掘将内部逻辑显式表达出来(控制方程),可以提升可解释性。

图23 神经网络
4.3 数据驱动的偏微分方程挖掘方法
根据候选集的完善程度,有三种主流方法:
4.3.1 封闭候选集方法:稀疏回归
前提:已知系统中所有可能的候选项(如各项导数)。方程通常是稀疏的,只有少数项系数非零。通过稀疏回归,找出稀疏向量及其系数(图24)。

图24 稀疏回归挖掘偏微分方程
4.3.2 半开放候选集方法:遗传算法(GA)
当候选集不完整时,采用遗传算法。模拟生物进化:种群个体(可行解)通过遗传、变异、交叉、复制寻找最优解。在KdV方程挖掘中(图25),遗传算法比稀疏回归更有效。

图25 基于深度学习+遗传算法的KdV方程挖掘
4.3.3 开放候选集方法:符号数学
在完全不知道候选集的情况下,使用树结构表示方程项(运算符为父节点,系数/变量/函数为子节点),通过符号回归和遗传算法挖掘自由形式的方程(图26)。

图26 候选集复杂度及树结构表示
4.4 进阶:符号数学实现控制方程自挖掘
为了解决无限可行域中的方程挖掘问题,引入树结构森林概念——每个方程是一片森林,每棵树代表一个方程项。通过遗传算法、符号数学,可以挖掘出极其复杂的方程(图27、28)。

图27 基于树结构挖掘自由形式的方程

图28 基于符号数学的控制方程自挖掘
4.4.1 挖掘分式结构方程
图29、30展示了挖掘分式结构方程的过程:初始代只有简单项,经过几十代迭代(交叉、变异、进化),最终挖掘出正确的复杂方程。

图29 分式结构方程挖掘(1)

图30 分式结构方程挖掘(2)
4.4.2 实际案例:粘性重力流宏观控制方程挖掘
粘性重力流问题的短期行为尚无已知控制方程。通过细观模拟数据→数据重构(DNN替代模型训练)→构造语义片段(计算空间导数/积分通量)→语义整合(遗传算法挖掘)三个步骤(图31-34),成功从微观数据中挖掘出宏观控制方程。

图31 从细观模拟数据挖宏观控制方程

图32 基于深度学习的PDE挖掘

图33 长期行为控制方程

图34 短期行为控制方程
▍五、总结:知识嵌入与知识发现的双向闭环
在“行业+AI”的未来,数据驱动(机器学习)与模型驱动(传统方法)必须深度融合(图35)。其关键就是:
- 知识嵌入——将行业知识注入AI模型,提升精度、鲁棒性,降低对数据的需求。
- 知识发现——让AI从数据中自动提炼新知识,反哺领域认知。
只有当两者形成闭环,机器学习才能真正解决工业级实际问题。

图35 数据驱动与模型驱动的融合
【常见问题】 知识嵌入和知识发现哪个更难实现?
答案:两者各有挑战。知识嵌入的难点在于如何将复杂方程(如分式、复合函数)高效融入神经网络训练;知识发现的难点在于如何在完全开放的解空间中找到既符合数据又符合物理直觉的方程。实际应用中,两者需协同迭代。
编辑:黄飞
