如果问最近哪个行业最热,无疑是大模型。ChatGPT的落地,证明了它已经能针对具体任务进行场景化应用,跟用户的距离,一下子拉近了不少。
当一批类ChatGPT的通用大模型层出不穷时,另一批参与者把目光投向了“更容易落地”的行业垂直大模型,它们也走到了舞台中央。机器视觉作为大模型重点应用的垂直领域,自然会从这场技术革命中受益。但工业场景与生俱来的碎片化、样本量少等特点,也给大模型的应用带来了实实在在的挑战。说到底,这一碘伏性的技术究竟该怎么用在工业里,大家还都在摸索着前进。
机器视觉的长期痛点:样本少、时间短、爬坡要求高
在人工智能和机器人领域,有个著名的“莫拉维克悖论”——对计算机来说,掌握人类的逻辑推理这类高级智慧,只需要很少的计算能力;但人类那些无意识的感知、运动等“低级智慧”,反倒需要极大的计算资源去模拟。这个悖论,在工业领域体现得尤为明显。
用自动化的机器人替代人类,完成一个简单的动作,往往存在巨大的瓶颈。比如摁压、扣接这类精密组装,人类可以靠肌肉的弹力或指尖的触感,在不做出明显向前位移的情况下就出色完成;可对于机器人,仅这一个简单动作,背后就需要海量的计算。更棘手的是,工业各细分领域千差万别,每一项固定工序都需要大量的计算,这些训练工作叠加起来的时间和成本,企业根本负担不起。
当下,小样本学习、预训练、预适应,被认为是最适合工业场景的技术路径。这背后,是工业实际应用场景的严苛要求:样本少、时间短、爬坡要求高。
样本量少,是工业领域的典型难题。很多工厂里的边缘AI应用,都缺少丰富、多样化的产品样本来进行模型训练。正如凌云光知识理性研究院副院长全煜鸣所说:“在缺陷检测场景中,工厂里会有大量正常的‘好样本’,但异常样本的积累,通常要花几个月甚至半年的时间。”不妨想象一下,一款新手机即将发布,前期模组生产已经耗费大量时间,最终组装就剩两三个月,根本来不及积累足够的异常样本。
要在样本极少、产能爬坡要求极高的条件下,让产线适应新产品,对小样本、预训练、预适应就提出了极高的要求。对小样本来说,模型必须有极其严苛的适应性,数据上要有很强的增广能力——在样本稀缺的情况下,能自己增广出更多样本来完成训练。
寻找共性,是增广样本数量常用的办法。有些缺陷,在不同行业是相通的,比如中框、结构件的外观检测和手机整机的外观检测,再比如锂电和光伏的外观缺陷检测,都存在一定的相通性。凌云的方案是,建立了拥有500万样本的专用工业数据集,对缺陷的机理进行研究,再结合深度学习与人工智能算法平台F.Brain,让预训练模型能更好地实现样本扩增。当然,生成缺陷只是第一步,还得兼顾与场景融合过程中的科学性,才能保证小样本缺陷图增广的有效性。
预适应也一样,目的都是让模型有更好的精度和更广的适应范围,以满足不同工业场景,从而在一定程度上缓解产品在实验室表现稳定、一到真实产线就“歇菜”的普遍问题。
一方面,工业场景对小样本学习技术提出了高要求;另一方面,工业场景对产品的要求也在日益提高。
首先,生产的精度要求越来越高。宁德时代的倪军教授曾提出“极限制造”的概念,认为工业领域做到6σ(每百万个产品里只有一两个不良品)远远不够,而是要达到9σ-12σ,也就是对不良品的要求上升到十亿级——每十亿个产品中,只允许出现1到3个不良品。这对机器视觉厂商来说,是个极大的挑战。
其次,3C制造、汽车、印刷品等行业不断升级,对产品良率和产品形态也提出了更高要求。在这个过程里,怎么把物理世界的缺陷,通过摄像头感知到光电领域、数字领域,并对不同类型和程度的瑕疵进行科学分级,最终定义良品与不良品,其实是个难题。因为,无瑕疵的产品几乎不存在,所谓的“良品”,本质上来自人们的主观定义。比如,苹果和富士康通过三级质量分级完成了对良品的定义,而为其提供视觉感知系统的凌云光,则对标人眼感知,把缺陷细化为十级,再针对不同客户的质量要求,通过微调来满足需求。
这一切,都建立在一个前提基础上:有一套能够精确感知缺陷的视觉系统。而这背后有两大挑战,一个来自数据,一个来自平台架构。
To B 丛林探险,向场景要什么样的数据?
人工智能由两个部分驱动,一是数据,二是模型。数据的重要性,正如ML大牛吴恩达提出的“二八定律”:80%数据+20%模型=更好的AI。随着预训练大模型技术的发展,对数据质量、数量和多样性的要求越来越高。
从样本中积累行业知识、场景知识,是一条重要的路径。以显示屏裂纹检测为例,只有掌握了缺陷和产品物理位置的关系、物理形态上是否垂直于边缘、不同位置产生缺陷的概率等数据,才能打造出好的预训练模型。
但要获取精准的数据,并不容易。其中至少有三大难点:一是数据的完整性问题;二是数据维度单一性问题——检测点获取的数据以及制程点的人、机、料、法、环、测数据,能否从逻辑上实现闭环建模;三是做知识抽取和知识沉淀时,得出的结论在验证阶段仍会出现偏差,需要更大数据量的验证。
即使是有着20多年行业积累、手握数十亿级相关样本的凌云光,在数据获取过程中也同样面对这些挑战。全煜鸣坦言,要减少这些问题的影响,核心在于实现精准感知和数据获取的标准化。
精准感知,是对器件提出的要求。照明系统、感知元件、光学传递的镜头以及待测目标,都得做到相关的标准化。只有在模块级做到精准,才能在系统级达到成像性能的一致性。对照明系统来说,辐射通量、光谱信息、时间稳定性、温度稳定性等度量指标,要在模块级完成测量和度量;对感知元件来说,灵敏度、量子效率、暗噪声、动态范围,也得能精准度量、调节;对被测目标,要能完整地对光电成像过程进行物理建模和理论分析。
数据的标准化,则是从维度上说的。比如对一件产品进行质检,维度包括整体产品数据、瑕疵数据、产品履历、不同制程段的检测结果等,既有图像数据,又有文本数据,既有结构化数据,又有非结构化数据。但需要注意,并非所有数据都有价值。数据标准化的过程,需要舍弃那些永远无人关心的“沉默数据”,只留下有用的数据。全煜鸣强调:“数据的标准化是个系统性问题,对数据的单位、背景条件、存储都应有相应的标准。比如,数据要以什么形式存储下来,是不是要有产品的大图,有缺陷的小图用什么格式定义,在什么地方可以获取到,这些都需要明确。”
实现数据标准化只是第一步,在此基础上,还需要进一步实现数据的精准化和数据知识化。数据的精准化,指的是能够重复获取、稳定且客观的数据。实现精准的数据,是挖掘到带有工艺知识和场景知识的数据的基础。以手机维修产线为例,维修不同产品过程中产生的数据,其实就包含着如何对手机或主板进行下一步检测的知识。最终将维修记录整合成标准操作流程的过程,就是把一般数据变成带有知识沉淀的数据的过程。
把带有知识沉淀的数据用到知识图谱和大模型上,能帮终端客户缩短整体业务流程。比如,富士康的主板维修严重依赖于有经验的工人,但制造业的人力供应链很不稳定,工人离职率高达100%以上,有经验的工人很难留住,老师的知识和经验也随之流失。而通过知识图谱将大模型拓展到主板维修环节,过去需要1500步工序才能搞定一块主板,现在15步就能完成,产线UPPH提升了37%,真正让一线维修工做到了“入职三个月,五年老司机”。
从标准化数据,到精准化数据,再到带工艺知识的数据,三者层层递进,而数据自始至终是贯穿其中的主线。
向平台化架构要体验
机器视觉涉及多个学科,复杂性高、通用性差,且高度依赖数据驱动。在全煜鸣看来,机器视觉至今仍像一门“民间艺术”——光、机、电、算、软各自为战,从成像硬件,到成像方案,再到算法软件平台,并没有形成一个整体解决方案。
与此同时,大模型时代的到来,对数据和技术架构都带来了全新挑战。如果没有全新的技术架构和解决方案做支撑,就很容易出现技术投入越大、复杂度越高、可持续性越差的问题。基于此,行业在思考如何高效利用数据迭代模型的同时,也越来越重视技术架构的创新。
不过,企业在搭建技术架构时,需要注意两个问题。
首先,要警惕脱离具体场景谈技术架构。必须基于业务来搭建技术架构和平台,否则就是做无用功。做架构的第一件事,是把需求和业务目标捋清楚,然后才有可能找到合适的方案。据全煜鸣介绍,为真正做到从场景中来、回到场景中去,凌云光将技术规划和产品规划分成了三部分:第一部分是目前已经落地应用的解决方案,比如2D视觉、3D视觉的量测和检测方案,思考怎么提高效率、提高精度,降低对端侧算力的要求;第二部分是在一些新兴、短期有落地应用机会的创新方案上,领先行业半步,进行人才补齐等资源投入;第三部分是针对超前的研究进行提前布局,比如三年前就开始构建大模型和知识图谱的能力,提前完成整体技术框架的落地。对于不同成熟度的解决方案,要能分梯次落地应用,并形成闭环。
其次,当前构建的架构要有足够的灵活性,能应对未来的变化,保持旺盛的生命力。也就是说,要能够诞生多个可模块化快速复制的集成用例,并在平台化的技术架构基础上,设计横向快速复制的方法。一个既支持现在、又支持未来的架构,不仅能避免重复建设、节约成本,还能整体拉低综合成本。
技术架构走向平台化,是重要趋势之一。凌云光从2018年左右开始向平台化方向转变,时隔5年,今年又发布了全新的KingKong技术架构,包含视觉、数字基准、大脑、自动化和驾驶舱五个部分。在全煜鸣看来,这个架构的特征可以概括为三点:视觉领域实现了科学的标定和图像评价,整体系统一致性非常好;数据层面做到了精准,且是带有知识的数据;AI模型上实现了数据加知识的双轮驱动。
对凌云光而言,这些技术为平台构建了丰富且差异化的功能与服务,提升了基础技术能力,为业务的安全、稳定、高效运行提供了保障。对客户来说,一个更具一致性的技术架构,更能帮助提升缺陷产品的检出精度、加快交付,从而提升生产效率、拉动产能。一般来说,新设备进入工厂要经过NPI新品导入,之后就进入产量和质量爬坡阶段。这个阶段越短,客户就能省下更多物料和人力成本,更快进入大批量生产。KingKong架构调整后,能让手机中框、顶框、底框的外观检测,到整机外观检测的交付时间缩短,并且这样的解决方案还能拓展到锂电外观、圆柱外观检测上。
垂直大模型叩响工业大门,碘伏性技术随时可能发生
人工智能领域发展突飞猛进,大模型将对全行业产生碘伏性重构,这已是业界共识。在工业领域,从生产优化到供应链管理,从质量控制到创新设计,大模型正逐渐改变着工业的运作方式和业务模式。然而,工业领域的复杂性和专业性,决定了通用大模型无法直接应用,尤其是在一些要求高精度和专业知识的领域。
面对种种挑战,能针对行业细分领域提供精确、可解释、安全且定制化解决方案的垂直模型,受到越来越广泛的关注。通用大模型虽然在多个领域表现不错,但并不具备深入的领域专业知识。以工业质检为例,产品质检涉及大量数据和复杂的图像、声音、视频等信息,要求模型能准确识别和分析各种缺陷——甚至是微小的变化。但通用模型很难在短时间内学会这些领域知识,也难以捕捉产线上工艺流程和设备运行的细节。
垂直模型则具备专业知识,能更好地理解和处理行业数据与任务,达到更高的精度和性能,输出更准确的结果。工业领域数据的稀缺性和特殊性,也使通用模型难以应对。要达到高精度,模型通常需要大量高质量的训练数据。可在某些工业领域——特别是新兴或小规模领域——短期内很难积累足够的异常样本,模型经常面临训练数据不足的窘境。此外,工业数据还具有许多特殊性,对大量实时数据、多种类型数据、异常数据的处理和分析极其复杂,通用模型难以胜任。而垂直模型对数据的需求更低,只需较少的场景训练数据就能实现高效开发,定制成本也更低。
工业领域讲求实际,对稳定性、可控性的要求极高,垂直模型在这方面更能赢得客户信任。工厂需要模型能提供清晰的解释和推理过程,以便理解并信任其判断,做出下一步决策。通用大模型通常是个“黑盒”,内部运行机制复杂,难以提供透明解释,风险较高,很难获得客户信任;而垂直大模型则能将决策过程和推理逻辑展现出来。
安全和隐私问题,是敲开工业客户的最后一道大门。工业领域的数据庞大且复杂,通用大模型尚难提供足够的数据安全保障。而且,生产流程、产品工艺、设备参数等都属于企业的敏感数据,通用大模型在训练过程中会接触广泛的公共数据,存在将工厂敏感数据泄露出去的风险。因此,很多企业在权衡风险与收益后,并不愿意交出数据。垂直模型则可以在特定领域内进行本地化处理,减少数据共享和隐私泄露的风险。
大模型的诞生让行业意识到,机器视觉的整体解决方案,很有可能被一些极具革命性和创造力的新模型所重构。全煜鸣坦言,“最近看到很多碘伏性技术,一些原先的技术路径或解决方案,很有可能被新技术碘伏。”目前,凌云光F.Brain深度学习平台已实现工业场景数据、算法、推理为一体的云边端协同一体化平台——先通过算法平台进行特定场景的数据增广和模型训练精调,再通过推理平台完成多端多平台的部署优化。
不过,工业场景对精确度、可靠性的要求极高,现阶段这些新模型要直接导入应用,还存在一定的瓶颈。在全煜鸣看来,这是时代抛给企业的两个命题:一边要沿着已有路线不停迭代,保证满足客户4个9、12个σ的确定性需求;一边要保持技术的敏感性和兴奋度,警惕那些会带来碘伏性的新技术。
要打磨出对行业有碘伏性价值的模型,绝不是闭门造车的事。企业需要在通用大模型基础上微调出行业大模型,再精调成具体制造场景的模型。过程中,企业需要对不同产品和行业特点有深刻认识;需要有行业高质量数据的积累;需要有在数据上进行研发、计算和推理的能力;更需要有懂行业know-how的研究员和科学家。这意味着,那些深耕产业、能触达更多客户场景、容易从生产线上获取大量行业数据、且已积累大量科学精准样本的企业,将更好地满足工业领域的需求与挑战,同时具备更快的技术迭代速度和竞争优势。
结语
ChatGPT带来的热度,就像是将一根针丢进了一片铁屑中,它与各行各业之间的连接,是确定无疑的。但现阶段,大模型究竟该怎样在工业领域落地,怎样在边端、云端做相应的优化和轻量化,最终做到投资回报的闭环、真正给工业带来效益,还处在探索之中。
这一过程中充满无数变数,很难评判哪家公司更有可能胜出。但可以确定的是,市场竞争的核心将始终围绕一个词:真实需求。接下来,在机器视觉领域,谁能提供在光学相机成像系统、软件和算法等AI技术上,对客户的提质、增效、降本、减存有数量级和革命性帮助的解决方案,谁就将获得更大的加速度。
