游乐游手机版
首页/AI热点日报/热点详情

一种基于AI Transformer模型的高效机器视觉目标检测方案

类型:热点整理2026-07-21
AITransformer模型正革新机器视觉目标检测,其端到端设计简化开发流程,无需锚点框与非极大值抑制。在自动驾驶、安防等应用中,模型需兼顾准确性、硬件灵活性与安全性,并适应边缘端低延迟处理需求。

自动驾驶、智能制造和安防监控这些热门领域,目标检测几乎是所有机器视觉应用的基石。而这一切的核心,都离不开AI建模。不过,现在大家关心的焦点已经变了——不只是怎么把模型做得更准,更重要的是怎么让模型的开发过程更简单、更高效。

这些年,业界涌现了一大堆目标检测模型,YOLO、Faster R-CNN、Mask R-CNN、RetinaNet……它们各有绝活,专门用来检测图像或视频里的目标,识别物体类型,然后做出判断。但风向在变,最近大火的AI Transformer模型正成为更好的选择。它们为什么更香?和传统模型比到底强在哪?咱们得好好聊聊。

机器视觉中的目标检测,这事儿本身就很有嚼头。人眼扫过街道,能瞬间认出红绿灯、行人、车辆,甚至自动忽略背景里的树木和楼房。大脑还会把注意力牢牢锁定在前景目标上——是在跑的人,是静止的动物,还是路边的消防栓。比如开车的时候,司机的注意力高度集中在红绿灯和附近的行人上,根本不会去留意远处的风景。理想情况下,人工智能模型也要干同样的事:抓住关键目标,过滤掉背景,然后把目标分好类。这一切,都得靠它训练积累的经验来做出预测。

Arm汽车业务线高级产品经理Alexander Zyazin打了个很形象的比方:“现在的机器‘看’东西,靠的是图像传感器加镜头,信号经过专门的图像信号处理(ISP)模块后,被送入SoC,ISP负责把图像调理到机器视觉能用的状态。之后,这个处理好的数据再被送到翻跟斗或者通用CPU里,做进一步的预处理和后处理。”

不同场景,对设计要求完全不同。Zyazin指出:“在安防监控和工厂场景里,机器视觉通常用来统计人数,便于规划调度,或者检测产线上的产品缺陷。而在汽车领域,它现在主要用在高级辅助驾驶系统(ADAS)上,融合多个传感器的输入,实现自动紧急刹车、车道保持这类单一功能。”

技术还在往前走,目标是真正没人的自动驾驶汽车。那时候,所有输入都来自传感器,完全不需要人参与。Zyazin认为:“这就需要车子周围装大量传感器,产生海量数据,而且必须极低延迟地管理和处理。从硬件到软件,这绝对是一个高复杂度的系统设计挑战。”

Transformer架构

近几年,一批全新的Transformer模型陆续登场,比如O2DETR(2021年论文)、Meta的DETR(2020年)等等。跟Faster R-CNN这类传统模型一比,Transformer方案的优势很明显,最直观的就是设计更简单。这里我们就拿Meta的DETR来解剖一下,看看它到底是怎么工作的。开发者如果想动手试试,DETR的训练代码也是开源的。

图1:DETR Transformer模型把预测结果和真实值做对比。如果没对上,就输出“无对象”;匹配上了,才确认是检测到的对象。来源:Facebook AI论文《使用Transformer进行端到端目标检测》

大部分目标检测模型是先做个初步预测,再慢慢微调得到最终结果。DETR不一样,它走的是单通道、端到端的路线,靠Transformer来完成编码和解码。DETR有两个核心设计:第一,是一套“一组预测损失”,强制让预测和真实值直接对齐;第二,是一种架构,能一次性预测出一组目标,还能把目标之间的关系建模。这里说的“真实值”,就是图1左侧图片里的实际情况——两只独立的同一种鸟。如果算法不“检查”真实情况,设计得不好,可能最后预测出两只不同的鸟,或者一只两个头的怪鸟。

图2:DETR Transformer模型结构。来源:Facebook AI论文《使用Transformer进行端到端目标检测》

人脑识别物体,靠的是先前的知识和经验来处理图像信息。机器视觉却必须从头学起,把图像转成数字数据。如图2所示,卷积神经网络(CNN)通常被用来处理原始数据。DETR也是先用传统的CNN骨干网络提取特征,然后把这些特征送入Transformer的编码-解码流程。最后,数据会进入一个共享的前馈网络(FFN),由它来决定是预测出一个目标,还是判定为“无对象”。

传统方法会按顺序处理一个个“锚点框”,但DETR用的是端到端方法,并行处理所有数据。简单说,DETR先看全局,做出初步预测,然后把一个个小块跟真实值做比较。如果DETR“看到”一只鸟头,并且在真实值里找到了相同的鸟头,它就匹配上了,如图1右侧的黄色框所示;否则就像绿色框那样,输出“无对象”。

另外,DETR在没有“锚点框”和“非极大值抑制”的情况下,也能搞定重叠物体的检测。

“锚点框”是传统目标检测模型的标配。为了锁定感兴趣的目标,算法会在目标周围生成一些框,这些框后来被用作位置和尺寸预测的参照。如果多个物体重叠了怎么办?比如两只鸟站得很近,其中一只挡住了另一只的一部分。这时就需要一个叫“非极大值抑制”的流程,来选出置信度最高的预测,最终保留两只鸟,同时抑制掉其他所有预测。

传统AI模型离不开锚点框和非极大值抑制。而DETR直接绕开了这两步,这也是它比传统模型更高效的原因所在。

AI无处不在,但针对不同应用做了优化。用机器视觉做目标检测,需要AI模型或算法在专门的AI芯片、FPGA或模块上跑,这些硬件常被统称为“AI引擎”。模型第一次训练好后,就可以部署到合适的硬件上执行推理——也就是做出预测或决策。一个很现实的问题是,硬件开发得跟上新AI模型迭代的速度。

Flex Logix首席技术官兼软件与架构高级副总裁Cheng Wang解释得非常直白:“如果只是检测物体,像YOLO这样的非Transformer模型可能就够了。但我们现在进入的是一个瞬息万变的领域。三年前开始用Transformer做分类和检测,现在它已经是生成式AI和生成式AI视觉的必需品了。而这些新操作,都是我们以前设计AI硬件或AI芯片时根本没考虑过的。”

更进一步,光有能跑基准测试的AI硬件远远不够——那些基准测试可能已经是五年前的了,而软件模型每隔几个月就要变一次。Wang认为,像eFPGA这类AI硬件才是出路。它具备软件可编程的灵活性,能跟上最新Transformer模型的节奏。他说:“换句话说,光靠今天的出色表现是不够的。你必须让你的设计具有面向未来的能力。”

在越来越多的领域,AI的应用正在全面铺开。

瑞萨电子执行副总裁兼嵌入式处理、数字电源和信号链解决方案事业部总经理Sailesh Chittipeddi在Semicon West的一次小组讨论中给出了一个很有冲击力的数据:“到2025年,75%的数据将来自网络边缘和端点,而不是云端生成。所以,抛开所有炒作,AI真正活跃的地方其实在端点边缘。另一个有趣的数据是,从所有这些设备进入企业的数据中,有90%实际上被丢弃了。这就是所谓的‘暗数据’。那么,我们能在哪里拦截这些正在产生的数据,让它们变得有用呢?答案是端点边缘。真正能产生巨大差异的,正是预测网络端点边缘正在发生什么的能力。”

说到计算,大家首先想到的是微控制器、微处理器、CPU、GPU——尽管现在所有人都在聊GPU,聊GPT-3、GPT-4,以及后面的滚滚洪流。但Chittipeddi提醒到:“别忘了,这些都是大语言模型。大多数数据集根本不需要这么强大的处理能力。端点边缘需要处理的数据量小得多,但通常要求极低延迟、快速响应。延迟、安全性、在本地处理数据的能力,以及把数据变得可操作——这些才是边缘端的第一要义。”

从这个角度看,计算处理的分布已经远远超出了传统市场。AI生成的数据量暴涨,以及对更快处理结果的需求,正是这场变革的关键驱动力。

华邦闪存营销副总裁Alex Wei也指出:“市场过去非常关注网络、PC、ERP这些传统应用,它们当然还会增长。但大家都在寻找能引领我们进入下一个时代的新应用。这就是为什么NVIDIA在AI领域能赚得盆满钵满,AMD也紧跟着推出自己的GPU。这些新应用需要更多组件,所有东西都需要更高密度。AI就像是在你脑海里映射信息。但你开车时,如果看到有人走在街上,你必须尽量忽略他才能绕过去。这就是神经学习,它消耗了大量的内存,而这还只是个开始。”

图3:使用InferX编译器部署DETR。DETR被分为100层。InferX编译器会自动最大化快速SRAM访问,最小化慢速DRAM访问,并为运行每一层生成配置位。来源:Flex Logix

机器视觉是另一项关键技术,如今AI和机器视觉的交互方式多种多样。Arm的Zyazin总结了两个方面:“第一,机器视觉的输出被送到AI引擎,用来做人数统计、物体识别等决策。第二,AI本身也在通过基于AI的降噪来提升图像质量,然后辅助决策。比如在汽车应用中,AI和机器视觉的结合,可以更早识别出限速标志并及时调整车速。”

不过,想象一下自动驾驶场景:如果AI模型从有缺陷的传感器那里收到了相互矛盾的视觉信号,该怎么办?最好的规则就是在安全上犯错。Synopsys负责AI和机器学习的副总裁Thomas Andersen说,这要看具体应用对系统故障的严重性敏感度有多高。“正因为如此,需要多个系统来双重甚至三重交叉检查信息。一旦发生冲突,决策就会变得很棘手。比如自动驾驶汽车,如果雷达检测到一个物体而摄像头没发现,人们可能会倾向于谨慎行事,自动刹车。但这种‘幽灵刹车’也可能会导致事故。永远要记住,没有完美的解决方案,人类自己也会犯很多错。”

AI模型整体在进步,但在目标检测和预测中,准确性的重要性毋庸置疑。

Cadence Tensilica Vision和AI DSP的产品管理、营销和业务发展总监Amol Borkar说得更直接:“就像任何应用一样,可接受的误报率完全取决于应用场景。消费级应用,把一个人误识别成沙发,问题不大。但在汽车应用中,对行人的错误分类,或者对医疗状况的错误诊断,就可能是致命的。这本质上是AI/分类/检测的问题。AI的进步让我们能更准确地自动识别成像数据中的复杂模式,并提供定量的、而非定性的放射学特征评估。”

Borkar认为AI确实改进很多东西,但他也承认这给平台增加了更多的计算需求,比如需要处理海量的卷积和神经网络层。“为了让AI模型跑得好,需要大量合成数据来训练和验证模型。更进一步,如果修改感知栈,用事件相机数据取代传统的滚动/全局快门传感器,可能会对微小的运动产生超敏感度,从而提高系统精度,适用范围也更广。当然,和任何想跑好的AI模型一样,这种方法也需要海量数据来训练或验证,然后才能投入实战。”

安全问题

好的数据是得到好结果的前提,而保护数据,以及处理和存储这些数据的系统,同样生死攸关。

Synopsys战略营销经理Ron Lowman强调,机器视觉系统需要时刻处于保护之下。“在AI对AI的对抗中,安全是必须的。过去做硬件威胁分析,主要基于不良行为者及其攻击向量。但AI能让攻击向量和被攻击设备数量成倍增加,这让安全成了一切的基础。很多年来,安全都是在软件层面实现的,因为便宜。但纯软件安全显然不够,所以我们看到了安全标准的出现和硬件可信根IP的实现。PCIe和蓝牙就是很好的例子。蓝牙有自愿性加密标准,但因为有成本,没人执行。行业正在慢慢改善。PCIe方面,新的标准把安全性引入了通信接口。短短时间内,大量公司开始采用PCIe IDE,这迅速改变了整个接口IP要求的发展方向。”

Arteris产品营销副总裁Andy Nightingale完全同意这一点。“在任何技术应用中,安全都是必需的,机器视觉也不例外。机器视觉系统经常涉及敏感数据和流程,比如监控录像、医学成像、自动驾驶汽车控制,安全尤为重要。”

Nightingale指出了机器视觉应用中安全至关重要的四个领域:

数据隐私:机器视觉系统通常处理大量数据,包括敏感的个人或商业信息。必须防止这些数据被非法访问或泄露。可以通过加密、访问控制和数据匿名化来实现。

系统完整性:机器视觉系统可能受到操纵或破坏性攻击。保护系统组件和数据免遭篡改或黑客入侵至关重要。可以通过安全启动、系统强化和入侵检测来实现。

认证:机器视觉系统通常依赖于传感器、摄像头等设备,这些设备很容易被欺骗或冒充。确保设备经过身份认证,并且系统能够检测和阻止非法访问非常重要。可以通过生物特征认证、设备证书和网络分段来实现。

合规:机器视觉系统可能需要遵守与安全和隐私相关的法规或行业要求。确保系统设计和运行符合这些要求至关重要。这可能涉及风险评估、审计追踪和数据保留策略等措施。

Nightingale补充说:“在整个SoC设计过程中,应该使用像平台安全架构(PSA)这样的行业标准,而且安全问题应该贯穿终端设备的部署和运行。只要实施适当的安全措施,机器视觉系统就能在保护数据、方法和个人隐私的同时,被有效使用。”

展望未来

随着AI模型的继续进化,它们会变得更高效,就像新兴的Transformer模型一样。未来的开发者需要在设计中权衡好软件和硬件。设计考量因素有很多,包括硬件灵活性、冲突管理、准确性和安全性。

Synopsys的Lowman预测:“未来的架构,会对机器视觉有一个系统级的视角。需要权衡的因素很多:系统成本、分解架构中的内存可用性、片内和片外的内存带宽、处理器数量、不同阶段的处理器类型、每个AI阶段的位宽等等。这些只能通过复杂的工具,配合可配置、可优化的IP(无论是存储器、接口、安全还是处理器IP)来优化。”

而且,随着新AI和生成式AI模型的涌现,机器视觉还会不断扩展到新的应用领域。

Synopsys的Andersen总结了几大方向:“机器视觉有几个主要走向:用于扩展深度学习解决方案的云计算,用于改进ML管道的自动化ML架构,优化计算机视觉(机器视觉的超集)的Transformer架构,以及在边缘端集成计算机视觉技术的移动设备。”

来源:https://m.elecfans.com/article/2320047.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。