游乐游手机版
首页/AI热点日报/热点详情

SAM时代高效打造高性能计算大模型训练平台

类型:热点整理2026-07-19
Meta推出的SAM模型借鉴ChatGPT提示学习范式,通过SA-1B数据集和零样本迁移能力实现图像通用分割。衍生模型SEEM、MedSAM、SAM-Track分别提升交互、医学和视频分割性能。该模型赋能3D重建、安防、自动驾驶、遥感及机器视觉等领域。
# SAM大模型:从原理到部署的完整教程

Segment Anything Model (SAM) 是Meta公司推出的革命性AI模型,专为计算机视觉中的图像分割任务设计。它借鉴ChatGPT的学习范式,将预训练与特定任务结合,大幅提升泛化能力,用户只需一次点击即可分割图像中的任何物体。本教程将从SAM的核心原理、衍生模型、应用场景到环境配置与服务器选型,为您提供一份全面、易懂的实操指南。

一、SAM模型:CV领域的ChatGPT

1.1 什么是SAM模型?

SAM模型是Meta推出的人工智能模型,在官网上被描述为“仅需一次点击,即可在任何图像中分割出任何物体”。它采用以前的图像分割模型作为基础,并在庞大的数据集上进行训练,旨在解决多个下游任务并成为一种通用模型。

核心要点:

  • 借鉴ChatGPT的启发思想,采用可提示学习范式,提高学习效率
  • 建立迄今为止最大的图像分割数据集Segment Anything 1-Billion(SA-1B),包含1100万张图像和超过10亿个掩码
  • 构建通用且自动的分割模型,在零样本情况下灵活应用于新的任务和领域,其结果优于以往的监督学习结果

SAM 模型官方文章

1.2 Prompt:将ChatGPT的学习思维应用在CV领域

SAM利用先进技术路线实现计算机视觉底层技术突破,具备广泛的通用性和零样本迁移的能力。采用prompt-based learning方式进行学习训练,即利用提示语作为模型输入。

1.2.1 Prompt之前的模型在做什么

预训练语言模型(PLM)是一种先进的自然语言处理(NLP)模型,在人和计算机交互方面起着重要的作用。NLP旨在改善人与计算机之间的交流和理解,而PLM则是这一领域前沿模型之一。

预训练模型(PLM)的发展阶段和特征

预训练模型根据学习范式和发展阶段可以分为四代:

  • 特征学习:通过设置规则来提取文本特征编码文本,例如TF-IDF模型。
  • 结构学习:引入深度学习在NLP中应用,代表性模型是Word2Vec。第一代、第二代预训练模型的共同点是输出被用作下游任务的输入,但本身并不直接执行下游任务。
  • 下游微调:采用预训练加下游微调方式,代表性模型有BERT和GPT。
  • 提示学习:在BERT和GPT的基础上进一步改进,采用基于提示学习(Prompt-based Learning)方法。代表性模型有ChapGPT、GPT3.5和SAM。

预训练模型就像是培养出的高中毕业生,而下游任务则相当于大学的专业课程。高中毕业生学习未来应用领域相关的课程,就能够成为具备专业技能和知识的大学生。

基于提示的学习(prompt-based learning)各分支

1.2.2 Prompt的优势:实现预训练和下游任务的统一

传统的PLM+微调范式存在上下游之间差异较大、应用不匹配问题。随着模型参数越来越庞大,企业部署模型成本非常高,主要有以下两个缺点:

  • 微调所需的样本数量非常大
  • 模型的专用性高,部署成本高昂

针对以上缺点,GPT-3团队提出在大量无监督文本阅读后,语言模型可以通过“培养广泛技能和模式识别能力”有效地解决问题。实验表明在少样本场景下,模型不需要更新任何参数就能实现不错的效果。

Fine-tune 和 prompt 两种范式的区别

Prompt范式具有以下优点:

  • 大大降低模型训练所需样本量,可以在少样本甚至零样本的情况下进行训练
  • 提高模型的通用性,在实际应用中减少成本并提高效率

小提示:当下大型模型如GPT-4已经不再完全开放全部参数,用户只能通过API接口使用模型进行预测。由此可见,Prompt工程在下游任务中的重要性已经不言而喻。

1.3 ZSL:零样本学习降本增效,提高模型泛化能力

1.3.1 什么是零样本学习能力?

零样本学习(Zero-shot Learning, ZSL)是机器学习中的一个难题,其目标是让模型能够对从未见过的“未知物体”进行分类和识别。下图中展示一个经典案例,即认识斑马。一个“儿童”在动物园里见过马、熊猫、狮子、老虎等,但从未见过斑马。通过老师的描述,了解到斑马有四条腿、黑白相间的条纹以及尾巴,最终这个“儿童”轻松地辨认出斑马。

零样本学习(ZSL)示例

1.3.2 SAM的零样本学习能力得到认可

SAM正具备这样一种零样本分割能力,可以从各种prompt输入(包括点、方框和文本)中生成高质量的掩膜(Mask)。学术界有多篇论文探讨SAM的ZSL能力,如《SAM.MD: Zero-shot medical image segmentation capabilities of the Segment Anything Model》测试SAM的ZSL效果,在图像分割任务中输入部分点和框作为prompt提示,结果显示:专家用户可以通过SAM实现大部分场景下的快速半自动分割。

SAM 的零样本学习能力在 CT 影像中的应用

1.4 SA-1B:迄今为止最大的分割数据集,助力模型增效

1.4.1 Data Engine:使用数据引擎生成掩码

SAM使用数据集进行训练,并采用SAM交互式注释图像的方式对数据进行标注。整个过程可以分为三个阶段:

  • 手工阶段:标注人员利用SAM模型作为辅助工具,通过点击、框选或输入文本等操作生成MASK,模型实时更新并反馈可选的MASK。该方式使得标注人员能够快速而准确地分割图像中的对象。
  • 半自动阶段:SAM模型已具备一定分割能力,可自动预测对象,标注人员主要检查和修正预测结果,确保MASK的准确性和完整性。
  • 全自动阶段:SAM模型达到较高水平,能准确分割图像中的所有对象,无需任何人工干预,标注人员只需确认和验证模型的输出。

SAM使用数据引擎(data engine)渐进式收集数据示意图

1.4.2 Data Set:使用数据引擎生成掩码

通过逐步进行“模型辅助的手工注释——半自动半注释——模型全自动分割掩码”方法,SAM团队成功创建名为SA-1B图像分割数据集,具有规模空前、质量优良、多样化丰富和隐私保护的特点。

  • 图像数量和质量:包含多样化、高清晰度、隐私保护的1100万张照片
  • 分割掩码数量和质量:包含11亿个精细的分割掩码,由Meta开发的数据引擎自动生成
  • 图像分辨率和Mask数量:每张图像平均分辨率1500x2250像素,每张图像包含约100个掩码
  • 数据集规模对比:SA-1B比现有的分割数据集增加400多倍;使用SAM的方法比完全手动标注快6.5倍

SA-1B比现有分割数据集多 400 倍

小提示:SA-1B数据集的跨区域代表性较强,作者还进行了RAI(责任智能)分析。

SA-1B 数据集的跨区域代表性较强

二、SAM核心优势与衍生模型

2.1 SAM核心优势:减少训练需求,提升分割性能

SAM的核心目标是在不需要专业建模知识、减少训练计算需求以及自行标注掩码的情况下,实现目标通用分割。具体通过以下三种方法:

  • 数据规模和质量:通过零样本迁移能力,收集1100万张图像和11亿个掩码构建SA-1B数据集
  • 模型效率和灵活性:借鉴Transformer模型架构,结合注意力机制和卷积神经网络,能够处理任意大小和比例的图像
  • 任务的泛化和迁移:通过可提示分割任务,构建零样本迁移的图像分割模型

SAM 的可提示分割模型分为三部分

目前SAM已经具备以下功能:

  • 学习物体概念并理解图像中物体的概念和特征
  • 为未见过物体生成准确掩码
  • 高通用性,适应不同场景和任务
  • 支持多种交互方式:全选分割、框选分割等

框选分割(BOX)

2.2 基于SAM二次创作,衍生模型提升性能

2.2.1 SEEM:交互、语义更泛化,分割质量提升

SEEM是一种基于SAM的新型交互模型,利用SAM强大的零样本泛化能力,实现对任意图像中所有物体的分割任务。该模型结合SAM和一个检测器,通过使用检测器输出的边界框作为输入提示,生成相应物体掩码。SEEM能够根据用户提供多种输入模态(如文本、图像、涂鸦等),一次性完成图像或视频中所有内容分割与物体识别任务。

SEEM在交互和语义空间上都比 SAM 更具泛化性

小提示:SEEM是第一个支持各种用户输入类型的通用接口,包括文本、点、涂鸦、框和图像,提供强大的组合功能。

SEEM 根据用户输入的点和涂鸦进行图像识别

SEEM 根据参考图像对其他图像进行分割

2.2.2 MedSAM:提升感知力,应用医学图像分割

为评估SAM在医学影像分割任务中的性能,深圳大学等多所高校合作创建COSMOS 553K数据集(迄今为止规模最大的医学影像分割数据集)。测试结果显示,SAM在全自动Everything分割模式下对大多数医学影像分割任务的适应能力较差,其感知医学分割目标的能力有待提高。

SAM 分割医学影像测试的详细框架

测试 SAM 对医学影像分割性能的数据集 COSMOS 553K 及分割效果

因此,MedSAM提出一种简单的微调方法,将SAM适应到通用的医学影像分割任务中。通过在21个三维分割任务和9个二维分割任务上进行全面实验,MedSAM证明其分割效果优于默认的SAM模型。

MedSAM 示意图

2.2.3 SAM-Track:扩展SAM应用领域,增强视频分割性能

最新开源的SAM-Track项目由浙江大学ReLER实验室开发,为SAM模型增强在视频分割领域的能力。SAM-Track能够对任意物体进行分割和跟踪,支持各种时空场景(街景、AR、细胞、动画和航拍等)。在单卡上即可实现目标分割和跟踪,能够同时追踪超过200个物体

三、SAM及衍生模型赋能多场景应用

3.1 基于3D重建,赋能AR、游戏

在AR/VR领域,SAM模型结合3D重建技术和图像处理算法,为用户提供更加逼真和沉浸的视觉体验。通过SAM模型,用户可以将2D图像转化为3D场景,并在AR或VR设备上进行观察和操控。此外,SAM模型还结合了深度学习算法,对用户视线和手势进行识别和跟踪,实现更智能化的互动方式。

3.2 跟踪运动物体,赋能安防监控

SEEM和SAM-Track可以赋能安防和视频监控等领域,准确地对视频中的物体进行分割,以便进行后续的识别和处理。通过输入的提示信息,能够准确地判断目标物体并进行精确的分割。例如在跑酷、运动和游戏等视频中,SEEM模型不仅能够准确识别参考对象,还能够消除背景干扰,提高分割的精度。

3.3 解决长尾难题,赋能自动驾驶

自动驾驶技术仍然存在10%的长尾场景难题,包括突发事件、复杂地形和恶劣气候等。SAM的自动化分割能够大幅降低成本并提高准确性,在自动驾驶系统中实时感知道路标记、车道线、行人、交通信号灯等关键元素。以行人识别和车道线跟踪为例,SAM能够预测行人和车辆的运动轨迹,帮助减少潜在的交通事故风险。

城市道路场景中长尾场景较多

3.4 提高分割性能,赋能遥感图像

大型遥感图像分割模型SAM为遥感图像处理提供全新方法。基于深度学习算法,SAM能够高效地对遥感图像进行分割、识别和生成,显著提升遥感图像解译的效率。尽管在阴影、掩体分割和隐蔽动物定位等任务中准确性较低,但通过引入RSPrompter等方法可以自动生成prompt,实现语义可辨别的分割。

大模型应用于遥感图像处理

基于锚点的 prompter

大模型为空天信息产业带来了驱动和挑战

3.5 算力应用驱动,赋能机器视觉

机器视觉被称为“智能制造之眼”,主要功能归类为四种:

  • 识别:通过识别目标物的特征,如外形、颜色、字符、条码等,实现高速度和高准确度的甄别。
  • 测量:将图像像素信息转化为常用的度量单位,精确计算目标物的几何尺寸。
  • 定位:获取目标物体的二维或三维位置信息。
  • 检测:主要针对外观检测,如产品装配后的完整性检测、外观缺陷检测等。

机器视觉四大功能及难度

机器视觉发展历程

引入AI大模型为机器视觉产业带来重大突破。SAM作为一种重要的视觉领域AI大模型,可以在机器视觉领域推动创新和进步,如直接应用于智慧城市中的交通监测、人脸识别等任务,以及增强语义理解能力。

基于 AI 的轻量级人脸识别网络,可用于视频实时分析、安防监控等

OVD 目标检测基本流程

四、SAM大模型环境配置

4.1 部署前准备工作

要部署“Segment Anything Model”,需要按以下步骤进行操作:

  • 收集和标记训练数据:收集模型进行分割的对象的图像数据,并进行标记。
  • 进行数据预处理:调整图像的大小、剪裁不相关的区域或应用增强技术。
  • 构建和训练模型:选择适合的模型并使用预处理后的数据进行训练。
  • 模型评估和调优:对训练完成的模型进行评估并调优。
  • 部署和推理:将训练好的模型部署到目标环境中,并使用新的图像数据进行推理。

系统要求:

  • Python版本 ≥ 3.8
  • PyTorch版本 ≥ 1.7
  • torchvision版本 ≥ 0.8

可以参考官方教程:https://github.com/facebookresearch/segment-anything

4.2 安装主要库的方式

方式1:使用pip安装(需要配置Git)

pip install git+https://github.com/facebookresearch/segment-anything.git

方式2:本地安装(需要配置Git)

git clone git@github.com:facebookresearch/segment-anything.git
cd segment-anything
pip install -e .

方式3:手动下载+手动本地安装

cd segment-anything-main
pip install -e .

4.3 安装依赖库

pip install opencv-python pycocotools matplotlib onnxruntime onnx

注意:如果安装matplotlib时遇到错误,可以尝试安装特定版本:

pip install matplotlib==3.6.2

4.4 下载权重文件

从以下链接下载三个权重文件中的一个:

  • default 或 vit_h:ViT-H SAM 模型
  • vit_l:ViT-L SAM 模型
  • vit_b:ViT-B SAM 模型

如果下载速度过慢,请联系小助手获取权重文件。

五、如何配置训练SAM模型的服务器

5.1 计算资源需求

SAM模型依赖于深度学习算法,需要进行大规模的矩阵运算和神经网络训练,因此服务器需要具备足够的CPU和GPU资源。

5.1.1 GPU

  • GPU内存:需要足够内存来存储模型参数和图像数据,建议选择大容量显存的GPU。
  • GPU计算能力:选择具有较多CUDA核心和高时钟频率的GPU,可提高运行效率。

5.1.2 CPU

  • CPU核心数量:选择多核心CPU可提高并行处理能力。
  • CPU时钟频率:预处理和加载任务需要高频CPU以加快执行速度。

5.1.3 常用CPU+GPU推荐

组合 说明
AMD EPYC 7763 + Nvidia A100 80GB 64核心EPYC芯片 + 80GB显存,适合大模型训练
双AMD EPYC 7742 + 8张 AMD Instinct MI50 64核心双CPU + 8张16GBGPU,计算资源充足
双Intel Xeon Platinum 8280 + 8张 Nvidia V100 32GB 56核心双CPU + 8张32GB V100
AMD EPYC 7713 + 8张 Nvidia RTX A6000 高性价比,48GB显存,经济实用
双Intel Xeon Gold 6300 + 8张 AMD Instinct MI100 低成本多核心Xeon + MI100配合
AMD EPYC 7003系列 + Nvidia A100 推荐组合,最高96核心EPYC + 至多8块A100

5.1.4 存储需求

SAM模型需要加载和存储大量模型参数和图像数据,建议使用高速SSD(固态硬盘)以加快数据读写速度。

5.1.5 高性能网络需求

SAM模型需要通过网络接收和发送大量数据,服务器需要高速、稳定的网络连接,特别是处理实时图像分割任务时需低延迟高带宽。

六、蓝海大脑大模型训练平台

蓝海大脑大模型训练平台提供强大的算力支持,包括基于开放加速模组高速互联的AI翻跟斗。配置高速内存且支持全互联拓扑,满足大模型训练中张量并行的通信需求。支持高性能I/O扩展,可扩展至万卡AI集群。主要应用于深度学习、学术教育、生物医药、地球勘探、气象海洋、超算中心、AI及大数据等领域。

6.1 为什么需要大模型?

  • 模型效果更优:大模型在各场景上的效果均优于普通模型
  • 创造能力更强:大模型能够进行内容生成(AIGC),助力内容规模化生产
  • 灵活定制场景:通过举例子的方式,定制大模型海量的应用场景
  • 标注数据更少:通过学习少量行业数据,大模型就能应对特定业务场景的需求

6.2 平台特点

  • 异构计算资源调度:调度和管理多种异构计算资源(CPU、GPU等),充分发挥硬件加速能力
  • 稳定可靠的数据存储:支持多存储类型协议,采用多副本、多级故障域和故障自恢复等数据保护机制
  • 高性能分布式网络:提供算力资源的网络和存储,透传物理网络性能
  • 全方位安全保障:严格权限管理、私有化部署、数据磁盘加密、账号认证和日志审计

6.3 常用配置

6.3.1 H100服务器常用配置

英伟达H100配备第四代Tensor Core和Transformer引擎(FP8精度),与上一代产品相比,可为多专家(MoE)模型提供高9倍的训练速度。通过第四代NVlink提供900 GB/s GPU间互连。

  • CPU:英特尔至强Platinum 8468 48C 96T 3.80GHz 105MB 350W *2
  • 内存:64GB DDR5 4800MHz *24
  • 存储:固态硬盘3.2TB U.2 PCIe第4代 *4
  • GPU:Nvidia Vulcan PCIe H100 80GB *8
  • 网络:英伟达IB 400Gb/s单端口适配器 *8
  • 电源:2000W(2+2)冗余高效电源

6.3.2 A800服务器常用配置

NVIDIA A800深度学习运算能力可达312 teraFLOPS(TFLOPS),采用NVIDIA NVLink可提供两倍于上一代的吞吐量。

  • CPU:Intel 8358P 2.6G 11.2UFI 48M 32C 240W *2
  • 内存:DDR4 3200 64G *32
  • GPU:HV HGX A800 8-GPU 80GB *1
  • 电源:3500W电源模块*4

6.3.3 A100服务器常用配置

NVIDIA A100 Tensor Core GPU采用NVIDIA Ampere架构,性能比上一代提升高达20倍,可划分为七个GPU实例。

  • CPU:Intel Xeon Platinum 8358P_2.60 GHz_32C 64T 230W *2
  • 内存:64GB DDR4 RDIMM服务器内存 *16
  • GPU:NVIDIA TESLA A100 80G SXM *8

6.3.4 H800服务器常用配置

H800基于Hopper架构,与A800相比性能提升了3倍,显存带宽达到3 TB/s。由于美国限制,H800是面向中国市场的替代方案。

  • CPU:Intel Xeon Platinum 8468 Processor, 48C64T, 105M Cache 2.1GHz, 350W *2
  • 内存:64GB 3200MHz RECC DDR4 DIMM *32
  • GPU:NVIDIA Tesla H800 -80GB HBM2 *8

6.3.5 A6000服务器常用配置

  • CPU:AMD EPYC 7763 64C 2.45GHz 256MB 280W *2
  • 内存:64GB DDR4-3200 ECC REG RDIMM *8
  • GPU:NVIDIA RTX A6000 48GB *8
  • 电源:2200W(2+2)冗余钛金电源

6.3.6 AMD MI210服务器常用配置

  • CPU:AMD EPYC 7742 64C 2.25GHz 256MB 225W *2
  • GPU:AMD MI210 64GB 300W *8
  • 电源:2200W(2+2)冗余钛金电源

6.3.7 AMD MI250服务器常用配置

  • CPU:AMD EPYC™ 7773X 64C 2.2GHz 768MB 280W *2
  • GPU:AMD MI250 128GB 560W *6
  • 电源:2200W(2+2)冗余钛金电源

常见问题(FAQ)

Q1:SAM模型需要多少GPU显存才能运行?

这取决于你使用的模型版本:vit_h(默认)需要约8GB显存进行推理,vit_l约6GB,vit_b约4GB。如果进行训练或微调,建议至少24GB显存(如RTX A6000 48GB或A100 80GB)。

Q2:配置SAM环境时遇到“No module named 'sam'”怎么办?

请确保已正确安装segment-anything库。使用pip install -e .进行本地安装,并检查是否在segment-anything目录下执行。如果使用pip安装,请确保Git配置正确且网络通畅。

Q3:SAM模型可以用于视频实时分割吗?

可以,但需要高性能GPU支持。例如SAM-Track项目已经实现了视频中的目标分割和跟踪。对于实时分割,建议使用H100或A100等高性能GPU,并配合高效的推理框架。

Q4:SA-1B数据集能否免费下载使用?

SA-1B数据集由Meta发布,遵循数据许可证要求,可供计算机视觉研究使用。但下载需要较大的带宽和存储空间(约1TB以上),请确保磁盘空间充足。

Q5:部署SAM模型到生产环境中需要注意什么?

  • 选择合适的模型版本(vit_h/vit_l/vit_b),平衡精度与性能
  • 考虑使用ONNX Runtime或TensorRT进行推理加速
  • 配置足够的CPU内存和GPU显存
  • 确保网络带宽满足实时传输需求
  • 对敏感数据进行脱敏处理,遵守隐私法规

结语

SAM模型作为计算机视觉领域的里程碑式成果,为图像分割带来了全新范式和思维方式。从零样本学习到提示学习,从海量数据集到大模型环境配置,本教程系统性地梳理了SAM的核心原理、应用场景与部署方法。无论你是研究人员、工程师还是企业决策者,都能从中找到值得借鉴的思路。面对快速发展的AI技术,掌握SAM的配置与应用,将为你的图像分割任务带来事半功倍的惊喜。

来源:https://m.elecfans.com/article/2218135.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。