游乐游手机版
首页/AI热点日报/热点详情

Petals去中心化分布式大模型推理与微调框架解析

类型:热点整理2026-08-18
Petals是什么Petals 是由 BigScience‑workshop 团队开源的P2P分布式大语言模型运行框架,借鉴了 BT 下载的分片传输思路,将超大参数规模的大模型拆分为多个 Transformer 模块,分布运行在全球志愿者提供的 GPU 设备之上。对于普通用户而言,作为客户端使用时,

Petals是什么

Petals 是由 BigScience‑workshop 团队开源的P2P分布式大语言模型运行框架,借鉴了 BT 下载的分片传输思路,将超大参数规模的大模型拆分为多个 Transformer 模块,分布运行在全球志愿者提供的 GPU 设备之上。

对于普通用户而言,作为客户端使用时,无需在本地配备高端高显存显卡,也能直接调用网络中的分布式算力,完成千亿级大语言模型的推理和参数高效微调任务;而对于拥有闲置 GPU 资源的用户,则可以作为服务端节点贡献本机算力,接入整个分布式算力网络。该项目基于 PyTorch 与 Hugging Face 生态开发,既支持公共开放网络,也支持搭建完全隔离的私有分布式集群,本质上是一套面向超大规模 LLM 的去中心化算力协作方案。

使用方法

客户端模式(调用分布式大模型,普通使用者)

  1. 安装依赖环境

pipinstallpetals
  1. Python 基础调用示例

frompetalsimportAutoDistributedModelForCausalLMfromtransformersimportAutoTokenizermodel_name="meta-llama/Llama-3.1-405B-Instruct"tokenizer=AutoTokenizer.from_pretrained(model_name)model=AutoDistributedModelForCausalLM.from_pretrained(model_name)inputs=tokenizer("Hello,introduceyourself",return_tensors="pt")outputs=model.generate(**inputs,max_new_tokens=128)print(tokenizer.decode(outputs[0]))

Llama 系列模型需要提前在 Hugging Face 获取权重访问权限,并在本地完成登录验证。

服务端模式(贡献GPU算力,加入网络)

  1. 安装 petals 后,执行启动命令,托管指定模型的部分网络层:

python-mpetals.cli.run_servermeta-llama/Llama-3.1-405B-Instruct
  1. 使用 Docker 进行部署

dockerrun--gpusall--rmpetals/servermeta-llama/Llama-3.1-405B-Instruct
  1. 私有集群部署:可指定自定义 bootstrap 节点地址,使所有节点接入同一个私有网络,完全脱离公共网络环境。

竞品对比

项目核心定位组网方式微调支持运行门槛
Petals去中心化 P2P 分片运行超大 LLMP2P 志愿者节点组网,支持公共网络与私有集群双模式支持 Prompt‑tuning 参数高效微调客户端几乎没有显存压力;服务端单卡即可托管部分模型块
vLLM单机高性能大模型推理加速引擎单机或多机中心化部署,依赖自有硬件资源支持 LoRA 微调推理需要完整部署模型,硬件显存需匹配模型参数规模
DeepSpeed‑Inference微软开源的大模型推理库,支持模型分片中心化多机多卡部署,由用户自行管理全部节点完整支持全量微调与 LoRA 微调推理需要用户具备全部硬件,并手动配置多机集群环境

常见问题解答

Q:使用Petals,客户端电脑需要多大显存?

A:客户端仅保存 tokenizer 和少量模型元数据,即使运行千亿参数模型,通常也只需要几百 MB 显存,无需加载完整模型权重;主要推理算力由网络中的服务端节点提供。

Q:公共网络处理我的输入数据,数据会被其他人获取吗?

A:在公共 swarm 模式下,输入内容会经过网络内的志愿者节点处理,因此不适合商业敏感数据或隐私信息。若需更高的数据安全性,建议搭建私有 swarm,由自己统一管理全部节点。

Q:我贡献GPU作为服务端,其他用户能在我的机器运行任意代码吗?

A:不能。Petals 节点只会执行预定义的 Transformer 模块计算,并隔离外部代码执行环境,第三方无法向你的主机下发任意自定义脚本。

Q:为什么公共网络生成token速度不稳定?

A:公共网络中的节点来自全球各地的志愿者,节点在线状态、网络带宽以及 GPU 性能存在差异,因此生成 token 的速度可能波动较大。若追求稳定性能,建议部署私有集群。

Q:可以运行任意HuggingFace上的模型吗?

A:并非所有模型都可直接运行,目前主要支持原生适配的模型架构,例如 Llama、BLOOM、Falcon、Mixtral;如果是较为小众的模型架构,通常需要修改源码后进行适配。

Q:Llama系列模型加载报错是什么原因?

A:Llama 权重受许可限制,需要先在 Hugging Face 申请访问权限,并在本机执行 huggingface‑cli login 完成身份验证后,才能正常加载模型。

相关链接

  • GitHub仓库:https://github.com/bigscience-workshop/petals

  • 官方文档:https://petals.readthedocs.io

  • 官网网站:https://petals.dev

  • 论文地址:https://arxiv.org/pdf/2209.01188.pdf

总结

Petals 通过 P2P 分片分布式方案,有效降低了千亿参数大模型对单台设备硬件的高门槛,让普通用户也能以更低成本体验超大开源大语言模型。更重要的是,它同时保留了科研微调与私有部署两项关键能力,为算力受限的个人开发者、研究团队和实验室提供了一条切实可行的超大模型运行路径。整个项目依托开源社区志愿者协同维护分布式算力网络,并能够兼容主流大模型生态,因此无论用于科研实验、AI 推理实践,还是企业内网私有化部署,都具备明确且实际的应用价值。

来源:https://www.aipuzi.cn/ai-news/petals.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。