谷歌开源Gemma:大模型领域的“妙手”还是“俗手”?
2024年2月,谷歌突然改变了过去坚持的“大模型闭源”策略,正式推出开源大模型 Gemma。这一举动打破了此前由Meta的Llama和Mistral主导的开源格局,也让谷歌在大模型领域形成了“闭源对抗OpenAI,开源对抗Meta”的双线作战态势。本文将从模型细节、策略分析、行业影响三个维度,为你全面解读Gemma的发布意义。
一、Gemma模型速览:技术规格与关键特性
Gemma(拉丁语意为“宝石”)由谷歌DeepMind与其他团队合作开发,采用了与Gemini相同的核心技术。谷歌同时发布了多种工具,帮助开发者快速上手。
- 模型规模:提供两种权重版本——Gemma 2B 和 Gemma 7B,每种均包含预训练和指令微调版本。
- 训练数据:Gemma 7B使用了6万亿Token数据进行训练,特别增强了数学和代码类数据以提升推理能力。
- 工具链支持:通过原生Keras 3.0支持JAX、PyTorch、TensorFlow三大框架的推理与监督微调(SFT);与Hugging Face、MaxText、NVIDIA NeMo等工具集成。
- 部署选项:可在笔记本、工作站或Google Cloud上运行,支持Vertex AI和Google Kubernetes Engine(GKE)部署。
- 硬件优化:针对NVIDIA GPU和Google Cloud TPU进行了专门优化。
- 商用许可:所有组织(无论规模)均可负责任地进行商业使用和分发。

图片来自谷歌官方
