2023年3月,GLM技术团队开源了ChatGLM-6B,随后又推出了ChatGLM3-6B。这两步棋走得相当扎实,开发者社区对第四代模型的开源期待自然水涨船高。经过近半年的探索和打磨,GLM团队终于端出了第四代GLM系列开源模型——GLM-4-9B。
这次预训练的策略很有意思。GLM团队引入大语言模型来辅助数据筛选,最终拿到了10T的高质量多语言数据——这个量级是ChatGLM3-6B的三倍以上。训练效率上也下了功夫,FP8技术的应用让训练速度提升了3.5倍。更有意思的是,团队在有限显存环境下反复测试,发现6B参数规模的模型确实到了性能天花板。考虑到大多数开发者手里的显存配置,索性把模型规模拉到9B,预训练计算量直接增加了五倍。

GLM-4-9B的能力表现可以用几个关键维度来拆解。推理性能显著提升,上下文处理能力也做了大幅延伸——从128K一路扩展到1M tokens,什么概念?差不多相当于两部《红楼梦》连着读完,或者125篇学术论文的体量。多语言方面,模型支持26种语言,词表大小扩充到150k,编码效率提升了30%。Function Call能力在Berkeley Function-Calling Leaderboard上表现得相当亮眼。All Tools能力也一并开放,模型可以直接调用外部工具来完成复杂任务。
值得注意的是,这次GLM系列首次推出了多模态版本。GLM-4V-9B-Chat的效果相当可观,在图像理解、图文对话等场景下表现不俗。
简单来说,GLM-4-9B提供了几个版本供不同场景使用:8K上下文的基础版GLM-4-9B、128K的对话版GLM-4-9B-Chat、1M超长上下文版GLM-4-9B-Chat-1M,以及多模态版GLM-4V-9B-Chat。开发者可以根据实际需求灵活选择。
基础能力方面,中文和英文的综合性能相比ChatGLM3-6B提升了整整40%。长文本处理能力从128K扩展到1M tokens,这在实际应用中意味着更长的文档理解、更复杂对话历史的消化都成为可能。多语言能力的提升也不容忽视,词表编码效率提高30%意味着对非英语内容的高效处理。Function Call和All Tools的组合,让模型在工具调用场景下有了更实际的应用价值。
相关代码与模型权重已在开源平台开放下载,感兴趣的开发者可以直接上手体验。
