商汤科技正式发布日日新5.0多模态大模型,综合能力全面对标GPT-4 Turbo,这是业界首个真正实现云端、终端、边缘侧全栈覆盖的大模型产品矩阵。本教程将带你深入解析其核心架构、能力亮点及行业影响,助你快速掌握这一重大技术突破。
一、核心发布:云、端、边全栈大模型矩阵
2024年4月23日,商汤科技董事长兼CEO徐立在2024商汤技术交流日上正式发布了行业首个云、端、边全栈大模型产品矩阵,可灵活满足不同规模场景下的应用需求。同时,全新升级的“日日新SenseNova 5.0”大模型体系,其综合能力全面对标GPT-4 Turbo。
- 云:面向云端复杂推理与训练任务,提供高性能算力支撑。
- 端:面向手机、PC等终端设备,实现本地化推理,有效降低延迟。
- 边:面向边缘计算场景,兼顾实时响应与隐私保护需求。
二、5.0大模型的架构与技术亮点
1. 混合专家(MoE)架构
日日新5.0大模型独特采用混合专家(MoE)架构,通过多个“专家子模型”协同工作,在保持推理效率的同时大幅提升模型容量。这意味着模型能够动态选择最合适的专家处理不同任务,从而在知识、推理、数学、代码等多个维度达到更高水平。
2. 超大训练数据与合成数据
该模型支持多达10T Tokens的中英文训练数据,并在此基础上推理合成数据可高达数千亿Token。如此庞大的数据规模为模型提供了丰富的知识储备与坚实的推理基础。
3. 超长上下文窗口
在进行推理计算时,日日新5.0的上下文窗口可扩展至约200K Token范围。这意味着它能够一次性处理长达十几万字的文档,非常适合合同分析、书籍摘要等需要长文本理解的场景。
