游乐游手机版
首页/AI热点日报/热点详情

深圳17岁高中生破解AI难题获马斯克点赞

类型:热点整理2026-07-23
埃隆·马斯克点赞Kimi团队技术成果,17岁深圳高中生陈广宇作为共同一作引发关注。团队提出“注意力残差”方法,可减少约20%训练计算量,提升大模型效率。陈广宇呼吁关注技术而非个人,强调成果属团队共同努力。

3月16日,埃隆·马斯克在社交平台上公开发文,对中国人工智能公司月之暗面(Moonshot AI)旗下Kimi团队的一项技术成果给予了“令人印象深刻”(Impressive work from Kimi)的高度评价。这一公开认可,让该团队最新披露的研究成果迅速进入更广泛的公众视野。

随后,在同一天发布的技术论文中,排名第一的作者“Guangyu Chen”因其“17岁高中生”的身份,在社交网络上引发了大量关注和讨论。

经核实,这位作者本名陈广宇,来自深圳,目前仍是一名在读高中生。他在接受采访时明确表示,希望外界更多关注技术本身和团队协作,而不是过度聚焦个人,并强调这项成果是团队共同努力的结晶。

公开的论文附录显示,Guangyu Chen、Yu Zhang、Jianlin Su三位作者被标注为“同等贡献”(Equal contribution),其余34位作者则未获得这一标注。与陈广宇并列共同一作的张宇和苏剑林,均为大模型领域的重要研究者:张宇是Kimi高效模型架构的关键人物,苏剑林则是旋转位置编码(RoPE)的提出者,这一编码方法已被主流大模型广泛采用。

这项成果之所以引人注目,不仅因为作者名单中有一位高中生作为并列共同一作,更因为它触及了大模型领域一个长期沿用却较少被公众讨论的底层结构问题。

今天的主流大模型大多建立在Transformer架构之上。可以说,没有2017年提出的Transformer,就难有后来这一轮生成式人工智能的爆发。它改变了文本内部的信息处理方式,但模型层与层之间如何传递信息,长期仍沿用较为固定的办法。包括OpenAI联合创始人伊尔亚·苏茨克维在内,不少研究者都曾思考过,这种连接方式是否还能被改写。

过去常用的方法是“残差连接”。简单来说,就是每计算完一层,就把前面的信息直接加到下一层。这种做法简单高效,但随着层数加深,真正重要的信息很容易被不断累积的内容冲淡。

Kimi团队这次提出的“注意力残差”(Attention Residuals),正是为了解决这个问题。它不再让每一层无差别地接收前面所有层的信息,而是由当前层按需选择更值得参考的内容,再加以聚合。通俗地讲,以前的做法像是把所有资料整包往后传,现在则更像先翻一遍,再挑出最有用的几页带走。

传统残差连接与注意力残差结构对比示意图。

这项工作的意义在于,它提供了一条新的思路:大模型能力的提升,未必只能靠堆参数、堆算力,也可以从底层结构入手,提高信息利用效率。公开材料显示,这一方法已在Kimi Linear 48B模型上完成验证,在相近效果下,训练计算量可减少约20%,相当于约1.25倍的效率优势,而推理延迟增加不到2%,且可直接替换标准残差连接。相关解读认为,引入“注意力残差”后,模型设计可能重新关注“加深深度”这一路径,而不只是继续向更大参数规模扩展。

陈广宇真正深入接触人工智能研究,是近一年的事。起步阶段,他通过研读经典论文、追踪GitHub开源项目等方式,补上了基础认知。后来,他在社交平台上分享对技术博客的反思,引起了一家硅谷AI初创公司CEO的注意,并在通过一项限时实验测试后获得了实习机会。暑假期间,他前往美国实习七周,回国后于去年11月加入Kimi团队实习。

陈广宇个人网站,展示了他参与的多项项目。

论文发布后,他在朋友圈回顾这段经历时,特别提到了同等贡献作者(Equal contribution)以及从事模型扩展与基础设施(scaling、infra)工作的同事,称这项工作“缺一不可”。

在接受采访时,陈广宇多次重复同样的意思:不要“造神”,不希望被写成突出个人的故事。对这名来自深圳的17岁少年而言,比起被贴上“天才”标签,他更希望外界看到的,是一项团队共同完成的研究,以及它试图解决的大模型底层难题。

17岁的年纪,一作的成果,谦虚的态度,为陈广宇点赞。

News

来源 | 深圳发布

编辑 | 卓映紫

来源:https://k.sina.com.cn/article_7879776589_1d5abd94d01901hc06.html?from=tech

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。