游乐游手机版
首页/AI热点日报/热点详情

微信语音卡顿听不清?电信0.266kbps技术搞定

类型:热点整理2026-07-21
中国电信自研的智传网(AIFlow)技术,以0 266kbps超低码率实现清晰语音通话,刷新世界纪录。其核心生成式智能传输将传输对象从比特流变为词元流,用计算换带宽。该技术荣获WAIC最高奖SAIL奖,并在天、空、地、海通信及视频压缩存储、隐私保护等领域展现广泛应用前景。
通勤路上,你挤在地铁车厢里,手机举到耳边,微信语音那头是同事在交代今天要交的方案细节。“关于那个…… 预算…… 三点之前……”声音断断续续,关键信息大半都漏掉了。 在地铁、地下车库,或者大会、演唱会现场,这种场景想必并不陌生。只要网络变差,微信通话就成了一件折磨人的事,卡顿、吞字、电流声,让人莫名烦躁。怎么都2026年了,想打个微信电话把事情说清楚还这么难?网络差就听不清,这真的是铁律吗? 今年WAIC中国电信的展台上,我们看到了反常识的一幕。展台上摆着两部正在通话中的手机,上面各自显示着一个局域网IP地址,音质听起来很清晰。然而,其背后的几个字——“**极窄带宽语音通话**”——却吸引了我们的注意。 “极窄”到底有多窄?现场听到一个超乎想象的数字:**0.266kbps**! 没错,这确实很夸张。你可以翻翻你电脑上任意一个音频文件的码率,几乎不可能找到如此低码率的文件。0.266kbps,是一项目前已知的世界纪录。 目前主流的音乐文件的码率通常为320kbps,某些甚至可达数千kbps。 那么,码率究竟是什么?从其单位也能看出来:kbps = kilo-bits per second,也就是每秒多少千比特。简单说,码率决定了一秒钟的语音里能装下多少信息。码率越高,声音细节越完整;码率越低,数据要挤过狭窄的通道,就得舍弃细节——声音发闷、发飘、断断续续,都是这么来的。 实际语音通话中,服务商通常会使用动态码率:网络好时用高码率,清晰流畅;一旦网络波动(比如地铁钻进隧道),就自动降到低码率,以保住通话不断。 那0.266kbps到底有多低?做个对照更有体会:移动通信的语音编码走过了2G的AMR-NB、4G的AMR-WB,到今天VoLTE高清通话普遍采用的EVS编解码(这已是3GPP迄今性能最好的语音编码),但也需要在5.9到128 kbps区间工作,日常一通VoLTE高清通话大约需15 kbps。而智传网(AI Flow)把这个数字压到了0.266 kbps。 按过去的经验,这种码率顶多传输一些简单的文字指令,打电话是想都不敢想的事。极端情况下,对方说“飞流直下三千尺,疑是银河落九天”,你听到的却是“飞……天”。但在中国电信这里,它不仅能清晰通话,甚至连音乐都能传——仅相当于传统编解码技术128 kbps的1/500;如果只传语音,码率还能更低。这也**刷新了已知语音通信的最低码率纪录**。 可以说,中国电信的这项技术挑战了“网络差就听不清”的铁律。而这项技术也有个名字:智传网(AI Flow),由中国电信人工智能研究院(TeleAI)全自研原创打造。就在大会开幕当天,它从230多个项目中脱颖而出,拿下了今年WAIC的最高奖:**卓越人工智能引领者奖(SAIL奖)**,这个奖也被称为“AI界的奥斯卡”。 此外,智传网(AI Flow)的核心技术生成式智能传输(Generative Transmission)还获得了**首届WAIC-Academic最佳论文奖**。 那么,智传网(AI Flow)到底是什么?为什么能做到传统通信做不到的事?会对哪些领域带来深远影响?中国电信集团CTO、首席科学家、中国电信人工智能研究院(TeleAI)院长李学龙在WAIC中国电信人工智能生态论坛上进行了深度解析。 ## 生成式智能传输:把传“比特流”变成传“词元流” 智传网(AI Flow)是什么?其名字本身就已暗示:智代表人工智能,传是指通信传输,而网指网络技术。 表面看是一项技术,但背后融合了三大学科,这就不难理解为什么智传网(AI Flow)会诞生在TeleAI。 TeleAI是央企里第一家人工智能研究院。而中国电信这家公司本身就是通信起家的。也正因如此,通信的天花板在哪里、瓶颈卡在哪里,没有人比他们更清楚。智传网(AI Flow)就是他们把AI这套新工具,接进通信这门老手艺后长出来的东西。 它到底新在哪儿?关键在于换掉了传输的“货物”。 最传统的通信本质上做的是符号搬运。你的声音被麦克风收进来,收到多少信息,就原原本本传多少比特;视频则拆成一个个像素点往外发。信息越清晰,数据量越大,占的带宽也越多。这是一笔省不掉的刚性开销。 带宽不够怎么办?只能压缩,而压缩又分为无损压缩和有损压缩。为了尽可能降低带宽,只能选择有损压缩,即丢弃部分细节。可压缩有极限,压到最后,就是我们熟悉的那种糊成一团、断断续续的体验。所以在旧框架里,这几乎是个死结:要清晰就得要带宽,没带宽就别想清晰。 不同程度的图像有损压缩示意,音频也是类似。 智传网(AI Flow)的不同之处在于,它是一种借助智能完成的压缩。其核心技术叫**生成式智能传输**,思路可以概括成六个字:**用计算换带宽**。 具体来说,发送端不再直接搬运声音本身,而是先用多模态大模型把这段语音“读懂”,把其中最核心的语义、声纹、特征等信息,凝练成一小串词元(Token)发出去;接收端收到这串词元后,再用生成式大模型把声音重新“生成”还原出来。传输的对象,就此从“比特流”变成了“词元流”。词元的体量远小于原始比特,带宽占用自然断崖式下降。 这套打法背后是TeleAI早就铺下来的理论地基。早在2002年,李学龙团队就提出了**信容理论**,揭示了计算、通信与存储之间可以相互折叠、彼此换算的关系。除此之外,团队对“噪声”的重新定义也为这套架构扫清了认知障碍——传统通信视噪声为洪水猛兽,而“**正激励噪声**”理论指出,当噪声与任务目标相关时,它反而能降低任务复杂度、起到正向驱动作用。这一认知让AI不再盲目地“丢弃”低码率下的细节,而是学会区分哪些是干扰、哪些是可用的线索。后来,多模态大模型成熟,“用计算换带宽”终于得以从纸面走进现实——通信研究盯了几十年的编码和信道,天花板被AI捅破。 对智传网(AI Flow)来说,传语音其实只是一道“简单题”,毕竟语音的码率本来就不大。真正的考验是视频。 传统视频编码(从H.264到H.265、H.266)本质上是在“找冗余”,即靠帧间预测和运动补偿,只记录前后画面里变化的部分。这套思路已经打磨到极致,H.266在理想情况下甚至能把码率压到H.264的四分之一。但它再聪明,传的仍然是像素的差值,一旦带宽被压到临界点,残差信息不够了,画面就开始糊、开始丢帧。这是“搬运像素”这条路线绕不开的物理下限。 同样地,智传网(AI Flow)更换了这条路线:不再搬运像素差值,而是传词元。 发送端从视频流中抽出画面语义、动态特征,凝成轻量的词元流发出;接收端再把画面重新“生成”出来。结果相当夸张:一段1080P、24FPS的高清视频,不到100kbps就能稳定传输,而传统方式需要约3.6Mbps——前者只有后者的3%。如果说语音方向,智传网实现的是“**用发信息的带宽打电话**”,那在视频方向它就实现了“**用打电话的带宽传高清视频**”。 极致的压缩效率让“传词元”这件事的想象力没有止步于传画面。和世界模型联手之后,它甚至能传一个“世界”。 最近有多少人熬夜看世界杯?但无论你买的电视多大,你能看到的画面始终是导播给你切的那个角度,说白了就是一个三维世界的投影。 智传网(AI Flow)就不一样了,借助词元流,它**能装下一场球赛的球员、足球、球场和动作轨迹之间的时空关系**。当然,要把这样的词元流还原成画面,靠传统解码已经不够了,TeleAI在接收端引入的,正是当下AI领域最热的技术之一:世界模型。 接收端也不再只是逐帧重建像素,而是根据词元流还原出一个可进入、可观察的三维世界——同一次射门,你可以从全景俯瞰,可以贴身跟拍,甚至可以切换到门将的第一人称视角,重新看一遍。 李学龙在演讲中用了柏拉图的比喻:传统视频里,观众是洞xue中看影子的囚徒;而智传网(AI Flow)让你走出洞xue,自由翱翔。对赛事直播来说,这也许意味着一件不小的事:“导播决定你看什么”的时代,正在出现裂缝。 **这就是“传比特”和“传词元”的本质区别,前者很快触及天花板,而后者的应用边界才刚刚开始探索。** 当然,画面是AI“生成”出来的,一个自然的疑问是:它能信吗?毕竟,一个不可信的东西,你传得再快、再清晰有什么用? 这方面,TeleAI给出的回答是双重保障。一方面,团队对重建的通信速率与理解性能做了系统评估,无论是下游任务的理解能力,还是原始音视频的重建质量,都达到国际领先水平;另一方面,可信溯源技术会给每一段重建视频打上“不可磨灭的数字烙印”,确保无论从哪个视角观察,事件的真实性都不会被篡改。 这其中,藏着一次迟到七十多年的突破。早在信息论奠基之初,香农和韦弗就把通信分成了三层:符号层,关心一串比特能否准确送达;语义层,关心意思有没有传对;效用层,关心接收方拿到信息后能不能真正把事情办成。传统通信八十年来主要在啃第一层。 而智传网(AI Flow)想做的是**让同一串词元贯通三层**:它既是精准重建画面的特征数据(符号层),又是可被理解、推理的语义向量(语义层),还能直接驱动一次救援决策或一个机器人动作(效用层)。 以灾区救援为例,一棵树的纹理还原得准不准,优先级其实很低;“哪里有人、道路断没断、房子会不会塌”,才是效用层真正在乎的东西。 所以,智传网(AI Flow)真正的意义,不只是把声音、画面压缩得更小,而是让信息以“可信可用”的形态抵达原本到不了的地方,去发挥它应有的效用——这对AI来说,正是当下最紧迫的一道关卡。 ## 天空地海:低带宽链路下实时传输音视频 这几年AI的演进有一条清晰的主线:从大模型,到智能体,再到具身智能,能力越来越强,也越来越需要突破物理边界“走出去”,走进天空、荒野、深海这些人和网络都难以抵达的地方。可传统通信的覆盖,高度依赖基站、光纤和稳定电力,一旦离开这些基础设施,连接就会迅速崩塌。 智传网(AI Flow)要做的,是让一批硬件终端摆脱这种束缚,把智能送到更远的地方。TeleAI把这件事拆成了**天、空、地、海**四个方向。 先看“天”和“空”。当下业界都在喊“算力上天”,但算力上天的意义究竟在哪?过去,卫星在通信网络里扮演的角色几乎没变过,它就像一面挂在天上的镜子,只负责把信号反射回去,大部分的“思考”都发生在地面。算力上天真正的价值,就是让卫星从“管道”变成“节点”:信息还在轨道上,就被读懂了。 道理成立,但怎么落地?智传网(AI Flow)提供了实现的可能。星地链路的特点是地面终端功率小、天线小,往卫星发信号(上行)的带宽很紧张;而卫星往地面广播(下行)的带宽相对宽裕。顺着这个天然的不对称,智传网(AI Flow)把最吃算力的解码模型部署到在轨卫星上——终端只管把轻量词元发上去,重活留给天上。目前,这一应用方向还在推进过程中。 而顺着这张网往下,就到了“空”这一层——**轻小型无人机直连卫星,传输高清视频,这是国内首次**。 TeleAI自研的人形机器人,以及像宇树这样的合作伙伴的机器人,都能接入这张网:一台机器人发现的路况,可以同步给另一台;一台学到的经验,可以变成整个机器人网络的共识。多台设备由此减少重复感知与重复计算,逐步走向**分布式群体智能**。 最后是“海”或者说“水”。我们生活在一个被水包围的世界,很多活动都在水里展开。可在无线通信意义上,任何一片水域都是一块“信号黑洞”,因为电磁波在水里衰减极快,几乎传不了几米;换光通信,清水里能传得远,可水一浑浊就瞬间失效。于是只能退回到声波,因为声学链路是浑浊水体里唯一还能远距离传输的载体,但它本身带宽极窄。智传网(AI Flow)做的,是在这条狭窄的声学链路上,硬生生跑通了实时高清视频。 依托智传网(AI Flow)与自研的高速声通信模组,TeleAI首次实现了在任意水体中的远程无线实时视频传输,可在超过10米的距离上稳定回传720P高清画面,应用于水下巡检、生态监测、应急搜救等场景,为这些极端环境提供了稳定、实时的无线视觉通信能力。 这套核心载荷,目前已经搭载在TeleAI自研的“空海跨域潜航器”上。我们可以把它理解成一台能从空中扎进水里的无人机,未来还将随着与中国船舶集团的合作,出现在更多平台上。 第二块是海量视频的存储。城市里的摄像头越来越多,4K、8K设备不断普及,视频数据正在爆炸式增长。传统做法要完整保存每一帧画面,可大量监控画面长期“存而不用”,既吃存储空间,又难以按需调取。很多监控往往只能留存一周左右就得清空腾地方。 智传网(AI Flow)换了个思路:不再逐像素保存,而是把视频编码成精简的词元存下来,需要时再用生成式模型按需还原。 需要说明的是,传统视频压缩同样会利用前后帧的冗余,这不新鲜。智传网(AI Flow)的不同在于它进一步借助模型能力,把背景、人物、车辆、事件统一编码,因为固定机位的监控画面里,背景常年不变,系统就只留人和车这些真正动态的语义,而不是一帧帧去记录几乎没变的画面。 中国电信拥有全球最大的视联网,覆盖超过1亿路摄像头,正在规模化推广这项压缩存储技术。 效果是:在同等硬件条件下,存储空间可降低为传统方案的约1/40,**原本只能存一周的影像,如今能存下接近一整年**。这项技术已在天翼视联的视联网上规模化落地,首批已有上千路摄像头接入。 第三块是隐私保护。在养老看护、校园防霸凌这类敏感场景里,人们既希望摄像头能及时发现危险,又不愿意自己的生活被赤裸裸地录下来、传上去。这是一对天然的矛盾。 智传网(AI Flow)靠分层的语义词元流化解了它:在传输阶段就把敏感词元筛掉,让接收端能读懂“发生了什么”,却无法还原“看到了什么”。比如在养老场景中,系统能识别老人跌倒、挥手求助等异常行为并及时向后台报警,但原始影像无从恢复。用一句现场文案来说——“传的是词元,不是画面;认的是行为,不是人脸”。这套方案将在智云上海等平台上线,触达约400万终端用户。 从灾区到城市,从抢险到看护,这三块场景的共同点在于:智传网(AI Flow)关心的,已经不只是“传了多少数据”,而是“这些信息能不能帮人和机器把事情办成”。 ## 通信,正在成为智能涌现的条件 从地铁里那通断断续续的电话,到灾区、深海和卫星轨道,智传网(AI Flow)在WAIC上讲的其实是一个关于“连接”的故事:那些因为带宽、距离和环境而被切断的连接,正在一条一条被接回来。 李学龙在演讲里说过一句让人印象很深的话:“**智能的涌现,源于连接和交互。**”他说,智人之所以繁衍壮大,靠的不是比尼安德特人更强壮的体格,而是语言和信息的交流互动,即连接让个体的聪明变成了集体的智慧。 AI时代同样如此。**大模型、智能体和机器人都不会孤立成长,只有当一个机器看到的世界能成为另一个机器的经验,当分散的感知与能力能够持续流动、融合,智能才可能真正涌现。** 七十多年前,香农用信息论教会人类如何把比特送得更远;今天,智传网(AI Flow)想回答的是另一个问题:当比特变成了词元,当连接无处不在,智能可以生长到多远? 值得玩味的是,AI圈这些年一直在讲“压缩即智能”,即一个模型能把世界压缩得多好,某种程度上就代表它对世界理解得多深。智传网(AI Flow)把这句话反了过来:**用智能去做压缩**。它靠对世界的理解,把该传的意思拎出来、把冗余的比特扔掉,还在其分层网络架构中部署了一系列大小不同的**家族式同源模型**,希望实现**基于连接与交互的智能涌现**。压缩与智能,就此变成了一条真实跑在网络里的技术路径。 从这个意义上说,通信正在卸下“传输工具”的旧身份,成为智能得以涌现的条件本身。而智传网(AI Flow)所拓展的也不只是带宽的边界,更是智能能够抵达、连接与生长的边界。
来源:https://www.jiqizhixin.com/api/article_library/articles/2026-07-20-23

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。