首页 游戏 软件 资讯 排行榜 专题
首页
科技数码
华盛顿大学研发无损文本压缩引擎,性能超越ZIP

华盛顿大学研发无损文本压缩引擎,性能超越ZIP

热心网友
63
转载
2025-10-11

当大语言模型生成海量数据时,数据存储的难题也随之而来。

免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈

对此,华盛顿大学(UW)SyFI实验室的研究者们提出了一个创新的解决方案:LLMc,即利用大型语言模型自身进行无损文本压缩的引擎。

基准测试结果表明,无论是在维基百科、小说文本还是科学摘要等多种数据集上,LLMc的压缩率都优于传统的压缩工具(如ZIP和LZMA)。同时,与其他以LLM为基础的闭源压缩系统相比,LLMc也表现出同等甚至更优的性能。

值得一提的是,该项目已经开源,主要作者是来自上海交通大学ACM班的本科生Yi Pan,目前正在华盛顿大学实习。

LLMc的压缩机制

LLMc的灵感来源于实验室一年前的一次内部讨论。当时,研究者们面临一个核心挑战:LLM推理中涉及的内核操作具有高度的非确定性,这使得精确、可复现的压缩和解压变得困难。

但随着业界在确定性LLM推理方面取得突破,这一问题迎刃而解,也为新引擎的诞生铺平了道路。研究团队顺势快速构建了LLMc的原型,并成功证明用LLM进行高效压缩的可行性。

LLM与数据压缩之间的联系根植于信息论的基本原理。

香农的信源编码定理(source coding theorem)指出,一个符号的最优编码长度与其负对数似然(negative log-likelihood)成正比。简而言之,一个事件的概率越高,编码它所需的信息量就越少。

由于LLM的核心任务是预测下一个词元(token),一个优秀的LLM能够为真实序列中的下一个词元赋予极高的概率。

这意味着,LLM本质上就是一个强大的概率预测引擎,而这正是实现高效压缩的关键。LLMc正是利用了这一原理,将自然语言的高维分布转换为结构化的概率信息,从而实现前所未有的压缩效果。

LLMc的核心思想是一种名为“基于排序的编码”(rank-based encoding)的巧妙方法。

在压缩过程中,LLM会根据当前上下文预测下一个可能出现的词元,并生成一个完整的概率分布列表。在大多数情况下,真实出现的那个词元总是在这个预测列表的前几位。

LLMc并不直接存储词元本身(例如其ID),而是存储该词元在概率排序列表中的“排名”(rank)。这些排名通常是非常小的整数,因此占用的存储空间极小。

在解压时,系统使用完全相同的LLM和上下文来重现当时的概率分布。然后,它只需读取之前存储的“排名”,就能准确地从列表中选择对应的词元,从而无损地恢复原始文本。

在这个过程中,LLM本身就像一个压缩器和解压器之间共享的、容量巨大的“密码本”或参考系统。

挑战与局限性

尽管LLMc取得了突破性的成果,但研究团队也指出了当前版本存在的一些挑战和局限性。

效率问题:LLM推理的计算复杂度与序列长度成二次方关系,且长序列推理受到内存带宽的限制。为了缓解这一问题,LLMc采用了分块处理文本的策略,以提高GPU利用率并降低计算开销。

吞吐量:由于严重依赖大规模模型推理,LLMc目前的处理速度远低于传统压缩算法。

数值稳定性:为了保证解压过程的确定性,系统需要使用特殊的内核(batch_invariant_ops),并对词元排名进行整数编码,而非直接使用对数概率。

应用范围:当前实现主要针对自然语言。如何将其扩展到图像、视频或二进制数据等其他模态,是未来值得探索的方向。

参考链接:

https://syfi.cs.washington.edu/blog/2025-10-03-llmc-compression/Github

网址:

https://github.com/uw-syfi/LLMc

来源:https://36kr.com/p/3504564783111302
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

最新APP

宝宝过生日
宝宝过生日
应用辅助 04-07
台球世界
台球世界
体育竞技 04-07
解绳子
解绳子
休闲益智 04-07
骑兵冲突
骑兵冲突
棋牌策略 04-07
三国真龙传
三国真龙传
角色扮演 04-07

热门推荐

美国SEC主席Paul Atkins证实:加密货币安全港提案已送交白宫审查
web3.0
美国SEC主席Paul Atkins证实:加密货币安全港提案已送交白宫审查

加密货币行业翘首以盼的监管里程碑,终于有了实质性进展。美国证券交易委员会(SEC)主席保罗·阿特金斯(Paul Atkins)近日证实,那份允许加密项目在早期获得注册豁免权的“安全港”框架提案,已经正式送抵白宫,进入了最终审查阶段。 在范德堡大学与区块链协会联合举办的数字资产峰会上,阿特金斯透露了这

热心网友
04.08
微策略Strategy报告:第一季录得144.6亿美元浮亏 再斥资约3.3亿美元买进4871枚比特币
web3.0
微策略Strategy报告:第一季录得144.6亿美元浮亏 再斥资约3.3亿美元买进4871枚比特币

微策略Strategy报告:第一季录得144 6亿美元浮亏 再斥资约3 3亿美元买进4871枚比特币 市场震荡的威力有多大?看看Strategy的最新季报就明白了。根据其最新向美国证管会(SEC)提交的8-K报告,受市场剧烈波动影响,这家公司所持的比特币在第一季度录得了一笔惊人的数字——144 6亿

热心网友
04.08
稳定币发行商Tether再扩Web3版图!Paolo Ardoino:正开发去中心化搜索引擎Hypersearch
web3.0
稳定币发行商Tether再扩Web3版图!Paolo Ardoino:正开发去中心化搜索引擎Hypersearch

稳定币巨头Tether的动向,向来是加密世界的风向标。这不,它向Web3基础设施的版图扩张,又迈出了关键一步。公司执行长Paolo Ardoino在社交平台X上透露,其工程团队正在全力“烹制”一个新项目——去中心化搜索引擎 “Hypersearch”。这个消息一出,立刻引发了行业的广泛猜想。 采用D

热心网友
04.08
Base链首个原生DeFi借贷协议Seamless Protocol倒闭 将于2026年6月30日下线
web3.0
Base链首个原生DeFi借贷协议Seamless Protocol倒闭 将于2026年6月30日下线

基地位于Coinbase旗下以太坊Layer2网络Base的Seamless Protocol,日前正式宣告了服务的终结。这个曾经吸引了超过20万用户的原生DeFi借贷协议,在运营不到三年后,终究没能跑赢时间。它主打的核心产品是Integrated Leverage Markets(ILMs)——一

热心网友
04.08
PAAL代币如何参与治理?社区投票能决定哪些事项?
web3.0
PAAL代币如何参与治理?社区投票能决定哪些事项?

PAAL代币揭秘:深度解析Web3社区治理的核心钥匙 在去中心化自治组织的浪潮中,谁真正掌握了项目的话语权?PAAL代币提供了一套系统化的答案。它不仅是生态内流转的价值媒介,更是开启链上治理大门的核心凭证。通过持有并质押PAAL代币,用户能够对协议升级、资金分配乃至战略方向等关键事务投出决定性的一票

热心网友
04.08