游乐游手机版
首页/AI热点日报/热点详情

Gemini长文本记忆力测评:整本书输入后能记住多少细节

类型:热点整理2026-08-18
基于ICLR2025基准测试,Gemini2 5Pro在简单召回任务得分0 968,位列第一,但时序感知得分仅0 796。当超长文本超过96Ktokens后准确率降至61%,出现“中间丢失”现象。其上下文学习能力非常出色,可快速学习新语言语法,并展现出较强泛化能力。

实测 Gemini 长文本记忆能力:丢给它一整本书,它到底能记住多少细节?

把一整本书直接交给AI,真正考验的是它的长文本记忆能力与信息检索、召回能力。Gemini系列因支持200万tokens超大上下文窗口而备受关注,但“能装下”并不等于“能记准”。这次,我们结合权威基准测试与真实使用场景,系统拆解Gemini在处理超长文本、整本书阅读和细节提取时的实际表现。

测评 Gemini 的长文本记忆力:丢给它一整本书,它能记住多少细节?

核心测评:Gemini到底能记住多少细节?

本次测试结合了行业常用的episodic memory(情节记忆)评测框架与“大海捞针”测试,重点观察两个关键维度:简单召回(能否准确找到明确事实)与时序感知(能否理清事件顺序、前后因果与情节脉络)。

在ICLR 2025公布的情节记忆榜单中,Gemini 2.5 Pro的简单召回得分高达0.968,排名第一,明显高于Claude Sonnet 4的0.790。这说明,Gemini在面对书中已经明确写出的信息时,具备非常强的长文本细节记忆与精准提取能力,几乎可以做到“过目不忘”。

不过在时序感知方面,表现就更值得深入看了。当任务需要梳理事件先后、人物状态变化和因果关系时,Gemini 2.5 Pro的得分为0.796,虽然依然处于领先水平,但也说明超长文本中的复杂逻辑链条仍然是难点。同时,随着上下文长度不断增加,模型准确率会出现阶段性下降。在MRCR v2 128K测试中,当上下文超过96K tokens后,准确率可能降至61%左右,这正是典型的“Lost in the Middle”(中间信息丢失)现象。

性能数据对比

测试维度 具体表现 数据依据
情节记忆(简单召回) 极高,可精准提取分散在全文中的事实细节 ICLR 2025基准:得分0.968(Gemini 2.5 Pro)
时序与状态跟踪 较强,但面对复杂逻辑时可能出现时序混淆 ICLR 2025基准:得分0.796(Gemini 2.5 Pro)
超长文本(>96K) 信息召回率明显下降,文本中段内容更容易遗漏 长文本检索测试:准确率降至61%
上下文学习能力 能够“现学现用”新语言语法规则(如Kalamang语) MTOB基准:Gemini 1.5 Pro得分4.0/6,接近人类学习者的5.52

亮点与使用建议

核心优势:
上下文容量巨大(200万tokens),处理《三体》三部曲这类大体量书籍基本没有压力。在上下文学习方面,Gemini表现尤其突出,甚至可以通过阅读语法书、词典等材料,快速掌握生僻语言的翻译规则与基本用法。

选购/使用建议:

  1. 优化提问方式:如果你想查找全书中的特定细节,例如“第X章某个人物说过什么”,直接、明确地提问,通常能获得更高准确率。
  2. 注意中间段落信息:如果问题集中在书籍中部内容,建议将上下文分段处理,或使用XML标签增强指令约束,以提升召回效果。
  3. 适合做长文本摘要:如果目标是概括全书主旨、提炼核心内容,Gemini表现相当出色;但若要梳理特别复杂的人物关系或时间线,仍建议人工复核。

常见问答(FAQ)

Q1:Gemini一次性能处理多少字的小说?
A: Gemini 1.5 Pro支持200万tokens上下文,换算成中文大约为140多万个字符,足以覆盖《三体》三部曲的整体篇幅。

Q2:它真的能记住书里很偏、很细的一句话吗?
A: 在短中期范围内(大约文本前50%-70%区域),Gemini可以实现接近完美的细节召回(准确率>90%)。但当文本接近超长负载,尤其超过96K tokens后,中间区域的信息更容易丢失,准确率可能下降到61%左右。

Q3:它能分清书中不同角色之间复杂的关系吗?
A: 处理简单人物关系网通常没有问题。但在情节记忆测试中,模型在跟踪多个实体状态变化时得分为0.796(满分为1),说明在复杂关系推理上仍存在一定逻辑混淆风险。

Q4:测评地址在哪里可以看?
A: 官方基准测试、论文说明及相关细节,可参考ICLR 2025发布的对应文档。

来源:https://segmentfault.com/a/1190000048038225

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。