实测 Gemini 长文本记忆能力:丢给它一整本书,它到底能记住多少细节?
把一整本书直接交给AI,真正考验的是它的长文本记忆能力与信息检索、召回能力。Gemini系列因支持200万tokens超大上下文窗口而备受关注,但“能装下”并不等于“能记准”。这次,我们结合权威基准测试与真实使用场景,系统拆解Gemini在处理超长文本、整本书阅读和细节提取时的实际表现。

核心测评:Gemini到底能记住多少细节?
本次测试结合了行业常用的episodic memory(情节记忆)评测框架与“大海捞针”测试,重点观察两个关键维度:简单召回(能否准确找到明确事实)与时序感知(能否理清事件顺序、前后因果与情节脉络)。
在ICLR 2025公布的情节记忆榜单中,Gemini 2.5 Pro的简单召回得分高达0.968,排名第一,明显高于Claude Sonnet 4的0.790。这说明,Gemini在面对书中已经明确写出的信息时,具备非常强的长文本细节记忆与精准提取能力,几乎可以做到“过目不忘”。
不过在时序感知方面,表现就更值得深入看了。当任务需要梳理事件先后、人物状态变化和因果关系时,Gemini 2.5 Pro的得分为0.796,虽然依然处于领先水平,但也说明超长文本中的复杂逻辑链条仍然是难点。同时,随着上下文长度不断增加,模型准确率会出现阶段性下降。在MRCR v2 128K测试中,当上下文超过96K tokens后,准确率可能降至61%左右,这正是典型的“Lost in the Middle”(中间信息丢失)现象。
性能数据对比
| 测试维度 | 具体表现 | 数据依据 |
|---|---|---|
| 情节记忆(简单召回) | 极高,可精准提取分散在全文中的事实细节 | ICLR 2025基准:得分0.968(Gemini 2.5 Pro) |
| 时序与状态跟踪 | 较强,但面对复杂逻辑时可能出现时序混淆 | ICLR 2025基准:得分0.796(Gemini 2.5 Pro) |
| 超长文本(>96K) | 信息召回率明显下降,文本中段内容更容易遗漏 | 长文本检索测试:准确率降至61% |
| 上下文学习能力 | 能够“现学现用”新语言语法规则(如Kalamang语) | MTOB基准:Gemini 1.5 Pro得分4.0/6,接近人类学习者的5.52 |
亮点与使用建议
核心优势:
上下文容量巨大(200万tokens),处理《三体》三部曲这类大体量书籍基本没有压力。在上下文学习方面,Gemini表现尤其突出,甚至可以通过阅读语法书、词典等材料,快速掌握生僻语言的翻译规则与基本用法。
选购/使用建议:
- 优化提问方式:如果你想查找全书中的特定细节,例如“第X章某个人物说过什么”,直接、明确地提问,通常能获得更高准确率。
- 注意中间段落信息:如果问题集中在书籍中部内容,建议将上下文分段处理,或使用XML标签增强指令约束,以提升召回效果。
- 适合做长文本摘要:如果目标是概括全书主旨、提炼核心内容,Gemini表现相当出色;但若要梳理特别复杂的人物关系或时间线,仍建议人工复核。
常见问答(FAQ)
Q1:Gemini一次性能处理多少字的小说?
A: Gemini 1.5 Pro支持200万tokens上下文,换算成中文大约为140多万个字符,足以覆盖《三体》三部曲的整体篇幅。
Q2:它真的能记住书里很偏、很细的一句话吗?
A: 在短中期范围内(大约文本前50%-70%区域),Gemini可以实现接近完美的细节召回(准确率>90%)。但当文本接近超长负载,尤其超过96K tokens后,中间区域的信息更容易丢失,准确率可能下降到61%左右。
Q3:它能分清书中不同角色之间复杂的关系吗?
A: 处理简单人物关系网通常没有问题。但在情节记忆测试中,模型在跟踪多个实体状态变化时得分为0.796(满分为1),说明在复杂关系推理上仍存在一定逻辑混淆风险。
Q4:测评地址在哪里可以看?
A: 官方基准测试、论文说明及相关细节,可参考ICLR 2025发布的对应文档。
