探索AI语言世界的钥匙,一文掌握大模型核心术语,轻松驾驭智能时代。

一、基础概念
大语言模型(LLM)
基于海量文本数据训练的、参数规模巨大的深度学习模型,能理解和生成自然语言,比如GPT系列。它就像数字世界的“通才”,凭借庞大的“大脑”(参数),能完成复杂对话、文本创作等各种任务。
小提示
LLM是当前AI应用的核心,了解它能帮助你更好地理解后续所有术语。
常见问题
问:LLM和普通AI模型有什么区别?
答:LLM参数规模巨大(通常数十亿以上),且基于Transformer架构,擅长处理自然语言,而传统模型如CNN更适合图像识别。
参数
模型内部可调节的变量数量,好比大模型的“脑细胞网络”。参数决定模型复杂度和学习能力,数量越多,学习能力越强,不过也需要更多计算资源和数据来训练。常见的有7B、175B、671B等参数级别,例如DeepSeek-R1拥有671B参数,可想象成在人脑中植入6710亿个神经元。
小提示
参数越多,模型越“聪明”,但训练成本也越高。实际使用时需要平衡性能与资源。
常见问题
问:参数是不是越多越好?
答:不完全是。参数增多会提升能力,但也会带来过拟合风险,并且需要更多数据训练。小模型经过微调也能在特定任务上表现优异。
Token
大语言模型处理文本的最小语义单位,是文本的离散化表示,类似人类语言中的“词汇片段”,粒度由分词算法决定。如“人工智能”,可能被分词为“人工”和“智能”,也可能是单一Token。它将原始文本转化为模型能识别的数字编码,是语言理解与生成的基础,堪称大模型世界里的“原子”。
小提示
Token的数量直接影响模型的成本和响应速度。例如,调用API时通常按Token计费。
常见问题
问:中文一个汉字算一个Token吗?
答:不一定。不同分词器对中文的处理不同,常见方式是一个汉字可能对应一个或多个Token,例如“你好”可能为两个Token。
上下文窗口(Context Window)
模型处理信息时能参考的历史文本范围或最大长度,一般以Token数量计算。简单来说,它决定了模型在生成回答时能够“记住”多少前文信息。比如你和模型进行多轮对话,如果超过上下文窗口长度,模型可能就“记不住”之前说过的内容了。
小提示
上下文窗口越大,模型越能处理长文档或长对话,但也会占用更多显存。
常见问题
问:如何查看一个模型的上下文窗口大小?
答:通常在模型的技术文档或官网会标注,例如GPT-4的上下文窗口为8K或32K Token。
温度(Temperature)
控制模型输出随机性和创造性的参数。温度越高,模型输出越随机、多样;温度越低,输出越确定、保守。举个例子,在写故事时,调高温度能让故事更有创意和惊喜;写正式报告时,调低温度可使内容更严谨、准确。
小提示
温度通常在0~2之间调节,0.7左右是平衡创造性和准确性的常用值。
常见问题
问:温度设为0会怎样?
答:模型会每次输出概率最高的文本,结果完全确定,但可能缺乏多样性。
词向量(Embedding)
将文字转换为包含语义信息的数值向量的技术,让计算机能够处理语言。它把每个单词映射到一个高维空间中的点,通过向量之间的距离来衡量单词之间的语义相似度。比如“国王”和“王后”的词向量在空间中距离较近,因为它们语义相近。
小提示
词向量是很多NLP任务的基石,例如语义搜索、文本聚类等。
常见问题
问:词向量和Token有什么区别?
答:Token是文本的最小单元,而词向量是Token的数学表示(通常是浮点数数组)。Token经过Embedding层后才能被模型处理。
二、模型架构
Transformer
一种基于自注意力机制的神经网络架构,能高效处理序列数据中的长距离依赖关系,是当下大模型的基础框架。它就像一位“超级翻译官”,能同时处理输入序列中的所有单词,并依据上下文关系理解和生成。其核心组件自注意力机制,可根据输入序列中不同位置的关系,计算每个位置的“注意力权重”,从而更好地理解上下文信息。
小提示
目前绝大多数大模型(GPT、BERT、LLaMA等)都是基于Transformer架构。
常见问题
问:Transformer和LSTM哪个更好?
答:Transformer支持并行计算,训练效率高,且能捕捉长距离依赖,因此成为主流;LSTM是循环结构,处理长序列时容易出现梯度消失。
自注意力机制
Transformer架构的核心亮点。模型处理序列数据时,它能动态关注输入序列的不同部分,捕捉各个位置之间的关联,帮助模型更好地理解上下文,做出更准确判断。比如理解“我喜欢苹果,因为它很美味”这句话,模型通过自注意力机制,能明白“它”指代的是“苹果”。
小提示
自注意力机制让模型同时看到整个序列,而不像RNN那样逐步处理。
常见问题
问:自注意力和交叉注意力有什么区别?
答:自注意力在同一个序列内计算,而交叉注意力在编码器和解码器之间计算(例如机器翻译中源语言和目标语言之间)。
编码器(Encoder)与解码器(Decoder)
在Transformer等架构中,编码器负责将输入数据转换为具有丰富上下文信息的特征表示,类似“翻译官”把原始数据转化为模型易理解的形式;解码器则根据编码器输出的特征表示生成目标序列,像机器翻译中,解码器会根据编码器对源语言的理解,生成对应的目标语言译文。
小提示
BERT只使用编码器,GPT只使用解码器,而T5等模型则两者都用。
常见问题
问:为什么GPT只有解码器也能做生成?
答:GPT通过自回归方式(预测下一个Token)实现生成,解码器本身已具备理解上下文的能力。
BERT
Bidirectional Encoder Representations from Transformers的缩写,基于Transformer的预训练语言模型。采用双向Transformer编码器,能充分利用上下文信息,在文本分类、情感分析等自然语言处理任务中表现出色。
小提示
BERT的预训练任务包括“掩码语言模型”和“下一句预测”。
常见问题
问:BERT和GPT的主要区别?
答:BERT是双向编码器,适合理解任务(分类、标注);GPT是单向解码器,适合生成任务(对话、写作)。
GPT
Generative Pretrained Transformer的缩写,生成式预训练Transformer模型。强大之处在于能生成自然流畅的文本,广泛应用于文本创作、对话生成等领域。
小提示
GPT系列模型(GPT-3、GPT-4)引入了指令微调和RLHF,大幅提升了实用性。
常见问题
问:GPT-4和ChatGPT有什么关系?
答:ChatGPT是基于GPT系列模型开发的聊天机器人应用,底层模型是GPT-3.5或GPT-4。
三、训练相关
预训练(Pre-training)
在大规模无标签文本数据上进行的初始模型训练,目的是让模型学习通用的语言知识。好比小孩上学前读百科全书,大量输入信息,自编练习题,练就“通用脑回路”,建立基础认知。
小提示
预训练成本极高,通常需要数千GPU小时,但通用知识一旦学成,后续微调就非常高效。
常见问题
问:预训练数据从哪里来?
答:通常来自互联网文本、书籍、论文、维基百科等公开语料,需要经过清洗和去重。
微调(Fine-tuning)
在预训练模型基础上,用特定任务的有标签数据进一步训练,使模型适应具体应用。类似摄影师从“全能拍”到“人像专精”,利用预训练阶段学到的通用知识,通过少量目标数据的针对性训练,快速提升模型在特定场景下的性能。
小提示
微调不需要重新训练整个模型,通常只更新部分参数(如LoRA方法),成本较低。
常见问题
问:微调需要多少数据?
答:视任务复杂度,几百到几万条标注数据即可,远少于预训练所需。
指令微调(Instruction Tuning)
通过包含指令和对应输出的数据集对模型进行微调,让模型更好地理解和遵循指令。例如,通过大量“请总结这段文本”及对应的总结内容来训练模型,使其更擅长文本总结任务。
小提示
指令微调使模型从“知识库”变成“助手”,是ChatGPT成功的关键之一。
常见问题
问:指令微调和普通微调有何不同?
答:普通微调针对特定任务(如分类),指令微调让模型学会理解多种自然语言指令,更具通用性。
对齐微调(Alignment Tuning)
通过微调使模型的输出符合人类的价值观、偏好和期望。比如让模型生成的内容避免歧视性言论,更符合道德规范。
小提示
对齐微调通常结合RLHF(基于人类反馈的强化学习)来实现。
常见问题
问:对齐微调会导致模型变“笨”吗?
答:可能会轻微降低某些任务的性能,但整体上能显著提升安全性和可用性。
自监督学习(Self-supervised Learning)
利用数据本身生成标签或监督信号进行训练的机器学习方法。比如根据前文预测下一个单词,模型自己生成训练所需的监督信号。
小提示
自监督学习是预训练阶段的主要方式,几乎不需要人工标注。
常见问题
问:自监督学习与无监督学习有什么区别?
答:自监督学习使用数据的部分信息作为监督信号(例如预测缺失的部分),而无监督学习通常没有显式的监督信号,如聚类。
强化学习(Reinforcement Learning, RL)
模型通过与环境交互,根据获得的奖励或惩罚来学习最优策略的机器学习方法。以下棋为例,模型每走一步,根据棋局结果得到奖励或惩罚,不断调整策略以赢得比赛。
小提示
在大模型中,强化学习常用于微调阶段(RLHF),不直接用于预训练。
常见问题
问:强化学习在AI中有哪些应用?
答:游戏AI(AlphaGo)、机器人控制、推荐系统、以及大模型的对齐微调。
RLHF(基于人类反馈的强化学习)
利用人类对模型输出的偏好反馈作为奖励信号,通过强化学习优化模型,让模型输出更符合人类期望。比如对于模型生成的多个回答,人类选择更优质的那个,模型根据这个反馈不断改进。
小提示
RLHF是ChatGPT等聊天机器人大获成功的重要技术。
常见问题
问:RLHF需要多少人标注?
答:通常需要数千到数万条人类偏好标注,成本较高但效果好。
四、模型能力与特性
涌现(Emergence)
模型规模增大到一定程度后,突然出现的、无法从小规模模型简单推断出的新能力。这就像量变引发质变的AI“尤里卡时刻”,例如大模型在达到一定参数规模后,突然具备了复杂推理和解决新问题的能力。
小提示
涌现是当前研究热点,许多能力(如思维链)在参数超过100B时才显著出现。
常见问题
问:所有大模型都会涌现吗?
答:不一定。涌现依赖于模型架构、训练数据和质量,有些小模型通过优化也能产生类似涌现的效果。
大模型幻觉(Hallucination)
模型生成看似合理但与事实不符或缺乏依据的错误信息。比如模型可能虚构出不存在的事件或人物。
小提示
幻觉是目前大模型的主要缺陷之一,可以通过RAG(检索增强生成)和提示工程减轻。
常见问题
问:为什么大模型会产生幻觉?
答:因为模型本质上是根据概率生成文本,并不真正“知道”事实,且训练数据中可能包含错误信息。
语义理解(Semantic Understanding)
模型理解文本内在含义、概念和上下文关系的能力。例如理解“苹果从树上掉下来”这句话,模型不仅知道“苹果”“树”这些词汇,还明白它们之间的动作关系。
小提示
语义理解是衡量模型智能水平的重要指标,与词向量、注意力机制密切相关。
常见问题
问:如何测试模型的语义理解能力?
答:常用数据集有GLUE、SuperGLUE、SQuAD等,包含推理、问答、指代消解等任务。
思维链(Chain-of-Thought, CoT)
引导模型在解决问题时,显式地生成一步步的中间推理过程,提高复杂任务的准确性。比如回答数学问题时,模型逐步展示解题思路。
小提示
CoT提示可以大幅提升模型在数学、逻辑推理等任务上的表现,使用时只需在提示中加入“让我们一步一步思考”。
常见问题
问:所有模型都支持思维链吗?
答:通常模型需要具备一定的参数规模(如100B以上),小模型可能效果不明显。
知识图谱(Knowledge Graph)
用图结构表示现实世界中的实体及其相互关系的结构化知识库。比如将“苹果”“水果”“红色”“甜”等概念和关系以图的形式组织起来,帮助模型更好地理解和运用知识。
小提示
知识图谱可以与大模型结合,缓解幻觉问题,例如通过检索知识图谱来提供事实依据。
常见问题
问:知识图谱和向量数据库的区别?
答:知识图谱表示实体间的关系(图结构),向量数据库存储嵌入向量用于相似性搜索,二者可互补使用。
掌握这些大模型术语,就像拿到了开启AI世界大门的钥匙。无论是科技从业者,还是对AI感兴趣的普通爱好者,了解这些术语都能让我们更好地与大模型互动,挖掘其潜力,在这个科技飞速发展的时代紧跟潮流。
