首页 /文章 /大模型术语词典——120 个核心概念速查

大模型术语词典——120 个核心概念速查

面向初学者的 LLM 术语速查。收录 120 个核心概念,按模型结构、推理、上下文、评估、应用、安全六类编排,每词列中英文对照、释义与常见误用。

大模型术语词典概念速查2026Q3
分类:入门与导航 › 核心概念词典 发布于 2026-09-22 20 次浏览

说明

本词典覆盖 2026 年 9 月大模型领域 六大类共 120 个核心术语,每个词条含"术语 + 一句解释 + 常见误用场景"。使用方式:遇术语先看中英对照与"误用",可排查表述错误还是概念混淆。六大类:①模型结构与训练 ②推理与部署 ③上下文与记忆 ④评估与对齐 ⑤应用与架构 ⑥安全与合规。

不包含

  • "大模型训练相关术语"中的分布式训练细节(ZeRO 系列 / FSDP / 混合并行),本篇不展开,参考相关章节
  • "多模态相关术语"中的CLIP / DINOv2 / SigLIP 等视觉模型,参考相关章节
  • "推理框架相关术语"中的vLLM / SGLang / TensorRT-LLM 特有术语,参考相关章节

这 3 板块各有专门的主题文章覆盖,本篇只覆盖"通用 + 高频"的 120 个术语,用于速查与防误用。

一 术语分类

1.1 模型结构与训练(25 个)

术语一句话解释常见误用
Transformer2017 Google 提出的神经网络架构,核心是自注意力机制(Self-Attention)误用:把"Transformer"当作"大模型"
Decoder-Only只用解码器生成序列(如 GPT、LLaMA、Qwen)误用:与 Encoder-Only(BERT)混淆
MoE(混合专家)多个子网络(专家)按需路由,激活参数远小于总参数误用:"激活参数小" ≠ "显存小"
MoE 路由(Router)根据输入 token 选择激活哪几个专家误用:把"路由"理解为"分类"
同参数量训练参数总数,决定模型大小误用:把"同参数量"当作"文件大小"
稠密模型(Dense)每个 token 都会激活全部参数误用:与 MoE 区分不清
ReZero / ReLU激活函数 / 残差连接变体误用:把 ReZero 误当 ReLU
Layer Norm对层输入标准化,稳定训练误用:与 Batch Norm 等同
残差连接(Residual)跳过若干层,让梯度 / 信息流更短误用:把"跳层"当作"删层"
位置编码(Positional Encoding)让 Transformer 感知 token 顺序(旋转 / 正弦 / 可学习)误用:把"位置编码"理解为"输入顺序"
旋转位置编码(RoPE)用旋转矩阵编码位置信息,跨长度泛化更好误用:把 RoPE 当作"分页编码"
注意力头注意力(Attention Head)QKV 矩阵被切分为多个头,各自独立计算误用:"头"数与"GPU 核"数混淆
Head Dim每个注意力头的维度,决定了单次注意力的内存占用误用:与 embedding dim 混同
MLP 层Transformer 块内的两层全连接(FFN / FFN 变体)误用:把整个 Transformer 叫 MLP
交叉注意力(Cross-Attention)Q 来自 Encoder,K/V 来自 Decoder(如 LVLM)误用:把 Encoder-Decoder 全部叫 cross-attention
自注意力(Self-Attention)Q/K/V 都来自同一序列误用:把"注意力" = "记忆"
Embedding 词嵌入把 token 映射到连续向量,是模型的"记忆"误用:把 embedding 当作"词向量"
Tokenizer把文本切成 token 表(字节对编码 / BPE / SentencePiece)误用:"切字" ≠ "切 token"
Token 多已训练好的"单位",是词嵌入查表单位误用:把"token"当"句子"
上下文窗口(Context Window)模型一次能"读"到的最大 token 数误用:把"上下文窗口"当作"最长回复"
Context Length单次推理时能携带的最大 token 数误用:与"训练长度"混淆
Pretraining(预训练)用大量语料无监督训练出基础模型误用:把"预训练" = "第一阶段"
Instruction Tuning(指令微调)用问答对训练,让模型遵循指令误用:把"指令微调"当作"从 0 开始训"
SFT(监督微调)用带标签数据微调,比指令微调范围更大误用:把"SFT"叫成"训练"
LoRA(低秩适配)只微调低秩增量矩阵,大幅降低微调成本误用:把 LoRA 当作"少样本学习"

1.2 推理与部署(20 个)

术语一句话解释常见误用
推理(Inference)用训练好的模型做前向计算,产出 token 序列误用:把"推理"当"训练"
生成(Generation)逐 token 自回归地生成输出误用:把"生成"与"翻译"混同
逐 token 生成(Autoregressive)每次只生成 1 个 token,基于之前全部历史误用:把"逐 token"当作"快速"
解码策略(Decoding)控制"下一步选哪个 token":greedy / beam / top-p / top-k误用:"解码" = "编码"混淆
Temperature控制输出概率分布的"锐度",1.0 以下偏确定,误用:把数值当"速度"
Top-P(核采样)只从累积概率达到 P 的 token 池里采样误用:"P" = "概率"读错
Top-K只从概率最高的 K 个 token 里采样误用:"K" = "K-means"
Beam Search同时探索多个候选路径,适合翻译 / 代码误用:把 beam 当"快速"
Greedy Decoding每步选概率最大的 token,确定性最强误用:把 greedy 当"最优"
PagedAttention把 KV Cache 分页,减少内存碎片,提升并发吞吐误用:"分页" = "分页不存"耐
Batch Size单次推理 / 训练的 token 处理数量误用:"batch" = "批次大小"机械翻译
Continuous Batching动态拼接新请求,提升 GPU 利用率误用:"连续" = "不停"
Speculative Decoding用小模型先猜 N 步,大模型一次验证,加快速度误用:"投机" = "猜"
Quantization(量化)把权重 / 激活从 FP32/FP16 降到 INT8/INT4误用:"量化" = "压模型"
AWQ(激活感知量化)按激活权重重要性做 4-bit 量化误用:把 AWQ 当作"官方量化"
GGUFllama.cpp 的量化格式,按 Q2/Q4/Q8 分精度误用:把 GGUF 当作"模型格式"通用名
Tensor Parallel把模型层切到多卡,每卡存一部分层误用:"张量并行" = "层并行"
Pipeline Parallel把多层分到多卡,像流水线一样并行误用:"流水线" = "顺序处理"
NCCLNVIDIA 集体通信库,多卡带宽与同步核心误用:把 NCCL 当作"驱动"
MoE All-ReduceMoE 路由后多卡合并专家的通信算子误用:"all-reduce" = "reduce-all"

1.3 上下文与记忆(15 个)

术语一句话解释常见误用
Context Window模型一次能"读完"的最大 token 数(4K / 8K / 32K / 128K)误用:与"上下文窗口长度"混用
KV Cache把已计算的 Key/Value 向量存起来,避免重算误用:"KV 缓存" = "GPU 缓存"
滑窗注意力只关注最近的 K 个 token,限制注意力范围误用:"滑窗" = "截断"
注意力池化(Attention Pooling)对序列做特征池化,用于检索 / 向量化误用:"池化" = "批量"
截断(Truncation)超长输入被裁掉,丢失信息误用:"截断" = "变短"
Summary 记忆用摘要代替原始历史,节省上下文误用:"摘要记忆" = "压缩记忆"
短期记忆(Short-term)当前对话窗口内的内容误用:"短期" = "几小时"
长期记忆(Long-term)跨会话的持久化记忆(向量库 / 数据库)误用:"长期" = "几个月"
工作记忆(Working Memory)处理中"活跃使用"的信息,类比人脑工作记忆误用:"工作" = "职场"
记忆压缩(Memory Compression)把记忆压成低维 / 摘要,牺牲精度换空间误用:"压缩" = "删除"
检索增强(Retrieval-Augmented)先把相关信息检索出来,再喂给模型误用:"增强" = "增强能力"
Context Cache服务端缓存同前缀的 KV Cache,命中可省 10-30 倍成本误用:"上下文缓存" = "会话缓存"
命中率(Hit Rate)缓存命中次数 / 总请求次数误用:"命中率" = "准确率"
Prompt 前缀(Prompt Prefix)多个请求共享的头部 token,适合做缓存误用:"前缀" = "开头文字"
Semantic Windowing按语义分块,比固定 token 数切分更稳误用:"语义" = "字面"

1.4 评估与对齐(18 个)

术语一句话解释常见误用
Benchmark一组标准测试集,衡量模型"成绩"误用:"基准" = "起点"
Perplexity(PPL)语言模型对文本的"惊讶程度",越低越好误用:"困惑度" = "困惑"
Accuracy(准确率)预测正确比例误用:"准确" = "好"
F1 Score精确率与召回率的调和平均误用:"F1" = "partial"
Recall(召回率)相关项被检出的比例误用:"召回" = "回忆"
Exact Match(EM)预测与标准答案完全一致误用:"精确匹配" = "完全一样"
ROUGE摘要评估指标,基于重叠度误用:"摘要" = "总结"
Elo / GPT-Eval模型两两对战,用 Elo 排名误用:"对战" = "比赛"
Human Eval人类打分,主观但更贴近"好"误用:"人工评估" = "人工打分"
LLM-as-Judge用大模型当评委给别的模型打分误用:"LLM 判" = "自动评估"
RLHF(基于人类反馈的强化学习)先训 reward model,再用 RL 优化模型误用:"强化学习" = "人类偏好"
DPO(直接偏好优化)不训 reward model,直接对齐偏好误用:"DPO" = "RLHF 简化"
宪法 AI(Constitutional AI)用一组"原则"约束模型行为误用:"宪法" = "规则"
PPO(近端策略优化)RLHF 主力算法,多步迭代误用:"PPO" = "RL 算法"
REINFORCE早期 RL 策略梯度算法误用:"REINFORCE" = "强化"
IPS(逆倾向得分)纠正"采样偏差"的 RL 估计方法误用:"IPS" = "倾向"
KL 散度两个概率分布差异,RLHF 常用作正则项误用:"KL" = "距离"
奖励模型(Reward Model)根据人类偏好训练出来的"打分器"误用:"奖励" = "奖励金"

1.5 应用与架构(25 个)

术语一句话解释常见误用
LLM 网关(LLM Gateway)统一入口,负责路由、限流、计量、审计误用:"网关" = "API 客户端"
路由(Routing)按请求特征分发到不同模型 / 端点误用:"路由" = "转发"
负载均衡(Load Balancing)把流量分散到多实例误用:"负载均衡" = "分流量"
限流(Rate Limiting)控制每秒 / 每分钟请求数误用:"限流" = "调慢"
熔断(Circuit Breaking)上游故障时自动断开,避免雪崩误用:"熔断" = "断网"
降级(Fallback)主服务挂了走备用方案误用:"降级" = "差服务"
MCP(Model Context Protocol)统一的"模型 - 工具"通信协议(Anthropic 2025)误用:"MCP" = "插件"
函数调用(Function Calling)模型输出结构化的"调用工具"指令误用:"函数" = "方法"
工具调用(Tool Calling)模型调用外部工具(API / 数据库 / 搜索)误用:"工具" = "插件"
结构化输出(Structured Output)强制模型输出符合 JSON Schema 格式误用:"结构化" = "表格化"
RAG(检索增强生成)先检索相关资料再让模型生成误用:"RAG" = "增强"
向量数据库(Vector DB)专存高维向量,支持相似检索(Milvus / Qdrant / pgvector)误用:"向量库" = "图库"
Embedding Model(嵌入模型)把文本 / 图像 / 音频映射为向量误用:"嵌入模型" = "模型"
Colbert多向量交互检索模型,适合语义级搜索误用:"Colbert" = "向量库"
Indexing Layer向量化 / 建索引层误用:"索引" = "目录"
Chunking(分块)把长文本切成小块,方便向量化和检索误用:"分块" = "切片"
Overlap(重叠)相邻块之间重复的 token 数,保证上下文衔接误用:"overlap" = "重复"
Re-ranking对初检结果再排一次,提升 top-k 精度误用:"重排" = "重复排序"
意图识别(Intent Detection)判断用户想要做什么(客服 / 搜索 / 创作)误用:"意图" = "想法"
对话管理(Dialogue Management)管理对话状态,控制轮次与跳转误用:"管理" = "控制"
多轮对话(Multi-turn)同一会话里跨多轮,模型用历史记忆误用:"多轮" = "多任务"
Agent(智能体)能自主决策 + 调用工具 + 处理多步任务的实体误用:"Agent" = "聊天机器人"
Multi-Agent(多智能体)多个 Agent 协作完成复杂任务误用:"多 Agent" = "多模型"
Orchestration(编排)多个 Agent / 任务之间的协调与调度误用:"编排" = "排序"
Observability(可观测性)指标 + 追踪 + 日志,能"看到"系统什么状态误用:"可观测" = "可监控"

1.6 安全与合规(17 个)

术语一句话解释常见误用
Prompt Injection(提示注入)恶意输入注入 prompt,让模型偏离原意误用:"提示注入" = "注入提示"
越狱(Jailbreak)绕过安全限制让模型输出违规内容误用:"越狱" = "反过滤"
数据脱敏(Data Masking)把敏感字段替换成占位符误用:"脱敏" = "删除"
RAG 越界攻击通过 RAG 检索结果让模型输出训练数据误用:"越界" = "超出"
输出过滤(Output Filter)对模型输出做规则 / 模型双重过滤误用:"过滤" = "删除"
内容审核(Content Moderation)检测违规内容,用于用户 UGC误用:"审核" = "检查"
偏见(Bias)模型对群体 / 性别的系统性偏差误用:"偏见" = "偏好"
幻觉(Hallucination)模型输出内容不存在 / 不准确误用:"幻觉" = "胡说"
可解释性(Interpretability)能说出模型为什么这么答误用:"解释" = "说明"
公平性(Fairness)对平稳评估,确保群体公平误用:"公平" = "平等"
隐私计算(Privacy-Preserving)在保护数据前提下做计算(联邦 / 同态加密)误用:"隐私" = "暗中"
数据出境(Data Cross-border)数据跨越国境,受中国法规限制(2026-09 节点)误用:"出境" = "出公网"
训练数据追溯(Provenance)记录模型训练数据的来源,用于版权合规误用:"溯源" = "查服务器"
输出授权(License)模型输出的使用权状态(商业 / 教育 / 研究)误用:"授权" = "激活"
模型水印(Model Watermark)给生成内容打隐藏标记,识别来源误用:"水印" = "logo"
供应链安全(Supply-chain)模型 / 框架 / 数据集的引入风险误用:"供应链" = "供应商"
合规(Compliance)满足行业法规(GDPR / 个保法 / 数据安全法)误用:"合规" = "合法"

二 使用建议

  • 查词速度:遇到一个术语,先查中英对照,再看"常见误用",快速判断是表述错误还是概念混淆。
  • 术语使用规则:同篇文章里同一个术语必须统一名称(如"KV Cache"不能写成"KV 缓存"),英文首字母大写规范(如 RoPE / MoE / RAG)。
  • 学习顺序建议:①-2 → 4 → ⑤,先打基础(模型架构 + 推理),再上应用层,最后到安全合规。
  • 误用自检:写技术文章前,可以列术语表 + 误用列,对照排查。
  • 更新节奏:大模型领域术语每 6 个月需要一次更新(例如 "MoE 路由" 2024 上半年还不常见,2026 已经普及)。
关键词 大模型术语词典概念速查2026Q3 000043