AI 百科词条
95 个 AI 核心术语,从大模型、RAG、Agent 到提示词工程、LoRA 微调,每个词条都有通俗易懂的解释。
大模型
大模型(Large Language Model,LLM)是指参数规模达到数十亿甚至数千亿的深度学习模型,通过海量文本训练获得理解和生成人类语言的能力,是 ChatGPT 等 AI 产品的底层技术。
Transformer
Transformer 是一种基于自注意力机制的深度学习模型架构,由 Google 在 2017 年提出,是现代大模型(如 GPT、BERT)的基石架构,彻底改变了自然语言处理和 AI 领域。
扩散模型
扩散模型(Diffusion Model)是一种生成式 AI 模型,通过先向数据逐步添加噪声再逆向去噪的方式学习生成新数据,是 Midjourney、Stable Diffusion、DALL-E 等 AI 绘画工具的核心技术。
多模态
多模态(Multimodal)是指 AI 模型能够同时理解和处理多种类型的数据,如文本、图片、音频、视频等,实现跨模态的感知和生成能力,是 GPT-4V、Gemini 等前沿模型的核心特性。
GPT
GPT(Generative Pre-trained Transformer)是 OpenAI 开发的一系列大语言模型,采用"预训练+微调"范式,通过海量文本数据预训练后适应各种任务,ChatGPT 即基于 GPT 系列模型。
VLM(视觉语言模型)
VLM(Vision Language Model,视觉语言模型)是一种能同时理解图像和文本的多模态 AI 模型,可以看懂图片内容并回答相关问题,是 GPT-4V、Claude 3.5 Vision 等模型背后的技术。
基础模型
基础模型(Foundation Model)是指在大量数据上预训练、可被适配到各种下游任务的通用 AI 模型,如 GPT-4、Claude、Gemini 等。它类似于 AI 时代的"操作系统",开发者在此基础上构建具体应用。
MoE(混合专家模型)
MoE(Mixture of Experts,混合专家模型)是一种模型架构,将多个专门的"专家"子网络组合在一起,每次只激活部分专家来处理输入,在保持模型能力的同时大幅降低计算成本,GPT-4、Mixtral 等都采用了 MoE 架构。
BERT
BERT(Bidirectional Encoder Representations from Transformers)是Google于2018年提出的预训练语言模型,通过双向Transformer编码器和掩码语言模型实现深度上下文理解,是NLP领域里程碑式的模型。
LLaMA
LLaMA(Large Language Model Meta AI)是Meta(原Facebook)发布的一系列开源大语言模型,以较小的参数量达到媲美甚至超越更大模型的性能,推动了开源大模型生态的快速发展。
生成对抗网络
生成对抗网络(GAN)由Ian Goodfellow于2014年提出,通过生成器和判别器的零和博弈来学习数据分布,是最具影响力的生成模型之一,广泛应用于图像生成、超分辨率、风格迁移等领域。
ResNet
ResNet(残差网络)是2015年由微软研究院提出的深度卷积神经网络架构,通过引入残差连接(skip connection)解决了深层网络的退化问题,使训练超过100层的深度网络成为可能。
Vision Transformer
Vision Transformer(ViT)是Google于2020年提出的将纯Transformer架构应用于图像分类的模型,将图像分割为固定大小的patch序列作为输入,证明了Transformer无需卷积即可在视觉任务上达到SOTA。
RNN
循环神经网络(RNN)是一类专门处理序列数据的神经网络,通过隐藏状态的循环连接捕获时间依赖关系,是自然语言处理、语音识别和时间序列分析的基础模型架构。
YOLO
YOLO(You Only Look Once)是一种实时目标检测算法,将检测建模为回归问题,通过单次前向推理同时预测边界框和类别,以其极快的推理速度成为工业界最广泛应用的检测框架。
U-Net
U-Net是一种对称的编码器-解码器卷积网络架构,通过跳跃连接融合浅层和深层特征,专为生物医学图像分割设计,后成为语义分割和扩散模型等领域的标准架构。
CLIP
CLIP(Contrastive Language-Image Pre-training)是OpenAI开发的视觉-语言对比预训练模型,通过4亿图文对学习图像与文本的对齐表示,实现零样本图像分类和跨模态检索。
Segment Anything
Segment Anything(SAM)是Meta于2023年发布的通用图像分割基础模型,通过提示工程(点、框、文本)实现零样本分割任意物体,是计算机视觉领域的里程碑式基础模型。
RAG(检索增强生成)
RAG(Retrieval Augmented Generation,检索增强生成)是一种让大模型从外部知识库检索相关信息后再生成回答的技术,能有效解决大模型知识截止日期和幻觉问题,是企业构建 AI 知识库的核心方案。
微调
微调(Fine-tuning)是在预训练大模型的基础上,用特定领域的数据进一步训练,让模型适应特定任务或风格的技术。相比从零训练,微调成本低、速度快,是定制 AI 模型的常用方法。
LoRA(低秩适配)
LoRA(Low-Rank Adaptation,低秩适配)是一种高效的模型微调方法,通过在原始模型权重旁添加小型可训练矩阵来调整模型行为,仅需训练全量微调 0.1%-1% 的参数,大幅降低微调成本和显存需求。
RLHF(基于人类反馈的强化学习)
RLHF(Reinforcement Learning from Human Feedback)是一种将人类偏好融入 AI 模型训练的技术,通过人类对模型输出的评分来训练奖励模型,再用强化学习优化语言模型,使模型输出更符合人类期望,ChatGPT 的核心技术之一。
思维链
思维链(Chain-of-Thought,CoT)是一种提示词技术,引导大模型在回答复杂问题时先展示中间推理步骤再给出最终答案,类似"说人话的解题过程",能显著提升模型在数学、逻辑等推理任务上的表现。
提示词工程
提示词工程(Prompt Engineering)是设计和优化 AI 输入提示词的技术和方法,通过精心构造指令来引导大模型生成更准确、更有用的输出,是使用大模型的核心技能。
少样本学习
少样本学习(Few-shot Learning)是指在提示词中给大模型提供少量示例(通常是 2-5 个),让模型通过这些示例理解任务模式并完成类似任务,无需额外训练。
零样本学习
零样本学习(Zero-shot Learning)是指不给大模型任何示例,仅通过自然语言指令就让模型完成指定任务的能力。这是大模型最基础也最常用的使用方式,即"直接告诉 AI 要做什么"。
知识蒸馏
知识蒸馏(Knowledge Distillation)是一种将大型复杂模型(教师模型)的知识迁移到小型模型(学生模型)的技术,让小模型在推理速度和资源消耗上接近大模型的效果,是模型轻量化的核心方法。
模型量化
模型量化(Quantization)是一种减少模型体积和加速推理的技术,通过降低模型参数的数据精度(如从 32 位浮点数降到 8 位整数),使模型体积缩小 4 倍,推理速度提升 2-4 倍,适合在消费级显卡上运行大模型。
P-Tuning(提示调优)
P-Tuning(提示调优)是一种参数高效微调方法,通过在输入层添加可学习的"软提示"向量来引导模型行为,只训练少量提示参数而保持模型主体不变,比 LoRA 更轻量,适合大模型的快速适配。
指令微调
指令微调(Instruction Tuning)是一种让大模型学会理解和遵循人类指令的训练方法,通过大量"指令-回答"对数据微调模型,使模型从单纯的"语言模型"变成能听从指令的"AI 助手",ChatGPT 的核心训练技术之一。
DPO(直接偏好优化)
DPO(Direct Preference Optimization)是一种无需强化学习的偏好对齐方法,直接利用偏好数据优化语言模型,简化了 RLHF 的训练流程。
思维树(Tree of Thoughts)
思维树(Tree of Thoughts, ToT)是一种让大语言模型在推理过程中主动探索多条思考路径并回溯评估的提示策略,大幅提升了复杂推理任务的表现。
GraphRAG
GraphRAG 是一种将知识图谱的结构化语义融入检索增强生成的大模型技术,能更好地处理多跳推理和全局性问题,由微软提出并开源。
多模态RAG
多模态RAG(Multimodal RAG)是传统 RAG 的多模态扩展,可同时检索和生成包含文本、图像、表格、音频等多种模态内容的答案。
适配器微调(Adapter)
Adapter 是一种参数高效微调方法,通过在预训练模型的层间插入小型瓶颈网络来实现下游任务适配,仅需训练新增的少量参数。
模型剪枝(Pruning)
模型剪枝是一种模型压缩技术,通过移除神经网络中不重要的权重、神经元或通道来减小模型体积和加速推理,是模型部署的关键优化手段。
数据增强(Data Augmentation)
数据增强通过对原始数据进行变换或合成生成新训练样本,是提升模型泛化能力和缓解数据匮乏问题的关键技术。
对比学习(Contrastive Learning)
对比学习是一种自监督表征学习方法,通过拉近相似样本(正例)在表示空间中的距离、推远不相似样本(负例)的距离来学习高质量的语义特征。
位置编码(Positional Encoding)
位置编码是 Transformer 架构中的关键组件,通过向输入序列注入位置信息来弥补自注意力机制不具备序列顺序感知的先天缺陷。
多头注意力(Multi-Head Attention)
多头注意力是 Transformer 的核心机制,通过并行计算多组注意力头使模型能够从多个子空间同时关注信息的不同方面,显著提升了表征能力。
Token(词元)
Token(词元)是大模型处理文本的最小单位,可以是一个词、一个字符或一个子词。大模型按 token 计费和使用,理解 token 概念有助于估算成本、优化提示词长度和控制输出。
上下文窗口
上下文窗口(Context Window)是大模型一次能"记住"的最大输入长度,以 token 为单位。窗口越大,模型能处理的文档越多、对话越长,Claude 支持 200K token,GPT-4 Turbo 支持 128K token。
温度参数
温度参数(Temperature)是控制大模型输出随机性和创造性的参数,取值范围通常 0-2。温度越低(接近 0)输出越确定、保守,适合事实问答;温度越高(接近 1)输出越多样、有创意,适合写作和头脑风暴。
幻觉(AI 幻觉)
AI 幻觉(Hallucination)是指大模型生成看似合理但实际错误或虚构的内容,模型会"自信地胡说八道"。这是大模型固有的局限性,源于模型本质上是"概率预测器"而非"事实数据库"。
向量嵌入
向量嵌入(Embedding)是将文本、图像等数据转换为数值向量的技术,使语义相似的输入在向量空间中距离更近。它是 RAG、语义搜索、推荐系统等 AI 应用的基础技术。
注意力机制
注意力机制(Attention)是深度学习中的一种核心技术,让模型在处理一个词时能够"关注"输入序列中的其他相关词,捕捉长距离依赖关系。自注意力机制(Self-Attention)是 Transformer 架构的基础,也是大模型成功的核心原因。
向量数据库
向量数据库(Vector Database)是一种专门存储和检索向量嵌入数据的数据库系统,支持高效的相似度搜索(如找"意思最相近的文本"),是 RAG 架构、语义搜索和 AI 知识库的核心基础设施。
Top-P(核采样)
Top-P(核采样)是一种大模型文本生成的采样策略,模型只在累积概率达到 P 值的最小候选词集中选择下一个词。P 值越大候选词越多,输出越多样;P 值越小候选词越少,输出越确定。通常与 Temperature 参数配合使用。
Top-K(Top-K采样)
Top-K 是一种大模型文本生成的采样策略,模型只从概率最高的 K 个候选词中随机选择下一个词。K 值越小输出越确定,K 值越大输出越多样。相比 Top-P 的动态调整,Top-K 是固定数量的选择策略。
神经网络
神经网络是受生物神经系统启发而设计的计算模型,由大量相互连接的神经元层组成,通过调整连接权重从数据中学习模式,是深度学习的核心基础。
深度学习
深度学习是基于多层神经网络的机器学习方法,通过逐层抽象提取高级特征,在图像识别、自然语言处理等领域取得了突破性成果,是当前 AI 浪潮的核心驱动力。
反向传播
反向传播是训练神经网络的核心算法,通过链式法则从输出层向输入层逐层计算损失函数对各参数的梯度,为梯度下降优化提供方向,是深度学习模型能够学习的根本原因。
梯度下降
梯度下降是最常用的优化算法,通过沿损失函数梯度的反方向迭代更新模型参数,逐步逼近最小化损失的最优解,是训练几乎所有机器学习模型的基石方法。
损失函数
损失函数是衡量模型预测值与真实值之间差异的定量指标,是模型训练的优化目标,通过最小化损失函数来让模型的预测越来越准确。
激活函数
激活函数是神经网络中引入非线性的关键组件,将神经元的加权输入转换为输出信号,使网络能够学习复杂的非线性模式,没有激活函数的多层网络等价于单层线性模型。
Dropout
Dropout 是一种简单而强大的正则化技术,在训练过程中随机丢弃一部分神经元及其连接,迫使网络学习更鲁棒的特征,是防止深度神经网络过拟合最常用的方法之一。
Softmax
Softmax 是一个将实数向量转换为概率分布的数学函数,将多分类输出映射为每个类别的预测概率,是所有多分类神经网络模型的标准输出层配置。
学习率
学习率是控制模型参数每次更新幅度的超参数,决定梯度下降优化的步长大小,是最重要的超参数之一——设置不当会导致训练失败或收敛缓慢。
AI Agent(智能体)
AI Agent(智能体)是一种能自主感知环境、制定计划并使用工具的 AI 系统。它不再只是"回答问题",而是能独立完成复杂任务——规划方案、调用工具、执行操作、反思改进,代表 AI 从"对话"到"行动"的进化。
函数调用(Function Calling)
函数调用(Function Calling)是大模型调用外部工具和 API 的能力——模型在对话中识别出需要调用某个函数(如查天气、发邮件、查数据库),然后输出结构化的函数调用参数,由应用程序执行。
工具使用(Tool Use)
工具使用(Tool Use)是指大模型调用外部工具和资源来扩展自身能力,如搜索网页、运行代码、操作文件、调用 API 等。工具使用让大模型突破了自身知识限制,能获取实时信息并执行实际操作。
多智能体系统
多智能体系统(Multi-Agent System)是多个 AI Agent 协作完成复杂任务的架构,不同 Agent 扮演不同角色(如"研究员""写手""审核员"),通过分工协作处理单个 Agent 难以完成的复杂工作流。
代码解释器
代码解释器(Code Interpreter)是让大模型编写并执行代码的沙箱环境,模型可以编写 Python 代码、运行并获取结果,实现数据分析、图表绘制、数学计算、文件格式转换等超越纯文本处理的能力。
MCP(模型上下文协议)
MCP(Model Context Protocol,模型上下文协议)是 Anthropic 推出的开放协议,为 AI 模型提供统一的方式来连接外部工具和数据源,相当于 AI 应用的"USB 接口"——标准化的工具连接规范。
AIGC(AI 生成内容)
AIGC(AI Generated Content,AI 生成内容)是指利用 AI 技术自动生成文本、图像、音频、视频等各类内容,是继 PGC(专业生产内容)和 UGC(用户生产内容)之后的新一代内容生产方式。
AI 工作流
AI 工作流是指将多个 AI 模型、工具和人工审核步骤串联成自动化流程的编排方式,让复杂任务无需人工逐一手动操作即可端到端完成。
RAG 应用架构
RAG(检索增强生成)应用架构是一种将信息检索与大语言模型生成能力相结合的系统设计模式,通过在回答前检索外部知识库来提升内容的准确性和时效性。
AI 知识库
AI 知识库是将企业文档、规章制度、产品手册等非结构化数据经过向量化处理后构建的智能问答系统,用户可以用自然语言提问并即时获得带引用的精准回答。
智能文档处理
智能文档处理(IDP)利用 OCR、NLP、大模型等技术自动从发票、合同、报表等文档中提取、分类和验证关键信息,将非结构化数据转化为结构化数据。
AI 编程助手
AI 编程助手是基于大语言模型的代码生成与辅助工具,能够在 IDE 中实时提供代码补全、函数生成、Bug 修复、代码审查、自然语言转代码等能力。
AI 数字人
AI 数字人是利用计算机图形学、语音合成、自然语言处理和多模态 AI 技术构建的具有人类外观、语音和交互能力的虚拟形象,广泛应用于直播、客服、教育和品牌代言。
AI 数据分析
AI 数据分析是利用大语言模型和机器学习技术,通过自然语言对话进行数据查询、可视化、异常检测和预测分析的新型数据交互方式,让非技术人员也能轻松驾驭数据。
AI 客服
AI 客服是基于大语言模型和知识库的智能对话系统,能够自动理解用户问题、检索知识库并生成精准回复,在售前咨询、售后支持和工单处理中替代或辅助人工客服。
AI 搜索
AI 搜索是融合大语言模型与传统搜索引擎的新一代搜索范式,能够理解用户自然语言提问,从互联网或企业知识库中检索信息,并直接生成带有引用的综合答案。
AI 自动化
AI 自动化是利用大语言模型、计算机视觉、RPA 等技术自动执行业务流程和重复性任务的新一代自动化范式,使系统能够理解非结构化信息并自主完成复杂多步骤操作。
AI 对齐
AI 对齐(Alignment)是确保 AI 系统的目标和行为符合人类意图和价值观的研究领域,是 AI 安全的核心问题。对齐的目标是让 AI"做人类想让它做的事",而不是"做人类告诉它做的事"。
AI 安全
AI 安全(AI Safety)是研究如何确保 AI 系统安全、可靠、可控地运行的领域,包括防止模型生成有害内容、抵御提示注入攻击、确保隐私保护、防止滥用等,是 AI 大规模应用的前提条件。
偏见(AI 偏见)
AI 偏见(Bias)是指 AI 模型在输出中表现出系统性偏差或不公平倾向,如性别歧视、种族偏见等。偏见通常源于训练数据中的历史偏见过滤或不平衡,是 AI 伦理和安全领域的重要问题。
过拟合
过拟合(Overfitting)是指机器学习模型在训练数据上表现很好,但在新数据上表现很差的现象,相当于"死记硬背"了训练数据而没有学会真正的规律,是机器学习中最常见的问题之一。
涌现能力
涌现能力(Emergence)是指大模型在规模扩大到某个阈值后,突然展现出小模型不具备的高级能力(如逻辑推理、代码生成、翻译等),这些能力没有被显式编程或训练,而是规模扩大后自然"涌现"出来的现象。
Scaling Law(扩展定律)
Scaling Law(扩展定律)是指大模型性能随模型规模、数据量和计算量的增加而可预测地提升的规律。简单说就是"越大越好"——参数越多、数据越多、算力越多,模型就越强,而且这种提升是可预测的。
RAGAS(RAG 评估)
RAGAS(Retrieval Augmented Generation Assessment)是一套评估 RAG(检索增强生成)系统性能的指标体系,从检索精度、忠实度、答案相关性等多个维度衡量 RAG 系统的质量,是 RAG 系统开发和优化的核心工具。
SFT(监督微调)
SFT(Supervised Fine-Tuning,监督微调)是使用标注数据对预训练模型进行有监督训练的微调方法,是 RLHF 之前的基础训练步骤,让模型学会遵循指令和生成高质量回答的基本能力。
PPO(近端策略优化)
PPO(Proximal Policy Optimization,近端策略优化)是一种强化学习算法,在 RLHF 中用于优化大语言模型。PPO 通过限制每次更新的步长来保证训练稳定性,是目前大模型 RLHF 训练中最常用的强化学习算法。
思维链自洽性(CoT-SC)
思维链自洽性(CoT-SC,Self-Consistency)是一种提升大模型推理准确率的技术,让模型对同一问题生成多条思维链推理路径,然后投票选择出现频率最高的答案,能显著提升数学、逻辑等推理任务的准确率。
AGI(通用人工智能)
AGI(Artificial General Intelligence,通用人工智能)是指具备与人类同等甚至超越人类的通用认知能力的 AI 系统,能够理解、学习和执行任何智能任务,是 AI 研究的终极目标,目前尚未实现。
模型可解释性
模型可解释性(Model Interpretability)是指理解和解释 AI 模型内部工作机制及决策原因的技术和理论,旨在打开 AI 的"黑箱",让人类能够理解模型为什么做出某个决策。
对抗样本
对抗样本(Adversarial Examples)是指通过对输入数据施加人眼难以察觉的微小扰动,导致 AI 模型产生完全错误输出的样本,揭示了深度学习模型在鲁棒性方面的根本脆弱性。
红队测试(Red Teaming)
红队测试(Red Teaming)是指通过模拟攻击者行为,对 AI 系统进行系统性对抗测试以发现安全漏洞、偏见行为和潜在风险的方法,是 AI 安全评估的核心实践。
提示注入(Prompt Injection)
提示注入(Prompt Injection)是一种针对大语言模型的安全攻击手段,攻击者通过构造恶意输入覆盖或劫持模型的原始指令,导致模型执行非预期行为。
超级对齐(Superalignment)
超级对齐(Superalignment)是研究如何确保比人类更聪明的 AI 系统(超级智能)能够可靠地按照人类意图行事的前沿安全课题,是 AI 安全领域最具挑战性的长期问题。
联邦学习
联邦学习(Federated Learning)是一种分布式的机器学习范式,允许多个参与方在不共享原始数据的前提下协同训练模型,实现"数据不动模型动",有效解决了数据隐私和数据孤岛问题。
自监督学习
自监督学习(Self-Supervised Learning, SSL)是一种无需人工标注标签的机器学习方法,通过从数据自身结构构造监督信号来学习通用表示,是 GPT、BERT、CLIP 等大模型预训练的核心技术。
模型卡(Model Card)
模型卡(Model Card)是一种标准化记录 AI 模型信息的文档格式,类似于药品说明书,详细记录模型的用途、性能、局限性、训练数据、偏见评估等信息,是 AI 透明度和负责任 AI 实践的重要工具。
越狱攻击(Jailbreak)
越狱攻击(Jailbreak)是指通过精心设计的提示词绕过 AI 模型的安全限制,让模型生成本应被拒绝的有害内容或执行非授权操作的技术,是提示注入的一种特殊形式。