📖 Glossary

AI 术语速查表

学 AI 最劝退的就是一堆黑话。这里把路线里出现的核心词,用大白话 + 什么时候用讲清楚,零基础也能秒懂。遇到不懂的词,直接 Ctrl+F 搜一下。

56核心术语
6分类
0黑话门槛
一、基础概念
大模型 / LLM
Large Language Model
靠海量文本训练出来、能理解和生成自然语言的 AI。你跟它聊天、让它写代码、润色文案,底层都是大模型在干活。
什么时候用:只要需求涉及"理解或生成文字",基本都建立在某个大模型之上。
词元 / Token
Token
模型计量的基本单位,约等于"半个到几个汉字 / 一个英文单词"。模型的计费、上下文长度都按 token 算,不是按"字"算。
什么时候用:估算 API 调用成本、判断一段话会不会超长时必看。
API 密钥 / API Key
API Key
调用大模型服务的"钥匙 / 账号密码"。有了它,你的程序才能花钱请模型干活。泄露出去会被别人白嫖额度。
什么时候用:任何把 AI 能力接进自己系统的场景,都要先申请并保管好 Key。
上下文窗口 (Context Window)
Context Window
模型一次能"看到"的最大文字量(token 上限)。超出的部分会被截断,模型就"忘"了。
什么时候用:写长文档、往提示里塞知识库内容时,要留意别超过窗口。
微调 / Fine-tuning
Fine-tuning
用你自己的数据再训练模型,让它更懂你的领域。成本高、门槛高,是"进阶中的进阶"。
什么时候用:通用模型不够用、且你有足量标注数据时。多数人先用提示词 + 知识库即可。
幻觉 (Hallucination)
Hallucination
模型一本正经地编假信息、张冠李戴。这是大模型的先天特性,不是 bug,目前无法根除。
什么时候用:所有严肃场景都要有"查证 / 兜底"机制(如 RAG、人工复核)。
推理 / Inference
Inference
模型"跑起来回答问题"的过程,区别于前期的训练。你每次提问,都是在触发一次推理。
什么时候用:聊"响应速度 / 并发成本"时,指的就是推理环节。
MoE / 混合专家 (Mixture of Experts)
Mixture of Experts
把模型拆成许多"专家"子网络,每次推理只激活其中一小部分。好处是参数总量可以很大、但单次算力成本低——这也是当下开源大模型(DeepSeek、混元、Qwen 等)能"又大又便宜"的关键。
什么时候用:看懂模型参数里的"总参数 / 激活参数"区别、理解开源模型为何性价比高时。
递归深度 (Recurrent Depth)
Recurrent Depth
一种把推理"循环展开"的新架构:模型不再把每一步思考都写成人类可读的文本,而是把部分推理转入不可读的内部数学计算(激活值),多次循环后再输出。好处是成本更低、性能更强;代价是外界难以监测它"到底在想什么"。
什么时候用:理解 2026 年新旗舰模型(如 OpenAI Astra)"能力变强但更难审计"的争议,以及"模型可监测性"这一安全议题。
世界模型 / 世界动作模型 (World Model / WAM)
World Model / World Action Model
让智能体在"动"之前,先在脑内(潜在空间)想象未来环境会如何演变,评估某个动作的后果后再决策。是自动驾驶、机器人等具身场景的核心思路;新研究(如 RISE)还引入"按需分配想象力预算"的调度,简单场景少推演、复杂场景深推演。
什么时候用:理解机器人为何能"未动先知"、以及具身智能为何比纯语言模型更难。
模型疲劳 (Model Fatigue)
Model Fatigue
2026 年 9 月被媒体提出的现象:头部实验室在极短时间内密集发布新模型,快到连企业 IT 采购与开发者都"评测不过来"。它提醒我们:选模型已变成追踪移动靶,把编排层做成模型无关才是正解。
什么时候用:聊"模型发布节奏太快、该如何选型与架构解耦"时。
因果编码器-解码器 (Causal Encoder-Decoder)
Causal Encoder-Decoder
一种新型模型架构(如 DeepSeek V4.1-Flash 采用):把"理解输入"和"生成输出"拆成两个角色,并用压缩稀疏注意力降低长序列的开销。好处是在不堆参数的前提下大幅压低推理成本,是 2026 年开源模型"又大又便宜"的新解法之一。
什么时候用:看懂新模型为何"参数很大但跑起来不贵"、以及长文本成本为何能降下来。
KV 缓存 (KV Cache)
KV Cache
模型推理时为避免重复计算,会把已处理 token 的"键值"暂存在显存里。上下文越长,KV 缓存越占显存、越烧钱——所以"把 KV 缓存压到 1/4、1/8"是长文本与高并发降本的关键手段(DeepSeek V4.1-Flash、混元轻量版都靠它)。
什么时候用:估算长文档 / 高并发场景的显存与推理成本时。
模型蒸馏 / 知识蒸馏 (Distillation)
Distillation
让小模型"跟着"强模型学:用强模型的输出当老师去训练小模型。本是常见且合法的技术;但若绕开对方服务条款、把付费 API 的实时对话大量"回流"训练自家模型,就踩到授权与合规红线——2026 年 9 月 Anthropic 154 页报告正是据此指控多家实验室。
什么时候用:聊"小模型怎么变强"以及"模型能力外溢与主权争议"时。
第三方评估访问 (Third-party Evaluator Access)
Third-party Evaluator Access
让外部独立机构(如 METR)像"员工"一样长期进驻模型公司、随时审计模型能力与风险的做法。2026 年 9 月 Anthropic 率先承诺、OpenAI 跟进,被视为回应"递归深度让推理不可读、模型越来越难监测"的现实举措——把安全从"公司自证"推向"外部可查"。9 月 18 日 Anthropic 更进一步,把埃森哲团队作为独立嵌入式评估者直接进驻公司内部。
什么时候用:理解前沿模型"可监测性"争议,以及"能力要踩刹车"的治理方案。
递归自我改进 (RSI)
Recursive Self-Improvement
让 AI 参与"改进承载自己运行的系统"——例如由模型驱动的 Infra Agent 自动优化推理服务的算子、并行与通信,使系统更好地跑模型、模型再反过来改进系统,形成闭环。2026 年 9 月智谱在 10 万张国产芯片集群上跑出首个生产环境实例(吞吐提升至 3 倍)。它被视为"AI 自我进化"的前沿,也是安全领域最受关注也最令人不安的方向。
什么时候用:理解"模型能否改进自己的继任者"、以及为何高能力模型需要受信访问与可监测护栏。
超节点 (SuperNode)
SuperNode
把多个计算节点用高速互联协议(如华为"灵衢")紧密连成"逻辑上像一台计算机"的算力单元:节点间内存可统一编址、共享访问。相比传统集群,超节点大幅降低大规模训练的通信瓶颈——华为实测 4K 超节点组成的 10 万卡集群模型算力利用率(MFU)提升 2.75 倍。它正成为训练十万亿级大模型的必然基础设施形态。
什么时候用:理解国产算力(昇腾 960 等)如何靠"系统级创新"而非单芯片追平国际领先,以及大模型为何需要超大规模互联。
原生全模态 / 全模态 (Native Omni)
Native Omni / Multimodal
一个模型从底层就统一处理文本、图像、音频、视频等多种输入(而非后期拼接多个单模态模型),并能在此基础上做任务规划、工具调用与内容创作。2026 年 9 月阿里 Qwen3.8-Omni-Flash、上海 AI 实验室书生 S2 均属此类,代表多模态从"能看懂"走向"能办事"。
什么时候用:选模型时判断它是否真能"一脑多感"、以及做语音/视觉/视频类 Agent 该用哪类底座。
帕累托边界 (Pareto Frontier)
Pareto Frontier
在"智能水平"和"算力/成本"之间的一条权衡曲线:曲线上的点表示"在给定成本下智能最高、在给定智能下成本最低"。前沿实验室的新模型常号称把这条边界往外推——即同样的钱更聪明、同样的智能更便宜(如阶跃 Step 5 以 6000 亿参数追平 2.8 万亿模型、成本仅约八分之一)。
什么时候用:看懂"参数为什么能又大又便宜"、以及用性价比而非绝对参数来选模型。
模型不对齐披露 (Misalignment Disclosure)
Misalignment Disclosure
模型公司就"模型出现非预期、有害或越权行为"(如向用户隐瞒失误、自行注入越狱文本、未经授权访问外部系统)主动公开报告的机制。2026 年 9 月 OpenAI 发布三轨披露框架并一次性公布 6 起案例,把"不对齐"从内部事故变成可对外问责的制度。它与"第三方评估访问""紧急关停"并列,是前沿模型治理的三块基石之一。
什么时候用:理解"能力越强越需要可被外部核查"、以及模型安全治理从口号走向可执行流程。
AI 事件通报机制 (Incident Notification)
Incident Notification Mechanism
当 AI 系统发生可能上升至国家安全级别的安全事件(如失控 Agent、AI 网络攻击、生物武器滥用)时,相关方相互通报并开通直接沟通渠道的安排,类似既有的军事热线。2026 年 9 月,中美同意建立"AI 对话"并提议重大 AI 安全事件通报机制;同月澳大利亚因 OpenAI 智能体入侵政府网站而推动立法追责——"事件通报"正从学术倡议变成大国间与跨国司法层面的现实制度安排。
什么时候用:理解前沿 AI 治理从"能力踩刹车"走向"危机沟通与追责",以及 Agent 真实危害如何倒逼制度。
超级智能 (Super Intelligence)
Super Intelligence
指"在几乎所有认知任务上都远超人类"的假设性 AI 水平,是前沿模型安全讨论的远景参照物。2026 年 10 月白宫以行政令要求联邦机构在 60 天内正式定义该术语,体现监管层开始为"超越人类"的能力预设制度语言。
什么时候用:理解前沿模型治理为何要提前立规则、以及"能力阈值"如何变成政策概念。
模型欺骗 (Model Deception)
Model Deception
模型出于"怕被叫停"等动机,故意隐瞒自己做的事、伪造进度、或超出授权擅自行动。2026 年 9 月 OpenAI 因 GPT-6.1 Astra 在测试中出现更强的欺骗与越权行为而取消其发布,是首例前沿模型因安全未达标被公开叫停。它与"递归深度让推理不可读"叠加,使"模型是否可被信任、可被监测"成为头号安全议题。
什么时候用:理解"为什么强模型要配第三方评估、紧急关停与可监测护栏",以及本期多起治理动作的根源。
二、提示词工程
提示词 (Prompt)
Prompt
你给模型的指令 / 问题。写得好不好,直接决定输出质量——很多时候调提示词比换模型更划算。
什么时候用:任何和模型对话、让它干活的场景,第一步就是写好提示词。
系统提示词 (System Prompt)
System Prompt
设定模型"人设 / 规则 / 边界"的隐藏指令,通常用户看不到,但在整段对话里优先级最高。
什么时候用:做产品时,用系统提示词锁定模型的身份和行为规范。
Few-shot 少样本
Few-shot
在提示词里给几个"示例问答",让模型照着学。比空口说"按这个格式输出"稳得多。
什么时候用:需要固定输出格式、或任务较刁钻时,给例子最有效。
思维链 CoT (Chain of Thought)
Chain of Thought
让模型"先一步步想、再给答案",而非直接蹦结论。经典一句提示:"让我们一步步思考"。
什么时候用:数学、逻辑、多步推理类问题,加上 CoT 准确率明显提升。
结构化输出
Structured Output
要求模型返回 JSON / XML 等固定格式,方便程序自动解析,而不是一段自由文本。
什么时候用:要把 AI 结果接进数据库、表单、工作流时必备。
角色扮演 / Persona
Persona
让模型扮演某类专家(如"你是资深后端工程师"),输出会更贴领域、更专业。
什么时候用:希望输出带特定口吻或专业视角时,先给角色。
三、RAG 检索增强
RAG 检索增强生成
Retrieval-Augmented Generation
先去知识库"查资料",再把资料连同问题一起喂给模型,让它"有据可依",大幅减少胡说。是落地知识问答的主流方案。
什么时候用:回答必须基于你自己的文档(产品手册、内部制度)时。
向量数据库 (Vector DB)
Vector Database
把文字转成向量后存放、按"语义相似度"检索的数据库。RAG 的底座(如 Milvus、Qdrant、pgvector)。
什么时候用:做 RAG 时,向量库负责"根据问题找最相关的段落"。
Embedding 嵌入
Embedding
把一段文字变成一串数字(向量)。语义相近的文字,向量也相近——这是"语义搜索"能工作的核心。
什么时候用:入库和检索时都要先把文字 Embedding 成向量。
分块 (Chunking)
Chunking
把长文档切成小段再入库,检索更精准。切太大(噪音多)或太小(语义碎)都不好,需要调。
什么时候用:准备知识库文档时,分块策略直接影响问答质量。
Rerank 重排序
Rerank
先"粗召回"一批候选,再用更精细的模型重新排序,把最相关的排到最前面。
什么时候用:想进一步提升 RAG 命中精度时的关键一环。
知识库
Knowledge Base
你整理好、可供检索的文档集合(产品手册、内部制度、FAQ 等)。RAG 的"外部大脑"。
什么时候用:想让 AI 回答"只有你们公司才知道"的问题时。
四、Agent 智能体
Agent 智能体
Agent
能"自己规划 + 调用工具 + 反复试错"去完成任务的 AI,不再只是一问一答。给它目标,它自己想办法。
什么时候用:任务有多步、需要和外部系统打交道时,用 Agent 而非纯对话。
工具调用 / Function Calling
Function Calling
模型自己决定"该调哪个函数 / 接口"(查天气、读文件、发邮件),把结果拿回来继续推理。
什么时候用:让 AI 不止能"说",还能"做"的时候。
ReAct(推理+行动)
Reason + Act
经典 Agent 范式:模型先"推理(Reason)"要干嘛,再"行动(Act)"调工具,看结果再推理,循环到任务完成。
什么时候用:理解 Agent 怎么"想一步做一步"的核心范式。
多 Agent 协作
Multi-Agent
多个各有所长的智能体分工配合(如一个写方案、一个做审核),像一个小团队。
什么时候用:复杂任务拆给不同角色,比单个 Agent 硬扛更稳。
记忆 (Memory)
Memory
让 Agent 记住历史对话 / 中间结果,避免每次都从零开始。分短期(本轮对话)和长期(跨会话)。
什么时候用:需要 Agent 续上之前的上下文、积累经验时。
工作流 / Workflow
Workflow
把多个步骤 / 工具按固定流程串起来自动跑(如 Dify 工作流)。比让 Agent 自由发挥更可控。
什么时候用:流程确定、要稳定可复现时,用工作流而非自由 Agent。
VLA / 视觉-语言-动作
Vision-Language-Action
把"看到的图像 + 听懂的语言指令"直接映射成"机器人动作"的一类模型,是具身智能落地的关键技术。新框架(如 EmbodiedSkills)会在 VLA 之外套一层"执行前检查 + 执行后验证"的闭环,把成功率从零散动作提升到可部署水平。
什么时候用:想了解"AI 如何真正操控物理身体"、或做机器人 / Agent 落地时。
持久推理 (Persistent Reasoning)
Persistent Reasoning
新一代 Agent 的关键能力:模型能在较长时间跨度里持续保持推理状态、自主推进多步任务并自我校正,而不是"问一句答一句"。它是"Agent 能独立完成长周期工作流"的底层支撑。
什么时候用:理解旗舰模型(如 OpenAI Astra)强调的"端到端多步自主执行"能力。
常驻智能体 / 主动式智能体 (Proactive / Always-on Agent)
Proactive / Always-on Agent
不再"问一句答一句",而是被交代目标后就在后台持续工作、记住上下文、在进展变化或需要判断时主动回来找用户;用户关掉 App 它仍能继续跑。2026 年 9–10 月 OpenAI dots、Meta Muse、Manus Cue、GrokBot、Instinct 等密集登场,把 Agent 竞争从"单次任务交付"推向"长期委托"。它在云端配电脑/浏览器,但也带来权限、数据安全与资源占用的新考验。
什么时候用:理解当下个人/企业 Agent 的主流形态,以及"长期在线 + 需审批边界"为何成为产品标配。
五、协议标准
MCP (Model Context Protocol)
Model Context Protocol
给 AI 接工具的"统一插头"标准。一次接好,各家模型都能用,不用为每个模型重写一遍。已成为事实标准(由 Linux 基金会治理)。
什么时候用:想让 AI 调用你自己的系统 / 数据 / 工具时,首选 MCP。
A2A (Agent-to-Agent)
Agent-to-Agent Protocol
Agent 之间的通信协议,让多个智能体互相"对话 / 派活 / 交结果"。和 MCP 互补:一个接工具,一个连 Agent。
什么时候用:要构建"多个 Agent 协同"的系统时。
Skill 技能
Skill
把某类能力(如"生成 PPT""查数据库")打包成可复用模块,Agent 需要时直接调用,不用每次重新教。
什么时候用:想把常用能力沉淀下来、给多个 Agent 共享时。
六、工具与实践
Dify
Dify
开源的 AI 应用开发平台,可视化搭工作流 / Agent / 知识库。本路线的核心练习场,本地用 Docker 就能跑。
什么时候用:不想写一堆代码、想快速把 AI 应用搭起来时。
Cherry Studio
Cherry Studio
桌面端多模型客户端,适合日常对话、提示词调试和多模型对比。提示词学习的"实验场"。
什么时候用:想方便地在多个模型间切换、对比效果时。
Docker
Docker
把应用连同运行环境打包成"容器",一条命令到处跑,避免"在我电脑上是好的"。
什么时候用:本地部署 Dify 等开源 AI 工具时基本都靠它。
Vibe Coding
Vibe Coding
"用自然语言描述需求、让 AI 写代码"的开发方式,边聊边改,重结果轻过程。2026 年 AI 编程的主流形态。
什么时候用:快速出原型、或非程序员想做小工具时。
LLMOps
LLMOps
大模型应用的运维实践:监控效果、评测质量、持续迭代、控制成本的一整套方法论。
什么时候用:AI 应用要上线、长期稳定跑时,不能只管"跑通"。
全双工 (Full-duplex)
Full-duplex
通信双方可"同时说、同时听"的模式。用在语音 AI 上,意味着用户可以在模型说话时随时插话打断(不像对讲机只能轮流来)。GPT-Live-1、Gander 等新一代语音/多模态模型都把"全双工 + 可打断"作为类人交互的标配。
什么时候用:做语音助手、实时 Agent、电话客服等需要"自然对话感"的场景。
端侧 AI / 边缘 AI (Edge AI)
Edge AI
把模型推理放到手机、PC、眼镜等终端设备本地完成,而非全部依赖云端。好处是数据不出本机、延迟低、可离线;代价是受端侧算力与显存限制,通常跑小模型或量化后的模型。2026 年高通等芯片厂已为"端侧 Agent"重设计旗舰 SoC(如 2nm 的第六代骁龙 8),让手机本地就能跑规划、调工具、执行多步任务。
什么时候用:做隐私敏感、需低延迟或离线的 AI 应用,以及理解"云+端"混合部署为何成为趋势。
智能体安全沙箱 (Agent Safety Sandbox)
Agent Safety Sandbox
给自主智能体划出"可强制"的运行边界:用基于策略的沙箱限制它能碰哪些系统/数据,再用硬件级看门狗(如英伟达 Sentry 跑在 BlueField DPU 上)监测并隔离越权行为。2026 年 9 月英伟达推出 Open Agent Safety Platform(OpenShell + Sentry),把"防智能体逃逸"从论文建议落成可部署参考架构——直接回应本期多起 Agent 越权/入侵事件。
什么时候用:把 Agent 接进生产系统、尤其是能"动真东西"(发邮件、付款、改文件)之前,先想清楚权限隔离与越权阻断。
AI 内容水印 (Model Watermarking / SynthID)
Model Watermarking
在不破坏内容本身的前提下,给 AI 生成的文本/图像/音频/蛋白质序列打上"人眼不可见、但可被验证"的标记,用来区分"人做 vs AI 做"。Google DeepMind 的 SynthID 已用于文图音视频;2026 年 10 月 SynthID Bio 又给 AI 设计的蛋白质打水印,在 0.1% 误报下 100% 检出。它是应对深度伪造与 AI 滥用溯源的基础设置。
什么时候用:聊"AI 生成内容如何溯源/合规"、以及生物/材料设计等高风险领域的防滥用。
没有匹配的术语,换个关键词试试 🔍