40 个高频 AI 术语,用大白话解释。看新闻、读文档、用工具时遇到生词,来这里查。
认识 AI 之前,先认识这些每天都在刷屏的词。
Artificial Intelligence。让机器模拟人类智能的技术总称:理解语言、识别图像、做决策。现在说的 AI 大多指生成式 AI。
AI Generated Content,AI 生成内容。用 AI 自动产出文字、图片、音频、视频、代码。区别于人写的内容(UGC/PGC)。
Large Language Model。用海量文本训练的巨型神经网络,能理解和生成语言。ChatGPT、DeepSeek、Claude 都是 LLM。
Artificial General Intelligence。能在任何智力任务上达到或超越人类的 AI。目前还未实现,是各大实验室的终极目标。
模型能同时处理多种信息类型:文字、图片、音频、视频。GPT-4o 和 Gemini 是典型的多模态模型。
你发给 AI 的指令。提示词的质量直接决定回答的质量,「会提问」是使用 AI 的核心技能。
模型处理文本的最小单位,约等于 0.75 个英文单词或 1-2 个汉字。API 按 Token 计费,上下文长度也按 Token 计算。
对话中模型能「记住」的内容。多轮对话的历史、系统提示词、上传的文档都算上下文。
模型单次能处理的最大 Token 数。超出就「失忆」。主流模型已支持 128K-1M Token,可以一次读完整本书。
模型一本正经地编造不存在的事实。AI 的答案本质是「概率拼接」,重要信息务必交叉验证。
控制回答随机性的参数(0-2)。越低越保守稳定(适合代码、翻译),越高越发散有创意(适合写作、头脑风暴)。
模型规模大到一定程度后突然「开窍」的能力,如推理、编程,训练时并未专门教过。规模是涌现的前提。
模型是怎么练出来的,又怎么被改造成你手上的产品。
让模型在海量数据上自学语言规律的阶段,烧掉训练成本的 90%。产出「基础模型」,是后续一切能力的底座。
在预训练模型基础上,用特定领域数据继续训练。成本低,能让模型学会客服话术、医学知识等专长。
Retrieval-Augmented Generation。回答前先从知识库检索相关资料,再让模型基于资料作答。企业知识库问答的标准方案,能大幅减少幻觉。
把文字/图片转成一串数字(向量),语义相近的内容数字也相近。搜索引擎、推荐系统、RAG 的底层技术。
专门存储和检索向量的数据库,如 Milvus、Pinecone、Chroma。RAG 系统中负责「找到相关资料」的那一环。
2017 年谷歌提出的神经网络架构,靠「注意力机制」并行处理序列。今天几乎所有大模型都基于它,包括 GPT 的「T」。
Reinforcement Learning from Human Feedback。让人类给模型的回答打分,再用这些反馈训练,使回答更符合人类偏好。
用大模型当「老师」教小模型,让小模型以极低成本逼近大模型能力。DeepSeek-R1-Distill 系列就是这么来的。
把模型参数从高精度压缩到低精度(如 FP16→INT4),体积缩小数倍、速度提升,代价是轻微掉分。本地跑模型必懂。
Low-Rank Adaptation,一种轻量微调技术:只训练一小部分附加参数,几 GB 显存就能微调,产出的小补丁可插拔复用。
Mixture of Experts。模型分成多个「专家」子网络,每次只激活一小部分。参数总量巨大但推理便宜,DeepSeek-V3 即用此架构。
模型训练好了,怎么让它跑起来、跑得快、跑得省。
模型生成答案的过程。训练一次,推理千万次;日常用的 API、网页对话,都是推理。
Chain-of-Thought。让模型「一步步想」再回答,显著提升数学、逻辑题正确率。o1/R1 的深度思考就是强化版 CoT。
让模型输出结构化指令,触发外部工具(查天气、下单、写代码执行)。Agent 干活的关键机制。
权重公开、可自由下载和商用的模型,如 DeepSeek、Qwen、Llama。可本地部署、可微调,数据不出门。
图形处理器,AI 训练的算力心脏。英伟达几乎垄断市场;推理时用消费级显卡(如 RTX 4090)也能跑小模型。
Application Programming Interface。模型厂商提供的编程接口,按 Token 计费,开发者把 AI 能力接进自己产品的方式。
Tokens Per Second,每秒生成的 Token 数。衡量推理速度的核心指标,受 GPU、量化、框架共同影响。
把开源模型跑在自己的电脑/服务器上。用 Ollama、vLLM 等工具,隐私无价,免费无限用。
从「对话机器人」到「会干活的同事」,这些词定义 AI 的形态。
能自主规划、调用工具、多步执行任务的 AI 系统。不是问答,而是「接到目标,自己想办法完成」。
Model Context Protocol。Anthropic 提出的开放协议,统一 AI 与外部工具/数据的连接方式,被称为「AI 的 USB 接口」。
把多个 AI 步骤按固定流程串起来:审核→生成→翻译→发布。n8n、Dify 是常用编排工具。
把企业文档切块、向量化后存储,供 RAG 检索。让 AI 回答「基于我们公司资料」的问题。
文字描述生成图片。代表:Midjourney、即梦、Stable Diffusion、DALL·E。
文生图/视频的主流技术:先给图片加噪打马赛克,再学「去噪还原」,生成时从纯噪声一步步还原成图。
文字或图片生成视频片段。代表:可灵、Runway、Sora、即梦。正在颠覆短视频和影视制作流程。
Text-to-Speech,文字转语音。现代 TTS 已能以假乱真,用于有声书、AI 配音、智能客服。
Optical Character Recognition,把图片里的文字提取出来。配合大模型,拍张发票就能自动入账。