Basics

基础概念

认识 AI 之前,先认识这些每天都在刷屏的词。

AI / 人工智能

Artificial Intelligence。让机器模拟人类智能的技术总称:理解语言、识别图像、做决策。现在说的 AI 大多指生成式 AI。

AIGC

AI Generated Content,AI 生成内容。用 AI 自动产出文字、图片、音频、视频、代码。区别于人写的内容(UGC/PGC)。

大语言模型(LLM)

Large Language Model。用海量文本训练的巨型神经网络,能理解和生成语言。ChatGPT、DeepSeek、Claude 都是 LLM。

AGI 通用人工智能

Artificial General Intelligence。能在任何智力任务上达到或超越人类的 AI。目前还未实现,是各大实验室的终极目标。

多模态(Multimodal)

模型能同时处理多种信息类型:文字、图片、音频、视频。GPT-4o 和 Gemini 是典型的多模态模型。

提示词(Prompt)

你发给 AI 的指令。提示词的质量直接决定回答的质量,「会提问」是使用 AI 的核心技能。

Token

模型处理文本的最小单位,约等于 0.75 个英文单词或 1-2 个汉字。API 按 Token 计费,上下文长度也按 Token 计算。

上下文(Context)

对话中模型能「记住」的内容。多轮对话的历史、系统提示词、上传的文档都算上下文。

上下文窗口(Context Window)

模型单次能处理的最大 Token 数。超出就「失忆」。主流模型已支持 128K-1M Token,可以一次读完整本书。

幻觉(Hallucination)

模型一本正经地编造不存在的事实。AI 的答案本质是「概率拼接」,重要信息务必交叉验证。

温度(Temperature)

控制回答随机性的参数(0-2)。越低越保守稳定(适合代码、翻译),越高越发散有创意(适合写作、头脑风暴)。

涌现能力

模型规模大到一定程度后突然「开窍」的能力,如推理、编程,训练时并未专门教过。规模是涌现的前提。

Training

模型与训练

模型是怎么练出来的,又怎么被改造成你手上的产品。

预训练(Pre-training)

让模型在海量数据上自学语言规律的阶段,烧掉训练成本的 90%。产出「基础模型」,是后续一切能力的底座。

微调(Fine-tuning)

在预训练模型基础上,用特定领域数据继续训练。成本低,能让模型学会客服话术、医学知识等专长。

RAG 检索增强生成

Retrieval-Augmented Generation。回答前先从知识库检索相关资料,再让模型基于资料作答。企业知识库问答的标准方案,能大幅减少幻觉。

嵌入(Embedding)

把文字/图片转成一串数字(向量),语义相近的内容数字也相近。搜索引擎、推荐系统、RAG 的底层技术。

向量数据库

专门存储和检索向量的数据库,如 Milvus、Pinecone、Chroma。RAG 系统中负责「找到相关资料」的那一环。

Transformer

2017 年谷歌提出的神经网络架构,靠「注意力机制」并行处理序列。今天几乎所有大模型都基于它,包括 GPT 的「T」。

强化学习(RLHF)

Reinforcement Learning from Human Feedback。让人类给模型的回答打分,再用这些反馈训练,使回答更符合人类偏好。

蒸馏(Distillation)

用大模型当「老师」教小模型,让小模型以极低成本逼近大模型能力。DeepSeek-R1-Distill 系列就是这么来的。

量化(Quantization)

把模型参数从高精度压缩到低精度(如 FP16→INT4),体积缩小数倍、速度提升,代价是轻微掉分。本地跑模型必懂。

LoRA

Low-Rank Adaptation,一种轻量微调技术:只训练一小部分附加参数,几 GB 显存就能微调,产出的小补丁可插拔复用。

MoE 混合专家

Mixture of Experts。模型分成多个「专家」子网络,每次只激活一小部分。参数总量巨大但推理便宜,DeepSeek-V3 即用此架构。

Deployment

推理与部署

模型训练好了,怎么让它跑起来、跑得快、跑得省。

推理(Inference)

模型生成答案的过程。训练一次,推理千万次;日常用的 API、网页对话,都是推理。

思维链(CoT)

Chain-of-Thought。让模型「一步步想」再回答,显著提升数学、逻辑题正确率。o1/R1 的深度思考就是强化版 CoT。

函数调用(Function Calling)

让模型输出结构化指令,触发外部工具(查天气、下单、写代码执行)。Agent 干活的关键机制。

开源模型

权重公开、可自由下载和商用的模型,如 DeepSeek、Qwen、Llama。可本地部署、可微调,数据不出门。

GPU

图形处理器,AI 训练的算力心脏。英伟达几乎垄断市场;推理时用消费级显卡(如 RTX 4090)也能跑小模型。

API

Application Programming Interface。模型厂商提供的编程接口,按 Token 计费,开发者把 AI 能力接进自己产品的方式。

吞吐(TPS)

Tokens Per Second,每秒生成的 Token 数。衡量推理速度的核心指标,受 GPU、量化、框架共同影响。

本地部署

把开源模型跑在自己的电脑/服务器上。用 Ollama、vLLM 等工具,隐私无价,免费无限用。

Applications

智能体与应用

从「对话机器人」到「会干活的同事」,这些词定义 AI 的形态。

Agent 智能体

能自主规划、调用工具、多步执行任务的 AI 系统。不是问答,而是「接到目标,自己想办法完成」。

MCP 模型上下文协议

Model Context Protocol。Anthropic 提出的开放协议,统一 AI 与外部工具/数据的连接方式,被称为「AI 的 USB 接口」。

工作流(Workflow)

把多个 AI 步骤按固定流程串起来:审核→生成→翻译→发布。n8n、Dify 是常用编排工具。

知识库

把企业文档切块、向量化后存储,供 RAG 检索。让 AI 回答「基于我们公司资料」的问题。

文生图(Text-to-Image)

文字描述生成图片。代表:Midjourney、即梦、Stable Diffusion、DALL·E。

扩散模型(Diffusion)

文生图/视频的主流技术:先给图片加噪打马赛克,再学「去噪还原」,生成时从纯噪声一步步还原成图。

文生视频

文字或图片生成视频片段。代表:可灵、Runway、Sora、即梦。正在颠覆短视频和影视制作流程。

TTS 语音合成

Text-to-Speech,文字转语音。现代 TTS 已能以假乱真,用于有声书、AI 配音、智能客服。

OCR 文字识别

Optical Character Recognition,把图片里的文字提取出来。配合大模型,拍张发票就能自动入账。