大模型多维知识中枢

🧱基础理论·打通从 Token 到 Transformer 的底层心智模型,是一切上层应用的地基。

知识点

6个机器学习核心算法对比

六种算法横向对比
维度线性回归Linear Regression逻辑回归Logistic Regression梯度下降Gradient Descent神经网络Neural Network决策树Decision TreeK均值聚类K-Means
类别回归分类优化深度学习分类/回归聚类
复杂度⭐ 极低⭐ 极低⭐⭐ 中⭐⭐⭐ 高⭐ 低⭐⭐ 中
监督类型✅ 有监督✅ 有监督通用优化器✅ 有监督为主✅ 有监督❌ 无监督
最适合房价预测、趋势分析二分类、概率输出神经网络训练、参数优化图像/语音/NLP 复杂任务可解释性要求高的场景数据分组、语义聚类
大模型关联输出层 logits = Wx + bSoftmax = 多分类逻辑回归Adam 是大模型训练主流优化器Transformer 是特殊深层神经网络CoT 推理类比决策树分解Embedding 空间语义聚类
线性回归Linear Regression
⭐ 极低
输入特征线性变换 Wx+b预测连续值最小化平方误差参数更新
  • 最小二乘法,最小化 Σ(y - ŷ)²
  • 高斯1809年提出,最古老的统计学习方法
  • Python: sklearn.LinearRegression
  • 大模型关联:Transformer 每层线性变换的基础
逻辑回归Logistic Regression
⭐ 极低
输入特征线性变换Sigmoid→(0,1)输出分类概率交叉熵损失更新
  • Sigmoid: σ(x) = 1/(1+e⁻ˣ),压缩到(0,1)
  • 输出可解释为概率,适合置信度场景
  • 大模型关联:next-token 预测用 Softmax(多分类版)
  • 适用:垃圾邮件分类、疾病预测
梯度下降Gradient Descent
⭐⭐ 中
初始化参数前向传播计算损失反向传播求梯度θ=θ-lr×∇L迭代收敛
  • Cauchy 1847年提出,沿梯度反方向下降
  • 变种:SGD / Mini-batch / Adam(自适应)
  • 大模型训练标配:AdamW + 学习率预热 + 余弦退火
  • 风险:局部最小值、梯度消失/爆炸
神经网络Neural Network
⭐⭐⭐ 高
输入层隐藏层×N(线性+激活)前向传播损失计算反向传播更新
  • 结构:输入层 → 多隐藏层 → 输出层
  • 激活函数:ReLU / GELU(大模型常用GELU)
  • 大模型关联:GPT/BERT 都是特殊深层神经网络
  • 训练技巧:Dropout、BatchNorm、残差连接
决策树Decision Tree
⭐ 低
选最优特征按阈值分裂递归子集到达叶子节点输出预测结果
  • 分裂标准:信息增益(ID3)/ 基尼系数(CART)
  • 优点:可视化、可解释、无需归一化
  • 集成进化:随机森林、XGBoost、LightGBM
  • 大模型关联:CoT 推理类似决策树逐步分解
K均值聚类K-Means
⭐⭐ 中
随机初始化K质心分配最近质心更新质心迭代收敛输出K个簇
  • 需预设 K(肘部法则选择)
  • K-means++ 改进初始化稳定性
  • 大模型关联:对 Embedding 向量做语义聚类
  • RAG 应用:检索结果聚类后再送 LLM,减少重复
Token
基础 · 把语言切成'可计算积木'

模型按 token 预测,不是按字面意思整体理解。中文平均每字约 1.5 个 token。

  • 中文常被切成多个 token,英文按子词切分
  • 上下文窗口按 token 计,决定最大输入长度
  • API 成本通常按输入+输出 token 数计费
  • 不同模型的 tokenizer 切分规则不同
来源:内置2025-03-25
Embedding 向量
进阶 · 语义坐标系

把文本映射到高维向量空间,距离近代表语义近,是 RAG 和推荐系统的基础组件。

  • 常用于语义检索、推荐、分类
  • 向量维度依模型而定(768~4096 维)
  • 同模型的 embedding 才能做余弦相似度比较
  • 是 RAG 的核心底层能力
来源:内置2025-03-25
Context Window
进阶 · 模型的短时工作台

上下文窗口决定模型能看到多少内容,太长会被截断,提示词结构直接影响效果。

  • 长文拆块处理比直接塞入更稳
  • 关键规则和约束放 prompt 前面
  • 输出约束可减少跑偏
  • 主流模型窗口:8K~2M token 不等
来源:内置2025-03-25
Transformer 架构
基础 · 注意力就是选择性聚焦

Transformer 通过 Self-Attention 让模型对序列中每个位置都能关注全局,是现代大模型的核心架构。

  • Self-Attention:每个 token 与全局 token 计算相关性
  • Multi-Head:多个注意力头捕捉不同语义维度
  • 位置编码(RoPE 等)赋予模型序列顺序感知
  • 解码器型(GPT系)适合生成,编码器型(BERT系)适合理解
来源:内置2025-03-25
Prompt Engineering
基础 · 给模型写导演脚本

明确角色、目标、约束和输出格式,是使用大模型最低成本、最高回报的技能。

  • 先目标后规则,结构要清晰
  • 给失败示例(负样本)也有效
  • 结构化输出(JSON/Markdown)更稳定
  • Chain-of-Thought 提升推理准确率
  • System Prompt 设定角色和边界
来源:内置2025-03-25
线性回归
基础 · 找一条最合身的直线

通过最小化预测值与真实值的平方误差,找到最佳拟合直线或超平面。是大模型输出层、回归头的数学基础。

  • 核心:最小二乘法,最小化 Σ(y - ŷ)²
  • 适用场景:线性关系明显的预测任务(房价、趋势)
  • Python: sklearn.LinearRegression
  • 局限:只能捕捉线性关系,对非线性数据无效
  • 与大模型关系:输出层的线性变换 logits = Wx + b
线性回归
来源:6个机器学习的核心算法.pdf2025-03-26
逻辑回归
基础 · 给线性回归装一个概率开关

将线性回归输出映射到 [0,1] 区间(Sigmoid),实现二分类。是理解分类头、Softmax 的起点。

  • 核心:Sigmoid 函数将实数压缩到 (0,1)
  • 输出可解释为概率,适合分类置信度
  • 适用场景:垃圾邮件分类、疾病预测
  • 与大模型关系:Softmax 是多分类版逻辑回归,用于 next-token 预测
  • 局限:只能处理线性可分问题
逻辑回归
来源:6个机器学习的核心算法.pdf2025-03-26
梯度下降
基础 · 蒙眼下山,每步沿最陡方向走

通过计算损失函数关于参数的梯度并沿反方向更新参数,迭代降低损失直至收敛。是所有大模型训练的核心优化机制。

  • 参数更新:θ = θ - lr × ∇L(θ)
  • 学习率太大震荡,太小收敛慢
  • 变种:SGD(随机)、Mini-batch、Adam(自适应)
  • 与大模型:Adam 是当前大模型训练主流优化器
  • 风险:可能陷入局部最小值,平坦区梯度消失
来源:6个机器学习的核心算法.pdf2025-03-26
神经网络基础
基础 · 模仿大脑的多层信号传递网络

通过多层非线性变换学习复杂函数,是 Transformer 和所有深度学习模型的结构基础。

  • 结构:输入层 → 隐藏层(多层)→ 输出层
  • 每层:线性变换 + 非线性激活函数(ReLU/GELU)
  • 训练:前向传播计算预测,反向传播更新参数
  • 与大模型:Transformer = 特殊的深层神经网络
  • 风险:层数增加易过拟合,需 Dropout/正则化
神经网络基础
来源:6个机器学习的核心算法.pdf2025-03-26
决策树
基础 · 一棵会问问题的树

通过递归选择最优特征进行数据划分,形成树状决策结构。是理解特征重要性和模型可解释性的重要工具。

  • 每个节点选择信息增益最大的特征分裂
  • 叶子节点给出分类/回归预测结果
  • 优点:可视化、可解释、无需归一化
  • 缺点:容易过拟合,需剪枝或集成(随机森林)
  • 与大模型:Chain-of-Thought 推理类似决策树的逐步分解
决策树
来源:6个机器学习的核心算法.pdf2025-03-26
K均值聚类
基础 · 让数据自动抱团

无监督学习算法,通过迭代将数据分为 K 个簇,每簇以质心表示。与大模型中的向量聚类、语义分组直接相关。

  • 流程:随机初始化K个质心 → 分配最近质心 → 更新质心 → 迭代收敛
  • 需预先设定 K 值(可用肘部法则选择)
  • 对初始质心敏感,可用 K-means++ 改进
  • 与大模型:Embedding 空间的语义聚类、文档分组
  • 与 RAG:可对检索结果做语义聚类后再送给 LLM
K均值聚类
来源:6个机器学习的核心算法.pdf2025-03-26