线性回归Linear Regression
⭐ 极低输入特征→线性变换 Wx+b→预测连续值→最小化平方误差→参数更新
- 最小二乘法,最小化 Σ(y - ŷ)²
- 高斯1809年提出,最古老的统计学习方法
- Python: sklearn.LinearRegression
- 大模型关联:Transformer 每层线性变换的基础
6个机器学习核心算法对比
| 维度 | 线性回归Linear Regression | 逻辑回归Logistic Regression | 梯度下降Gradient Descent | 神经网络Neural Network | 决策树Decision Tree | K均值聚类K-Means |
|---|---|---|---|---|---|---|
| 类别 | 回归 | 分类 | 优化 | 深度学习 | 分类/回归 | 聚类 |
| 复杂度 | ⭐ 极低 | ⭐ 极低 | ⭐⭐ 中 | ⭐⭐⭐ 高 | ⭐ 低 | ⭐⭐ 中 |
| 监督类型 | ✅ 有监督 | ✅ 有监督 | 通用优化器 | ✅ 有监督为主 | ✅ 有监督 | ❌ 无监督 |
| 最适合 | 房价预测、趋势分析 | 二分类、概率输出 | 神经网络训练、参数优化 | 图像/语音/NLP 复杂任务 | 可解释性要求高的场景 | 数据分组、语义聚类 |
| 大模型关联 | 输出层 logits = Wx + b | Softmax = 多分类逻辑回归 | Adam 是大模型训练主流优化器 | Transformer 是特殊深层神经网络 | CoT 推理类比决策树分解 | Embedding 空间语义聚类 |
模型按 token 预测,不是按字面意思整体理解。中文平均每字约 1.5 个 token。
把文本映射到高维向量空间,距离近代表语义近,是 RAG 和推荐系统的基础组件。
上下文窗口决定模型能看到多少内容,太长会被截断,提示词结构直接影响效果。
Transformer 通过 Self-Attention 让模型对序列中每个位置都能关注全局,是现代大模型的核心架构。
明确角色、目标、约束和输出格式,是使用大模型最低成本、最高回报的技能。
通过最小化预测值与真实值的平方误差,找到最佳拟合直线或超平面。是大模型输出层、回归头的数学基础。

将线性回归输出映射到 [0,1] 区间(Sigmoid),实现二分类。是理解分类头、Softmax 的起点。

通过计算损失函数关于参数的梯度并沿反方向更新参数,迭代降低损失直至收敛。是所有大模型训练的核心优化机制。
通过多层非线性变换学习复杂函数,是 Transformer 和所有深度学习模型的结构基础。

通过递归选择最优特征进行数据划分,形成树状决策结构。是理解特征重要性和模型可解释性的重要工具。

无监督学习算法,通过迭代将数据分为 K 个簇,每簇以质心表示。与大模型中的向量聚类、语义分组直接相关。
