- **线性模型(Linear Models)** - 核心思想:线性组合拟合目标,凸优化易解 - 适用/假设:近似线性、特征可加性、高维稀疏常见 - 代表算法: - 线性回归 / 岭回归 / Lasso / Elastic Net - 优点:可解释、训练快 - 缺点:表达力弱 - 要点:标准化、交叉验证调正则 - 逻辑回归 - 优点:输出概率、鲁棒 - 缺点:非线性能力弱 - 要点:L1做特征选择,类不平衡设权重 - 线性SVM - 优点:最大间隔、泛化好 - 缺点:无概率输出 - 要点:C与特征缩放决定边界 - 常见技巧:多项式或交叉特征扩展表达力;使用L1压稀疏 - **核方法(Kernel Methods)** - 核心思想:通过核函数隐式映射到高维空间 - 适用/假设:决策边界平滑、中小样本 - 代表算法: - 核SVM - 优点:非线性强 - 缺点:O(n²)扩展性差 - 要点:常用RBF核,调C与γ - 核岭回归 - 优点:闭式解+正则化 - 缺点:规模受限 - 要点:选核函数与带宽 - KPCA - 优点:非线性降维 - 缺点:仅能变换训练点 - 要点:样本数量不宜过多 - 常见技巧:标准化后输入;用网格或贝叶斯优化搜索核超参 - **基于树的方法(Decision Trees & Ensembles)** - 核心思想:通过特征划分近似复杂非线性关系 - 适用/假设:表格数据、混合类型、缺失较多 - 代表算法: - 决策树(CART) - 优点:可解释、能处理缺失与离散特征 - 缺点:易过拟合 - 要点:控制深度和叶子样本数 - 随机森林 - 优点:稳健、少调参 - 缺点:模型大、推理慢 - 要点:增加树数、限制最大特征数 - 梯度提升树(GBDT / XGBoost / LightGBM / CatBoost) - 优点:Tabular数据强基线 - 缺点:调参多、过拟合风险高 - 要点:小学习率+多树、早停、类别特征推荐CatBoost - 常见技巧:交叉验证评估;注意数据泄漏(分桶/编码放管道内) - **近邻与基于实例的方法(Instance-based)** - 核心思想:预测依赖于训练样本的局部相似性 - 适用/假设:局部邻域可代表真实分布 - 代表算法: - kNN - 优点:简单、无需训练 - 缺点:预测慢、维度灾难 - 要点:特征缩放、距离度量、选择合适k - 原型 / 度量学习 - 优点:可学习距离 - 缺点:需标注、对噪声敏感 - 要点:采用三元组或对比损失 - 常见技巧:先PCA或UMAP降维,再用kNN提升速度与效果 - **概率与贝叶斯方法(Probabilistic / Bayesian)** - 核心思想:建模数据生成过程与不确定性 - 适用/假设:需要可信区间、小样本、可用先验知识 - 代表算法: - 朴素贝叶斯 - 优点:极快、鲁棒 - 缺点:独立性假设强 - 要点:文本或计数特征效果好 - 贝叶斯线性 / 逻辑回归 - 优点:提供后验不确定性 - 缺点:计算成本高 - 要点:选合适先验,使用变分或采样推断 - 高斯过程(GP) - 优点:非参数、带不确定性 - 缺点:O(n³)复杂度 - 要点:核函数选择与稀疏近似 - 常见技巧:层级先验防过拟合;报告置信区间提高可信度 - **概率图模型(PGM)** - 核心思想:用图结构表示变量依赖 - 适用/假设:结构化数据,可编码因果或条件独立关系 - 代表算法: - 贝叶斯网络(BN) - 优点:可解释 - 缺点:结构学习困难 - 要点:设定先验结构并评分搜索 - 马尔可夫随机场(MRF) / 条件随机场(CRF) - 优点:适合序列或图像标注 - 缺点:推断与训练成本高 - 要点:采用消息传递或对比散度 - 常见技巧:小图可手动设结构;大图需近似推断 - **聚类方法(Clustering)** - 核心思想:无监督地分组发现潜在结构 - 适用/假设:类簇可由形状、密度或层级刻画 - 代表算法: - 划分类:k-means / k-medoids - 优点:速度快 - 缺点:对尺度敏感,仅适合球形簇 - 模型类:GMM - 优点:软簇,概率可解释 - 缺点:高斯假设强,初始敏感 - 密度类:DBSCAN / HDBSCAN - 优点:自动确定簇数 - 缺点:不同密度区域困难 - 层次类:凝聚 / 分裂 - 优点:可视化层级结构 - 缺点:复杂度高 - 其他:谱聚类 / Mean-Shift - 优点:可处理非凸簇 - 缺点:内存与参数敏感 - 常见技巧:先PCA降维;用轮廓系数 / CH / DB指标评估效果 - **降维与表示学习(Dimensionality Reduction)** - 核心思想:压缩维度保留主要结构 - 适用/假设:高维冗余或噪声场景,用于可视化或加速 - 代表算法: - 线性:PCA(去噪与可解释)、ICA(独立源分离)、NMF(非负部件表示) - 判别:LDA(监督降维,提高类间可分性) - 非线性/流形:Isomap / LLE / t-SNE / UMAP(可视化强,但不可外推) - 常见技巧:标准化后做PCA;保留95%方差作为经验阈值 - **密度估计与异常检测(Density & Outlier Detection)** - 核心思想:学习数据分布或检测少数异常点 - 代表算法: - 显式密度:KDE(光滑,但带宽敏感)、GMM(可解释) - 边界类:One-Class SVM(小样本有效,但慢) - 随机类:隔离森林(伸缩性好,但随机性带方差) - 局部类:LOF(局部密度分析,但对k敏感) - 常见技巧:稳健缩放输入;评估用PR-AUC与召回率优先 - **神经网络与深度学习(Neural Networks)** - 核心思想:通过多层非线性自动学习特征表示 - 适用/假设:大规模数据、复杂模式、端到端学习 - 代表结构: - MLP:通用逼近能力强,但易过拟合 - CNN:空间局部不变,图像与语音任务强 - RNN / LSTM / GRU:捕获序列依赖,但长依赖难并行 - Transformer:自注意力机制,可扩展但成本高 - 常见技巧:AdamW + 余弦退火;Batch/LayerNorm;Dropout;数据增强;混合精度训练 - **生成式模型(Generative Models)** - 核心思想:学习数据分布以生成新样本 - 代表算法: - VAE:概率潜变量模型;生成稳定但细节欠佳 - GAN:对抗训练;生成锐利但不稳、易模式崩溃 - Flow:精确似然估计;可逆约束强 - Diffusion:逐步去噪;生成质量高但推理慢 - 常见技巧:使用感知损失与判别器技巧;采用分类器引导与加速采样 - **图神经网络(GNN)** - 核心思想:在图结构上进行消息传递 - 代表算法:GCN(平滑)、GraphSAGE(采样扩展)、GAT(注意力机制)、GIN(判别力强) - 优点:能利用关系结构信息 - 缺点:易过平滑,难以扩展至大图 - 常见技巧:采样(mini-batch)、残差+归一化、早停防过拟合 - **强化学习(Reinforcement Learning)** - 核心思想:通过与环境交互最大化长期奖励 - 方法族: - 值函数类:Q-learning / DQN(经验回放,适合离散动作) - 策略梯度类:REINFORCE(方差大,需基线) - Actor-Critic类:A2C / PPO(稳定)、DDPG / SAC(连续动作强) - 模型式:MPC / Dyna(样本效率高但建模难) - 常见技巧:奖励归一与塑形;熵正则;目标网络;延迟更新 - **半监督与自监督(Semi / Self-supervised)** - 半监督学习: - 方法:伪标签、Consistency(Π / Mean Teacher)、MixMatch / FixMatch - 特点:少量标注即可显著提升表现 - 自监督学习: - 方法:对比学习(SimCLR / MoCo)、遮盖预测(BERT / MAE)、BYOL / DINO - 特点:无标签预训练 → 下游微调 - 要点:强数据增强、合适温度或阈值、保持分布一致性 - **集成学习(Ensembling)** - Bagging:降低方差(如随机森林),易并行 - Boosting:降低偏差(如GBDT / XGB / LGBM / CatBoost),强但易过拟合 - Stacking / Blending:融合异质模型,需严格交叉验证防泄漏 - 常见技巧:小学习率 + 早停;模型多样性优先于数量 - **优化与正则化(Optimization & Regularization)** - 优化器:SGD / Momentum / Adam / AdamW / RMSProp / L-BFGS(凸问题) - 正则化:L1 / L2、Dropout、数据增强、早停、权重衰减、BatchNorm / LayerNorm - 学习率策略:预热 + 余弦退火 / OneCycle;梯度裁剪 - 损失函数选择: - 回归:MSE / MAE / Huber - 分类:Cross-Entropy / Focal / Label Smoothing - 度量学习:Triplet / Contrastive