<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>机器学习入门：从知识结构全景到实战落地 on PlumePHP</title><link>https://plumephp.com/posts/ml/</link><description>Recent content in 机器学习入门：从知识结构全景到实战落地 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Mon, 28 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/posts/ml/index.xml" rel="self" type="application/rss+xml"/><item><title>AutoML 与超参自动调优：Optuna、搜索策略与端到端流水线</title><link>https://plumephp.com/ml-automl-hpo/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-automl-hpo/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;模型精度的一大半来自&lt;strong&gt;超参调得好&lt;/strong&gt;——同样的 XGBoost，调参前后 AUC 可能差 0.05。但人工调参像「猜密码」：试到哪儿算哪儿、难以复现。**AutoML（自动化机器学习）**把「选模型 + 调超参」变成自动搜索问题。本文从网格/随机搜索讲起，落地 Optuna 的贝叶斯优化（TPE），再到 AutoGluon/FLAML 一键自动化，最后讨论「哪些能自动、哪些不能」。&lt;/p&gt;</description></item><item><title>NLP 入门实战：文本向量化、词嵌入与情感分析</title><link>https://plumephp.com/ml-nlp-basics/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-nlp-basics/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;NLP 的核心问题是：&lt;strong&gt;把「人类语言」翻译成「模型能算的向量」&lt;/strong&gt;。本文按处理管线走一遍——分词清洗 → 向量化（TF-IDF 起步，Word2Vec 进阶）→ 模型（经典分类器到 Transformer）→ 端到端情感分析实战，最后给 HuggingFace 生态与常见陷阱，让你能独立处理一个文本分类任务。&lt;/p&gt;</description></item><item><title>决策树与树模型基础：分裂准则、剪枝与可视化</title><link>https://plumephp.com/ml-decision-tree/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-decision-tree/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;决策树是最直观的机器学习模型——「如果年龄 &amp;lt; 30 且月收入 &amp;gt; 1 万，就批准贷款」。它是一连串 if-else 规则的组合，也是随机森林、梯度提升等一切树集成的地基。本文讲清三件事：&lt;strong&gt;树怎么选分裂点&lt;/strong&gt;（信息增益/基尼）、&lt;strong&gt;怎么防止过拟合&lt;/strong&gt;（预剪枝/后剪枝）、&lt;strong&gt;树模型的边界与实战&lt;/strong&gt;。&lt;/p&gt;</description></item><item><title>异常检测实战：统计方法、隔离森林、AutoEncoder 与不平衡学习</title><link>https://plumephp.com/ml-anomaly-detection/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-anomaly-detection/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;欺诈交易、服务器故障、设备损坏——这些「异常」在数据里只占极小比例，却是最有价值的部分。&lt;strong&gt;异常检测（Anomaly Detection）&lt;strong&gt;的目标不是「分好多数类」，而是&lt;/strong&gt;找出少数异常&lt;/strong&gt;。它与类别不平衡问题紧密相关：异常极稀少、正负比例悬殊。本文覆盖从统计方法到隔离森林、AutoEncoder 的完整武器库，以及不平衡学习的处理套路与评估指标。&lt;/p&gt;</description></item><item><title>推荐系统入门实战：协同过滤、矩阵分解与召回排序</title><link>https://plumephp.com/ml-recommender-systems/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-recommender-systems/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;推荐系统是「预测用户会喜欢什么」——电商、视频、新闻、音乐都在用。本文按&lt;strong&gt;工业界真实架构&lt;/strong&gt;推进：先建 User-Item 交互矩阵（一切的地基），再讲协同过滤（User/Item 相似度）、矩阵分解（SVD/ALS，隐因子模型）、基于内容的推荐，然后是&lt;strong&gt;召回-粗排-精排&lt;/strong&gt;的工程架构与评估指标（准确率/召回率/NDCG），最后攻冷启动与新物品问题。&lt;/p&gt;</description></item><item><title>时间序列预测实战：ARIMA、Prophet 与 LSTM</title><link>https://plumephp.com/ml-time-series/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-time-series/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;时间序列预测是「用过去推未来」：销量、流量、温度、股价。与普通回归不同，时序数据有&lt;strong&gt;自相关&lt;/strong&gt;（今天影响明天）、&lt;strong&gt;趋势&lt;/strong&gt;、&lt;strong&gt;季节性&lt;/strong&gt;——需要专门的工具链。本文按「由易到难」推进：先讲平稳性与 ACF/PACF 诊断（所有方法的地基），再给经典统计法（指数平滑/ARIMA）、Facebook Prophet（自动处理趋势/节假日）、LSTM（深度学习），最后对比选型与评估。&lt;/p&gt;</description></item><item><title>模型可解释性实战：特征重要性、SHAP、LIME 与业务落地</title><link>https://plumephp.com/ml-model-interpretability/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-model-interpretability/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;黑箱模型上线被拒是常事——风控要解释为什么拒贷、医疗要解释为什么判病、合规要审计逻辑。&lt;strong&gt;可解释性（XAI）&lt;strong&gt;不是学术点缀，而是模型落地的硬要求。本文分两条线：&lt;strong&gt;全局解释&lt;/strong&gt;（这个模型整体怎么决策）与&lt;/strong&gt;局部解释&lt;/strong&gt;（这一个样本为什么被判成这样），重点落地特征重要性、SHAP、LIME 三种主流工具。&lt;/p&gt;</description></item><item><title>模型部署与 MLOps：ONNX、FastAPI、Docker 与监控</title><link>https://plumephp.com/ml-model-deployment/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-model-deployment/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;训练出一个好模型只完成了一半——&lt;strong&gt;「能上线、可回滚、看得见」才是生产&lt;/strong&gt;。本文讲透模型上线的工程链路：把 PyTorch 模型导出 ONNX（跨框架/硬件）、用 FastAPI 起推理服务、Docker 打包、批处理与在线推理的取舍、A/B 测试与版本管理，最后给监控告警——让 ML 项目从「notebook 里跑通」变成「生产里稳跑」。&lt;/p&gt;</description></item><item><title>深度学习进阶：CNN、RNN、正则化与训练调参实战</title><link>https://plumephp.com/ml-deep-learning-advanced/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-deep-learning-advanced/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;入门篇用 PyTorch 搭了第一个 MLP（/ml-neural-networks-basics/）。进阶要解决两个问题：&lt;strong&gt;MLP 处理不了的结构&lt;/strong&gt;（图像的空间局部性、序列的时序性）与&lt;strong&gt;深网络的训练困境&lt;/strong&gt;（梯度消失、过拟合）。本文先给 CNN 与 RNN 两大家族的结构，再集中解决「怎么把深网络训好」——正则化、优化器、学习率调度、迁移学习，最后用 CIFAR-10 完整跑通。&lt;/p&gt;</description></item><item><title>计算机视觉入门实战：图像处理与 CNN 图像分类</title><link>https://plumephp.com/ml-cv-basics/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-cv-basics/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;计算机视觉（CV）是深度学习落地最广的方向——图像分类、目标检测、分割、OCR。核心管线清晰：&lt;strong&gt;图像变成张量 → CNN 提特征 → 任务头输出&lt;/strong&gt;。本文从图像数据的底层表示讲起，用 OpenCV 讲预处理与增强，再完整跑通 PyTorch 的 CIFAR-10 图像分类，最后概览目标检测/分割和迁移学习，让你对 CV 实战有全景认知。&lt;/p&gt;</description></item><item><title>迁移学习实战：预训练模型、特征提取与微调全流程</title><link>https://plumephp.com/ml-transfer-learning/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-transfer-learning/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;从零训练一个图像分类/文本模型要几千万样本和大量 GPU，而现实中你的数据可能只有几千条。**迁移学习（Transfer Learning）**把「别人在大数据上学到的通用表示」拿过来，用你的小数据做适配——这是 CV 与 NLP 的默认起手式。本文讲清：什么是迁移学习、预训练模型从哪来、冻结与微调的取舍、以及一套可复用的 PyTorch 微调流水线。&lt;/p&gt;</description></item><item><title>集成学习实战：Bagging、随机森林、梯度提升与 Stacking</title><link>https://plumephp.com/ml-ensemble-learning/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-ensemble-learning/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;单个模型（决策树、逻辑回归）常有力不从心的时候：树容易过拟合、线性模型学不动非线性。**集成学习（Ensemble）**把多个「弱模型」组合成一个「强模型」，是几乎所有机器学习竞赛与工业落地的默认武器。本文从偏差-方差视角讲清「为什么集成有效」，再逐步落地 Bagging → 随机森林 → AdaBoost → GBDT → XGBoost/LightGBM → Stacking，全程附 sklearn 可运行代码。&lt;/p&gt;</description></item><item><title>无监督学习实战：聚类与降维（K-Means、层次聚类、PCA 与 t-SNE）</title><link>https://plumephp.com/ml-unsupervised-clustering/</link><pubDate>Sun, 27 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-unsupervised-clustering/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;监督学习有「标准答案」（标签），无监督学习没有——它的目标是发现数据内在的结构。两大任务：&lt;strong&gt;聚类&lt;/strong&gt;（把样本分成几群）与&lt;strong&gt;降维&lt;/strong&gt;（压缩特征但不丢失关键信息）。应用场景遍地都是：客户细分、异常检测、基因分型、推荐系统冷启动、高维可视化。&lt;/p&gt;</description></item><item><title>机器学习开发环境搭建：Python、NumPy、pandas 与 Jupyter 生态实战</title><link>https://plumephp.com/ml-python-environment-setup/</link><pubDate>Sun, 27 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-python-environment-setup/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;开始机器学习的第一道坎，不是算法，而是「环境装不上」。Python 包之间版本冲突、GPU 驱动缺失、Notebook 启动即崩……这些环境问题劝退了大量入门者。实际上，只要掌握「虚拟环境 + 包管理 + Notebook」这三板斧，环境搭建可以在十分钟内稳定复现。&lt;/p&gt;</description></item><item><title>模型评估与选择：交叉验证、偏差方差、过拟合与调参实战</title><link>https://plumephp.com/ml-model-evaluation/</link><pubDate>Sun, 27 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-model-evaluation/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;训练一个模型很容易，但「这个模型到底靠不靠谱、该不该上线」是更难的问题。评估不是跑完 &lt;code&gt;fit()&lt;/code&gt; 后打印一个分数就结束——它决定着你的一切后续决策：特征要不要删、超参往哪调、能不能换更强的模型、是不是已经过拟合了。&lt;/p&gt;</description></item><item><title>特征工程实战：从原始数据到有效特征的完整流程</title><link>https://plumephp.com/ml-feature-engineering/</link><pubDate>Sun, 27 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-feature-engineering/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;「模型决定上限，特征决定下限」——同一份数据、同一个算法，特征工程做得好坏可以拉开成倍的差距。很多「调参大师」在竞赛里拼不过「特征专家」，原因就在这。&lt;/p&gt;</description></item><item><title>监督学习实战（一）：线性回归与回归模型的完整流程</title><link>https://plumephp.com/ml-supervised-regression/</link><pubDate>Sun, 27 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-supervised-regression/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;回归是监督学习里最直观、也最实用的一类问题：给定若干特征（面积、房龄、位置），预测一个连续数值（房价）。线性回归假设「输出是输入的线性组合」，这个简单假设能解决大量真实问题，也是理解更复杂模型（逻辑回归、神经网络）的起点。&lt;/p&gt;</description></item><item><title>监督学习实战（二）：分类算法对比与实战（逻辑回归到随机森林）</title><link>https://plumephp.com/ml-supervised-classification/</link><pubDate>Sun, 27 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-supervised-classification/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;分类是监督学习的另一大类：输出不再是连续数值，而是离散类别——垃圾邮件（垃圾/正常）、欺诈交易（欺诈/正常）、肿瘤（良性/恶性）。分类问题的难点不在「训练一个模型」，而在&lt;strong&gt;评估与权衡&lt;/strong&gt;：假阳性与假阴性哪个更不能接受？数据严重不平衡时准确率会骗人，怎么办？&lt;/p&gt;</description></item><item><title>神经网络入门实战：用 PyTorch 从零构建第一个网络</title><link>https://plumephp.com/ml-neural-networks-basics/</link><pubDate>Sun, 27 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ml-neural-networks-basics/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;深度学习是机器学习最耀眼的分支，而神经网络是它的地基。很多人畏惧神经网络，是因为被「反向传播」「梯度消失」这些术语吓住。但用现代框架（PyTorch/TensorFlow），&lt;strong&gt;训练一个网络的工程步骤只有四步&lt;/strong&gt;：定义模型、定义损失、定义优化器、跑训练循环。剩下的是理解「它在学什么」。&lt;/p&gt;</description></item><item><title>机器学习的知识结构</title><link>https://plumephp.com/machine-learning-knowledge-structure/</link><pubDate>Tue, 07 Jan 2025 12:04:35 +0800</pubDate><guid>https://plumephp.com/machine-learning-knowledge-structure/</guid><description>&lt;p&gt;以下是关于机器学习知识结构的详细介绍，包含书籍、课程、社区等资源的有效链接，供参考：&lt;/p&gt;
&lt;h3 id="1-基础数学"&gt;&lt;strong&gt;1. 基础数学&lt;/strong&gt;&lt;/h3&gt;
&lt;p&gt;机器学习依赖于数学基础，主要包括以下领域：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;线性代数&lt;/strong&gt;：矩阵运算、特征值、特征向量、奇异值分解（SVD）等。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;概率论与统计&lt;/strong&gt;：概率分布、贝叶斯定理、期望、方差、最大似然估计等。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;微积分&lt;/strong&gt;：梯度、偏导数、链式法则、优化问题等。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优化理论&lt;/strong&gt;：凸优化、梯度下降、拉格朗日乘数法等。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;推荐资源&lt;/strong&gt;：&lt;/p&gt;</description></item></channel></rss>