十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

ML for Beginners 第一课精读:什么是机器学习——从 AI/ML/深度学习关系图到本地学习环境搭建

ML for Beginners 第一课精读:什么是机器学习——从 AI/ML/深度学习关系图到本地学习环境搭建 ML for Beginners 第一课精读什么是机器学习——从 AI/ML/深度学习关系图到本地学习环境搭建【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners本篇指南基于 ML for Beginners12 周、26 课、52 题测验的经典机器学习课程第一组“Introduction”的第一课 Introduction to machine learning 展开讲清机器学习的定义、它与 AI 和深度学习的边界、课程覆盖范围与明确排除项并给出开课前的完整环境准备清单Python、Node.js、VS Code、Scikit-learn、Jupyter 依赖安装。读完本篇你应能独立完成笔记本notebook本地运行环境搭建理解课程的术语体系与学习路线知道下一课与后续动手练习在哪里。1. 课程定位经典机器学习以 Scikit-learn 为核心ML for Beginners 是 Microsoft Cloud Advocates 出品的 12 周、26 课课程主打classic machine learning经典机器学习以 Scikit-learn并刻意不涉及深度学习——那部分由另一门 AI for Beginners 课程覆盖。本课Lesson 01在课程总表中的定位是课程编号主题所属分组学习目标01Introduction to machine learningIntroduction掌握机器学习背后的基本概念第一组 Introduction 共 4 课依次是机器学习导论本篇机器学习与 AI 的历史公平性与机器学习机器学习技术建模七步法课程的 pedagogy教学法有两条主线一是项目式学习project-based二是高频测验——课前预热测验pre-lecture quiz设定学习意图课后测验post-lecture quiz巩固记忆。全部 52 份每份 3 题的测验代码都放在 quiz-app/ 目录这是一个 Vue.js 3 应用可以在本地用npm installnpm run serve运行也可部署为静态站点详见 AGENTS.md 中的“Quiz Application”章节。每个课时的固定结构为可选 sketchnote → 可选补充视频 → 课前测验 → 书面讲义 → 知识检查knowledge check→ Challenge → Assignment → 课后测验。本课属于纯概念课因此目录下没有notebook.ipynb和solution/文件夹只有讲义 README.md、作业 assignment.md 和本课插图 images/ 目录——从目录结构看动手环节被有意推迟到第 5 课回归工具课才开始体现“先概念、后实操”的设计。另外整个课程文档基于 Docsify 实现“零构建”在线阅读index.html 配置了 docsify 入口仓库根目录执行docsify serve后在localhost:3000即可离线浏览全部讲义package.json 还定义了npm run convert用于通过 docsify-to-pdf 生成课程 PDF输出为 pdf/readme.pdf。侧边栏导航定义在 docs/_sidebar.md与 9 个主题组一一对应。2. 机器学习到底是什么从“孩子的大脑”到系统定义原文档从人的学习过程切入逐步给出机器学习的定义这条推理链值得完整保留孩子的大脑儿童通过感官接收周围环境的事实逐渐学会生活中隐藏的规律并据此构造逻辑规则去识别已学到的模式脑可塑性brain plasticity持续“发现隐藏模式 → 在模式上创新”的循环让人类在一生中不断进化这是人类成为最精密生命体的学习机制人类智能行为人脑从现实世界感知事物、处理感知到的信息、做出理性决策、并根据情境采取行动——我们把这种行为称为“智能行为”人工智能AI当把这个智能行为过程用程序实现到机器上时就得到 AI机器学习ML它是 AI 的一个重要子集原文给出的核心定义是——“ML 关注使用专门算法从感知到的数据中发现有意义的信息、找出隐藏模式以支撑理性决策过程”。从系统视角原文进一步将其表述为机器学习是构建能够自动从数据中学习隐藏模式、以辅助智能决策的自动化系统。这个定义在后续课程中会被反复印证例如 1-Introduction/4-techniques-of-ML/README.md 中“决定问题 → 收集与准备数据 → 选择训练方法 → 训练模型 → 评估 → 调参 → 预测”的七步建模流程。为什么需要机器学习而不是硬编码规则原文抛出的思考题是企业为什么愿意尝试 ML 策略而不是创建硬编码的规则引擎结合下一课的例子可以回答规则引擎在多变量场景下会迅速失效——例如精算场景中若变量只有“是否吸烟”还可以手写规则但一旦引入更多变量如天气预报需要经度、纬度、气候变化、距海洋距离、急流模式等ML 模型比人工规则更高效。这正是本课“为什么学习 ML”一节的实质答案。3. 术语辨析AI、ML、深度学习、数据科学原文配图见文首关系图Infographic by Jen Looper展示了 AI、ML、深度学习、数据科学四个概念的包含与交叉关系。结合课程给出的边界声明可以得到一张清晰的概念地图AI ⊃ MLAI 是更大的概念ML 是其子集专门指“从数据中学模式”的分支深度学习 ⊂ ML深度学习是用多层神经网络建模的 ML 子分支数据科学与 ML 交叉数据科学覆盖数据探索、清洗、可视化到建模的完整链条ML 是其中的建模核心。原文明确列出了课程覆盖与不覆盖的内容这是理解整门课边界的依据覆盖经典 ML主要使用 Scikit-learn机器学习核心概念ML 的历史ML 与公平性fairness回归技术regression分类技术classification聚类技术clustering自然语言处理技术NLP时间序列预测time series forecasting强化学习reinforcement learningML 的真實世界应用不覆盖深度学习deep learning神经网络neural networks广义 AI课程的理由是为了避免神经网络带来的复杂度让“经典 ML”成为理解更广阔 AI 概念所必需的地基数据科学方向则留待另一门 Data Science for Beginners 课程。从仓库结构看这十个方向恰好对应根目录下1-Introduction到9-Real-World的主题分组和 README.md 课程总表中的 26 课第 21–23 课为时间序列第 24–25 课为强化学习Postscript 两课为真实世界应用与模型调试。4. 开课前的环境准备清单可执行版原文档的 Getting started 一节要求开始前你的电脑必须配置好并能本地运行 notebooks。原始清单与仓库 AGENTS.md 中的 Setup Commands 相互印证合并后如下表准备项原始要求仓库确认的具体操作Python安装 Python 并理解基础语法Python 3.8用python --version验证Jupyter能本地运行 notebookspip install jupyterML 常用库熟悉 Scikit-learnpip install scikit-learn pandas numpy matplotlib seabornNode.js npm部分课程Web App使用 JavaScript安装 node 与 npm代码编辑器设置一个开发用编辑器Visual Studio Code同时支持 Python 与 JavaScriptGitHub 账号Fork 本课程到自己名下学习Fork 整个仓库后在本地完成练习Web App 课依赖第 9 课构建 Flask 应用pip install flask仅 Web App 课需要R可选多课提供 R 版本答案R 中执行install.packages(c(tidyverse, tidymodels, caret))验证环境的典型命令依据 AGENTS.md 的 Setup Commands 与 Common Commands Reference# 检查 Python 版本需要 3.8 python --version # 安装 Jupyter 与课程常用库 pip install jupyter scikit-learn pandas numpy matplotlib seaborn # 进入某个含 notebook 的课时目录后启动 jupyter notebook notebook.ipynb注意事项来自 TROUBLESHOOTING.md 与 AGENTS.md 的 Troubleshooting 章节若从 GitHub 克隆整个仓库50 语言的翻译目录会显著增大下载体积README.md 提供了 sparse checkout 方式git clone --filterblob:none --sparse后git sparse-checkout set --no-cone /* !translations !translated_images跳过翻译目录Jupyter 内核卡死时执行 Kernel → Restartimport 报错先确认对应包已 pip 安装路径报错时注意从 notebook 所在目录启动。5. 为什么数据质量重要贯穿后续课程的暗线原文专门用一节强调高质量数据提升模型性能低质量或噪声数据即使搭配先进算法也会导致预测不准。这一论断在课程后续动手课中都有落地案例从仓库文件可以定位到每课处理的具体数据集主题组实践数据数据文件路径回归美国南瓜价格2-Regression/data/US-pumpkins.csvWeb App部署回归模型为 Flask 应用3-Web-App/1-Web-App/data/分类亚洲与印度菜谱4-Classification/data/cuisines.csv聚类尼日利亚音乐数据5-Clustering/data/nigerian-songs.csv时间序列世界电力使用量7-TimeSeries/data/energy.csv因此从第 6 课起几乎每个动手课都会先做数据可视化与清洗例如 2-Regression/2-Data/README.md 专门练习“为 ML 准备数据”这正是本课数据质量论点的教学闭环。6. 机器学习的应用场景原文示例与课程对应原文列举的四个典型应用方向在课程主题组中都能找到对应的动手练习从患者的病史或检查报告预测患病可能性→ 对应分类主题组 4-Classification/README.md对菜谱分类数据训练分类器方法论同构利用气象数据预测天气事件→ 对应时间序列主题组 7-TimeSeries/README.md用 ARIMA 与 SVR 预测电力使用量理解文本的情感→ 对应 NLP 主题组 6-NLP/README.md酒店评论情感分析两课检测假新闻以阻止宣传扩散→ 对应 9-Real-World/1-Applications/README.md 中的真实世界应用场景讨论。原文还指出金融、经济、地球科学、太空探索、生物医学工程、认知科学乃至人文学科都已将 ML 用于解决各自领域中“数据处理繁重”的难题。7. 本课挑战与作业动手前的最后一步Challenge挑战在纸上或用在线绘图工具手绘你对“AI、ML、深度学习、数据科学四者差异”的理解图并标注每种技术擅长解决什么问题。该挑战直接检验第 3 节的概念地图可结合 sketchnotes/ 目录中课程作者绘制的各主题手绘速记图对照检查。Assignment作业Get up and running——一项非计分作业要求复习 Python 基础按原始指引的 Python Learning Path并完成本机环境搭建确保能够运行 notebooks。完成标准即第 4 节清单全部打勾、jupyter notebook可正常打开课时笔记本。课前/课后测验由 quiz-app/ 提供的测验应用承载全课程共 52 份。自研拓展原文明确列出两条 Microsoft Learn 学习路径作为后续自学方向云上用无代码方式构建预测模型、ML 基础入门模块可在完成本课作业后按图索骥。8. 小结与下一步机器学习的本质是自动化地发现数据中的隐藏模式并以发现的洞察辅助智能决策它是 AI 的子集、深度学习又是 ML 的子集数据科学则与之交叉覆盖更宽的数据处理链条。本课程的边界是“经典 ML Scikit-learn”不碰神经网络与深度学习。完成本课后的推荐路线按第 4 节清单搭好 Python/Jupyter 环境并跑通一个空 notebook完成 Challenge手绘四概念关系图与 Assignment环境自检依序学习 ML 历史 → 公平性 → ML 建模七步技术进入 2-Regression/1-Tools/README.md 开始第一个带 Jupyter notebook 与 R 双语解答的动手课。【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表