ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ML-For-Beginners 课程开篇《机器学习入门》:从基本概念、历史沿革到公平性与核心技术全景指南

ML-For-Beginners 课程开篇《机器学习入门》:从基本概念、历史沿革到公平性与核心技术全景指南 ML-For-Beginners 课程开篇《机器学习入门》从基本概念、历史沿革到公平性与核心技术全景指南【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners本文是机器学习开源课程 ML-For-Beginners 第一单元《机器学习入门》1-Introduction的完整技术指南。该单元位于课程根目录的 translations/es/1-Introduction/README.md对应英文原版 1-Introduction/README.md是整个 12 周课程26 课、52 个测验的起点。读完本文你将系统掌握机器学习的核心定义、AI/ML/深度学习之间的关系、机器学习近三百年的关键历史脉络、构建负责任的机器学习系统所需的公平性思维以及从数据到预测的完整七步技术工作流。本节概览四节课组成的学习路径《机器学习入门》这一单元包含四节课层层递进为后续回归2-Regression、分类4-Classification、聚类5-Clustering、NLP6-NLP、时间序列7-TimeSeries与强化学习8-Reinforcement等单元打好基础课次主题西班牙语文档英文原版1什么是机器学习Introduction to MLtranslations/es/1-Introduction/1-intro-to-ML/README.md1-Introduction/1-intro-to-ML/README.md2机器学习与 AI 的历史translations/es/1-Introduction/2-history-of-ML/README.md1-Introduction/2-history-of-ML/README.md3公平性与机器学习translations/es/1-Introduction/3-fairness/README.md1-Introduction/3-fairness/README.md4机器学习的技术方法translations/es/1-Introduction/4-techniques-of-ML/README.md1-Introduction/4-techniques-of-ML/README.md每节课都配套独立的作业assignment与课前/课后测验。本节课程由 Muhammad Sakib Khan Inan、Ornella Altunyan、Jen Looper、Amy Boyd、Tomomi Imura、Chris Noring 等多位作者协作编写。第 1 课什么是机器学习热潮曲线背后的真实图景“机器学习”是当下最热门的词汇之一但它的内部机制对大多数人仍是谜。课程用 Google Trends 的“炒作曲线”hype curve直观说明了这一现象——术语热度急剧攀升并不等于大众真正理解其原理图为 Google Trends 展示的“机器学习”一词近年的炒作曲线。对初学者而言最好的方式不是被热度裹挟而是通过具体、可操作的示例一步步理解机器学习到底是什么。从人脑学习到机器学习的类比课程以一个精妙的类比切入我们生活在一个充满谜团的宇宙中从霍金、爱因斯坦到每一个孩子人类的天性就是持续学习——孩子通过大脑和感官感知环境事实逐渐习得生活中的隐藏模式并据此构建识别模式的逻辑规则。这种持续“发现隐藏模式 → 基于模式创新”的能力与神经科学中的大脑可塑性概念相关。人类大脑感知真实世界、处理信息、做出理性决策并采取行动这就是“智能行为”。当我们将这一过程的副本编程到机器上时就称之为人工智能AI。核心术语辨析AI、ML、深度学习、数据科学这些术语常常被混用但课程给出了清晰的界定机器学习ML是人工智能的一个重要子集。ML 关注的是使用专门算法从感知到的数据中发现有意义的信息和隐藏模式以佐证理性决策过程。图为 AI、ML、深度学习与数据科学之间关系的示意图。本课程覆盖什么、不覆盖什么课程明确声明只覆盖“经典机器学习”的核心概念主要使用Scikit-learn这一教学友好的库覆盖机器学习核心概念、ML 历史、ML 与公平性、回归技术、分类技术、聚类技术、NLP 技术、时间序列预测技术、强化学习、ML 的真实应用。不覆盖深度学习、神经网络、广义 AI——这些属于更进阶的领域扎实的经典 ML 基础正是学习它们的前提。为什么要学机器学习从系统角度看机器学习被定义为创建能够从数据中学习隐藏模式、以辅助智能决策的自动化系统。这一动机与人类大脑基于外界感知数据学习的方式有松散的对应关系。课程还特别点出两个关键论断数据质量决定模型上限高质量数据能提升模型性能低质量或噪声数据即使使用先进的算法也会导致不准确的预测。应用无处不在预测疾病概率、利用气象数据预测气候事件、理解文本情感、检测假新闻与阻断宣传都是 ML 的典型场景金融、经济、地球科学、太空探索、生物医学工程甚至人文学科都在用 ML 解决领域内的数据处理难题。第 2 课机器学习与 AI 的历史值得铭记的奠基性发现虽然 AI 与 ML 作为独立研究领域在 20 世纪 50 年代才逐渐成型但支撑它们的算法、统计、数学与计算发现要早得多年份发现意义1763 / 1812贝叶斯定理及其前身描述基于先验知识的事件发生概率是推断的基础1805最小二乘法Adrien-Marie Legendre用于数据拟合课程后续回归单元会深入讲解1913马尔可夫链Andrey Markov描述基于先前状态的可能事件序列1957感知机Frank Rosenblatt一种线性分类器是深度学习进展的基石1967最近邻算法最初用于路径规划在 ML 语境下用于模式检测1970反向传播用于训练前馈神经网络1982循环神经网络RNN由前馈网络衍生可创建时间图1950–1956从图灵测试到达特茅斯会议1950 年艾伦·图灵Alan Turing为“会思考的机器”这一概念奠定基础并创设了图灵测试——这一主题会在课程的 NLP 单元中再次出现。1956 年的达特茅斯夏季人工智能研究项目是 AI 作为学科的奠基性事件“人工智能”一词在此被正式提出。项目负责人、数学教授 John McCarthy 期望“原则上学习的每个方面或智力的任何其他特征都可以被精确描述从而可以制造一台机器来模拟它。”参与者还包括该领域的另一位巨擘 Marvin Minsky。这次研讨会促成了符号方法、早期专家系统领域受限系统以及演绎系统与归纳系统之争等一系列讨论。1956–1974“黄金年代”从 50 年代到 70 年代中期乐观情绪高涨——1967 年 Minsky 曾自信断言“在一代人的时间内……创造‘人工智能’的问题将基本得到解决”。这一时期的成果包括Shakey 机器人能够“智能地”移动并决策如何执行任务图片见课程目录。Eliza早期的“聊天机器人”能与人对话并扮演初级的“心理治疗师”角色。积木世界Blocks world一个微世界的典型示例借助 SHRDLU 等库推动了语言处理研究。1974–1980第一次“AI 寒冬”到 70 年代中期人们发现“智能机器”的复杂度被严重低估而其承诺相对当时的算力而言被过度夸大资金枯竭、信心受挫。核心问题包括算力限制、组合爆炸随着对计算机要求提高训练参数数量呈指数增长而算力未同步演进、数据稀缺以及问题本身被质疑——图灵测试受到“中文房间”理论的挑战将 ELIZA 这类“治疗师”引入社会的伦理也遭到拷问。同时“杂乱派scruffyvs 整洁派neat”两种研究路线分野形成杂乱派反复调参直至得到理想结果整洁派专注逻辑与形式化问题求解。80 年代由于机器学习系统需要可复现结果更可解释的“整洁派”逐渐占据上风。1980 年代专家系统与之后的冷热交替80 年代专家系统成为首批真正成功的 AI 软件形态——它是混合系统一部分是定义业务需求的规则引擎另一部分是借助规则系统推导新事实的推理引擎。然而 1987–1993 年专家系统专用硬件过度专业化个人电脑的兴起又与之竞争算力民主化开启为后来的大数据爆发铺平了道路。1993–2011 年数据和算力双双迎来拐点数据量快速增长并广泛可得2007 年智能手机问世尤为关键算力指数级扩张算法同步进化ML 从“狂野岁月”走向真正的成熟学科。今天ML 与 AI 已触及生活的几乎每个角落同时也要求我们审慎理解这些算法对人类生活的风险与潜在影响。第 3 课公平性与负责任机器学习为什么公平性至关重要模型正在参与医疗诊断、贷款审批、欺诈检测等日常决策因此它们必须运行良好、结果可靠。课程抛出一系列尖锐问题当训练数据缺乏某些人口群体种族、性别、政治观点、宗教或不成比例地代表某些群体时会发生什么当模型输出被解读为偏向某个群体时后果是什么当模型产生有害结果时谁该负责“不公平”涵盖对特定群体如按种族、性别、年龄或残障状态定义的群体的负面影响即“伤害”。课程将主要伤害分类为分配不公Allocation例如偏向某一性别或族群。服务质量Quality of service为特定场景训练的数据无法应对更复杂的现实导致服务表现不佳——例如洗手液感应器无法识别深色皮肤的人。贬损Denigration不公正地批评或标签化某物某人例如图像标注技术曾将深肤色人群错误标注为“大猩猩”。过度或不足代表Over/under-representation某个群体在特定职业中缺席而继续强化这一现象的服务或功能即构成伤害。刻板印象Stereotypes将预设属性与特定群体关联例如英语-土耳其语翻译系统因性别刻板关联词而产生翻译偏差课程配有英文→土耳其语及回译示例图见 1-Introduction/3-fairness/images/ 目录。负责任 AI 的六大原则课程围绕六个基本原则展开公平性FairnessAI 系统应公平对待所有人避免以不同方式影响相似人群。训练数据常携带人类的继承性偏见且往往是无意引入的。可靠性与安全性Reliability SafetyAI 系统在正常与意外条件下都应可靠、安全、一致。例如自动驾驶 AI 必须考虑夜间、雷暴、暴风雪、儿童过街、宠物、道路施工等所有可能场景。包容性InclusivenessAI 系统应赋能所有人。全球有 10 亿残障人士设计时应识别并消除可能无意排斥用户的障碍。隐私与安全Privacy SecurityAI 系统必须安全并尊重个人隐私需考虑数据来源与完整性用户提交还是公开可得保护敏感信息并抵御攻击。GDPR 等法规推动了行业在隐私上的显著进步但 AI 面临“更多个人数据 → 更有效系统”与隐私之间的张力同时 AI 也在提升安全例如现代杀毒软件多由 AI 启发式驱动。透明度TransparencyAI 系统应可被理解。必须能解释系统行为、识别性能问题、安全隐患、偏见与意外结果。例如银行用 AI 辅助消费贷款决策时应能检验结果并理解哪些数据影响了推荐。问责制Accountability设计与部署 AI 系统的人必须对系统运行方式负责。人脸识别是典型敏感用例——既能用于寻找失踪儿童也可能被政府用于持续监控个体、危及基本自由。影响评估与负责任的调试课程强调训练模型前应进行影响评估Impact Assessment明确系统目的、预期用途、部署位置、交互对象。评估聚焦四个方面对个体的不利影响识别限制与不兼容用途、数据需求如 GDPR/HIPAA 等数据法规、数据来源与数量是否足够、影响摘要列出可能伤害并在 ML 生命周期内持续复查、针对六大原则的可衡量目标评估每个原则的达成情况与差距。调试 AI 系统如同调试软件。传统性能指标是定量聚合不足以分析模型如何违反负责任 AI 原则且模型本身是难以解释的“黑箱”。课程预告了后续将使用Responsible AI 面板进行系统化调试支持四类分析错误分析识别影响公平性或可靠性的错误分布、模型概览发现数据队列间的性能差异、数据分析理解数据分布、识别潜在偏见、模型可解释性理解什么影响了预测支撑透明度与问责。第 4 课机器学习的技术工作流七步构建机器学习流程与常规开发工作流不同构建、使用并维护 ML 模型及其数据是一个独特的过程课程将其拆解为七个步骤确定问题Decide the question大多数 ML 流程始于一个简单条件程序或规则引擎无法回答的问题这类问题往往围绕基于数据集合的预测。收集与准备数据Collect prepare data数据的质量有时还有数量决定了回答问题的能力。可视化是此阶段的重要环节同时要把数据划分为训练组与测试组。选择训练方法Choose a training method依据问题与数据特性选择训练方式这是最需要领域经验与大量实验的环节。训练模型Train the model用训练数据驱动算法识别模式模型内部权重可被调整以优化效果。评估模型Evaluate the model用从未见过的测试数据检验模型表现。参数调整Parameter tuning根据表现用不同参数控制算法行为的变量重做流程。预测Predict用全新输入检验模型精度。构建前的准备数据、特征与目标收集数据参考公平性课程的教训谨慎收集、留意数据来源与固有偏见、记录数据出处。准备数据多源数据可能需要归一化可将字符串转为数字如聚类单元 5-Clustering/1-Visualize/README.md 的做法基于原数据生成新数据如分类单元 4-Classification/1-Introduction/README.md清洗编辑数据如 Web 应用单元 3-Web-App/README.md 的做法按训练技术需要随机化与混洗。特征Feature数据的可测量属性常表现为列标题如“日期”“大小”“颜色”代码中通常记为X代表用于训练模型的输入变量。目标Target你要预测的东西代码中通常记为y是数据问题的答案——例如“12 月哪种颜色南瓜最便宜”“旧金山哪个社区房价最好”有时也叫标签属性label。特征选择 vs 特征提取两者并不相同——特征提取从原始特征函数中创建新特征特征选择则返回特征的子集。可视化数据借助 Seaborn、MatPlotLib 等库可视化能揭示隐藏的相关性也能暴露偏见或不平衡数据如 4-Classification/2-Classifiers-1/README.md 所述。划分数据集训练前把数据集划分为两个或多个不等但仍有代表性的部分——训练集拟合模型占大部分、测试集独立数据用于确认模型表现、验证集更小的独立样本用于调优超参数或模型架构数据量小或问题简单时可能不需要如时间序列单元 7-TimeSeries/1-Introduction/README.md 的说明。构建、评估与调参训练方法选择依赖问题与数据性质。课程使用 Scikit-learn其用户指南提供了大量训练方式通常需要尝试多种方法用未见数据检验精度、偏见等问题后择优。训练模型即“拟合fit”在许多 ML 库中对应model.fit调用——传入特征数组通常为X与目标变量通常为y。这在仓库中有大量实证例如线性回归单元 2-Regression/3-Linear/README.md 中的代码from sklearn.linear_model import LinearRegression from sklearn.metrics import mean_squared_error from sklearn.model_selection import train_test_split评估模型训练可能历经多次迭代大型模型需要多个“epoch”随后用模型未曾分析的测试数据子集衡量质量并打印质量指标表。欠拟合与过拟合模型拟合指的是底层函数对未见数据的分析准确度。欠拟合的模型对训练数据与未见数据都无法准确分析过拟合的模型则把训练数据的细节与噪声都学得过于透彻对训练数据预测得过好泛化能力反而下降图为过拟合与欠拟合的概念示意。参数调整Hyperparameter tuning初训完成后通过调整“超参数”改进模型质量。预测阶段则使用全新数据检验精度——在 Web 应用等“应用型”ML 场景中可能涉及捕获用户输入如点击按钮建立变量并送入模型进行推理这正是 3-Web-App 单元将要演示的完整链路。开始之前环境准备与课程配套资源课程要求学习者在进入正课前完成环境配置这也是本单元 README 明示的“Getting started”环节安装 Python并配置文本编辑器/开发环境本课程代码主要在 Jupyter Notebook如各单元根目录的 notebook.ipynb中运行学习 Python 基础这是数据科学家常用的编程语言安装 Node.js 与 npm课程偶尔会用它构建 Web 应用如 3-Web-App同时建议准备 Visual Studio Code 同时支持 Python 与 JavaScript 开发创建 GitHub 账号并 fork 本课程仓库README.md以便独立使用熟悉 Scikit-learn本课程各单元反复引用的 ML 库其官方用户指南是重要参考资料。每节课均配有课前/课后测验、视频讲解、思考题✅ 标记、挑战、复习与自主研读建议以及作业文件如各课目录下的 assignment.md。课程还提供了视觉化的 sketchnote 笔记如 sketchnotes/ml-history.png 与 sketchnotes/ml-fairness.png便于快速回顾历史脉络与公平性要点。结语《机器学习入门》单元的价值在于它先厘清“机器学习是什么、不是什么”排除深度学习与神经网络以聚焦经典 ML再用历史长河证明“数据、算力与算法”三者的协同演进继而以公平性视角警醒读者“模型影响真实人生”最后给出从问题定义到预测部署的七步可操作方法。掌握本单元后你就能带着“负责任”的意识沿着 2-Regression 到 9-Real-World 的路线逐一实践回归、分类、聚类、NLP、时间序列与强化学习最终成为能独立构建完整 ML 解决方案的工程师。【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表