ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

一年从零入门大模型:给小白的AI学习收藏指南

一年从零入门大模型:给小白的AI学习收藏指南 本文分享了作者从零开始学习AI和大模型的完整历程包括克服数学障碍、啃英文书籍、搭建模型等经验。作者建议初学者从深度学习入手推荐《深度学习的数学》等实用资料并强调设定小目标、坚持学习的重要性。文末附上作者筛选的核心学习资源及评价适合想入门AI的小白参考。2025年1月 DeepSeek 横空出世大家都在讨论”这个模型参数量多大“”上下文窗口够不够“我看着这些陌生的术语一个词都插不上。更扎心的是那时候我连”参数“和”上下文“到底指什么都不知道。那一刻我意识到AI 已经不是未来趋势了它就是现在。而我还站在门外。对于一个毕业 10 多年、从未学过人工智能的人来说这个念头既兴奋又让人发怵。但转念一想——如果 AI 是普通人难得一遇的机会那最好的入场时间就是现在。于是 2025 年初我下了决心用一年时间从零开始学 AI找到自己的方向。不知从哪里入门刚开始和所有人一样上网搜”AI 怎么学“结果大部分推荐的是吴恩达的视频课。看完了他的《提示词工程》对怎么使用 AI 有了粗浅的认识但完全不成体系。当时最大的困惑是AI 的知识体系太庞大了。机器学习、深度学习、大语言模型、强化学习——这些词到底什么关系花了些功夫终于搞清楚现在流行的大模型本质上是深度学习的一部分。于是我决定从深度学习开始啃。网上有人推荐李沐的《动手学深度学习》B 站有配套视频。兴冲冲翻开书看到数学基础那章的时候直接傻眼——满屏的偏导符号对于一个毕业 10 多年没碰过公式的人来说跟天书差不多。李沐讲得虽然好但数学推导默认你是有基础的跳跃性很大。当时真的想合上书放弃了。后来找到一本日本人写的《深度学习的数学》这本书救了我。它最大的特点是每章最后一节会用 Excel 把深度学习的概念从头模拟一遍——梯度下降不再是抽象的公式而是一行行看得见的数字变化。我对着书把梯度下降的推导翻来覆去看了好几遍总算通了。春节学习第一本英文技术书学到这里的时候国外刚出了一本《Hands on Large Language Model》吴恩达也推荐了。当时国内没有中文版硬着头皮开始看人生中第一本全英文技术书。那段时间刚好是春节假期。每天晚上安顿小孩睡觉后一边翻书一边查单词大概学了一个月才看完。说实话这本书用了很多漂亮的图但讲得不算细代码基本都是直接调接口加上全英文看完之后对大模型训练、微调的理解还很模糊。但我得到了一个意料之外的收获我不再害怕英文资料了。 一个月下来记住了大量大模型领域的英文术语这为后面直接看英文论文、听英文课程铺平了路。另一个收获是在做书中实验时第一次接触了 Google Colab——可以免费白嫖 GPU对于没有硬件的人来说简直是福音。记得上次在春节这样努力学习还是高三虽然大模型知识没学多少但是把“英文”这道心理门槛拆掉了。后面的学习资源有很多都是英文的看到也不会发怵了。午休时啃完《动手学习深度学习》接下来重新挑战《动手学深度学习》。反思了一下之前没坚持下去的真正原因是没有目标看到哪儿算哪儿很容易就停了。这次给自己定了一个目标每天至少看完一节。平时上班没时间主要利用中午午休和晚上小孩睡觉后学习。遇到卷积神经网络那章看了几遍都看不明白上网搜到了台湾大学李宏毅的《深度学习》视频。李宏毅讲得清楚又有趣尤其是卷积那块把复杂的操作讲得很直观。从那以后我的学习模式固定了下来先看书不懂的地方再去找李宏毅的对应章节。从 3 月初到 5 月初两个月终于把《动手学深度学习》啃完了。为了加深对 Transformer 的理解还找了一篇博客《Transformers Laid Out》跟着实操。这篇文章从初学者视角讲解《Attention Is All You Need》论文中每个部分的含义并用 PyTorch 一步步带你把 Transformer 编码实现。最后代码虽然跑通了但过程报了不少错——感觉作者写完了代码但没有充分调试。不过瑕不掩瑜这篇文章对 Transformer 原理的讲解是目前我看过最清晰的。这段时间最大的心得设定一个很小的、能坚持的每日目标养成习惯后更容易坚持下去动手造轮子搭建大模型在图灵书的微信群里看到《从零构建大模型》中文版正好接上了我的进度。如果要我推荐一本大模型入门书目前这本排第一。作者用 PyTorch 带着你从模型实现、预训练到微调像搭积木一样从零完成自己的大模型。即使没有深度学习的数学基础也能顺着逻辑看明白。大概一个月看完基本上摸清了大模型的核心脉络。7 月份微博上一个叫九原客的博主推荐了斯坦福公开课 CS336Language Modeling from Scratch。这门课的目标是引导学生从零开发自己的语言模型获得全面理解。印象最深的是听了一节课作业就要从零实现一个大模型包括 BPE 分词——光这一个作业估计要写大半个月。最后参考了一些网友的实现才把第一个作业写完。这门课和工程结合得特别紧学完并完成全部作业的话收获会非常大。但说实话投入时间也真的很大后来还是没能坚持到底。用了一个月搭出一个自己的大模型哪怕它很简陋但那种掌控感是看多少书都给不了的。第一次微调模型对大模型原理有了底之后开始尝试实战——用微调让模型根据需求自动生成测试用例。选用的是 LLaMA-Factory 框架网上教程很多上手比预想的简单。但真正跑起来后问题来了数据量太少最终效果并不好。虽然结果不尽如人意但完整走了一遍微调的流程从准备数据集、配置参数到看 loss 曲线下降那种亲身参与的感觉还是很不一样。拿到第一个Coursera证书8 月接下来的十来天用豆包搭建了工作流了解到 RAG 这个概念然后学完了 DeepLearning.AI 上的 RAG 课程拿到了人生第一个 Coursera 证书。这门课老师讲得很清楚结合课程中的小实验对 RAG 会有比较全面的理解——多亏了之前啃完那本英文书这次全英文的课程基本能听懂了。之后又学了 Hugging Face 的微调课程但这门课后来没更新只学了两章作业提交了也没有回应。从 9 月一直到 11 月底学习基本停滞了。原因很现实一是没有找到明确的学习方向不知道接下来该学什么二是工作忙起来后之前每天一节的节奏一断就很难再接上。这种停滞期可能是自学者最难熬的阶段——不是学不会而是不知道往哪走。坚持不放弃直到今年 1 月才重新捡起节奏学完了 DeepLearning.AI 上的强化学习课程拿到了第二张 Coursera 证书。说实话这门课讲得一般课程实验的重点不是很突出但对强化学习的基本概念有了入门级的理解。最近一段时间重心转移到了 AI Agent 上——除了一直在用 Cursor最近用得比较多的 Claude Code、还用了下Open Code 和 Hermes从学 AI 是怎么工作转变到用 AI 来工作通过这段时间的尝试前进的方向也开始有了一点轮廓。以下是我这一年来筛选过的核心学习资料附上我的真实评价《深度学习的数学》如果你的数学和我一样早就还给了老师这本书比任何视频课都管用。它不假设你有任何基础每章用 Excel 把抽象的公式变成看得见的数字。我就是靠它把梯度下降真正看懂的。《Hands on Large Language Model》全英文图画得很漂亮但写得不难。《动手学深度学习》 B 站李沐视频系统、全面适合作为深度学习的入门教材。但数学部分默认你有基础不懂的地方可以用下面李宏毅视频补。深度学习台湾大学李宏毅当你某个概念看书看不懂的时候去找李宏毅的对应章节。他讲得清楚、幽默。Transformers Laid Out从初学者视角用 PyTorch 带你实现 Transformer对《Attention Is All You Need》论文的每个部分拆解得很清楚。代码部分有些 bug 需要自己调但作为理解 Transformer 的辅助材料非常出色。《从零构建大模型》如果你只想买一本书来了解大模型怎么造买这本。像搭积木一样带着你从零完成模型实现、预训练和微调不需要数学基础也能顺着逻辑看明白。斯坦福 CS336Language Modeling from Scratch引导学生从零完整开发语言模型和工程结合很紧。作业量大一个作业可能写大半个月适合有大块时间和一定基础的人。安德烈·卡帕西深入探索大语言模型AI 大神卡帕西以 DeepSeek 为例整整 3 个半小时深入讲解 LLM 和强化学习原理。DeepLearning.AI 的 RAG 课程老师讲得很清楚课程附带小实验学完对 RAG 会有比较全面的理解学完还能拿一张 Coursera 证书。以上就是我这一年走过的路。如果你也是一个非科班出身、数学不太好、但很想学 AI 的人希望我的经历能让你少走一点弯路。最后2026 年一晃已经过半AI 大模型的热潮不仅没有降温反而持续升温金融行业用大模型做风控、医疗依靠 AI 解析影像电商、制造、教育各行各业都在把 AI 融入日常业务。曾经热闹的 “百模大战”早就告别单纯比拼模型参数正式进入落地应用时代。现在企业疯狂紧缺一类人才懂业务、懂 AI、能做出可上线项目的大模型开发工程师岗位缺口大薪资待遇十分可观。风口再好不如手握高薪 offer 实在。行情火热普通人、程序员该怎样从零入门大模型抓住这波机会今天整理好【2026 最新版】AI 大模型全套免费学习资源覆盖零基础入门、项目实战、理论知识、大厂面试从基础一路进阶。所有资料分类归档没有多余杂料无套路免费分享给想要入局 AI 赛道的程序员与零基础小白扫码免费领取全部内容1、大模型系统化完整学习路线2、大模型经典书籍文档3、AI 大模型最新行业研究报告4、企业级实战项目 完整配套源码5、大厂大模型面试真题汇总6、这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表