ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Data-Science-For-Beginners 官方排障指南:Python、Jupyter、Quiz App、Git 与 Docsify 问题完整解决方案

Data-Science-For-Beginners 官方排障指南:Python、Jupyter、Quiz App、Git 与 Docsify 问题完整解决方案 Data-Science-For-Beginners 官方排障指南Python、Jupyter、Quiz App、Git 与 Docsify 问题完整解决方案【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本篇技术指南完整覆盖 Data Science for Beginners10 周、20 课的数据科学入门课程官方排障文档的全部问题域从 Python/Jupyter 环境搭建、pip 依赖冲突到 Jupyter Notebook 运行故障、quiz-app 前端应用启动失败、Git 克隆与 SSH 认证、Docsify 文档站部署再到 CSV 数据加载与内存性能问题。读完后你可以针对本课程仓库的每个组件给出可复制、可验证的修复命令并知道在求助前应收集哪些环境信息。本指南对应仓库根目录的 TROUBLESHOOTING.md英文版为权威版本爱沙尼亚语版 translations/et/TROUBLESHOOTING.md 为自动翻译存在出入时应以英文版为准。问题域总览官方排障文档将问题划分为 9 大类与仓库中实际存在的组件一一对应问题域对应仓库组件Python / Jupyter 环境各课时目录下的notebook.ipynb、assignment.ipynb包与依赖INSTALLATION.md 中列出的jupyter pandas numpy matplotlib seaborn scikit-learnJupyter Notebook 操作全部.ipynb文件每课时一份Quiz 应用quiz-app/Vue 2 Vue CLI 项目Git / GitHub仓库克隆与 SSH 访问Docsify 文档站index.html、docs/_sidebar.md数据与文件data/ 目录下的 CSV/TSV 数据集性能Notebook 与浏览器求助流程GitHub Issues / 社区Python 与 Jupyter 环境问题问题python: command not found或版本不对排查与解决macOS/Linux# 检查 Python 版本 python --version python3 --version # 如果 Python 3 安装为 python3创建别名 # 在 ~/.bashrc 或 ~/.zshrc 中添加 alias pythonpython3 alias pippip3 # 或者直接显式使用 python3 python3 -m pip install jupyterWindows 解决步骤从 python.org 官方站点重新安装 Python安装过程中务必勾选 “Add Python to PATH”重启终端/命令提示符。适用前提INSTALLATION.md 要求 Python 3.7 及以上版本因此排查时首先要确认版本达标而不只是确认python命令存在。问题虚拟环境无法激活虚拟环境是本课程推荐的做法见 INSTALLATION.md Step 4python -m venv venv。激活失败分平台处理Windows执行策略错误# 若提示执行策略错误 Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser # 然后激活 venv\Scripts\activatemacOS/Linux脚本无执行权限# 确保 activate 脚本可执行 chmod x venv/bin/activate # 然后激活 source venv/bin/activate验证是否激活成功# 提示符前缀应出现 (venv) # 检查 Python 指向 which python # 应指向 venv 目录问题Jupyter 报 Kernel not found 或 Kernel keeps dying重新安装内核# 重新安装内核 python -m ipykernel install --user --namedatascience --display-namePython (Data Science) # 或者只安装默认内核 python -m ipykernel install --user # 重启 Jupyter jupyter notebook问题Jupyter 中选到的 Python 版本不对不是虚拟环境里的那个这是初学者最常踩的坑Jupyter 启动的是全局内核而你pip install的包装在虚拟环境里。解决方法是把 Jupyter 装进虚拟环境并注册内核# 先激活虚拟环境再在其中安装 Jupyter source venv/bin/activate pip install jupyter ipykernel # 注册内核 python -m ipykernel install --user --namevenv --display-namePython (venv) # 在 Jupyter 中通过 Kernel - Change kernel - Python (venv) 切换包与依赖问题问题ModuleNotFoundError: No module named pandas或其他模块# 先确保虚拟环境已激活 source venv/bin/activate # macOS/Linux venv\Scripts\activate # Windows # 安装缺失的包 pip install pandas # 或一次装齐课程常用包 pip install jupyter pandas numpy matplotlib seaborn scikit-learn # 验证安装 python -c import pandas; print(pandas.__version__)这里的包清单与 INSTALLATION.md Step 5 完全一致可视为本课程的最小依赖集。问题pip install因权限失败# 方案一使用 --user 标志 pip install --user package-name # 方案二推荐使用虚拟环境 python -m venv venv source venv/bin/activate pip install package-name问题pip install报 SSL 证书错误# 先升级 pip python -m pip install --upgrade pip # 临时绕过信任 PyPI 官方主机注意这只是临时手段 pip install --trusted-host pypi.org --trusted-host files.pythonhosted.org package-name问题包版本互相冲突# 重建一个干净的虚拟环境 python -m venv venv-new source venv-new/bin/activate # Windows 用 venv-new\Scripts\activate # 如需锁定版本 pip install pandas1.3.0 pip install numpy1.21.0 # 或让 pip 自行解析依赖 pip install jupyter pandas numpy matplotlib seaborn scikit-learnJupyter Notebook 运行问题问题jupyter notebook命令不存在# 安装 Jupyter pip install jupyter # 或者绕过 PATH 问题用 python -m 方式启动 python -m jupyter notebook # 如 pip 把命令装到用户目录macOS/Linux export PATH$HOME/.local/bin:$PATH问题Notebook failed to load 或保存失败检查文件权限ls -l notebook.ipynb chmod 644 notebook.ipynb # 必要时检查文件是否损坏Notebook 本质是 JSON 文件可用文本编辑器打开检查结构若已损坏把内容迁移到一个新建 notebook 中。清理 Jupyter 缓存jupyter notebook --clear-cache问题单元格卡在In [*]状态或执行极慢按顺序尝试中断内核点击 “Interrupt” 按钮或连续按I, I重启内核Kernel 菜单 → Restart检查代码中的死循环清空全部输出Cell → All Output → Clear。问题matplotlib 图形不在 notebook 中显示# 在 notebook 顶部添加魔法命令 %matplotlib inline import matplotlib.pyplot as plt # 创建图形 plt.plot([1, 2, 3, 4]) plt.show() # 确保调用 show()需要交互图形时的替代方案%matplotlib notebook # 或 %matplotlib widgetQuiz 应用quiz-app问题quiz-app 是一个 Vue 2 前端项目。从 quiz-app/package.json 可以看到vue: ^2.6.11、vue-router: ^3.4.9、vue-i18n: ^8.22.2构建工具为vue/cli-service: ~4.5.0脚本为serve/build/lint。Vue CLI 4.5 属于较老工具链这也是官方文档要求 Node.js 12.x 及以上版本的原因——版本过新的 Node 上偶发的依赖安装问题可用下面的--legacy-peer-deps方案兜底。问题npm install失败# 清理 npm 缓存 npm cache clean --force # 删除 node_modules 和 package-lock.json rm -rf node_modules package-lock.json # 重新安装 npm install # 仍失败时尝试忽略 peer 依赖冲突 npm install --legacy-peer-deps问题npm run serve无法启动# 检查 Node.js 版本 node --version # 应为 12.x 或更高 # 重装依赖 cd quiz-app rm -rf node_modules package-lock.json npm install # 换一个端口 npm run serve -- --port 8081问题端口 8080 被占用# 查找并结束占用 8080 端口的进程 # macOS/Linux lsof -ti:8080 | xargs kill -9 # Windows netstat -ano | findstr :8080 taskkill /PID PID /F # 或者直接使用其他端口 npm run serve -- --port 8081INSTALLATION.md 中说明 quiz 应用默认服务在http://localhost:8080端口冲突时换 8081 即可。问题页面加载了但显示空白排查顺序打开浏览器控制台F12查看报错清除浏览器缓存与 Cookie换一个浏览器试试确认 JavaScript 已启用检查是否有广告拦截插件干扰。# 重新构建后再启动 npm run build npm run serveGit 与 GitHub 问题问题git: command not foundWindows从 git-scm 官方站点安装安装后重启终端。macOS注意若尚未安装 Homebrew需先按 Homebrew 官方说明安装它。# 通过 Homebrew 安装 brew install git # 或者安装 Xcode Command Line Tools xcode-select --installLinuxsudo apt-get install git # Debian/Ubuntu sudo dnf install git # Fedora问题git clone因认证失败# 使用 HTTPS 地址克隆本课程仓库 git clone https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners.git # 若账号开启 2FA需使用 Personal Access Token # 在 GitHub 的 Settings → Developer settings → Tokens 中创建 # 克隆时把 Token 当作密码输入问题Permission denied (publickey)SSH 认证失败# 生成 SSH 密钥 ssh-keygen -t ed25519 -C your_emailexample.com # 把密钥加入 ssh-agent eval $(ssh-agent -s) ssh-add ~/.ssh/id_ed25519 # 把公钥添加到 GitHub # 查看公钥cat ~/.ssh/id_ed25519.pub # 然后粘贴到 GitHub 的 SSH Keys 设置页Docsify 文档站问题本仓库的文档站由 Docsify 驱动。index.html 中的关键配置是window.$docsify { name: Data Science for Beginners, repo: ..., relativePath: true }其中relativePath: true决定了所有 Markdown 图片路径都相对于各自所在的 Markdown 文件解析——这一点直接决定了下面“图片显示不出来”问题的排查方向。另外仓库根目录还有 docsifytopdf.js配置docsify-to-pdf把 docs/_sidebar.md 目录树导出为 PDF对应根 package.json 中的convert: node_modules/.bin/docsify-to-pdf脚本属于可选功能与日常文档浏览故障无关。问题docsify: command not found# 全局安装 docsify-cli npm install -g docsify-cli # macOS/Linux 权限不足时 sudo npm install -g docsify-cli # 验证 docsify --version # 仍找不到命令时把 npm 全局 bin 目录加入 PATH npm config get prefix # 查看 npm 全局前缀 export PATH$PATH:/usr/local/bin # 写入 ~/.bashrc 或 ~/.zshrc问题Docsify 服务起来了但文档不加载# 确认当前处于仓库根目录 cd Data-Science-For-Beginners # 确认入口文件存在Docsify 依赖根目录 index.html ls index.html # 指定端口启动 docsify serve --port 3000 # 打开浏览器控制台F12查看具体报错问题图片显示为断链图标检查图片路径是否为相对路径呼应 index.html 中relativePath: true的配置各课时 Markdown 中的图片应写成相对于该 Markdown 文件的路径如images/xxx.png确认图片文件确实存在于仓库对应目录中清除浏览器缓存检查文件扩展名大小写是否一致部分 Linux 系统对大小写敏感。以课时目录为例图片约定存放在各课时下的images/子目录如3-Data-Visualization/images/bee.jpg路径写错一级目录是最常见的断链原因。数据与文件问题本课程的数据集集中在 data/ 目录birds.csv鸟类测量数据442 条记录列为 Name/ScientificName/Category/Order/Family/Genus/ConservationStatus/Min~MaxLength/Min~MaxBodyMass/Min~MaxWingspan、taxi.csv、emails.csv、mushrooms.csv8000 余行、honey.csv以及diabetes.tsv、SOCR_MLB.tsv两个 TSV 文件。可视化课时的 notebook 使用相对于 notebook 自身位置的路径加载数据例如 09-visualization-quantities 的解答 notebook 中写的是birds pd.read_csv(../../../data/birds.csv)这说明 notebook 的工作目录是课时目录而非仓库根目录——理解这一点是解决下面FileNotFoundError的钥匙。问题加载数据时报FileNotFoundErrorimport os # 先看当前工作目录到底是什么 print(os.getcwd()) # 方案一用绝对路径 data_path os.path.join(os.getcwd(), data, filename.csv) df pd.read_csv(data_path) # 方案二用相对于 notebook 所在位置的相对路径 df pd.read_csv(../data/filename.csv) # 验证文件是否存在 print(os.path.exists(data/filename.csv))问题CSV 读取报错import pandas as pd # 尝试不同编码 df pd.read_csv(file.csv, encodingutf-8) # 或 df pd.read_csv(file.csv, encodinglatin-1) # 或 df pd.read_csv(file.csv, encodingISO-8859-1) # 规范缺失值标记 df pd.read_csv(file.csv, na_values[NA, N/A, ]) # 非逗号分隔时显式指定分隔符 df pd.read_csv(file.csv, delimiter;)针对本仓库的具体提示diabetes.tsv和SOCR_MLB.tsv是制表符分隔的 TSV应使用pd.read_csv(data/diabetes.tsv, sep\t)读取birds.csv首行含 BOM 头若出现列名异常可用encodingutf-8-sig处理。问题大文件触发MemoryError# 分块读取 chunk_size 10000 chunks [] for chunk in pd.read_csv(large_file.csv, chunksizechunk_size): # 逐块处理 chunks.append(chunk) df pd.concat(chunks) # 或者只读取需要的列 df pd.read_csv(file.csv, usecols[col1, col2]) # 使用更紧凑的 dtype df pd.read_csv(file.csv, dtype{column_name: int32})性能问题Notebook 执行很慢重启内核并清空输出Kernel → Restart Clear Output关闭不用的 notebook改用向量化写法# 差Python 循环 result [] for x in data: result.append(x * 2) # 好NumPy/Pandas 向量化 result data * 2开发阶段先抽样df_sample df.sample(n1000) # 或 df.head(1000)浏览器崩溃或无响应关闭不用的标签页清理浏览器缓存调高浏览器内存上限Chromechrome://settings/system改用 JupyterLabpip install jupyterlab jupyter lab求助前与如何求助提问前先查阅本篇TROUBLESHOOTING.md检索仓库已有的 GitHub Issues重读 INSTALLATION.md 与 USAGE.md把完整报错信息拿去搜索。提问时应包含的信息操作系统Windows / macOS / Linux注明发行版Python 版本运行python --version获取完整报错信息复现步骤出错前做了什么已尝试的方案你已经试过什么。官方文档给出的示例格式**Operating System:** macOS 12.0 **Python Version:** 3.9.7 **Error Message:** ModuleNotFoundError: No module named pandas **Steps to Reproduce:** 1. Activated virtual environment 2. Started Jupyter notebook 3. Tried to import pandas **What Ive Tried:** - Ran pip install pandas - Restarted Jupyter相关文档INSTALLATION.md —— 环境搭建步骤本指南所有前提步骤的出处USAGE.md —— 课程使用方法CONTRIBUTING.md —— 贡献指南README.md —— 课程总览quiz-app/README.md —— quiz 应用本地运行与 Azure 静态网站部署说明【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表