ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何安装 Playwright 让 Aider 的 /web 命令抓取动态网页

如何安装 Playwright 让 Aider 的 /web 命令抓取动态网页 如何安装 Playwright 让 Aider 的 /web 命令抓取动态网页【免费下载链接】aideraider is AI pair programming in your terminal项目地址: https://gitcode.com/GitHub_Trending/ai/aiderAider 的/web url命令可以把网页抓取成 Markdown 文本并作为一条消息加入聊天适合把冷门 API 的文档页、模型训练截止日之后的最新库文档等喂给模型。但默认情况下 Aider 用httpx库抓取网页只能覆盖一部分页面有些站点会显式拦截 httpx 这类工具的请求有些站点则依赖 JavaScript 渲染页面内容仅靠 httpx 拿不到正文来源optional.md。解决方式就是给 Aider 装上 Playwright 及其 Chromium 浏览器之后/web会用真实浏览器加载页面再抓取。准备条件已安装 Aider。安装命令来源optional.md、browser.mdpython -m pip install -U aider-chat已配置 API key。Aider 需要 API 提供商的 key 才能工作于大多数模型可以存在配置或 env 文件中运行时会自动加载来源optional.md。/web抓取的内容是发往聊天消息的所以需要一个可用的 key例如 OpenAIexport OPENAI_API_KEYkey # Mac/Linux setx OPENAI_API_KEY key # Windows, restart shell after setxkey替换为你自己的 API key。安装 Playwright 与 Chromium有两条路径任选其一装完后/web的行为一致。路径一在 Aider 聊天里按提示安装直接启动 Aider 并执行/web url。当 Aider 检测到没有可用的 Playwright 时会输出安装提示并询问是否安装。提示内容来自 scrape.py 中的install_playwright它先检查两件事playwright库能否导入、chromium能否成功启动缺哪一样就补哪一样给出的命令是pip install aider-chat[playwright] python -m playwright install --with-deps chromiumAider 随后提示 Install playwright?确认后会依次执行上面的命令。aider-chat[playwright]这个 extra 装的就是playwright包见 requirements-playwright.in--with-deps表示同时安装浏览器所需的系统依赖依赖安装的具体说明见 optional.md 中指向的 Playwright for Python 文档。注意--with-deps会往系统里装依赖包Linux 上通常需要相应权限安装前请确认当前用户有权限安装系统依赖。路径二手动安装如果你不想在聊天里让 Aider 代执行安装命令可以先退出 Aider手动执行python -m pip install -U aider-chat[playwright] python -m playwright install --with-deps chromium如果 Aider 聊天里已经装好了playwright包、只是缺 Chromium 浏览器那么按 optional.md 的说明只执行第二条命令即可。验证安装是否生效文档给出了一种不依赖模型调用的验证方式从命令行抓取页面查看 Aider 生成的 Markdown 版本来源images-urls.mdpython -m aider.scrape https://aider.chat/docs/usage/tips.html该命令走的是和聊天内/web相同的抓取流程scrape.py 的main会用has_playwright()判断 Playwright 是否可用即playwright库可导入且chromium能启动可用时走浏览器抓取否则回落到 httpx。抓取成功后输出就是 Aider 会发给模型的页面内容HTML 会被转成 Markdown 文本。再进入 Aider 会话做最终确认aider在聊天中执行/web urlurl换成你要抓取的地址。如果 Playwright 已生效JS 渲染页面的正文也能被抓取并作为消息加入聊天也可以直接把 URL 粘贴进聊天Aider 会询问是否添加。使用中的已知行为与限制默认路径是 httpx不装 Playwright 时/web仍能用但仅限不拦截 httpx、且内容不依赖 JS 渲染的页面。装 Playwright 后 Aider 对全部网页的抓取效果最好来源optional.md。加载超时不视为失败浏览器抓取时page.goto以wait_untilnetworkidle、5 秒超时等待超时只会打印Page didnt quiesce, scraping content anyway: url然后照常抓取当前已有内容来源scrape.py。浏览器启动失败会回落 httpx如果 Chromium 启动抛错Aider 会把playwright_available置为 False 并打印错误之后的抓取走 httpx来源scrape.py。遇到这种情况先确认上面两条安装命令都执行成功。不想让 Aider 尝试 Playwright启动时加--disable-playwright或设置环境变量AIDER_DISABLE_PLAYWRIGHT。该选项的说明是 Never prompt for or attempt to install Playwright for web scraping默认值为 False来源options.md、aider_conf.md。HTML 转 Markdown 依赖 pandoc抓到的 HTML 内容会用 pandoc 转 Markdown若本机没有 pandocAider 会尝试自动下载来源scrape.py转换失败时返回清理后的 HTML 原文。下一步Playwright 装好之后/web配合聊天即可使用把目标文档页或 API 参考页的 URL 用/web加入上下文再提出修改代码或回答问题的请求。Aider 的浏览器 UIaider --browser等其他用法见 browser.md。【免费下载链接】aideraider is AI pair programming in your terminal项目地址: https://gitcode.com/GitHub_Trending/ai/aider创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表