
Firecrawl一行代码把任意网站变成 LLM 可用的数据【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawlFirecrawl 是一个可自托管的网页数据提取 API给它一个 URL还你干净的 Markdown、结构化 JSON 或截图。做 RAG 的人都知道这个痛每个站点的 HTML 都要单独写一套解析规则遇到 JS 渲染的页面拿回空内容还不好排查。对比维度传统爬虫脚本Firecrawl动态页面抓不到 JS 渲染的内容内置浏览器渲染覆盖约 96% 的网页输出格式原始 HTML自己清洗Markdown / 结构化 JSON直接喂给 LLM批量任务并发、重试、轮询全要自己写批量 CrawlSDK 自动轮询反爬代理轮换自理内置代理轮换与限速 5 分钟跑通部署最轻路径是直接用托管服务装好 SDK、配一个 API Key 就能调。自托管则需要 Node.js 18 和 Dockerclone 仓库后一条docker compose up拉起全部依赖Redis、RabbitMQ、PlaywrightAPI 默认监听 3002 端口pip install firecrawl-pyfrom firecrawl import Firecrawl app Firecrawl(api_keyfc-YOUR_API_KEY) print(app.scrape(https://firecrawl.dev).markdown)自托管先克隆仓库git clone https://gitcode.com/GitHub_Trending/fi/firecrawl 三个核心能力各绑一个真实场景做 RAG 内容入库用 ScrapeScrape 是调用最多的端点直接输出 LLM 友好的 Markdown同时还能要截图和结构化 JSON网上托管的 PDF、DOCX 文件也能解析。把产品文档或博客文章喂给知识库一次调用就够不用再写 CSS 选择器或手动剔除广告位。不确定的站点先跑 Map 枚举全部链接再用 Crawl 整站抓取返回任务 ID 后 SDK 会自动轮询到所有页面取回。将网站内容转换为 AI 友好的标准格式不知道 URL用 SearchSearch 直接搜索全网每条结果返回完整 Markdown、标题和 URL可用 limit 控制返回条数。做新闻聚合、市场监控时找信息 抓正文一次调用完成不用自己拼装搜索引擎和爬虫两套东西。搜索并直接取回结果页面的全文内容页面要交互用 Interact 和 Agent目标数据藏在搜索框后面或需要登录态时Interact 能先对已抓取的页面执行输入关键词、点击第一条结果这类操作再提取。Agent 更进一步只用自然语言描述你要什么它自己搜索、导航、取回数据配一个 schema 就能返回结构化结果。模型方面spark-1-mini 便宜 60%日常任务够用复杂调研换 spark-1-pro。用自然语言指令驱动页面操作与数据提取️ 从 Demo 到生产场景与调优能直接落地的四个场景电商价格监控定时 batch_scrape 商品页列表把价格、库存提取成表竞品分析Crawl 竞品整站定价与功能页转结构化 JSON 入库对比新闻聚合按关键词 Search拿回每条结果全文去重后推信息流RAG 知识库Crawl 文档站Markdown 直接进向量数据库先调这 3 个参数limitCrawl/Map 的抓取上限先设 50 验证范围确认没抓偏再放大CRAWL_CONCURRENT_REQUESTS自托管默认 10目标站脆弱就调低防止被拉黑formats只请求要的格式markdown/json/screenshot 越少越快、消耗越少高频问题速查现象请求超时或长时间无响应 → 解法调大超时确认 JS 渲染已启用现象抓回内容不完整 → 解法提取前加 wait、scroll 动作等异步加载完成现象被目标站拦截 → 解法启用代理轮换降低抓取频率提示控制抓取频率、尊重目标站 robots.txt长期稳定比单次跑得快更重要。SDK 与集成按语言选一个即可Python SDKpip install firecrawl-py用得最广数据脚本首选Node.js SDKnpm install firecrawl适合前端与全栈工程Rust SDK追求吞吐和极致性能的大批量场景Go / Java / PHP / .NET / Elixir / Ruby SDK 均有官方版本另外用一条命令即可接入任意 MCP 客户端进阶路径示例代码看 examples/自托管细节看 SELF_HOST.md。下一步建议先跑通一个 scrape 确认输出干净再对一个小站试 crawl最后接上 MCP 让它服务你的 Agent。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考