ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

影刀RPA实操指南:法院裁判文书检索与批量下载

影刀RPA实操指南:法院裁判文书检索与批量下载 影刀RPA实操指南法院裁判文书检索与批量下载做法律相关工作的人都体会过翻裁判文书的苦一个案由检索出几千份文书逐篇点开、逐篇下载、手动重命名一个上午过去进度条还没走完三分之一的案子。我用影刀RPA做了裁判文书检索与批量下载流程输入案由和法院条件后自动翻页、逐篇打开、批量保存文件到本地全程不用人守着。先把边界说清楚法院类平台没有公开的RPA官方采集教程这篇是通用网页自动化方案的推导落地用到的全部是影刀RPA的标准指令思路适用于各类检索加批量下载的站点。另外要提醒一句文书数据仅用于自己正当的工作用途控制访问频率别给公共服务添负担。我非技术出身做这类流程两年多检索加下载是所有网页自动化里最能锻炼完整功力的场景因为它把定位、循环、等待、文件下载、异常处理全串起来了。认识影刀RPA与安装先把浏览器插件装对官网下载影刀客户端注册登录。装浏览器插件这步别跳设置→浏览器插件→安装Chrome或Edge插件装完重启浏览器。文书网站页面上有大量动态加载内容插件没装好后面全是元素捕获不到的怪问题。新建应用文书检索下载流程开头拖打开网页指令浏览器类型选Google Chrome网址填目标检索页保存网页对象至变量 web_court。打开网页指令的等待网页加载完成参数设25秒这类站点服务器响应偏慢默认值经常不够。社区版每天30分钟时长批量下载任务建议放在夜里定时跑时长不够可考虑创业版。元素定位四合一检索结果列表与文书链接的定位方案检索结果页是典型的列表结构每条结果带标题、法院、日期、案号。四个定位工具逐一派上用场。元素捕获建立基准元素XPath负责批量提取和跨字段关联# 捕获元素结果列表中所有文书标题链接 //div[classresult-list]//a[contains(class,title)] # 模糊匹配标题里包含劳动合同的文书条目变量传案由关键词 //*[contains(text(),$case_type$)] # 参照物定位通过发布日期文本定位同一容器内的链接 //*[contains(class,date)]/preceding-sibling::a[1] # 层级定位从案号定位整条结果卡片再取标题 //div[text()$case_no$]/ancestor::div[contains(class,item)]//aCSS选择器和XPath并列使用的选型原则不变div.result-list a.title这种单层结构CSS最快凡是通过文本找元素“向上找父级”“跨字段关联只能XPath。正则表达式在文书场景的高频用法是校验和提取案号格式比如从标题里提取”(2025)京01民终xxxx号这类模式数据清洗时省很多事。影像场景里文书页面可能有附件是图片格式OCR文字识别偶尔派上用场放在进阶部分讲。变量与数据类型检索条件与文书清单的组织检索条件用字典存键为 案由、法院、日期范围、文书类型拼接成检索URL或逐个填入表单。文书清单用列表的列表存每条包含 标题、案号、日期、文书链接、文件名 五列最后统一写Excel做下载台账。文件名怎么起是这个流程的设计重点。我第一版直接用网站默认文件名下载几百份全是乱码式的编号根本没法用。后来改成案号当事人关键词拼接命名用合成一个文本指令把案号和截取的标题前几个字拼起来作为文件名再用Python把非法字符替换掉# 输入case_no案号、title文书标题# 输出file_name合法的本地文件名importre basef{case_no}_{title[:12]}# 案号标题前12字file_namere.sub(r[\\/:*?|],_,base)# Windows非法字符替换为下划线file_namefile_name.strip()# 去两端空格防止路径异常JSON处理在走接口路线时会用到响应JSON字符串转Python对象提取文书ID和下载地址再转文本传给下载指令。流程控制翻页循环与逐篇下载的骨架主流程骨架分两段。第一段是检索与收集清单ForEach列表循环遍历检索条件组合循环相似元素(web)遍历当前页结果用提取文本抓标题和案号存进清单列表。第二段是逐篇下载For循环遍历清单每条执行打开文书详情页→定位下载按钮→下载文件→关闭页面→写台账。翻页用While条件循环加disabled判断//a[contains(class,next) and not(contains(class,disabled))]可见就点下一页继续收集不可见就结束。每篇文书必须包Try-CatchCatch里输出日志记录案号和报错Finally关闭可能残留的详情页。批量任务几百次循环中间任何一篇出问题都该跳过而不是停线台账里把失败项标出来跑完单独补一轮即可。网页自动化等待、弹窗与下载对话框三件事等待策略详情页内容异步加载必须等到位点进文书详情后正文是异步渲染的直接提取会抓到空。标准做法点击后用等待元素(web)等正文容器出现超时15秒返回True才继续。下载按钮也同理先等它出现再点。固定等待在文书站点上特别不可靠服务器慢的时候固定5秒经常不够动态等待是唯一正解。弹窗处理的标准流程文书站点常见两类弹窗登录提醒弹窗和访问频率提示弹窗。处理套路是固定的五步捕获弹窗的关闭按钮元素→流程关键节点前用IF 元素可见(web)判断弹窗是否存在→存在就点关闭→等待弹窗元素消失→继续原流程。有些弹窗关闭按钮藏得深定位不到用键盘Esc键或点击遮罩区域兜底。下载文件与处理下载对话框文书下载用下载文件指令保存目录参数设为按日期分类的文件夹指定文件名参数配合前面Python拼的file_name。如果站点走的是浏览器原生下载流程用处理下载对话框指令应对浏览器弹出的保存确认框。影刀还有HTTP 下载指令文书文件有直链时可直接按URL下载超时时间默认300秒大文件也扛得住。下载完成后用等待文件指令确认文件真实落盘再写台账不然台账说成功、文件其实没下完这种假成功最难排查。数据处理下载台账与文书内容提取台账Excel三件套开始下载前写入内容至Excel工作表写表头每篇下载完成后追加一行记录文件名、路径、下载时间、状态结尾统计成功失败数。几百份文书的下载记录攒在数据表格里最后写入表格数据一次性落表。文书正文如果是图片或扫描件用影刀离线OCR做文字识别识别结果和原文书关联存表后续做类案检索才能全文搜索。纯文本格式文书用从文本中提取内容和正则直接抽字段当事人、判决金额、引用法条这些结构化字段才是文书分析的核心资产。鼠标键盘与图像自动化滑块与特殊控件的兜底文书平台常有滑块或点选验证这类控件元素定位基本无效。影刀的图像自动化是兜底方案用等待图像等验证控件出现点击图像按截图匹配点击目标图片滑块用拖拽元素配合锚点偏移拖到位。识别类验证码可以用点击文本(OCR)按屏幕上识别出的文字点击配合影刀离线OCR。键盘自动化用在两处Esc关弹窗、CtrlS触发另存个别站点没有下载按钮只能靠浏览器快捷键。影刀支持虚拟键盘鼠标驱动安装后模拟操作不占用真实鼠标键盘夜里定时跑流程时人机互不干扰建议装。进阶技能接口监听与Python协同提效结果列表数据多数来自接口。用开始监听网页请求监听检索接口翻页时使用网页监听指令获取数据拿JSON一次响应带整页文书列表比页面循环提取快且稳。文书ID拼出详情页URL后进入下载环节两条路线可以混用清单靠接口下载靠页面。Python代码段承担所有脏活文件名清洗、日期标准化、Excel去重判断案号是否已在历史台账避免重复下载、失败重试队列。这些逻辑用指令拼会很长Python十行搞定影刀里Python图标要点亮才能用装完客户端在设置里确认Python引擎就绪。系统联动定时任务、邮件与飞书通知批量下载适合夜里无人值守定时触发器配每日触发凌晨2点跑避开平台白天的访问高峰。触发方式支持每日、每周、预约、自定义间隔和Cron表达式生效前提是高级任务计划已启用Windows电源设置里把睡眠关掉官方文档专门讲过计划任务Windows电源设置问题休眠导致的任务没跑排障我见过太多次。跑完的结果用发送邮件指令把台账Excel作为附件发给自己成功失败一目了然团队协作场景用飞书群通知发摘要消息本次检索案由、下载成功数、失败数机器人地址填群webhook签名校验按群机器人安全设置填密钥。企业版调度场景下任务监控页面还能配置告警邮箱和钉钉通知流程异常自动提醒无人值守才真的放心。工程化规范子流程拆分与命名规范我拆成五个子流程01_登录与登录态检查、02_检索与清单收集、03_单篇下载、04_台账与去重、05_结果通知。主流程只做调度逻辑都下沉到子流程参数用输入输出变量传递。子流程命名带编号主流程里读起来像目录接手的人不用点开就知道每步干什么。调试三板斧断点指令右键添加断点、单步执行、变量面板。批量下载的失败九成是定位或等待问题单步跑到失败那篇看变量面板里网页对象和文件名变量的实际值原因基本当场现形。模板化方面这套检索→清单→循环下载→台账→通知的结构是通用的换一个下载场景论文、公告、报告只改定位和文件名规则。易错速查表文书下载高频翻车点现象原因解决办法台账显示成功但文件不存在下载未完成就写记录用等待文件指令确认落盘后再写台账详情页提取不到正文正文异步加载未完成等待元素(web)等正文容器超时15秒文件名含非法字符保存失败案号或标题带/:*等符号Python正则替换非法字符后再命名翻几页后被要求登录或弹验证访问频率过高循环加2-3秒间隔异常时通知人工介入下载几百份文件名重复覆盖命名没含案号唯一项文件名必须拼案号写入前查台账去重学习资源与延伸阅读官方文档里下载文件“处理下载对话框”网页相似元素循环常见场景及解决方案三篇是这类流程的必读参考参数说明比我这篇细。这套裁判文书检索与批量下载流程的完整源码我放在代码仓库 home.linyan.cloud可以直接参考改造替换检索条件和保存目录就能投入使用。#影刀RPA #RPA自动化 #批量下载 #数据采集 #循环操作 #异常处理作者林焱
返回列表