ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RD-Agent 上手指南:3 步跑通你的第一个建模任务

RD-Agent 上手指南:3 步跑通你的第一个建模任务 RD-Agent 上手指南3 步跑通你的第一个建模任务【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-AgentRD-Agent 是一款 AI 驱动的研发自动化工具能自动完成数据加载、特征工程、模型训练到评估的建模闭环也支持 Kaggle 竞赛任务。这篇指南带你完成 RD-Agent 安装配置并跑通第一个数据科学任务。一、RD-Agent 替你干什么RD-Agent 的核心是一条“R”与“D”交替的闭环研究部分持续提出并修正假设开发部分把假设变成可执行代码执行完再拿到评估指标反馈给下一轮。对你来说这意味着你只需要提供数据集和任务描述加载数据、构造特征、训练模型、跑评估、迭代改进全由它自动驱动。这套流程适合三类人想让特征工程迭代更快的数据科学家、希望把论文模型自动落地成代码的算法工程师、以及在 Kaggle 上需要持续试提交的竞赛选手。它的入口都收在rdagent/目录里其中数据科学场景 rdagent/scenarios/data_science/ 内置了医疗ARF 12 小时预测、金融等 6 个行业示例任务配好环境即可开跑。二、三步跑起来 第 1 步装对 Python 和 DockerRD-Agent 仅支持 Python 3.10 和 3.11仓库constraints/目录下有 2 个版本锁定文件3.10.txt和3.11.txt。用其他版本安装会直接依赖解析失败建议用 pyenv 管理版本先建一个干净的 3.11 环境再装主包pyenv install 3.11 pyenv local 3.11 pip install rdagent代码执行被隔离在 Docker 容器里所以 Docker 是必装项并确认当前用户能免 sudo 执行 Docker 命令。成功标志是下面这条命令能打出 “Hello from Docker”docker run hello-world第 2 步配好 LiteLLM 模型接入所有模型调用都走 LiteLLM 后端支持 OpenAI、Azure、DeepSeek 等 20 供应商国内用户可以让 SiliconFlow 代理 embedding。关键约束是CHAT_MODEL与EMBEDDING_MODEL必须配套两者来自不同服务商时对应的 API Key 和 Base 都要补齐大约九成配置报错都出在这一点没对上。.env文件放在项目根目录与pyproject.toml同级加载优先级是环境变量 .env 默认配置。以 DeepSeek 对话模型 SiliconFlow 代理 embedding 为例下面这份配置可直接照抄修改CHAT_MODELdeepseek/deepseek-chat DEEPSEEK_API_KEY你的 DeepSeek API Key EMBEDDING_MODELlitellm_proxy/BAAI/bge-m3 LITELLM_PROXY_API_KEY你的 SiliconFlow API Key LITELLM_PROXY_API_BASEhttps://api.siliconflow.cn/v1注意 embedding 模型名必须带litellm_proxy/前缀它告诉 RD-Agent 该走独立代理。保存后执行这条命令验证输出deepseek/deepseek-chat即配置生效python -c from rdagent.core.conf import settings; print(settings.CHAT_MODEL)全部参数的默认值与含义见 LiteLLM 配置源码。第 3 步跑通第一个数据科学任务数据科学场景的入口是 rdagent/scenarios/data_science/ 目录跑任务不用写代码用官方 CLI 即可它会自动加载根目录的.env。先做健康检查确认 Docker 与端口状态再启动内置示例竞赛任务rdagent health_check --no-check-env rdagent data_science --competition bms-molecular-translation成功标志有两点终端按“假设 → 编码 → 运行 → 反馈”逐轮打印迭代日志本地git_ignore_folder/RD-Agent_workspace/目录下出现 RD-Agent 生成的特征代码与模型代码文件。三、换到 Kaggle 场景数据科学管线原生支持 Kaggle 竞赛任务同样用--competition参数指定竞赛名流程会自动完成数据读取、特征与模型迭代最后生成符合竞赛格式要求的提交文件可直接一键提交。切换到新竞赛只需替换参数值rdagent data_science --competition titanicKaggle 任务使用的内置 Docker 环境配置在 kaggle_environment.yaml需要自定义镜像时从这里改。四、卡住时按这张表查 报错或指标不对劲时先对照下表定位再动手现象原因处理代码生成时报 “CoSTEER 未初始化”git 子模块没拉下来缺少配套配置在仓库根目录执行git submodule update --init后重跑任务评估指标异常不涨、NaN 或明显偏低特征缺失或标签格式错误启动python -m rdagent.log.ui.app在日志界面检查数据输入环节逐个核对特征列与标签列任务中途失败说不清卡在哪一步日志分散在终端里难以回溯打开同一日志界面按 propose、develop、feedback 顺序看完整 trace定位失败步骤安装时依赖解析失败Python 版本不是 3.10 / 3.11用 pyenv 装 3.11按constraints/下的 2 个锁定文件重装日志界面里重点看数据输入阶段特征缺失和标签格式错误是指标异常最常见的两类来源。五、进阶方向自定义工作流改 workflow/ 目录下的模块可以插入自己的数据预处理管道、接入 HuggingFace 等外部模型或搭建多模型集成策略不需要 fork 整个仓库。团队共享实验结果启用 agent/mcp/ 里的 MCP 服务可把实验数据同步给团队成员同一实验不必重复跑。环境就绪后建议先用 titanic 任务让 RD-Agent 自动迭代 3 轮观察 trace 熟悉闭环完整的场景清单与参数说明去官方文档入口继续查。【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表