
RD-Agent 5 分钟跑通LLM Agent 自动研发数据与模型【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-AgentRD-Agent 是一个 LLM Agent 框架替你把数据与模型研发里最耗时的部分自动化提想法、写代码、跑实验、看反馈然后自动进入下一轮。它面向量化金融、Kaggle 数据科学、论文复现、LLM 微调等场景你负责准备数据和 API key剩下的交给它循环。快速安装 RD-Agent 的三步RD-Agent 只跑在 Linux 上Python 用 3.10 或 3.11CI 只验证了这两个版本。另外绝大多数场景需要 Docker 来隔离执行环境你的代码会被它写进容器里跑所以先装好 Docker并确认当前用户不用 sudo 就能执行docker run hello-world能过就算合格。conda create -n rdagent python3.10 conda activate rdagent pip install rdagent rdagent health_check --no-check-env最后这条命令检查 Docker 装没装好、默认 UI 端口有没有被占用。装完就准备配置 LLM 了。模板配置一个 .env 文件搞定 LLM所有 LLM 相关的设置都放在工作目录下的.env文件里框架默认走 LiteLLM 后端模型名按 LiteLLM 的写法来。最小配置只需要两样CHAT_MODELgpt-4o EMBEDDING_MODELtext-embedding-3-small OPENAI_API_KEY你的 API key几个常见变体DeepSeekCHAT_MODELdeepseek/deepseek-chat加DEEPSEEK_API_KEY。DeepSeek 官方没有 embedding 模型需要另外接一个比如硅基流动的 bge 系列模型名要加litellm_proxy/前缀并配LITELLM_PROXY_API_KEY和LITELLM_PROXY_API_BASE。推理模型如果模型回复里带思考过程think标签要加一行REASONING_THINK_RMTrue。Azure OpenAI用azure/前缀写模型部署名配AZURE_API_KEY和AZURE_API_BASE。改完配置务必跑一次不带--no-check-env的rdagent health_check它会验证 API 连通性这一步不能省。R D 双角色研发循环到底替你干了什么理解后面的场景之前先知道它在循环里做什么。名字里的 R 和 D 是两个角色R 端提假设比如这个时序数据适合用某种网络结构D 端把假设变成能跑的代码、执行、收指标。一轮下来假设、代码、执行反馈都会留在轨迹里下一轮基于这些历史再改进而不是从头再来。核心循环逻辑在 evolving_framework.py代码生成那一侧由 CoSTEER 策略驱动实现在 coder/CoSTEER/。这套循环在 MLE-bench75 个 Kaggle 竞赛组成的基准上验证过o3 提假设 GPT-4.1 写代码的组合整体通过率 30.22%领先于公开对比结果。量化因子进化一条命令起 fin_factor做量化的人都知道因子迭代是最磨人的环节想一个、测一个、换一个。rdagent fin_factor就是这个环节的自动版本它在 Qlib 上自循环地提出新因子、生成因子代码、回测、看指标、再提下一批。只想演进模型结构就用rdagent fin_model因子和模型联合优化用rdagent fin_quant。命令支持loop_n参数控制跑多少轮循环首次试跑建议给个小值先验证流程再放开。还有个省事的入口rdagent fin_factor_report --report-folder财报目录。给它一叠研报或财报它会自己读文档、抽取因子公式再落成可回测的代码不用你手动翻译公式。这几个场景的代码都在 scenarios/qlib/ 下想改提示词或流程时直接去那儿找。论文复现与数据科学场景general_model 和 data_science 怎么用论文到代码拿到一篇模型论文想复现结构直接rdagent general_model https://arxiv.org/pdf/2210.09789把 URL 换成任意论文地址即可。它会读 PDF、抽出模型结构描述再生成可运行的实现。医疗预测模型的自循环演进也属于这条链路文档里的 dmm demo。Kaggle 数据科学rdagent data_science --competition 竞赛名会自动做特征工程和模型调参。跑之前需要准备两样本地数据目录用dotenv set DS_LOCAL_DATA_PATH 路径指过去和 Kaggle 凭证kaggle.json放到~/.config/kaggle/并改成 600 权限。Kaggle 模式还要设DS_IF_USING_MLE_DATATrue和DS_SCENrdagent.scenarios.data_science.scen.KaggleScen。LLM 微调rdagent llm_finetune --base-model Qwen/Qwen2.5-7B-Instruct是 FT-Agent 场景围绕一个目标 benchmark 自动做数据处理、训练、评测和反馈修正运行前要配好FT_TARGET_BENCHMARK完整说明在 rdagent/app/finetune/llm/README.md。盯进度与常见报错排查看进度rdagent ui --port 19899 --log-dir log/ --data-science这是 Streamlit 界面用来翻每轮循环的日志和代码。--data-science参数表示要看数据科学场景的日志看量化场景就去掉它。另有一条 Web 前端路线cd web npm install npm run build:flask然后rdagent server_ui --port 19899起 Flask 后端浏览器打开http://127.0.0.1:19899看实时 trace但它目前不支持 data_science 场景。排查端口冲突19899 被占时 UI 起不来跑rdagent health_check --no-check-env --no-check-docker会报出来换个端口参数即可。Docker 相关报错先确认当前用户能否免 sudo 执行 docker 命令绝大多数执行类问题出在这。LLM 配置报错对照上面.env各 provider 的写法逐项检查改完重跑一次完整rdagent health_check。控制成本循环每轮都要花 token 和算力loop_n和step_n是最直接的两个阀门。第一次跑任何场景先小范围试一轮确认反馈链路正常再放量。先跑哪条命令RD-Agent 的用法可以压缩成一句话一个场景对应一条rdagent子命令装好、配好.env、health_check通过剩下就是选场景开跑。更细的场景文档在 docs/ 里按章节排好了。建议第一次先拿general_model喂一篇你熟悉的论文跑完对着生成代码看一眼5 分钟就能建立对这个框架的体感。【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考