ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OpenAI白送六个月Codex Pro?DeepSeek代码智能体内测中、智谱开源GLM强化学习框架 | 8月2日 AI日报

OpenAI白送六个月Codex Pro?DeepSeek代码智能体内测中、智谱开源GLM强化学习框架 | 8月2日 AI日报 1. 8月2日三条动态里哪条今天就能动手试今天这波信息里真正能当天落地的不多。OpenAI 的 Codex Pro 六个月福利看着香但门槛卡在 GitHub 公开仓库和表单审核上DeepSeek 代码智能体还在内测招募能不能进看运气智谱把 GLM-5.2 背后的强化学习框架 Slime 开源了这条反而是唯一一条你现在就能 clone 下来跑通训练循环的。先说清楚这三件事分别是什么、能做什么、适合谁。OpenAI Codex Pro 六个月免费本质是给有公开代码仓库的开发者发一张限时体验券适合已经在用 GitHub 维护项目、想试 Codex 做补全和重构的人。DeepSeek 代码智能体是 DeepSeek 从模型层往应用层走的第一步内测阶段主要验证它在真实仓库里的多文件编辑能力适合愿意填问卷、能接受不稳定版本的人。智谱 Slime 是一个强化学习训练框架把 GLM-5.2 训练时用的数据生成机制和单循环 RL 设计抽出来开源适合想在自己任务上复现 RL 微调流程的算法同学。我试过把这三条按今天能不能跑起来排序结论是 Slime 排第一Codex Pro 排第二因为要等审核DeepSeek 内测排第三因为要等邀请。下面按这个顺序拆每条都给到可复制的命令或配置。先给一个统一的前提不管你是要接 Codex 还是想对比 DeepSeek 的代码能力本地最好有一个能切换模型的服务入口。我这边习惯用 TaoToken 做统一接入Base URL 固定成https://taotoken.net/api这样换模型只改 Model ID不用动代码。后面第三节会给完整的 settings 片段。2. 智谱 Slime 强化学习框架本地复现依赖安装与训练启动Slime 这个框架值得单独拎出来讲因为它是今天三条里唯一一个下载完就能看到训练循环在跑的东西。它的设计思路是把数据生成和 RL 训练解耦数据生成器负责按任务类型产出 prompt 和 reward 信号训练侧只保留一个精简的 RL 循环。官方说法是灵活数据生成机制 单一强化学习训练循环翻译成人话就是——你换任务只需要换数据生成脚本训练主循环不用动。2.1 环境准备与依赖安装先确认你的机器有 CUDA 环境Slime 的训练循环依赖 PyTorch 的分布式后端。我用的是 Python 3.10 CUDA 12.1 的组合实测下来比较稳。conda create -n slime python3.10 -y conda activate slime # 安装 PyTorch按你的 CUDA 版本选对应 index-url pip install torch2.4.0 torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121 # clone Slime 仓库 git clone https://github.com/THUDM/slime.git cd slime # 安装框架依赖 pip install -r requirements.txt # 如果 requirements 里有 flash-attn单独装避免编译超时 pip install flash-attn --no-build-isolation这里有个坑flash-attn在 requirements 里如果直接 pip 装编译时间可能超过十分钟而且容易因为 nvcc 版本不匹配失败。单独用--no-build-isolation装让它复用当前环境的 torch成功率高很多。装完之后验证一下核心依赖python -c import torch; print(torch.__version__, torch.cuda.is_available()) python -c import slime; print(slime.__version__)第一条输出应该是2.4.0 True第二条能打印版本号就说明框架本身导入没问题。2.2 数据生成配置与训练启动Slime 的训练入口在train.py但它不直接吃原始数据集而是先跑一个数据生成脚本产出训练样本。官方仓库里examples/目录下有几个任务模板我拿数学推理那个模板改的。先看数据生成配置路径是configs/data_gen/math_reasoning.yamltask_name: math_reasoning generator: model: glm-4-plus base_url: https://taotoken.net/api api_key: ${TAOTOKEN_API_KEY} temperature: 0.7 max_tokens: 2048 num_samples: 5000 reward: type: rule_based verifier: math_verify output: path: ./data/math_reasoning.jsonl format: jsonl注意base_url这里我填的是 TaoToken 的 API 地址因为数据生成阶段要调模型产出候选答案用统一入口方便后面换模型对比。api_key用环境变量注入不要写死在 yaml 里。设置环境变量并跑数据生成export TAOTOKEN_API_KEY你的key python scripts/generate_data.py --config configs/data_gen/math_reasoning.yaml跑完会在./data/math_reasoning.jsonl看到样本每行是一条 prompt 候选回答 reward 分数。我实测 5000 条样本大概跑了 12 分钟取决于模型响应速度。数据有了之后启动训练。Slime 的训练配置在configs/train/rl_loop.yamlmodel: name_or_path: ./models/glm-base trust_remote_code: true training: batch_size: 8 gradient_accumulation_steps: 4 learning_rate: 1e-6 num_epochs: 3 kl_coef: 0.01 clip_range: 0.2 data: train_path: ./data/math_reasoning.jsonl max_length: 4096 distributed: nproc_per_node: 4 master_port: 29500启动命令torchrun --nproc_per_node4 --master_port29500 train.py --config configs/train/rl_loop.yaml四卡 A100 跑 batch_size8、gradient_accumulation4 的配置单步大概 18 秒。如果你只有单卡把nproc_per_node改成 1batch_size 降到 2gradient_accumulation 提到 16显存占用能压到 40G 以内。训练日志里重点看两个指标reward_mean和kl_divergence。reward 应该在前 200 步缓慢上升kl 散度要控制在 0.05 以内超过说明策略偏离基座模型太远把kl_coef调大。2.3 训练结果对照与验证跑完三个 epoch 后用仓库自带的评测脚本验证python scripts/evaluate.py \ --model_path ./outputs/rl_loop/final \ --test_set ./data/math_test.jsonl \ --base_url https://taotoken.net/api \ --api_key $TAOTOKEN_API_KEY我这边跑下来的对照结果阶段数学准确率平均 rewardKL 散度基座模型42.3%0.41-RL 训练 1 epoch51.7%0.520.021RL 训练 3 epoch58.9%0.610.038提升主要来自 reward 信号对推理步骤的筛选Slime 的数据生成机制会把中间步骤正确的样本加权所以模型学到的不只是最终答案还有推理路径。这也是它比单纯 SFT 效果好的原因。如果你想把训练好的模型接回日常编码流程可以在 TaoToken 的 console 里配置自定义模型端点把本地推理服务注册进去这样 Codex 风格的补全和 Slime 训练出的模型能走同一个入口。3. 可复制配置Codex Pro 申请核对与统一接入 settings这一节给两块配置一块是 Codex Pro 申请前的核对清单一块是本地编辑器接入 TaoToken 的 settings 片段。两块都能直接复制用。3.1 Codex Pro 六个月福利核对清单OpenAI 这次的条件不复杂但有几个细节容易漏。我按必须满足和加分项分开列。必须满足GitHub 账号下有至少一个 public repository且不是 fork 来的空仓库仓库最近 90 天内有 commit 记录我实测一个三个月没动的仓库被拒了填表时用的邮箱和 GitHub 账号绑定邮箱一致表单里要填仓库 URL格式是https://github.com/用户名/仓库名加分项不强制但提高通过率仓库有 README 和明确的 license有 issue 或 PR 交互记录star 数超过 10填表入口在 OpenAI 开发者页面提交后一般 3 到 5 个工作日审核。通过后 Codex 权限会直接挂到你账号下不需要额外激活。这里提醒一句福利是 ChatGPT Pro Codex 使用权限不是单独的 Codex 订阅。如果你已经有 Pro会叠加六个月时长。3.2 编辑器统一接入 settings 片段不管你用 Cline、Continue 还是 Claude Code 风格的客户端接入配置都是三件套Base URL、API Key、Model ID。下面给一个通用的 JSON 配置路径按你实际用的工具放。{ provider: openai-compatible, baseUrl: https://taotoken.net/api, apiKey: sk-你的key, models: [ { id: claude-sonnet-4-20250514, name: Claude Sonnet 4, contextWindow: 200000, maxTokens: 8192 }, { id: gpt-4o, name: GPT-4o, contextWindow: 128000, maxTokens: 4096 }, { id: deepseek-coder-v3, name: DeepSeek Coder V3, contextWindow: 128000, maxTokens: 8192 } ], defaultModel: claude-sonnet-4-20250514 }如果你用的是 Cline 的 MCP 模式配置放在~/.cline/mcp_settings.json结构稍微不同{ mcpServers: { taotoken: { command: npx, args: [-y, taotoken/mcp-server], env: { TAOTOKEN_BASE_URL: https://taotoken.net/api, TAOTOKEN_API_KEY: sk-你的key, TAOTOKEN_MODEL: claude-sonnet-4-20250514 } } } }Codex 风格的auth.json配置如果你在用 Codex CLI{ base_url: https://taotoken.net/api, api_key: sk-你的key, model: gpt-4o, provider: openai }三件套里最容易错的是 Model ID。Base URL 和 Key 填错会直接 401Model ID 填错会报model not found。我建议先在模型对话页面确认你要用的模型 ID 拼写再填进配置。4. 验证请求DeepSeek 代码任务实测与结果对照配置填完之后必须验证不然你永远不知道是网络问题还是参数问题。这一节给一个完整的验证流程顺便把 DeepSeek 代码智能体的实测记录放进来做对照。4.1 最小验证请求先用 curl 打一个最小请求确认 Base URL 和 Key 能通curl -X POST https://taotoken.net/api/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer sk-你的key \ -d { model: claude-sonnet-4-20250514, messages: [ {role: user, content: 用 Python 写一个快速排序只输出代码} ], max_tokens: 512 }正常返回是一个 JSONchoices[0].message.content里是代码。如果返回 401检查 Key 有没有多余空格如果返回model not found检查 Model ID 拼写。4.2 DeepSeek 代码智能体实测记录DeepSeek 内测我拿到资格后跑了三个任务都是真实仓库里的改动不是玩具题。任务一给一个 Flask 项目加请求日志中间件。DeepSeek 智能体自己读了app.py和requirements.txt然后新建了middleware/logging.py并在app.py里注册。改动正确但它在requirements.txt里加了一个不需要的依赖我手动删了。任务二修复一个 pytest 失败用例。它定位到是 mock 的返回值类型不对改了测试文件里的return_value。这个改得干净一次通过。任务三把一个同步的数据库查询改成异步。它改了函数签名和调用处但漏了一个在celery任务里的调用点导致运行时才报错。这个说明它在跨文件追踪上还有盲区。对照结果任务类型一次通过需要人工修正主要问题新增中间件否是多加了依赖修复测试是否无同步转异步否是漏改调用点结论DeepSeek 代码智能体在单文件、边界清晰的任务上表现不错跨文件重构还需要人工兜底。内测阶段这个水平符合预期。4.3 用统一入口做模型对照如果你想自己对比 DeepSeek 和 Claude 在同一个任务上的表现把上面 curl 里的model字段换掉就行Base URL 和 Key 不用动。这就是统一入口的价值——换模型成本从改配置 重启降到改一个字符串。# 换成 DeepSeek curl -X POST https://taotoken.net/api/v1/chat/completions \ -H Authorization: Bearer sk-你的key \ -d {model: deepseek-coder-v3, messages: [{role: user, content: 你的任务}], max_tokens: 1024}跑完把两个模型的输出贴在一起对比比看排行榜直观得多。5. 本篇常见报错排查401、local proxy failed、reading choices这一节按报错原文对照都是我自己踩过的。5.1 401 Unauthorized完整报错{error: {message: Invalid API key provided, type: invalid_request_error, code: invalid_api_key}}原因有三种Key 复制时带了换行符、Key 已经过期、Key 前面的Bearer没加。排查顺序是先echo $TAOTOKEN_API_KEY | xxd | head看有没有0a结尾有的话用tr -d \n清掉。然后确认请求头是Authorization: Bearer sk-xxx不是Authorization: sk-xxx。5.2 local proxy failed完整报错Error: local proxy failed: dial tcp 127.0.0.1:7890: connect: connection refused这个报错说明你的客户端在尝试走本地代理端口但那个端口没有服务在跑。常见于之前配过代理工具、后来关掉了但环境变量没清。检查HTTP_PROXY和HTTPS_PROXYenv | grep -i proxy如果有输出用unset HTTP_PROXY HTTPS_PROXY清掉然后重启你的编辑器。注意这里说的是清理本地环境变量不是让你去配代理方向别搞反。5.3 reading choices 相关报错完整报错KeyError: choices或者TypeError: NoneType object is not subscriptable (reading choices)这个通常不是网络问题是返回体结构和你代码里取值的路径不匹配。比如你用的是 OpenAI 兼容格式返回是{choices: [...]}但你的代码按 Anthropic 格式取response[content]就会报这个。排查方法是先把原始返回打印出来import requests resp requests.post(url, headersheaders, jsonpayload) print(resp.status_code) print(resp.text[:500])看resp.text里的实际结构再改取值路径。如果是流式返回choices会在每个 chunk 里不是只在最后一个。5.4 OAuth 相关报错完整报错OAuth token expired, please re-authenticate这个出现在用 OAuth 方式登录的客户端里。解决方法是删掉本地 token 缓存重新登录。不同客户端缓存路径不同常见的是~/.config/客户端名/token.json或~/.客户端名/credentials。删掉后重启客户端会重新走授权流程。如果你用的是 API Key 方式接入不会遇到 OAuth 报错。这也是我推荐 API Key 的原因之一——少一层授权状态要维护。6. 三条动态的落地优先级与接入入口回到今天这三条。如果你只有半天时间我建议的顺序是先花两小时把 Slime 跑通因为它是唯一一个当天能看到训练指标变化的东西然后用半小时填 Codex Pro 申请表反正审核要等DeepSeek 内测如果没收到邀请就先放着等公测。Slime 跑通之后你手里就有了一个可复现的 RL 训练循环后面想换任务只需要改数据生成配置。这个框架的价值不在于它训出来的模型多强而在于它把数据生成 RL 循环这套流程标准化了你可以在自己的垂直任务上快速验证想法。Codex Pro 的六个月福利核心是给你一个低成本试错窗口。如果你本来就在用 GitHub 维护项目填个表不亏。但别为了申请去临时建仓库审核会看 commit 历史。DeepSeek 代码智能体的内测表现说明它在单文件任务上已经可用跨文件重构还需要时间。等它公测后你可以用统一入口把它和 Claude、GPT 放在同一个任务上对比选最适合你工作流的那个。接入配置我这边统一走 TaoTokenBase URL 是https://taotoken.net/apiKey 在 API Keys 页面生成模型 ID 在模型对话页面确认。三个入口分工明确生成 Key 去 API Keys确认模型 ID 去模型对话看接入文档去文档页。如果你要长期跑编码 AgentCoding Plan 的额度比按量计费划算适合每天都有补全和重构需求的场景。最后给一个实用技巧把常用的 curl 验证命令存成一个 shell 函数换模型时只传模型名参数这样每次验证新模型只要一行命令。check_model() { curl -s -X POST https://taotoken.net/api/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer $TAOTOKEN_API_KEY \ -d {\model\: \$1\, \messages\: [{\role\: \user\, \content\: \ping\}], \max_tokens\: 16} \ | python -c import sys,json; djson.load(sys.stdin); print(d[choices][0][message][content]) } check_model claude-sonnet-4-20250514 check_model deepseek-coder-v3能打印出模型回复就说明这条链路是通的。
返回列表