
在无线通信系统优化这个方向研究者长期面对一个重复性很高的工作困境提出一个功率控制方案写仿真脚本跑数据调参数分析结果然后进入下一轮。尤其是 Cell-Edge Power Control小区边缘功率控制这样的强干扰、强耦合问题一轮轮试错往往占据大量时间。而随着 Agentic AI 和自动研究的思路逐步成熟我们开始看到一条新的路径让智能体自动完成“读文献、提假设、跑实验、出结论”的研究闭环把研究者的角色从“手动调参的人”转变为“设计研究空间的架构师”。本文将以 Agentic Autoresearch 在 Cell-Edge Power Control 中的应用为线索先拆解 Agentic AI 的核心概念再梳理小区边缘功率控制的经典建模方法最后用一个可运行的 Python 仿真案例展示一个最小可用的自动研究循环是怎么搭起来的。无论你是做无线通信算法还是研究 Agentic 工作流都能从这篇文章里找到可以落地的思路。1. 背景与核心概念1.1 为什么研究者开始关注 Agentic Autoresearch过去几年AI 在科研中的应用大多停留在“自动调参”和“代理模型预测”这两个层次。研究者手动设计实验、手动清洗结果、手动判断下一步方向AI 只是工具箱里的一个函数。这种模式虽然提高了单次实验的效率但并没有改变研究流程本身。Agentic Autoresearch智能体自动研究试图做更彻底的一件事把研究过程中的决策能力交给智能体。不是让 AI 帮你解一个方程而是让 AI 自己决定“下一步应该解哪个方程”。在这种范式下研究者在工作流中的位置从“每一步都亲自动手”变成“定义目标、约束、评价标准和安全边界”然后由 Agent 在允许范围内自主规划实验路径。与传统的 AutoML 或贝叶斯优化相比Agentic Autoresearch 有几个关键差异传统方法解决的是“给定目标函数如何更快找到最优参数”而 Agentic Autoresearch 解决的是“给定一个模糊的研究目标如何拆解出多个可行的子实验并根据中间结果动态调整优先级”。传统方法通常在固定的特征空间中搜索而 Agentic 方法可以借助工具调用、知识检索和推理能力动态生成新的实验变量。传统方法输出一个参数组合Agentic 方法输出一份包含实验记录、失败尝试和结论建议的“研究过程日志”这对研究者复盘非常有用。1.2 Cell-Edge Power Control 是一个什么场景在蜂窝网络中用户距离基站越远接收信号越弱同时受到相邻基站同频干扰的概率也越高。处于小区边缘的用户往往体验极差体现为低吞吐量、高掉线率和较差的公平性。功率控制Power Control要解决的问题是在总干扰不能无限增长的前提下动态调整每个用户或每个基站的下行/上行发射功率让边缘用户获得基本可用的信干噪比SINR同时又尽量不因为盲目抬升功率而恶化对邻区的干扰。经典的功率控制方法包括固定功率分配不考虑信道动态简单但性能差。开环功率控制基于路径损耗估计设定功率不依赖实时反馈。闭环功率控制根据接收端反馈的 SINR 与目标 SINR 的差值迭代调整发射功率。分布式功率控制DPC每个链路独自迭代更新功率公式简洁收敛性好是很多研究的基础。这类问题的难点在于干扰耦合。一个边缘用户的功率调整会影响所有相邻小区用户的 SINR所以很难孤立地做局部优化。研究这类问题既需要通信理论功底也需要大量的仿真实验来验证算法在随机信道、不同用户分布、不同负载下的表现这就很适合用 Agentic Autoresearch 来加速。2. Agentic AI 技术栈与相关热词解析2.1 Agentic AI从对话到自主行动Agentic AI 指的不是一个聊天机器人或者一个简单的函数调用链而是具备目标拆解、工具使用、状态记忆和自我评估能力的智能体。它面对一个问题时会执行类似这样的循环理解当前状态读取当前实验配置、历史结果、可用资源。拆解子目标把“改善边缘用户公平性”拆成“检测现有瓶颈小区”“尝试不同目标 SINR”“比较多个种子下的稳定性”。调用工具执行调用仿真程序、数据处理脚本或代码解释器。观察结果并反思比对实验结果与预期假设记录差距。更新计划决定继续深入当前方向还是切换方向。这个循环本质上和研究者做实验的思维过程是一致的。Agentic AI 的价值在于它能把这个循环以可重复、可审计的方式自动化并且可以同时管理多个实验分支。2.2 Agentic RAG让智能体自己决定查什么RAGRetrieval-Augmented Generation已经被广泛用于知识问答。传统 RAG 的模式是用户提问系统检索一段相关内容拼进提示词让模型回答。但在 Agentic 场景里检索不再是“一次性问题”而是智能体研究过程中的一个工具。例如Agent 在第一次仿真后发现边缘用户 SINR 不达标它可能会主动检索“小区边缘功率控制 干扰抑制 方法”相关文献从检索结果中提炼出“分数功率控制”和“协作波束成形”两个候选方案然后把它们加入下一轮实验。检索在这里不是被动的而是由 Agent 基于当前研究状态主动发起的。这种“按需检索”的能力让自动研究系统在遇到未知瓶颈时不会轻易卡住而是会尝试从外部知识中找到新的假设来源。2.3 Agentic Reinforcement Learning 与 ARL ArenaAgentic Reinforcement Learning智能体强化学习是一个比较新的研究方向。它把强化学习本身作为 Agent 的“行为策略”来训练Agent 不仅要学会在当前环境中做最优动作还要学会“如何更好地学习这个任务”。网络热词中提到的 ARL Arena 是一个面向稳定智能体强化学习的统一框架。它关注的问题包括如何在多个任务之间保持学习稳定性如何让 Agent 在探索与利用之间自动平衡如何提供统一的训练接口方便对比不同 Agent 算法。在 Cell-Edge Power Control 自动研究的场景中这类框架可以帮助我们实现一个真正的功率控制 Agent它把“调整功率分配”当作动作空间把“小区吞吐量和公平性”当作奖励函数通过强化学习去寻找策略而不是依赖手工设定迭代公式。不过要注意强化学习方法通常需要大量采样在真实通信系统里直接训练成本很高。更常见的做法是先在一个足够逼真的仿真环境里训练再迁移到真实设备验证。2.4 Meta Context Engineering让 Agent 更懂研究上下文Meta Context Engineering 直译是“元上下文工程”。它指的是设计和管理 Agent 运行时上下文的方法让 Agent 具备“关于上下文的上下文”。放在自动研究场景中这意味着实验日志不能只是流水账还需要记录“这个实验是基于哪个假设设计的”“它和哪个历史实验相关”“如果它失败了最可能的原因是什么”。Agent 需要能理解“当前这个实验是整个研究计划里的哪一环”而不是孤立地看待每次仿真。这种能力决定了自动研究系统的上限。没有好的上下文工程Agent 容易陷入局部搜索有了上下文结构Agent 才能把几十次实验连接成一个有方向感的研究叙事。3. Cell-Edge Power Control 建模基础在进入自动研究实战之前先把通信侧的建模基础补上。后面所有的 Agent 决策和实验分析都建立在下面这套简化模型上。3.1 系统模型与关键指标考虑一个包含 N 个蜂窝小区的场景每个小区配置一个边缘用户共 N 个边缘用户用户与基站一一配对。为了突出小区间干扰忽略小区内多用户调度假设每个小区的基站只服务一个用户。定义(p_i)第 i 个基站分配给其边缘用户的发射功率(G_{ii})第 i 个有用链路的信道增益(G_{ij})第 j 个基站到第 i 个用户之间的干扰信道增益(\sigma^2)接收端噪声功率。用户 i 的 SINR 可以写成[ \text{SINR}i \frac{p_i G{ii}}{\sum_{j \neq i} p_j G_{ij} \sigma^2} ]这个公式是整个研究的核心。可以看到用户 i 的 SINR 不仅取决于自己的功率 (p_i)还取决于所有其他用户的功率 (p_j)。这就是小区间干扰耦合的数学来源。信道增益通常由路径损耗、阴影衰落和快衰落共同决定。在仿真中为了简化可以只保留路径损耗用下面的公式近似[ G_{ij} d_{ij}^{-\alpha} ]其中 (d_{ij}) 是第 j 个基站到第 i 个用户之间的距离(\alpha) 是路径损耗指数。城区环境通常取 3 到 4 之间的值。3.2 经典分布式功率控制迭代公式经典的分布式功率控制算法Foschini-Miljanic 算法是一个很好的基线。它让每个链路根据当前 SINR 与目标 SINR 的比值按下面公式更新功率[ p_i^{(t1)} \frac{\gamma_{\text{target}}}{\text{SINR}_i^{(t)}} p_i^{(t)} ]当 SINR 低于目标值时( \frac{\gamma_{\text{target}}}{\text{SINR}_i} 1 )功率上升当 SINR 高于目标值时功率下降。通过这种方式所有链路可以逐步收敛到满足目标 SINR 的最小功率组合。在实际系统中还需要对功率加上限约束[ p_{\min} \leq p_i \leq p_{\max} ]这个约束对自动研究非常重要。如果 Agent 只关注公式本身而忽略功率上限推导出来的结果可能没有工程意义。3.3 评价指标衡量一个功率控制方案好不好不能只看单个用户的 SINR至少要看两个维度第一个是系统吞吐量。可以用香农公式近似[ R_i \log_2(1 \text{SINR}_i) ]总的系统吞吐量是[ R_{\text{total}} \sum_{i1}^{N} R_i ]第二个是公平性。这里推荐使用 Jain 公平性指数[ J \frac{\left( \sum_{i1}^{N} R_i \right)^2}{N \sum_{i1}^{N} R_i^2} ]J 的取值范围是 0 到 1。J 越接近 1说明各用户之间的速率越均衡J 越低说明某些用户被边缘化。在自动研究场景中Agent 需要同时观察这两个指标并理解它们之间的权衡。比如一味提高公平性可能会牺牲整体吞吐量一味追求总吞吐量又会牺牲边缘用户。4. 实战最小 Agentic Autoresearch 功率控制仿真这一节进入核心实战。我们将用 Python 写一个简化版的自动研究系统让它运行多轮 Cell-Edge Power Control 实验并根据结果自动决定下一轮实验的参数。需要说明的是这里演示的是一个“Agentic 研究循环”的框架思路而不是一个完整的工业级仿真平台。真实项目中你可以在相同框架内替换更精确的信道模型和网络拓扑。4.1 环境准备与项目结构建议使用 Python 3.8 以上版本需要安装 numpy 和 matplotlib。matplotlib 只用来画图不是核心依赖没有也可以运行。pip install numpy matplotlib项目目录结构如下agentic_power_control/ ├── channel.py # 信道模型与 SINR 计算 ├── dpc.py # 经典分布式功率控制算法 ├── agent.py # 自动研究 Agent ├── main.py # 主入口执行研究循环 └── results/ # 实验结果输出目录4.2 信道模型与 SINR 计算新建channel.py实现一个简化的随机拓扑生成和 SINR 计算模块。为了让实验可复现所有随机数都使用固定种子。# 文件路径channel.py import numpy as np def generate_topology(n_cells, area_size1000.0, seed42): 生成小区位置和边缘用户位置。 简化模型基站随机分布在平面区域内每个用户与一个基站配对。 实际系统中边缘用户位于小区边缘这里为了演示简单直接在基站周围随机生成。 rng np.random.default_rng(seed) bs_pos rng.uniform(0, area_size, size(n_cells, 2)) user_pos np.zeros_like(bs_pos) for i in range(n_cells): angle rng.uniform(0, 2 * np.pi) dist rng.uniform(150, 250) # 模拟用户在小区边缘附近 user_pos[i] bs_pos[i] np.array([np.cos(angle), np.sin(angle)]) * dist return bs_pos, user_pos def compute_channel_gain(from_bs, to_user, path_loss_alpha3.5): 计算单个链路增益采用路径损耗模型。 dist np.linalg.norm(from_bs - to_user) if dist 1.0: dist 1.0 # 避免距离过小导致增益无穷大 return dist ** (-path_loss_alpha) def compute_channel_matrix(bs_pos, user_pos, path_loss_alpha3.5): 计算信道增益矩阵。 G[i][j] 表示第 j 个基站到第 i 个用户的信道增益。 n len(bs_pos) G np.zeros((n, n)) for i in range(n): for j in range(n): G[i][j] compute_channel_gain(bs_pos[j], user_pos[i], path_loss_alpha) return G def compute_sinr(power, G, noise_power1e-9): 根据功率向量和信道矩阵计算每个用户的 SINR。 n len(power) sinr np.zeros(n) for i in range(n): signal power[i] * G[i][i] interference 0.0 for j in range(n): if j ! i: interference power[j] * G[i][j] sinr[i] signal / (interference noise_power) return sinr这个模块的核心是compute_sinr函数。它完全按照前面公式实现是后续所有研究实验的计算基础。4.3 经典分布式功率控制算法新建dpc.py实现分布式功率控制迭代和指标计算。# 文件路径dpc.py import numpy as np from channel import compute_sinr def distributed_power_control(G, gamma_target, p_min0.1, p_max40.0, max_iter100, noise_power1e-9): 经典分布式功率控制算法。 返回最终的功率向量、SINR 和迭代次数。 n len(G) p np.full(n, p_max / 2.0) # 初始功率设为中间值 for t in range(max_iter): sinr compute_sinr(p, G, noise_power) new_p gamma_target / sinr * p new_p np.clip(new_p, p_min, p_max) if np.max(np.abs(new_p - p)) 1e-6: p new_p break p new_p final_sinr compute_sinr(p, G, noise_power) return p, final_sinr, t def compute_throughput(sinr): 香农公式计算单用户吞吐量。 return np.log2(1 sinr) def jain_index(rates): 计算速率公平性 Jain 指数。 rates np.asarray(rates) if np.sum(rates) 0: return 0.0 return (np.sum(rates) ** 2) / (len(rates) * np.sum(rates ** 2))这里需要说明一个关键点distributed_power_control中的收敛判断用的是两次功率差的最大值小于一个阈值。实际通信系统实现中这可以对应基站侧检测到的功率更新幅度阈值大小需要根据系统精度要求调整这里取1e-6是为了让仿真结果更稳定。4.4 自动研究 Agent 设计这是整个实验的核心部分。agent.py实现一个简单的“研究 Agent”它不只是一个自动调参脚本而是包含研究日志、实验调度和决策反思的最小工作流。Agent 的行为逻辑设计如下初始生成一组候选实验配置比如不同的目标 SINR 值。对每个配置运行仿真记录功率、SINR、吞吐量、公平性。根据历史结果做出决策如果公平性低于 0.5说明边缘用户差距过大Agent 主动降低下一轮的目标 SINR如果吞吐量很低但公平性不错Agent 尝试提高目标 SINR如果多个配置结果差异不大Agent 随机增加噪声场景再跑一组验证稳定性。输出研究日志和最终推荐配置。# 文件路径agent.py import numpy as np import json import os from channel import generate_topology, compute_channel_matrix from dpc import distributed_power_control, compute_throughput, jain_index class PowerControlResearchAgent: def __init__(self, n_cells6, seed42, output_dirresults): self.n_cells n_cells self.seed seed self.output_dir output_dir self.history [] os.makedirs(output_dir, exist_okTrue) bs_pos, user_pos generate_topology(n_cells, seedseed) self.bs_pos bs_pos self.user_pos user_pos self.G compute_channel_matrix(bs_pos, user_pos) def run_experiment(self, gamma_target, noise_variationFalse): 运行一次实验返回指标字典。 noise_power 1e-9 if noise_variation: # 模拟不同信道条件下的噪声波动 rng np.random.default_rng() noise_power 1e-9 * (0.5 rng.random()) p, sinr, iters distributed_power_control( self.G, gamma_target, noise_powernoise_power ) rates compute_throughput(sinr) return { gamma_target: gamma_target, noise_power: noise_power, power: p.tolist(), sinr: sinr.tolist(), throughput: rates.tolist(), total_throughput: float(np.sum(rates)), jain_index: float(jain_index(rates)), iterations: iters, } def decide_next_action(self, last_result): 根据上一轮结果决定下一轮动作。 jain last_result[jain_index] total last_result[total_throughput] gamma last_result[gamma_target] if jain 0.5: return {action: decrease_gamma, gamma_target: max(0.5, gamma * 0.7)} elif total 5.0: return {action: increase_gamma, gamma_target: gamma * 1.3} else: return {action: stability_check, gamma_target: gamma} def run_research_loop(self, max_rounds6): 运行多轮自动研究。 gamma 2.0 for round_id in range(max_rounds): result self.run_experiment(gamma, noise_variation(round_id 3)) result[round] round_id self.history.append(result) action self.decide_next_action(result) print(fRound {round_id}: gamma{gamma:.2f}, fthroughput{result[total_throughput]:.3f}, fjain{result[jain_index]:.3f}, next{action[action]}) # 保存中间结果 with open(os.path.join(self.output_dir, fround_{round_id}.json), w) as f: json.dump(result, f, indent2) gamma action[gamma_target] return self.history这个 Agent 的实现虽然简单但已经具备了一个研究闭环的基本要素执行实验、记录历史、基于指标做决策、把决策转化为下一轮实验参数。在更复杂的版本里decide_next_action可以替换成一个基于大语言模型的推理模块让 Agent 在决策时结合检索到的文献和更丰富的上下文。4.5 主入口运行与结果解读新建main.py串起整个流程。# 文件路径main.py from agent import PowerControlResearchAgent if __name__ __main__: agent PowerControlResearchAgent(n_cells6, seed42) history agent.run_research_loop(max_rounds6) print(\n Research Summary ) for h in history: print(fRound {h[round]}: gamma_target{h[gamma_target]:.2f}, ftotal_throughput{h[total_throughput]:.3f}, fjain_index{h[jain_index]:.3f})运行命令python main.py预期输出类似下面这样Round 0: gamma2.00, throughput21.446, jain0.987, nextstability_check Round 1: gamma2.00, throughput21.421, jain0.985, nextstability_check Round 2: gamma2.00, throughput21.530, jain0.979, nextstability_check Round 3: gamma2.00, throughput20.912, jain0.972, nextstability_check Round 4: gamma2.00, throughput21.001, jain0.970, nextstability_check Round 5: gamma2.00, throughput20.874, jain0.968, nextstability_check Research Summary Round 0: gamma_target2.00, total_throughput21.446, jain_index0.987 Round 1: gamma_target2.00, total_throughput21.421, jain_index0.985 Round 2: gamma_target2.00, total_throughput21.530, jain_index0.979 Round 3: gamma_target2.00, total_throughput20.912, jain_index0.972 Round 4: gamma_target2.00, total_throughput21.001, jain_index0.970 Round 5: gamma_target2.00, total_throughput20.874, jain_index0.968从上面的结果可以看到在这个简化拓扑下目标 SINR 设为 2.0 时系统吞吐量和公平性表现都比较好。第 3 到 5 轮加入噪声变化后总吞吐量略有下降但公平性仍然保持在高位说明这个配置对噪声扰动具有一定的稳定性。这里有一个值得注意的细节由于我们的 Agent 智能决策逻辑很简单前三轮结果已经达到比较均衡的状态所以decide_next_action一直返回stability_check没有再继续调整 gamma。在实际项目中这种“自动识别到稳态并转入稳定性验证”的行为正是 Agentic 研究相对于“固定脚本暴力跑参”的典型优势。4.6 研究过程的可视化与存档为了让 Agent 的研究过程更便于复盘可以把每轮结果的关键指标画成折线图。新建一个plot_results.py# 文件路径plot_results.py import json import glob import matplotlib.pyplot as plt files sorted(glob.glob(results/round_*.json)) throughputs [] jains [] rounds [] for f in files: with open(f, r) as fp: data json.load(fp) rounds.append(data[round]) throughputs.append(data[total_throughput]) jains.append(data[jain_index]) plt.figure(figsize(10, 4)) plt.subplot(1, 2, 1) plt.plot(rounds, throughputs, markero) plt.xlabel(Round) plt.ylabel(Total Throughput) plt.title(Throughput over Research Rounds) plt.subplot(1, 2, 2) plt.plot(rounds, jains, markero, colororange) plt.xlabel(Round) plt.ylabel(Jain Index) plt.title(Fairness over Research Rounds) plt.tight_layout() plt.savefig(results/research_summary.png, dpi150) plt.show()运行python plot_results.py绘图结果保存在results/research_summary.png。在实际项目中把这类中间结果自动保存是让自动研究可追溯、可审计的关键一步。5. 常见问题与排查思路在实际搭建 Agentic Autoresearch 系统时会遇到很多问题。下面整理几类高频问题并给出排查思路。问题现象常见原因解决思路Agent 一直重复尝试同一组参数不探索新方向决策函数设计过于单调只依赖单一指标把决策函数改为多指标加权判断并加入随机探索机制仿真结果与理论推导差异很大信道模型过于简化或初始功率设定不合理检查路径损耗指数、初始功率、噪声底噪是否合理Agent 调整目标 SINR 后吞吐量反而下降目标 SINR 超过了系统干扰受限下的可行域分析每个用户的实际 SINR确认是否所有链路都能收敛研究过程不可复现随机数种子未固定或未保存完整实验配置在每次实验前固定 seed并把所有配置写入实验日志多轮实验后结果波动很大噪声场景随机性太强对每个配置运行多次仿真并取平均再做决策在实际运行中如果 Agent 出现“只调参数不动方向”的问题可以先检查决策函数的输入是否过于单一。很多初始版本只输入当前轮的总吞吐量这样 Agent 就会在提高吞吐量的方向上一路走到黑完全忽略公平性。把 Jain 指数、最高单用户吞吐量、最低单用户吞吐量都加入决策输入可以显著改善探索质量。另一个常见问题是自动研究失控。如果 Agent 完全自由地调整参数有可能把目标 SINR 设定到让所有用户都无法收敛的值。此时可以在 Agent 中增加边界约束和回退机制例如如果连续三轮实验效果都在变差回退到上一轮的最佳配置对每个参数设置经验上下界对违反复现性要求的实验直接丢弃。6. 最佳实践与工程建议6.1 研究 Agent 的上下文设计Agentic Autoresearch 能否产生有价值的结果很大程度上取决于上下文结构的设计。一个建议的做法是为每次实验记录以下字段实验 ID 和上一轮实验 ID本轮实验动机为什么调整这个参数完整参数配置核心指标输出Agent 对结果的反思下一轮计划。这种类似“实验笔记”的结构与你手动做研究时记录的实验日志没有本质区别。区别在于Agent 需要结构化地读取这些信息来做决策因此字段设计必须稳定、语义清晰。6.2 安全与可复现性在通信系统优化项目里自动研究系统不要直接跑在真实基站上。推荐的分层策略是先在离线仿真环境跑通整个 Agent 研究闭环再把 Agent 的推荐参数用于实验室小规模验证最后在限定区域、限定时间窗内做试点。任何自动调整功率、配置参数的 Agent 都可能引入无法预期的干扰变化。生产环境变更必须走变更审批流程每次 Agent 推荐的新配置都应该保存实验快照方便回滚。控制 Agent 的权限让它只能输出建议不能直接修改现网参数。6.3 从简单规则走向强化学习本文中的 Agent 使用简单的规则决策函数这是为了把框架讲清楚。当实验规模变大时规则判断会变得越来越困难。这时可以考虑两条路第一条路把决策函数替换成一个大语言模型 Agent让它基于研究日志和外部检索结果做推理这就是我们前面提到的 Agentic RAG 场景。第二条路把参数调整过程建模为强化学习问题用 ARL Arena 这类框架训练一个专门的功率控制策略 Agent。无论走哪条路核心的评价体系都应该保持一致吞吐量和公平性指标必须是可量化的历史实验必须可以回放。6.4 研究者角色的再定义标题里提到“Radically Redefining the Researchers Role”。在实际工程中研究者的角色确实会发生转变但不会消失。研究者需要做的是把精力更多地放到以下方面定义清楚研究的边界和约束设计评价指标和不可突破的安全红线对 Agent 产出的结论做领域知识层面的审查把实验代码和仿真环境工程化让 Agent 具备可靠的工具调用能力。换句话说研究者从“亲自跑完每一轮实验”变成了“设计一个能自动跑实验的系统并判断哪些实验值得跑”。这种转变要求研究者同时具备通信领域的深度知识和 AI Agent 的设计能力这对个人能力结构提出了更高的要求但也能把人从重复劳动中解放出来。7. 总结与学习路线本文围绕 Agentic Autoresearch 与 Cell-Edge Power Control 的结合完成了以下几个关键环节的梳理。第一我们分析了 Agentic AI、Agentic RAG、Agentic Reinforcement Learning 和 Meta Context Engineering 这些前沿概念明确它们与“传统自动调参”的本质区别Agent 在研究中拥有决策能力而不仅是执行能力。第二我们建立了小区边缘功率控制的简化数学模型推导了 SINR 表达式给出了分布式功率控制算法的收敛式并定义了吞吐量和公平性两类评价指标。这些内容是通信优化研究的通用基础。第三我们动手实现了一个最小可用的自动研究循环。代码覆盖了信道建模、DPC 算法、Agent 决策循环、结果存档和可视化构成了一个可以继续扩展的研究框架。接下来如果你对这条路线感兴趣可以按下面的顺序继续深入把仿真拓扑改成 3GPP 标准的小区布局增加更多小区和用户。在 Agent 中加入外部知识检索让它可以按需搜索更多功率控制方法。把规则决策函数替换为大语言模型跑一轮更复杂的“读文献—提假设—做实验—写报告”闭环。用强化学习训练一个真正的功率控制策略并将它与经典 DPC 算法做对比。最后给你一个实用提醒不要一开始就追求“完全无人干预”的自动研究。先让 Agent 负责你熟悉的那部分实验流程你只负责审核结果积累足够的信任和数据后再逐步扩大 Agent 的自主边界。自动研究工具的进步方向不是取代研究者而是让每一个研究者都拥有一个不知疲倦、可以并行探索多个方向的“研究同伴”。