
1. 开场先泼冷水AI不是来接管IT是来重排IT的1.1 热搜词其实是一张岗位重排表上个月我拉了一场小范围圆桌地点就选在朋友公司的一间会议室聊的话题恰好就是那个被翻来覆去讨论的问题AI时代IT人怎么找到自己的位置。之所以想聊这个是因为打开热搜一眼扫过去几乎整屏都是AI前缀的词ai编程、ai测试、ai agent、ai模型部署、ai infra、ai产品经理。放在一年前这些词还分散在技术社区的不同角落如今已经扎堆涌进了大众视野。我身边的IT朋友状态基本分成两种一种觉得再不学AI就要被淘汰了焦虑到失眠另一种觉得AI就是个更聪明的CtrlC没啥大不了。两种心态说实话都偏了。我说句实在话AI不会把IT行业抹掉它做的是重排。重排的意思是有些重复性高、确定性强的活儿会被工具替代但围绕AI的部署、调优、测试、产品化、业务落地会出现一批新的活。岗位不会消失岗位会换名字、换技能要求。这就像热搜词本身的变化——大家都在看ai编程怎么替代程序员但ai测试和ai infra这些词的存在恰恰说明AI也需要人帮它兜底、给它铺路、替它把关。1.2 四位嘉宾四种完全不同的视角这场对话我请了四位朋友正好对应IT行业的四个切面阿黎以前是通信行业运维现在转做AI Infra和模型部署天天跟推理框架、GPU显存、延迟监控打交道。他是那种不写算法论文但能让你把模型跑起来的人。老周资深后端开发团队里已经全面引入AI编程辅助自己也写了大量提示词模板属于用AI写代码但不被AI带着走的一线实践者。Vivian某公司的测试负责人最近一年都在处理生成式AI带来的质量保障问题踩过不少LLM输出不可控的坑。大熊AI产品负责人做过好几个Agent应用从客服机器人到文档处理工具都有落地经验。我把问题抛给他们的第一句话是你觉得IT人现在最大的焦虑根源出在哪老周先开口很多人焦虑是因为还在用会不会被取代这个问题问自己。但这个问题本身就没法回答。应该问的是哪些事情AI能比我做得更好哪些事情只有我能做。两句话问完位置自然就清楚了。大熊补了一句AI本身不产生价值产生价值的是AI加场景。而场景在哪儿需要什么人能看懂这就是IT人最重要的职责。开场白说完四个人分别给出了自己的答案。我按对话顺序一个个展开说。2. 第一位大咖模型部署和AI Infra普通IT人最容易被低估的入口2.1 不啃算法论文也能和大模型打交道阿黎是四个人里转岗路径最草根的。他本科不是计算机以前干通信运维后来跳到一家做企业服务的公司从零开始搞AI Infra。他说的第一句话让我印象很深很多IT人觉得自己做不了AI是因为不会训练模型、不会推公式。这是个巨大的误解。今天真正缺的不是能设计新模型的人而是能把开源模型接回企业业务的人。他给我划了一道分界线算法工程师解决的是模型怎么更聪明的问题AI Infra工程师解决的是模型怎么跑得更稳、更快、更便宜的问题。绝大多数企业用不到自己训练基础模型开源的Qwen、Llama、DeepSeek系列已经够用真正难的是把这些模型部署成稳定的服务并且塞进现有的业务系统里。这活儿需要什么背景呢Linux、Docker、Kubernetes、网络、存储、监控告警这些传统运维和后端工程师的看家本事几乎原封不动能用上。阿黎说他的团队一共六个人三个以前是运维SRE两个是做Java后端的只有一个人算法出身。所以普通IT人别慌你现在积累的这套工程能力不是白学的。2.2 一次私有化部署要算清的账说到具体实操阿黎现场给我们算了一笔账。假设企业要私有化部署一个7B参数量的开源模型用FP16精度光模型权重就需要约14GB显存70亿参数乘以2字节。这还没完推理过程中的KV Cache还要占额外的显存如果你的并发用户是32个每个用户上下文长度4K左右KV Cache再算上4到8GB。再加上CUDA上下文、中间激活值一块24GB显存的消费级卡勉强能跑但并发一上去就吃紧。所以我一看到有人拿消费级显卡跑7B模型说生产可用就知道他没经历过真实业务。阿黎笑着说真正上线至少得是A10、A100这类专业卡或者用多卡部署。他还给了部署工具选型建议我整理成了表格推理框架适用场景上手成本关键注意点vLLM生产环境高并发、要求高吞吐中支持Continuous Batching吞吐优势明显SGLang复杂控制流、多轮推理优化中高需要熟悉Python和生成逻辑TensorRT-LLM追求极致延迟、显卡统一高模型编译时间较长灵活性稍差Ollama本地开发调试、快速验证低轻量但不够生产级阿黎特别强调不要一上来就追求最高级的框架。如果你的场景是内部工具、几十个人用Ollama加一台机器就够如果你面对的是企业级API服务、日均调用几百万次才需要上vLLM甚至TensorRT-LLM。选型的依据是你有多少卡、多少用户、多高的延迟要求不是框架越新越好。2.3 从事AI Infra的日常推理、监控、成本那AI Infra工程师每天都在干嘛阿黎说核心三件事推理优化、稳定性保障、成本治理。推理优化听起来高大上落到日常就是盯着几个指标首Token延迟TTFT、Token生成速度、请求排队时间、GPU利用率。他给我看了他们内部的一个监控面板配置用Prometheus采集推理服务的吞吐、延迟分位数、显存占用和GPU利用率Grafana上做可视化P99延迟超过2秒就会触发告警。有一个特别容易被忽略的坑很多团队只看平均延迟不看长尾延迟。平均80毫秒听起来很漂亮但如果你把P99拉出来可能已经到2.3秒了。这背后往往是某个慢请求拖累了整体感受。做AI服务必须把P99和P999放在跟平均值同等重要的位置去盯。成本治理这块阿黎也分享了一组心法模型服务最大的成本是GPU空转。传统架构下GPU卡利用率可能只有百分之二三十。换用vLLM的Continuous Batching机制动态拼装请求同样的显卡可以实现三到五倍的吞吐提升。这一升一降账单数字差距是肉眼可见的。所以阿黎对新人的建议是先别急着学TensorRT先学会看显存、看吞吐、看延迟学会用数据和账单倒推优化方向。懂成本是AI Infra这个方向最值钱的能力之一。3. 第二位大咖AI编程不是代码生成器是结对编程搭档3.1 现在的主流工作流已经不是人写AI查老周一开口就给了个判断现在还在把AI编程当成插件版Copilot用的人已经落后了。他所在团队从2024年开始全面推行AI辅助开发到现在的标准工作流已经变成需求拆解、写清上下文、AI生成初稿、人工审查、补充测试、合入主干。整个过程像带了两个水平的初级开发进来打下手但最后把关的还是人。他打了个比Debug更贴切的比喻以前我写代码像自己做菜从洗菜切菜到起锅烧油全包。现在AI是把配菜切好、调料备好的后厨助手我要做的是决定今天做什么菜、用什么火候、什么时候起锅。如果菜做砸了后厨助手不会背锅是我这个掌勺的人有问题。这个转变最直接的结果是编码这个动作在工时里的占比大幅下降而设计、评审、测试的占比大幅上升。老周统计过自己团队的项目数据在中等复杂度需求上AI生成的代码初稿接受率大约七成剩下三成需要人工重写或者调结构但一旦涉及跨服务改造、老系统迁移这类复杂架构任务AI生成代码的接受率会骤降到两成左右。这说明什么越是确定性高、模式固定的代码AI越能接住越是需要全局理解、隐性约束多的代码越离不开人。3.2 提示词与代码审查新的基本功老周现场分享了一条他惯用的提示词模板我觉得很有参考价值你是资深Java后端工程师熟悉Spring Boot 3和MyBatis-Plus。 当前项目有一个订单状态机需要实现状态流转方法。 硬性要求 1. 仅允许待支付 - 已支付 - 已发货 - 已完成 单向流转 2. 非法流转必须抛出OrderStateException并记录审计日志 3. 方法命名遵循项目现有规范 4. 输出包含对应的单元测试代码。他说这个模板的核心不是把需求描述完而是把什么是正确的约束条件交代清楚。AI最怕的不是复杂性而是含糊性。你给它模糊的需求它就会给出看起来没问题、一上线就出问题的代码。代码审查现在成了最关键的一环。老周说。他要求团队做Review时重点看三样东西一是有没有绕过现有基础设施、另起炉灶二是有没有处理异常和边界情况三是有没有引入难以维护的抽象。这些都是AI最容易出错的地方因为它不会知道你公司内部有统一的日志规范不知道某个老接口是千万不能碰的更不知道架构文档里那句不要在这里查数据库是什么意思。3.3 程序员真正的护城河说到程序员会不会被AI替代这个话题老周的态度很明确如果我是一个只会写CRUD、从来不问业务为什么这么设计的程序员那我确实危险。但如果我能定义什么是正确能拆解复杂业务规则能搭建并维护整个研发流程AI只会让我的产出放大十倍。他给了个很直白的例子以前一个后端开发要完成一个订单模块从数据库设计、接口实现到单元测试至少得两天。现在有了AI辅助把业务规则梳理清楚、分步生成、再补审查和测试一天以内就能搞定。省下来的时间不是用来摸鱼的是用来去跟前端对齐接口、去跟产品讨论逻辑漏洞、去查日志分析线上隐患的。位置不是靠AI让给你是你把低价值时间腾出来后去做更高价值的事才找到的。这一段讨论完我明显感觉到Vivian有点坐不住了她接过话说你们在讲代码怎么写得快我却天天在为AI写出来的代码怎么测而头疼。于是话题自然转向质量保障。4. 第三位大咖AI测试一个被误解很深的方向4.1 传统测试方法论在生成式AI面前失灵Vivian举了个例子她团队测试一个客服机器人用传统自动化脚本去测断言返回值中包含某段固定文本结果十次里能挂八次。不是程序有bug是大模型每次回答都不完全一样偶尔还会换个表达方式。原来的断言方式直接失效。这可能是很多测试团队最痛苦的认知冲击我们测了十几年的功能测试核心逻辑是expected等于actual。但LLM的输出天然是概率性的你没法要求它每次吐出同样的字。这时候再去纠结逐字匹配方向就错了。她总结了传统测试和AI质量保障的核心差异做成了一张对比表维度传统功能测试AI质量保障期望结果确定性可精确预期概率性需要语义判定断言方式expected actual语义匹配 规则校验 人工抽检测试数据固定用例集评测集 对抗样本 线上采样回归回归目标找出功能缺陷发现行为漂移和模型退化风险模型代码改动影响功能Prompt、模型版本、知识库都可能影响行为Vivian说做AI测试的第一步是接受不确定性是产品特性的一部分这个事实然后设计一套能跟不确定性共存的质量体系。4.2 用AI测AI评测集、护栏和回归策略那AI测试怎么做Vivian给了三层策略第一层输入侧。测试集要覆盖四类正常输入、边界输入、恶意输入、敏感输入。尤其不能漏掉对抗样例比如故意绕开安全规则的问题。她举了个例子某个客服机器人最初可以通过角色扮演的方式来套取系统提示词后来加入了一组专门的越狱攻击测试用例问题才暴露出来。没有这些对抗样例模型表面表现再好你都看不到它暗处的裂缝。第二层输出侧。用语义相似度来判断结果是否可接受而不是逐字匹配针对有固定结构的输出比如JSON、表格可以解析出关键字段再校验。现在很多团队用LLM as Judge来给AI输出打分但Vivian提醒Judge模型本身也是模型它也会犯错。我们内部会让两个不同模型交叉打分再抽10%人工复核。用AI测AI没问题但不能完全脱离人的判断。第三层系统侧。AI输出在进入下游业务前必须加规则护栏非法内容过滤、格式校验、危险操作拦截。Vivian说这些护栏某种意义上比模型本身还重要。模型可以直接调API发邮件你总不能指望它每次都想清楚吧 这些规则通常用确定性代码实现可解释、可测试、可回滚是整个质量体系里最稳的锚点。她还特别强调回归策略Prompt一改、模型版本一升、知识库一更新都可能让行为发生非预期变化。所以凡是跟AI行为相关的改动都要像代码版本一样记录配套跑一遍回归数据集跟踪关键指标有没有漂移。她的团队现在把Prompt文件纳入Git管理每次改动都走Review和CI流程效果非常明显。4.3 测试工程师的新技能栈那一个传统测试工程师想转AI测试应该学什么Vivian给了个排列顺序先把Prompt工程搞明白因为你不懂模型怎么输出就没法设计测试场景再把LangChain这类工具链跑通因为Agent应用的链路已经默认带着编排和记忆了最后才是回到老本行用pytest写自动化但这次自动化测的是行为不是函数返回值。她还提到AI时代测试工程师会更像一个系统的体检医生既懂业务规则又能设计检查项来评估系统健康度。会设计评测集、会分析错误案例、能定位是模型问题还是Prompt问题还是知识库问题这三件事就是AI质量保障方向的底层能力。这个方向目前人才稀缺Vivian说他们团队招人招了大半年能同时具备这几样能力的候选人少之又少。听Vivian说完大熊终于开口了你们一个把AI服务跑起来一个把AI代码写出来一个把AI质量测住那我就是那个决定今天要做什么菜的人。 他把老周的比喻接了过去开始聊产品和Agent。5. 第四位大咖AI产品与Agent应用做会干活的东西5.1 产品经理不再只是画原型大熊是四个人里话最少但每句都踩在点上的那种人。他说AI时代的产品经理最大的变化是核心工作从画原型、写PRD变成把模糊需求翻译成可实现、可评估的AI能力。他举了个反例某业务方提需求我们要一个AI助手能回答员工所有问题这根本不是一个可以开发的需求。产品经理要把这句话拆成目标用户是谁、回答范围是哪些知识库、准确率要做到多少、答错了怎么办、需不需要转人工、预算和延迟能不能接受。没有这些约束研发拿到需求只能两眼一抹黑。AI产品经理的本质是一个需求翻译器。大熊说你得先让业务知道AI能做什么、不能做什么再让技术知道业务到底要什么、接受什么样的容错。两头都得说人话。5.2 Agent应用从Demo到可用的距离大熊做过的Agent应用里印象最深的是一个客服机器人的演进过程。第一个版本就是最朴素的把用户问题直接丢给LLM让它自由发挥——当时是在Demo里演示效果惊艳老板当场拍板要上线。结果一上生产就知道完蛋了没有知识库约束没有兜底策略用户问一个产品手册里没有的问题它能凭想象力给你编一个答案。大熊把踩过的坑总结成四个方面工具调用不稳定。模型返回的JSON参数偶尔少个引号或者字段类型不对直接导致下游系统调用失败。这种问题不能指望模型哪天变好要在解析环节做容错。多步任务缺少重试。Agent执行一个查询订单-确认收货-发起退款的三步任务如果中间某一步超时整个链路就挂了又没有自动重试和日志追踪。这个坑不踩不知道踩一次能让人调一下午。记忆管理失控。上下文越长Token成本越高响应越慢。解决方式是引入摘要机制和向量检索只保留跟当前任务最相关的记忆而不是把所有历史都塞给模型。缺少客观评价标准。任务做没做成很多时候没有自动判定只能靠用户反馈。没有评价机制产品就没法迭代团队也不知道改版到底变好了还是变差了。客服机器人后来演进到了第三代先检索知识库再回答检索不到就转人工模型只负责在检索结果基础上组织语言。就这么一个改动用户满意度从70%升到85%再到88%。大熊说Agent的复杂度不在于模型强不强而在于你愿不愿意把边界、流程、兜底这些脏活累活都扛下来。扛下来Demo才叫会干活的东西。5.3 什么样的场景适合先用Agent改造我问他哪些行业场景最适合先上Agent应用他给了三条判断标准任务边界清晰且允许偶发的人工介入过程有数据反馈能衡量好和坏错误成本可控不会造成重大损失。按这个标准客服、内容摘要、单据录入、审批流、报表解读这类场景是最合适的。反向来看涉及医疗诊断、司法裁决、金融风控决策的场景现阶段硬上Agent风险极高只能做辅助不能做主力。所以AI产品经理真正稀缺的能力不是知道哪个模型跑分高而是知道哪个场景值得做、哪个场景不该碰。在AI时代不做判断的人是最危险的做错判断的人也被淘汰只有能持续做出正确判断的人才永远有位置。圆桌谈到这儿其实答案已经慢慢浮出来了。四个人的方向看似不同底层逻辑是相通的在AI时代位置不是靠守住旧技能保住的是靠带着旧经验扑向新问题抢出来的。6. 圆桌收尾IT人找到位置的行动路径6.1 向上走做模型和业务之间的水管工按照这场对话的结论我给出一条行动路径向上走去AI Infra和模型部署方向。这条路最适合谁现有运维、后端、SRE背景的人。因为AI模型最终要落到企业业务里就离不开服务化、集群调度、故障恢复、成本治理。这些能力不会因为AI的出现而贬值反而会因为AI的普及而更值钱。阿黎那条路就是活生生的证明。有人可能会担心我不懂Python、不懂推理框架是不是就做不了阿黎的回答是先别抗拒GPT或Claude就是最好的老师。把vLLM的官方文档丢给它让它给你拆成先装环境、再跑单卡、再压测的步骤跟着做一遍比你看十篇教程都管用。做这一行的手感是用脚本和显卡磨出来的不是看视频看出来的。6.2 向深走做AI的教练和质检员第二条路径是在某一个垂直领域往深扎。这适合那些不甘心只做全栈万金油、想拥有不可替代性的人。比如Vivian做的AI质量保障就是用行业know-how给AI兜底的典型。同样懂法律的人去做法律AI的知识库设计懂财务的人去做财务AI的评测集懂电商的人去做电商客服AI的Prompt调优这些都是教练和质检员的角色。老周补充了一个观点AI会写代码之后编写代码的技能不再稀缺但定义代码好坏、识别业务陷阱、判断架构风险的能力更稀缺了。往深走不是学更深的技术是在业务领域里建立你自己的判断力。6.3 向宽走让业务场景成为护城河第三条路径是往宽走成为AI业务的复合型人才。大熊说他现在招产品经理第一条要求是必须亲手玩过三个以上AI应用第二条是能讲清楚某个场景里AI的使用边界在哪里。我不看你会不会画原型我看你会不会定义问题。这也解释了一个现象为什么AI产品经理在热搜词里这么热。因为AI应用层的核心瓶颈已经不再是模型能力而是缺少能把业务问题翻译成技术方案、又能把技术能力包装成业务价值的中间人。这条路适合沟通能力强、喜欢和业务方打交道的IT人。6.4 最后一句实话对话接近尾声我问四个人如果只对屏幕前的IT人说一句话你们会说什么。阿黎想了想说别老问AI能做什么先问你现在手上的报表、脚本、监控告警能不能用AI从一天变成一小时。从自己身边最具体、最无聊的任务开始这是最快的切入方式。老周说真正的危机不是AI太强而是别人会用AI你不会。就算你现在的岗位看着还很稳也值得每周抽两个小时学一下主流AI编程工具哪怕只是把它当个高级自动补全用。Vivian说得很实在AI会放大你的能力也会加速你犯错。永远保留一道人工审查的关卡哪怕只是抽查10%关键时刻能救整个项目。大熊最后说的那句我记在了笔记最上面在AI时代最不危险的人不是最会写代码的人也不是最懂模型的人而是最会定义问题的人。因为定义问题的能力决定AI往哪使劲往哪使劲决定价值落在谁头上。圆桌散了我在回去路上一直在想这句话。AI时代IT人的位置确实不是靠在原地等待发下来的是主动去新地图上画出来的。希望这篇记录能给你一点方向感。