ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

我不想背提示词模板:于是让 AI 给自己写提示词,结果有点意外

我不想背提示词模板:于是让 AI 给自己写提示词,结果有点意外 现在想把 AI 用好好像总得记住一堆提示词写文章一套做分析一套做方案一套还得记提示词模板、工作流和各种“万能咒语”。这对勤奋的人也许没问题但对我这种懒得背模板的人实在不太友好。所以我想做一个简单实验如果我只记住一句口令让 AI 先根据需求生成提示词再用那条提示词让 AI 工作效果会怎么样这件事听上去有点怪。就像你点奶茶店员问你喝什么你说“你推荐一个”。店员写下“珍珠奶茶少糖”你再拿着纸条重新排队递给他“我要这个。”然后他才开始做。但我试了一下效果居然不错。为了避免只凭感觉我用同一个高难度问题做了对比让 AI 评估一座太空光伏电站要求它在 2040 年前为大型城市电网持续提供 1GW 净功率、99.9% 可用率和 20 年寿命。这个题目必须同时处理航天、能源、电网、通信、经济、安全和法规问题也允许得出“目标不可行”的结论。它不太容易靠漂亮话混过去功率、食季、热控、在轨组装、发射、并网、频谱、责任和成本任何一项没说清都会影响结果。实验在 Codex 桌面端完成。每次都是独立文档任务不读取、搜索或参考项目目录里的其他文档。成稿由一次独立 AI 辅助技术评审按目标达成、技术、工程、经济、安全、法规和验证路径评分。先别看结果。你可以先猜一下下面几种方式哪一种效果最好其中有一个方案是彻底失败的。第一轮六种初始方案1. 提示词生成型口令按需求生成执行提示词别执行。流程拿到执行提示词 → 开新对话粘贴它 → AI 执行并生成方案。2. 分步提示词包口令按需求生成全阶段提示词包别执行。流程拿到全阶段提示词包 → 开新对话执行当前阶段 → 完成上一阶段后将下一阶段提示词交给 AI直至结束。3. 提示词工厂型失败口令生成一条按需求定制提示词的提示词。它比方案一多套了一层先得到“提示词生成器” → 用它输入需求得到执行提示词 → 再用执行提示词完成任务。结果是失败。模型经常混淆两件事它到底应该直接生成方案文档还是生成一份“可以生成方案文档的提示词文档”。当然继续补充解释可以让它明白但这已经违背了“少记、少写”的初衷。这个失败也提醒我提示词不是套娃越多越好。任务意图一旦开始歧义元提示词很容易从帮忙变成噪声。4. 问诊方案口令先问关键问题我不懂的部分请自行假设。5. 三轮审查型口令先成稿再审查最后按意见重写。流程分三轮发需求根据需求生成完整方案。把初稿发回审查此方案列出漏洞、风险和修改建议暂不重写。把审查意见发回按审查意见重写为最终方案保留不确定项。第一轮没有写“先写初稿”是因为我担心 AI 一看到“初稿”就会默认可以交付低质量内容。6. 基准方案直接把需求交给 AI不提供额外流程提示。第一轮结果方案三没有稳定产出可评分方案所以不进入排名。其余五个方案的结果如下。方案做法去空白字符数技术评审分Token 用量调用次数耗时一先生成执行提示词再执行11,6855.600.10167分13秒二生成全阶段提示词包逐阶段执行8,3805.850.465426分01秒四先问关键问题不懂处自行假设6,6524.300.182845分45秒*五终成稿 → 审查 → 重写5,1725.800.355220分11秒基准直接生成6,0344.100.10215分49秒* 方案四出现过重试耗时仅作参考。第一轮的评审结果是方案二第一方案五终第二方案一第三问诊方案只比直接生成略好。方案目标达成技术工程经济安全法规验证加权总分排名一26667785.603二26677795.851基准23446674.105四25446564.304五终27558895.802这个结果已经很出乎我意料。方案一和基准方案的 Token 用量记录一样调用次数还更少但评分从 4.10 提升到了 5.60。也就是说先让 AI 写清楚“它接下来该怎么做”对复杂任务确实有明显帮助。方案二的质量最高但代价是更多 Token、调用和时间。方案五终则很有意思它是五个方案里最短的一篇却几乎追平方案二。说明篇幅不是质量的代理变量审查步骤能明显提高内容密度和自我纠错能力。反而是我原本很看好的方案四投入更多、等待更久结果提升最小。问题很可能出在“我不懂的部分请自行假设”这句话它既增加了问诊流程又允许模型把真正影响结论的关键问题用假设跳过去。到这里我有了一个新问题既然方案二的“分步提示词包”质量最好方案五的“审查”又很有效能不能把它们结合起来于是第二轮开始了。第二轮把方案二和审查结合我沿着三条路继续试。7. 二改提示词先把方案二生成的全阶段提示词包交给 AI 审查要求它找出漏洞并生成更好的提示词包再用新提示词包执行任务。换句话说审查的是“作业说明”不是作业成稿。8. 二审不改提示词包直接把方案二生成的完整方案交给 AI 审查并修改。换句话说先交作业再返工。9. 二改提示词审先走“二改提示词”的路径生成方案再审查方案本身最后输出最终稿。它是最完整、也最贵的一条路线。最终结果方案方法去空白字符数技术评审分Token 用量调用次数耗时基准直接生成6,0344.100.10215分49秒一生成执行提示词再执行11,6855.600.10167分13秒二全阶段提示词包逐阶段执行8,3805.850.465426分01秒四问关键问题不懂处自行假设6,6524.300.182845分45秒*五终成稿 → 审查 → 重写5,1725.800.355220分11秒二改提示词先审查方案二的提示词包再执行8,1526.100.506127分20秒二审直接审查方案二成稿并修改7,4546.100.857551分00秒二改提示词审审查“二改提示词”的结果再生成最终稿9,3476.251.059857分04秒最终评分排名方案目标达成技术工程经济安全法规验证加权总分排名一26667785.606二26677795.854基准23446674.108四25446564.307五终27558895.805二改提示词27668896.10并列 2二审27668896.10并列 2二改提示词审27678896.251这次追加实验告诉了我什么先改提示词再执行在这次实验里最划算“二改提示词”从 5.85 分升到了 6.10 分资源消耗只比原方案二小幅增加。而“二审”也得到了 6.10 分却多用了更多 Token、调用次数和时间。至少在这一次任务里先审查任务说明效果不低于事后审查成稿成本还更低。我不会把它说成普遍规律但它很符合直觉任务一开始被带偏后面再大修通常会更贵。最后一轮审查能提高质量但边际收益很小“二改提示词审”最高拿到 6.25 分。不过相对“二改提示词”它多消耗了 0.55 的 Token 用量、37 次调用和约半小时只换来 0.15 分提升。所以它适合对外发布、投资评审、监管沟通、安全相关等错误代价高的任务不适合每次都默认开启。字数不是答案方案一最长但最终只排第六方案五终最短却进入第一梯队。字数可能带来覆盖面但真正拉开差距的是有没有明确区分事实和假设、有没有检查计算和系统边界、有没有可验证的阶段门以及是否允许在证据不足时停止。最后我只留下两句口令如果只是想快速得到一个比直接提问更可靠的初稿我会用按需求生成执行提示词别执行。比较复杂的任务就使用提示词包拿到结果后开一个新对话把执行提示词粘进去。如果问题复杂、代价高或者你希望更认真一点再加一句以最挑剔的反驳者攻击这个提示词找出歧义、遗漏、不可验证假设和可能诱发幻觉的表述只输出修改后的可执行提示词别执行。然后用修改后的提示词开新对话执行。如果是要公开发布、做重大决定或涉及安全风险的成稿再增加最后一步审查成稿只列问题和修改建议确认后再重写。这不是万能提示词而是一种分工方式这次实验没有证明“AI 先生成提示词”永远更好。它只说明在这个高不确定性、重证据、重风险控制的工程任务里让 AI 先写清楚怎么做再挑一次这份说明的错比直接要求它立刻交作业更可靠。我想摆脱的不是提示词本身而是“必须背下几十种提示词模板”的负担。人负责提出真实需求、判断结果能不能用AI 负责把需求组织成任务说明、执行任务、暴露自己的盲点。这样我不用记几十套模板只要记住先写说明再挑毛病。实验限制这是一项单任务、单次运行的探索不是严格的统计实验。每种方案只在同一个复杂工程报告任务上运行一次不能直接外推到写代码、写营销文案、数据分析或日常问答。评分是一次 AI 辅助评审结果不等同于独立专家委员会结论也不代表太空光伏项目的真实可行性。模型输出有随机性。5.80、5.85、6.10 之间的小差异不能被理解为稳定的绝对能力差距。Token、调用次数和耗时均按当时平台显示记录耗时包含重试不宜作为严格性能指标。如果继续做我会把每种方案至少重复 3 到 5 次并换成代码调试、数据分析、日常写作和真实业务决策等任务。到那时才有资格讨论哪些规律可以复现。但在此之前这两句口令已经足够让我少背很多模板了。
返回列表