ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

35岁转大模型:先跑通一个闭环,再决定押不押注

35岁转大模型:先跑通一个闭环,再决定押不押注 版权与内容来源声明本文为原创整理。文中涉及官方文档、开源仓库、论文与公开报道的内容均在附表 A 中标注来源引用官方原文保持原样不作改写。文中命令、版本号与界面截图以本文成文时的实测/核验结果为准标注「待验证」的部分请以你本地环境实际输出为判断依据。本文不推荐任何不合规的软件获取方式也不对任何收益结果作承诺。转载请注明出处。第1章 真正贵的不是学费是「投错方向的那两年」你工作几年了技术栈也算熟最近常听人聊大模型、Agent、智能体。你心里动过念头要不要转但另一个念头马上跟着来——万一我花一两年学完发现这条路跟我根本不匹配那两年时间就白搭了。这种担心方向是对的但落点可能反了。真正贵的从来不是学费也不是买课的钱而是你把一两年整块时间压在一个还没验证过的方向上等回过神来才发现方向不对或者你并不适合用这种方式工作。我见过不少三十五岁上下、想往 AI 靠的技术人第一步往往是先报一堆课、先背一堆概念。这像极了当年学一门新语言时先把语法书翻完再动手。问题在于课能给你「我知道」但给不了「这条路适不适合我」这份证据。所以这篇不聊怎么找工作也不聊简历怎么写那些本账号发过。只聊一件事在你决定要不要押注之前先用一周时间亲手跑通一个最小闭环用「能不能跑通」和「有没有真实改善」来决定下一步。闭环这个词先解释一下它指的是「输入 → 处理 → 输出」能形成一个能用的小回路并且这个回路对你的真实工作产生了作用而不是只停留在看懂教程。本文后面会反复用到它。有人会问既然要试为什么不干脆多花点时间学深一点。答案还是成本。深度学习的成本在后面试探的成本在前面。你先用最低成本拿到一份「这条路和我匹不匹配」的证据再决定要不要把深度加上去顺序比努力多少更重要。你手里的筹码不是某个数字而是判断——判断这件事恰好是经验给的。第2章 为什么先用一周做闭环而不是先报课先报课的问题不在于课没用而在于它把「学习」和「验证」分开了。你学完会觉得懂了但懂了、能用、适合用中间还差着一次真实试错。Anthropic 在讲怎么构建 Agent 的官方文章里开篇就给了一个很朴素的原则When building applications with LLMs, we recommend finding the simplest solution possible, and only increasing complexity when needed. This might mean not building agentic systems at all. Agentic systems often trade latency and cost for better task performance, and you should consider when this tradeoff makes sense.这段话的潜台词是别一上来就搞复杂系统。先找最简单的办法把事做成。对一个想试探方向的人这个建议几乎可以直接当成行动指南——先用最简单的方式跑通再谈别的。同一篇文章还说Start with simple prompts, optimize them with comprehensive evaluation, and add multi-step agentic systems only when simpler solutions fall short.这里提到了一个关键动作评测evaluation简称 eval。评测的意思是你拿一组固定样例去量一量输出够不够好而不是凭感觉说「好像还行」。本篇后面判断「跑通没有」靠的就是这种可检查的标准而不是主观感受。同一篇还区分了工作流workflow指按固定步骤跑的流程和智能体agent指能自主决定下一步、调用工具完成任务的系统When more complexity is warranted, workflows offer predictability and consistency for well-defined tasks, whereas agents are the better option when flexibility and model-driven decision-making are needed at scale. For many applications, however, optimizing single LLM calls with retrieval and in-context examples is usually enough.对我们这种「先试探」的人结论很清楚大多数时候把一次模型调用也就是一次 API 调用用好加上检索和几个示例就够了。你不需要先理解整套 Agent 框架也能拿到第一份证据。所谓 APIApplication Programming Interface应用程序接口这里你可以理解成「你发一段文字给模型服务它返一段文字回来」的那个通道。它是后面所有闭环的入口也是你最该先跑通的那一关。把顺序反过来也成立先报课再验证等于先付了验证的钱再决定要不要验证。一周闭环的好处是它在你投入大量时间之前先给你一个可以反复运行、可以拿给别人看的证据。证据比热情靠谱因为它不随心情变化。评测不一定非要做得重。第一周你完全可以用一批真实样例人工看一眼输出对不对记下来。重要的是「有样例、有记录、能复查」而不是工具多高级。等哪天你真要继续这套样例就是现成的评测集。第3章 一周闭环计划表下面是一份可执行的一周计划。它的目标不是学全而是七天结束你能回答一个问题这件事我亲手做一遍顺不顺、值不值。天数做什么产出第 1 天搭环境装好能运行脚本的环境拿到一个可调用的接口凭证能发一条最小请求并收到返回第 2–3 天跑通官方接口照官方示例发请求先不求理解全部参数一份可复现的请求脚本第 4–5 天接一个真实小需求挑你工作中一个重复、明确的环节一个跑通的小样例接进你的真实流程第 6 天记录失败点把跑不通、答非所问的地方逐条记下来一份失败点清单第 7 天写结论基于前六天证据决定继续、缩小还是停一句话结论加下一步计划逐天说明第 1 天搭环境。装好能运行脚本的环境拿到一个可调用的接口凭证。产出是一条最小请求和一次成功返回。第 2–3 天跑通官方接口。照着官方示例发请求先不求理解全部参数先把「发得出去、收得回来」这关过了。产出是一份能复现的请求脚本。第 4–5 天接一个真实小需求。从你自己的工作中挑一个重复、明确、体量小的环节比如把一类工单按字段归类。把它接进你的真实流程哪怕只是半自动。产出是一个跑通的小样例。第 6 天记录失败点。把跑不通、答非所问、格式乱掉的地方逐条记下来。这一步很重要它决定你第七天结论的可信度。第 7 天写结论。基于前六天的证据用一两句话决定继续、缩小、还是停。你可能会问函数function指让模型能调用的一段预设能力要不要一次准备很多OpenAI 在 function calling 的官方文档里写得很直接Keep the number of initially available functions small for higher accuracy.Aim for fewer than 20 functions available at the start of a turn at any one time, though this is just a soft suggestion.也就是说一开始能确定的、能写成代码的逻辑就先别丢给模型去发挥。这和「先做小」是同一件事。第4章 你的老经验在这件事上不是包袱很多人担心我三十五了转这个会不会太晚经验是不是没用了。我的看法相反——你那几年的经验正好是模型最缺的那块。Anthropic 在提示词工程的最佳实践文档里有一句我特别想摘出来Think of Claude as a brilliant but new employee who lacks context on your norms and workflows.把这句话翻译一下模型像一个脑子很好、但刚来你们公司、完全不懂你们业务惯例的新人。它什么都会一点但不知道你这里的「工单怎么分」「异常怎么定级」「哪个字段代表什么意思」。而你干了几年恰恰攒下了这些「业务上下文」context指模型在回答时需要的背景信息比如你们内部的字段含义、流程约定。这部分上下文模型不会自己长出来得由你喂给它。同一篇还提到Examples are one of the most reliable ways to steer Claude’s output format, tone, and structure.示例是引导模型输出格式、语气、结构最可靠的方式之一。而你最容易给出的正是真实场景里的示例——你见过的那些工单长什么样、分类该落到哪个值。你不是在和模型竞争你是在把你的经验翻译成它能用的示例和约束。举个具体的你过去做运维知道「磁盘满了」和「磁盘即将满」是两类告警处理方式不同。这个区分模型一开始不懂但你给两三条真实历史告警当示例它很快就能照着分。你给的不是知识本身是判断的边界。这正是经验值钱的地方——不是你会做而是你知道边界在哪。Anthropic 在构建 Agent 的文章里把「增强型 LLM」定义为The basic building block of agentic systems is an LLM enhanced with augmentations such as retrieval, tools, and memory. Our current models can actively use these capabilities—generating their own search queries, selecting appropriate tools, and determining what information to retain.检索retrieval指从资料里找出相关内容喂给模型、工具tools指让模型能调用外部能力、记忆memory指跨轮次保留信息这三样都是「外部能力」。它们要接什么、怎么接靠的正是你对业务的判断。模型负责聪明你负责让它知道该聪明在哪儿。OpenAI 在那篇 function calling 文档里还提醒Offload the burden from the model and use code where possible.Don’t make the model fill arguments you already know.这两句加起来是一个很实在的做法能写成代码、你清楚的东西就交给代码别让模型去猜。这正是你多年经验能落地的具体方式——把确定的规则固化成代码把不确定的判断留给模型。第5章 怎么算跑通三个可检查的判据「跑通」不能靠感觉得有可检查的判据。我给自己定了三条每条都能用一次运行验证判据检查方式通过标准接口稳定返回连续多次请求都有结果不依赖人肉重试接进真实环节至少有一个工作步骤真的用到它不是单独跑个 demo结果可复用同样的输入给出稳定结构能放进模板下次不用重调最小可跑骨架下面给一个最小可跑骨架调用一次官方接口把返回结果按结构抽出来。这段代码我没有在本机实际运行环境差异可能导致细节不同请按你本地情况调整。⚠️代码待验证importosimportjsonimportrequests api_keyos.environ.get(API_KEY)endpointhttps://api.example.com/v1/messagespayload{model:model-name,max_tokens:512,messages:[{role:user,content:把下面工单按 title/priority/category 抽出结构登录提示密码错误}]}headers{x-api-key:api_key,content-type:application/json}resprequests.post(endpoint,jsonpayload,headersheaders)dataresp.json()defextract(text):blocks[lnforlnintext.split(\n)ifln.strip()]return{count:len(blocks),preview:blocks[:3]}print(json.dumps(extract(data[content][0][text]),ensure_asciiFalse))再给一个判据检查的小片段用来判断上一步的输出是不是「可复用」⚠️代码待验证defpassed(result):ifnotresult:returnFalserequired[title,priority,category]returnall(kinresultforkinrequired)sample{title:登录失败,priority:高,category:账号}print(passed(sample))关于评测Anthropic 的提示词工程概览里有一段值得记一下This guide focuses on success criteria that are controllable through prompt engineering. Not every success criteria or failing eval is best solved by prompt engineering. For example, you can sometimes improve latency and cost more easily by selecting a different model.意思是有些问题不是调提示词能解决的换个模型可能更直接。这也提醒我们闭环里若出现性能或成本问题先别急着堆复杂度。说「真实改善」而不是「跑通就好」是因为跑通只说明技术可行改善才说明方向值得。一个可检查的改善可以是原来你要手工归类一批工单如今这一步被替掉了而且结果你能直接接着用。哪怕只替掉一小段它也是货真价实的证据。第六天记下的失败点到这里也派上用场——哪些地方模型答非所问正好标出你经验里「必须讲清楚」的那几处。这份资料是什么一周闭环用到的官方文章与最小骨架示例整理进资料包扫码即可获取第6章 什么时候该停三个信号试探的意义一半在「该继续」一半在「该停」。以下三个信号只要中一个就建议先停而不是继续加码。信号含义建议跑通了但没有真实用途能演示但工作流里找不到落点停先去找真实用途只能做演示不能进流程离了人手调参数就垮停或缩到更小场景每次都要重新调一遍还没沉淀没形成可复用资产停先沉淀模板信号一跑通了但没有真实用途。你能演示但翻遍工作流也找不到落点。这时继续投时间边际收益很低。信号二只能做演示不能进流程。离了人手调参数就垮说明它还没成为你流程里可靠的一环。信号三每次都要重新调一遍还没沉淀。你没把成功的部分固化成模板或示例等于每次从零开始。停的另一个好处是它让你把这一周变成一次低成本的排除法。你排除了一个不适合的方向相当于为下一个方向省下了试错空间。排除本身也是进度不是空白。Anthropic 那篇文章把这件事说得很重To repeat: you should consider adding complexityonlywhen it demonstrably improves outcomes.「demonstrably improves outcomes」——能证明改善了结果才加复杂度。对应到我们的试探只在能证明「它真的让我的工作变好」时才给它加东西。否则先做小停在该停的地方不丢人。第7章 一周之后怎么决定下一步七天跑完你手里应该有四样东西一份能复现的脚本、一个真实小需求的样例、一份失败点清单、一句话结论。基于这些下一步只有三种走法第一种继续。判据都过了而且你清楚下一个真实场景在哪。那就按官方建议从简单提示词起步用评测慢慢优化需要时才上多步系统。第二种缩小。跑通了但范围太大撑不住就缩到更小、更明确的环节先把一个钉子钉牢。第三种停。三个信号中了一个就停。停不是失败是你用一周成本排除了一个不适合自己的方向——这比投两年才发现便宜太多了。回到开头那句话你犹豫的从来不是「学不学得会」而是「押不押得对」。把押注拆成一次次可验证的小闭环你就不必靠赌。先跑通一个再决定下一个。顺带一句这个节奏可以重复。你不一定要一次押对可以每隔一段时间用一周去试一个具体的小方向攒下几份跑通或停的结论你对「自己适合什么」的判断会越来越准。这比一次性豪赌稳得多也比一直观望强得多。这份资料是什么从路线到动手的配套资料含学习路线与实战课目录扫码即可获取附表 A本文引用事实与出处对照表官方原文事实出处URL本文位置When building applications with LLMs, we recommend finding the simplest solution possible, and only increasing complexity when needed. This might mean not building agentic systems at all. Agentic systems often trade latency and cost for better task performance, and you should consider when this tradeoff makes sense.https://www.anthropic.com/engineering/building-effective-agents第2章When more complexity is warranted, workflows offer predictability and consistency for well-defined tasks, whereas agents are the better option when flexibility and model-driven decision-making are needed at scale. For many applications, however, optimizing single LLM calls with retrieval and in-context examples is usually enough.https://www.anthropic.com/engineering/building-effective-agents第2章Start with simple prompts, optimize them with comprehensive evaluation, and add multi-step agentic systems only when simpler solutions fall short.https://www.anthropic.com/engineering/building-effective-agents第2章To repeat: you should consider adding complexityonlywhen it demonstrably improves outcomes.https://www.anthropic.com/engineering/building-effective-agents第6章Think of Claude as a brilliant but new employee who lacks context on your norms and workflows.https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-prompting-best-practices第4章Examples are one of the most reliable ways to steer Claude’s output format, tone, and structure.https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-prompting-best-practices第4章Keep the number of initially available functions small for higher accuracy.https://developers.openai.com/api/docs/guides/function-calling第3章Aim for fewer than 20 functions available at the start of a turn at any one time, though this is just a soft suggestion.https://developers.openai.com/api/docs/guides/function-calling第3章Offload the burden from the model and use code where possible.https://developers.openai.com/api/docs/guides/function-calling第4章Don’t make the model fill arguments you already know.https://developers.openai.com/api/docs/guides/function-calling第4章The basic building block of agentic systems is an LLM enhanced with augmentations such as retrieval, tools, and memory. Our current models can actively use these capabilities—generating their own search queries, selecting appropriate tools, and determining what information to retain.https://www.anthropic.com/engineering/building-effective-agents第4章This guide focuses on success criteria that are controllable through prompt engineering. Not every success criteria or failing eval is best solved by prompt engineering. For example, you can sometimes improve latency and cost more easily by selecting a different model.https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/overview第5章附表 B术语速查表术语人话解释闭环closed loop输入到处理到输出形成可用小回路并对真实工作产生作用API应用程序接口你发文字给模型服务、它返文字回来的通道上下文context模型回答时需要的背景信息如内部字段含义、流程约定检索增强retrieval / RAG从资料里找出相关内容喂给模型工具tools让模型能调用外部能力如查数据库、发请求记忆memory跨多轮对话保留信息的能力评测evaluation / eval用固定样例量化输出是否达标Agent智能体能自主做多步决策、调用工具完成任务的系统写在最后这篇用到的资料写这篇文章时把官方那几篇讲 Agent 构建的文章又重读了一遍顺手也整理了几份配套的东西大模型学习路线图从零基础到能自己动手做 Agent按阶段说明每一步该学什么、哪些可以先跳过《LangChain LangGraph MCP 智能体开发实战》视频课7 个模块从私有化部署、EmbeddingRAG 到 MCPAgent 全流程AI 大模型知识库在线可查Agent Skills 从入门到落地、Claude Skills 完全指南等专题按目录浏览即可640 套 AI 大模型行业报告 经典 PDF 书籍看行业落地案例和别人怎么做的时候用得上大模型零基础到精通教学视频跟着敲一遍比只读文档快得多资料是我自己整理的放在下面这个码上扫码即可获取添加时备注「AI」优先通过。资料按「先路线、再动手、最后查漏」的顺序整理好了建议先看学习路线那一份照着它挑一条适合自己当前基础的路径再往下看。
返回列表