
文章目录D4 | 模型选型指南:什么时候用 GPT-4o、Claude 3.5、DeepSeek?写在前面一、6 大模型 × 6 维度对比1.1 6 维度评估框架1.2 6 大模型总览表1.3 关键指标怎么算二、10 个真实业务场景的选型推荐2.1 场景 1:客服机器人2.2 场景 2:代码生成 / Code Review2.3 场景 3:长文分析(100K Token)2.4 场景 4:中文创作(公众号、文案、营销)2.5 场景 5:多模态(图像/视频理解)2.6 场景 6:翻译(中英、英中等)2.7 场景 7:数据抽取(结构化输出)2.8 场景 8:数学/逻辑推理2.9 场景 9:实时对话(低延迟)2.10 场景 10:大规模生产(成本敏感)2.11 场景速查表三、自建评测体系(5 步)3.1 第 1 步:建评测集3.2 第 2 步:选评估指标3.3 第 3 步:批量跑对比3.4 第 4 步:算总账3.5 第 5 步:选型决策四、4 个常见坑(避坑指南)坑 1:Token 化差异导致"看起来便宜其实贵"坑 2:长 Context 性能衰减坑 3:API 频繁限流坑 4:中文能力被高估五、这一篇的小结5.1 6 个 Key Takeaway5.2 速查表(建议打印贴墙)5.3 思考题下篇预告D4 | 模型选型指南:什么时候用 GPT-4o、Claude 3.5、DeepSeek?写给"已经在用 LLM,但不知道怎么选"的你本文是《60 天 AI 全栈转型:传统开发者的大模型工程师之路》S1 第 4 篇配套代码仓库:https://gitcode.com/road-emblem/60-days-ai-stack写在前面D3 我们讲了 6 大 LLM 厂商的 API 怎么调——但会调不等于会选。真实生产环境里,你迟早会面对这些问题:“客服机器人用哪个模型?”“代码生成 GPT-4o 还是 Claude?”“中文创作用通义还是 DeepSeek?”“这个月账单超出预算 3 倍,谁的锅?”“为什么大家都在用的模型,到我这里效果就差?”D4 的目标:给你一套可复用的模型选型方法论。这一篇你会拿到:6 大模型 × 6 维度的深度对比表10 个真实业务场景的选型推荐5 步自建评测体系——不靠宣传靠实测