
近期整理了美的AI Agent方向实习面试全套真题。整套题目看似基础、偏向概念但每一题都在筛选真正懂工程落地、而非只会背理论的候选人。美的大模型团队面试有一个鲜明特点不深挖复杂算法数学推导重点考察应用层工程思维、落地痛点、框架取舍、基础原理闭环。这意味着——你不需要推导 Transformer 的注意力矩阵但你必须说清楚 RAG 的每一步为什么这么做、Agent 框架的坑在哪、Function Calling 参数校验为什么不能省。本文将 10 道面试题做系统化深度复盘每题包含标准答案、底层逻辑、落地坑点、面试加分话术适合所有 AI 应用、Agent、RAG 岗位求职复习。本文目录 · 10道面试题目录本文目录 · 10道面试题Q1 AI Agent 与传统 LLM 应用的核心区别传统 LLM 应用问答式AI Agent任务式四大核心能力拆解通俗类比Q2 RAG 完整工作流程离线 在线阶段一离线准备知识库构建每一步的关键要点阶段二在线服务用户问答Q3 LLM 幻觉全套缓解方案每个维度的深度补充Q4 Agent 框架LangChain/LangGraph选型与取舍框架优点框架缺点面试核心踩坑点为什么调试是最大痛点Q5 Function Calling 完整落地流程逐步拆解Q6 多轮对话 Agent 核心设计痛点一上下文混乱痛点二状态爆炸痛点三意图漂移落地核心三点Q7 Agent 短期记忆 长期记忆机制深度补充长期记忆的工程实现Q8 ReAct 推理框架核心原理执行流程一个具体例子Q9 RAG 高阶优化方案ReRank HyDE优化一Re-ranking 重排序优化二HyDE 假想文档检索通俗类比Q10 文本相似度计算原理主流工业方案余弦相似度Cosine Similarity兜底传统方案TF-IDFEmbedding 余弦相似度TF-IDF 余弦相似度面试总结美的 AI Agent 招聘核心考察点整套 10 题本质只考察三件事备考策略建议Q1 AI Agent 与传统 LLM 应用的核心区别这是 Agent 面试第一道必问开题题用来判断你有没有建立智能体思维。答好了后面才会深入问答不好基本到此为止。传统 LLM 应用问答式执行模式单次输入 → 单次输出无规划、无记忆、无迭代、无工具用户问什么模型直接生成答案无法自主完成任务本质被动应答AI Agent任务式执行模式目标驱动的闭环任务四大核心能力规划、工具、记忆、迭代自主拆解步骤、调用外部工具根据返回结果继续推理直到完成本质主动执行四大核心能力拆解自主规划Planning把帮我订一张明天去上海的机票拆解为查日期 → 查航班 → 比价 → 下单 → 确认。工具调用Tool Use不是假装知道航班信息而是真正调用航班 API 拿到真实数据。记忆管理Memory记住你是谁、你偏好靠窗座位、你上次出行的时间。迭代纠错Reflection如果 API 返回该航班已满Agent 会自动换一班继续尝试而不是直接报错给用户。通俗类比传统 LLM 一个百科全书你翻一页它读一页你合上它就停了。AI Agent 一个实习生你给他一个任务目标他自己拆步骤、打电话、查资料、遇到问题想办法解决直到把结果交到你手上。面试满分回答传统 LLM 只能基于当前提问生成单次回答而 AI Agent 可以自主规划流程、调用工具、迭代执行实现完整任务闭环。Agent 的本质是从被动应答升级为主动执行。Q2 RAG 完整工作流程离线 在线RAG 是美的、车企、家电 AI 团队最核心的落地技术。面试官要求你分阶段完整口述不能只说检索 生成就完事。阶段一离线准备知识库构建离线构建文档解析→清洗过滤→语义切块→Embedding 向量化→存入向量数据库每一步的关键要点文档解析PDF / Word / Excel / HTML 各有解析策略表格和图片是难点。PDF 尤其坑——双栏排版、扫描件、公式渲染每一类都需要专门处理。清洗过滤去掉页眉页脚水印、空行、重复段落、乱码。垃圾进 垃圾出这一步直接影响最终检索质量。语义切块Chunking这是最容易被忽视但影响最大的环节。不按固定字符数硬切而是按标题层级、段落语义、自然语句边界切块。一个 chunk 应该是一个完整语义单元——既不能太碎丢上下文也不能太长检索精度下降。Embedding 向量化每个 chunk 通过 Embedding 模型转为高维向量通常 768~1536 维。模型选择直接影响语义匹配质量中文场景推荐 BGE-large-zh 或 M3E。存入向量数据库Milvus / Qdrant / Chroma / FAISS根据数据规模和部署条件选择。阶段二在线服务用户问答在线问答用户提问→Query 向量化→向量库相似度检索→BM25 重排可选→上下文拼接→LLM 生成答案面试加分点RAG 的本质用外部私有知识库约束大模型解决三大问题——幻觉让模型有据可依、知识滞后知识库可随时更新、私有数据不可用企业内部文档不在公网训练集中。踩坑提醒面试官最爱追问切块大小怎么定回答没有万能数值需要根据文档类型实验调优。经验值通用文本 256~512 tokens代码类按函数粒度切表格按行切。一定要强调实验驱动而不是拍脑袋定一个数。Q3 LLM 幻觉全套缓解方案这是工程岗最高频考点。面试官不想听幻觉是模型会编造信息这种废话他要听的是你在工程上怎么治理。核心认知幻觉无法 100% 消除只能工程层面极致降低概率。面试必须答出以下 5 大维度少一个都是减分。维度策略核心原理1. 知识增强RAG所有答案依托私有真实文档让模型有据可依而非自由发挥2. 实时校验工具调用时效问题、动态数据调用接口 / 搜索引擎获取最新真实数据3. 提示词约束Prompt Engineering强制限定无依据则回答不知道禁止编造、禁止扩写4. 引用溯源答案校验生成答案必须附带来源文档模型自主校验答案是否完全来自检索内容5. 规则兜底人工审核高风险场景增加规则拦截、人工复核机制每个维度的深度补充知识增强RAG——这是第一道防线。但光有 RAG 不够如果检索回来的内容本身就不相关模型照样会幻觉。所以 RAG 的检索质量直接决定幻觉率。工具调用实时校验——当用户问今天黄金价格是多少模型不可能从知识库里找到今天的金价除非你每秒更新知识库。这时候必须让 Agent 调用实时 API。这解决了 RAG 解决不了的时效性问题。提示词工程约束——在 system prompt 里明确写死你只能基于以下检索到的内容回答。如果检索内容中没有相关信息你必须回答根据现有资料无法回答该问题禁止自行编造。这一条简单粗暴但有效。引用溯源 答案校验——让模型在生成答案时标注每句话的来源 chunk。可以用第二个 LLM 做审核员检查答案中每一句是否都能在检索内容中找到出处。这叫Self-Check 机制。规则兜底 人工审核——金融、医疗等高风险场景不能完全信任模型。必须加规则引擎做关键词拦截 人工抽检。这是最后一道防线也是生产环境的标配。面试话术建议不要只说用 RAG 解决幻觉。要说幻觉治理是一个分层防御体系——RAG 是知识层、工具调用是时效层、Prompt 约束是行为层、引用溯源是校验层、规则兜底是安全层。五层叠加才能把幻觉率压到生产可接受的范围。Q4 Agent 框架LangChain/LangGraph选型与取舍面试官非常喜欢问这道题因为它的真正考点不是你会不会用框架而是你会不会无脑用框架知不知道框架的坑框架优点组件高度封装工具、记忆、检索、解析开箱即用快速搭建原型加速开发效率生态成熟社区案例丰富降低入门门槛适合 POC 验证框架缺点面试核心踩坑点抽象层级过高底层黑盒多复杂业务链路调试困难、可观测性差自定义逻辑、特殊流程改造受限版本迭代快API 频繁 breaking change性能开销大量中间抽象层拖慢推理为什么调试是最大痛点LangChain 的 Chain 是层层嵌套的——一个 Agent 调用背后可能涉及 Prompt 模板渲染 → LLM 调用 → 输出解析 → 工具路由 → 工具执行 → 结果回填中间任何一步出错报的都是一个笼统的 Exception。你不知道是 Prompt 没拼对、还是模型输出格式变了、还是解析器 regex 没匹配上。生产环境最怕的就是不可观测。满分回答原型快速验证用框架生产核心链路轻封装、自主可控保证可调试、可追溯、可监控。框架是脚手架不是地基——当地基用迟早要还债。进阶认知LangGraph 是 LangChain 团队推出的升级方案把 Agent 的执行流建模为有向图比传统 Chain 的线性执行更灵活可观测性也有改善。但核心矛盾没变——抽象层越厚定制化空间越小。面试提到 LangGraph 会加分但要点出这个根本矛盾。Q5 Function Calling 完整落地流程Function Calling 是 Agent 工具调用的底层核心。面试必须说出完整闭环链路不能只说模型决定调用哪个函数。共 5 个步骤漏了第 3 步直接扣大分。1. 工具注册→2. 模型决策→3. 参数校验→4. 工具执行→5. 结果回填逐步拆解① 工具注册——定义工具名称、功能描述、入参 Schema、参数类型、必填项。这个 Schema 就是告诉模型你有哪些工具可用每个工具需要什么参数。描述写得越清晰模型决策越准确。{ name: query_stock_price, description: 查询指定股票的实时价格, parameters: { type: object, properties: { stock_code: {type: string, description: 股票代码如 600519}, market: {type: string, enum: [SH, SZ], description: 交易所代码} }, required: [stock_code] } }② 模型决策——LLM 根据用户问题自主判断是否需要调用工具调哪个参数填什么这一步完全由模型推理完成。③ 后端参数校验最关键面试必杀点模型输出的参数不一定合法模型可能把600519输出成600519数字而非字符串可能漏掉必填参数可能填了枚举值之外的值。必须在代码层做二次校验 容错修复。这一步漏了 生产事故。很多面试者只说 4 步注册→决策→执行→回填跳过了校验面试官立刻知道你没做过生产级落地。④ 工具执行——校验通过后调用真实外部接口 / 函数获取返回结果。这里要处理超时、重试、异常降级。⑤ 结果回填二次生成——把工具执行结果喂回大模型让模型结合真实数据生成最终自然语言答案。注意不是直接把 API 返回的 JSON 丢给用户而是让模型翻译成用户能理解的话。Q6 多轮对话 Agent 核心设计多轮对话看似简单不就是记住历史消息吗但真正落地时最大痛点是上下文混乱、状态爆炸、意图漂移。面试官要听你怎么治理这三个问题。痛点一上下文混乱用户第 1 轮问ETF 是什么第 2 轮说那它的费率呢——模型必须知道它指 ETF。如果上下文管理不好模型可能回答成股票费率。痛点二状态爆炸一个复杂任务比如帮我分析这三只基金然后选一只中间状态极多——已分析了哪几只、每只的关键指标、用户的偏好变化……如果全部塞进上下文token 爆炸如果不塞任务断裂。痛点三意图漂移用户聊着聊着话题就变了——从查基金聊到今天天气。Agent 需要识别意图切换不能还沉浸在上一个任务里。落地核心三点1. 状态统一管理——维护结构化会话状态对象不靠原始消息堆叠。包含当前任务进度、用户信息、历史关键结论、待执行步骤。这比把所有历史消息原样塞给模型高效得多。{ current_task: fund_analysis, task_progress: comparing, analyzed_funds: [000001, 110011], user_preference: {risk_level: medium, horizon: 3y}, pending_steps: [compare_returns, generate_recommendation] }2. 上下文感知意图——每一轮问答不孤立理解基于历史对话捕捉用户真实意图。具体做法在发送给模型之前先做一轮意图识别判断用户是在继续上一个话题、还是开启了新话题、还是在做澄清补充。3. 上下文动态治理——通过摘要、截断、过期清理三招控制 token 长度摘要Summarization超过阈值后把早期对话压缩成一段摘要保留关键信息丢弃细节。截断Truncation保留最近 N 轮原始消息更早的只保留摘要。过期清理Expiry超过一定时间或任务已完成的历史归档或清除。面试加分提到滑动窗口 摘要压缩组合策略。具体来说最近 5 轮对话保留原文第 6~20 轮压缩成摘要20 轮之前的归档。这样在 token 预算和上下文完整性之间取得平衡。Q7 Agent 短期记忆 长期记忆机制工业级 Agent 必须区分两种记忆。这是高阶面试常考点能区分出做过系统设计和只跑过 Demo的候选人。维度短期记忆会话记忆长期记忆用户记忆范围当前对话、正在执行的任务、临时状态用户偏好、历史习惯、个人画像、长期结论生命周期随会话更新会话结束清空或归档持久化存储可删除、可更新存储介质内存 / Redis低延迟向量数据库 / 关系数据库持久化作用保证多轮连贯、任务不中断实现个性化智能、越用越懂你典型场景刚才你说的那只基金叫什么你每次都偏好低风险产品这次也先看低风险的深度补充长期记忆的工程实现长期记忆不是简单的 key-value 存储。工业级方案通常用向量数据库 结构化标签双轨制向量存储把用户历史交互的关键信息做 Embedding 存入向量库每次新对话开始时用当前 Query 检索相关历史记忆。结构化标签同时维护一个用户画像表偏好风险等级、常查品类、操作频率……这些是确定性数据不需要语义检索。面试常追问长期记忆怎么更新什么时候写入 回答不是每轮都写。应该设置记忆提取触发条件——用户明确表达偏好时我不喜欢高风险、任务完成得出结论时、用户主动要求记住时。无差别写入会导致记忆库膨胀且噪声大。Q8 ReAct 推理框架核心原理ReAct 是目前企业 Agent最主流的执行范式。面试答这道题要说出它是什么、怎么运转、工程上要注意什么三层。ReAct Reason Act推理与行动交替循环。执行流程Reason 思考→Act 行动→Observe 观察↻循环迭代Reason思考分析当前任务状态判断还缺什么信息确定下一步该做什么。输出一段自然语言推理过程。Act行动根据思考结论执行具体动作——调用工具、检索知识库、查询接口。Observe观察接收外部返回的结果把它加入上下文。循环迭代基于新的观察结果再次进入 Reason直到任务闭环或决定停止。一个具体例子用户茅台2024年净利润是多少和五粮液比谁更高 Thought: 我需要查询茅台和五粮液2024年的净利润数据。 Action: query_financial_report(stock茅台, year2024, metricnet_profit) Observation: 茅台2024年净利润 862亿 Thought: 茅台的数据拿到了现在需要查五粮液的。 Action: query_financial_report(stock五粮液, year2024, metricnet_profit) Observation: 五粮液2024年净利润 318亿 Thought: 两家数据都拿到了。862亿 318亿茅台更高。 Final Answer: 茅台2024年净利润862亿五粮液318亿茅台更高 差额约544亿。工程落地必杀点必须设置最大迭代步数ReAct 的循环结构天然有死循环风险——模型可能在 Thought → Act → Observe 之间无限绕圈消耗大量 Token 和 API 调用。生产环境必须设max_iterations通常 5~10 步超限后强制终止并返回当前最优结果。这不是可选项是强制安全措施。面试加分提到 ReAct 的变体Reflexion在 ReAct 基础上增加自我反思环节失败后总结经验教训再重试和Plan-and-Execute先做完整规划再逐步执行适合复杂长链路任务。说明你不只知道 ReAct还了解 Agent 执行范式的演进方向。Q9 RAG 高阶优化方案ReRank HyDE普通 RAG 人人都会——切文档、Embedding、检索、拼 Prompt。说出 ReRank 和 HyDE代表你懂工业级调优不是只跑过 Demo。优化一Re-ranking 重排序问题背景向量检索是粗排——它基于语义相似度快速从百万级 chunk 中筛出 Top-K但语义相似 ≠ 事实相关。比如用户问ETF 申赎流程向量检索可能召回一段ETF 和 LOF 的区别——语义很近但答非所问。解决方案在向量检索拿到 Top-20 之后用一个更精确但更慢的重排模型如 BGE-Reranker、Cohere Rerank对这 20 条做二次精准打分重新排序后取 Top-5 喂给 LLM。阶段模型速度精度候选量粗排召回Embedding 向量检索极快毫秒级中语义近似Top-20~50精排重排Cross-Encoder 重排模型较慢百毫秒级高深层语义匹配Top-3~5为什么不全用精排因为 Cross-Encoder 太慢。它需要把 Query 和每个候选拼在一起过一遍完整 Transformer百万级数据全做精排需要几分钟。所以工业方案永远是快粗排 慢精排两阶段架构——先用快的筛到小范围再用慢的精准挑。优化二HyDE 假想文档检索问题背景用户提问往往过短、模糊、语义稀疏。比如用户问怎么赎回——就三个字Embedding 之后跟知识库里ETF赎回操作流程的向量距离可能很远检索召回率极差。解决方案HyDE Hypothetical Document Embeddings先让 LLM 根据用户问题生成一份假想的标准答案不需要准确只需要语义丰富。用这份假想答案而非原始问句做 Embedding去向量库检索。假想答案的语义信息远比三个字的原始问句丰富召回质量大幅提升。通俗类比用户问怎么赎回——太短了搜索引擎不知道你在说基金赎回还是 ETF 赎回还是理财产品赎回。HyDE 的做法先让模型帮你脑补一段答案——ETF赎回是指投资者将持有的ETF份额通过证券账户向基金公司申请换回一篮子股票或现金的过程……。这段话信息量远大于怎么赎回三个字用它去检索精准度自然高得多。HyDE 的代价多一次 LLM 调用 多一次延迟 多一份成本。所以 HyDE 适合离线批处理或对延迟不敏感的场景。实时低延迟场景需谨慎或用小模型生成假想文档以降低延迟。Q10 文本相似度计算原理基础但必考考察基本功是否扎实。面试官用这道题做收尾确认你对底层原理有闭环理解。主流工业方案余弦相似度Cosine Similarity对两段文本做 Embedding转为高维向量如 768 维。计算两个向量的余弦夹角——夹角越小方向越一致语义越相似。余弦值范围 [-1, 1]值越接近 1 表示越相似。数学公式cosine_similarity(A, B) (A · B) / (||A|| × ||B||)直观理解把两段文本想象成高维空间中的两个箭头箭头方向越接近语义越相似。注意这里比较的是方向而非长度——向量长度代表文本信息量方向代表语义含义。兜底传统方案TF-IDF无模型场景下比如没有 GPU、不能用 Embedding 模型可用TF-IDF做传统文本相似度计算TF词频一个词在文档中出现的频率。IDF逆文档频率一个词在所有文档中越稀有区分度越高、权重越大。TF × IDF 该词对该文档的重要性得分。把两段文本的 TF-IDF 向量做余弦比较得到相似度。Embedding 余弦相似度语义级匹配开心 ≈ 高兴需要模型推理有计算开销适合现代 RAG / 语义搜索对中文、多语言效果好TF-IDF 余弦相似度字面级匹配开心 ≠ 高兴纯统计计算无模型开销适合简单关键词匹配场景对同义词、多义词无感知面试加分提到BM25——它是 TF-IDF 的改进版加入了文档长度归一化和词频饱和机制是传统全文检索如 Elasticsearch的标准算法。工业级 RAG 中经常用BM25 向量检索混合召回兼顾关键词精确匹配和语义模糊匹配效果优于单一方案。面试总结美的 AI Agent 招聘核心考察点整套 10 题本质只考察三件事你是否具备完整的 Agent 运行世界观——规划、工具、记忆、迭代四要素是否形成闭环认知Q1、Q5、Q6、Q7、Q8你是否懂 RAG 全链路工程优化——从基础流程到 ReRank、HyDE、幻觉治理是否都能说清楚Q2、Q3、Q9、Q10你是否避开纯理论懂真实落地坑点——框架弊端、参数校验、循环限制、上下文治理Q4、Q5、Q6、Q8只要吃透这 10 题足以应对绝大多数大厂 AI 应用、Agent 开发、RAG 工程、大模型落地面试。备考策略建议不要只背答案——面试官会追问为什么理解底层原理才能应对变体问题。每个知识点配一个踩坑经历——我在做 XX 项目时遇到过 YY 问题最后通过 ZZ 解决的。有故事的回答远胜干巴巴的概念背诵。准备一个端到端项目案例——能从需求分析讲到架构选型再到踩坑解决这是面试中最有说服力的部分。关注前沿动态——ReAct 之外了解 Reflexion / Plan-and-ExecuteRAG 之外了解 GraphRAG / Self-RAG。不需要深入但知道名字和核心思路就能加分。面试的本质不是考你知道多少而是考你做过多少、想过多少。每一个概念背后面试官都在判断你是背了答案还是真正踩过坑、做过决策、解决过问题。带着工程视角去准备你就能从会答升级到会聊——而后者才是通过面试的关键。