ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

京东数据分析师笔试复盘:从SQL到业务思维的进阶之路

京东数据分析师笔试复盘:从SQL到业务思维的进阶之路 看着手边放着的那份2019年京东春招数据分析类试卷我到现在还觉得那是所有互联网大厂笔试里最值得反复琢磨的一份。那年我前后投了二十多家公司的数据岗笔试做了不下三十套说实话论SQL难度拼多多和头条更狠论统计理论腾讯和美团更偏但要说把“数据分析师该有的样子”考得最立体、最贴近真实业务的京东这份卷子排第一。它不是考你会不会写代码而是考你有没有用数据解决过一个真实商业问题的完整思路。这份试卷适合谁三类人准备冲大厂数据分析师岗位的应届生、想从其他岗位转行做数据的朋友、以及那些正在带数据团队、想看看自己手底下的人到底几斤几两的Leader。它能让你看到在京东眼中一个合格的初级数据分析师应该具备什么样的知识结构、思维习惯和业务直觉。1. 拿到这份2019春招试卷时我在想什么1.1 为什么这份试卷值得反复研究先说一个可能有点反直觉的结论这份卷子的难度放在今天的招聘标准里依然不过时甚至比很多2024年的笔试更有代表性。原因很简单2019年是京东从粗放式增长转向精细化运营的关键节点这一年的数据岗试题恰好反映出了业务方对数据分析师最真实的期待。我当时刚做完卷子第一感受是“这不像是一份考试题更像是一份工作模拟题”。它没有把大量的时间花在测试你记不记得某个函数的语法上而是不断地把你拉进某个具体业务场景然后逼你回答“面对这个情况你会怎么拆解、取什么数、用什么方法、得出什么结论、下一步做什么”另一个让我印象深刻的地方是它的分值分布。整份试卷虽然涵盖SQL、Python、统计学、机器学习、业务分析但如果你把分值占比拉出来看你会发现业务分析类题目占了绝对大头。这说明什么说明京东招数据分析师默认你的技术和工具能力是基本盘而真正拉开差距的是你对业务的理解和对数据的敏感度。1.2 试卷的整体印象与考察布局从题目结构上看这份试卷大致可以分为四个模块每个模块对应一类能力模块考察内容大致占比能力标签SQL与数据处理多表关联、聚合、窗口函数、查询优化20%-25%基础硬技能统计学与机器学习假设检验、AB测试、回归、分类评估20%-25%分析师的理论底子Python与工具应用Pandas操作、数据可视化逻辑10%-15%日常实操能力业务分析与案例指标异动归因、用户分层、运营策略40%-45%业务价值创造能力这四个模块的排列顺序也是有讲究的。它不是按难度递增而是按“数据工作流的自然顺序”来排的先给你一堆原始数据考验你怎么处理然后让你做统计分析检测显著性再让你用Python跑出结论最后抛出一个综合业务案例看你能不能把前面所有能力串起来。这个逻辑本身就是京东数据分析团队工作流的缩影。一个数据分析师每天干的事情从取数、清洗、建模到输出策略建议正好就是这张卷子从第一题到最后一题的路径。明白了这一点你就知道为什么不要只刷题而要带着业务视角去准备每一类题目。2. 从考题倒推京东数据分析岗的能力要求2.1 基本功考察SQL与数据处理能力这份试卷的SQL题不炫技但很实用。我记得有一道题大概是这样的有一张订单表和一个商品表要求统计每个品类下复购率超过20%的商品数量。这个题目听起来不难但真正写起来很多人会栽在“复购率的口径定义”上。这里其实藏了一个京东很看重的点数据分析师必须能清晰定义口径。复购率到底是按购买人数算还是按订单数算一个用户在一个品类下买了两次分子分母各加几这些问题没有标准答案但如果你在答题时没有明确说明你的口径而是闷头写SQL考官第一反应就是这个人对业务指标的理解不够敏感。SQL本身的考点集中在三类多表关联要会用inner join和left join的区别、窗口函数row_number、rank、lag这些、以及聚合后过滤having的用法。其中窗口函数是重中之重京东2019年已经全面使用Hive和Spark这类大数据环境下的取数逻辑本质上就是靠窗口函数解决“分组内排序”和“分组间比较”的问题。我的建议是准备SQL时不要只刷LeetCode而是多用真实业务场景练习。比如计算每个用户最近一次成交距今天数、计算商品价格连续下降的天数、统计每个品类Top10商品贡献的GMV占比。这些题目看似是SQL题其实都是京东日常运营中真正要排查的问题。2.2 统计与建模从假设检验到回归分析统计部分题目量不大但覆盖面很精准。我印象最深的是有一道关于AB测试的题它没有直接问你“什么是p值”而是给了你一个场景某频道改版后CTR从1.2%涨到了1.5%转化率从3.1%降到2.9%问你是不是应该上线新版本。这道题厉害的地方在于它同时考察了三个层面的能力第一你是否能识别出这是一个AB测试的显著性检验问题第二你是否知道CTR和转化率这两个指标可能一涨一跌背后反映的是用户结构变化还是流量分配问题第三你会不会建议先看置信区间和p值再下结论。除了AB测试回归分析也是必考项。那一年考了一道简单的线性回归题给了几个特征和系数问怎么解释系数的含义。这里有个坑如果特征量纲不同系数的绝对值大小不能直接比较重要性如果是分类特征还要先说明基线类别是什么。这些细节京东的出题人不会明说但答没答出来直接反映了你的统计基础扎不扎实。2.3 Python与工具链的隐性问题Python在试卷里占比不高但考点很有意思。我记得有一道是用Pandas处理一份用户行为日志要求做数据清洗、去重、按用户聚合、计算人均浏览时长。看起来简单但里面埋了好几个坑时间戳格式不一致、同一用户在同一天有重复访问记录、部分会话时长明显异常比如超过24小时。这些场景我在实际工作中经常遇到而且京东的日志数据量级非常大真正到了线上环境远不止这些坑。所以这道题的核心不在于考你会不会用drop_duplicates而是你有没有数据质量的意识。真实的数据永远是脏的你需要有一套自己的“数据体检”流程先看空值比例、再看分布形状、然后处理异常值。这里顺带提一个很多人忽略的细节试卷上那道Python题其实在暗示一个真实工作流——数据清洗占掉数据分析师60%以上的时间。所以京东考的并不是你用Python建模的能力而是你用Python处理脏数据、从垃圾里淘金的能力。2.4 商业敏感度这是试卷的隐藏主角整份试卷答到最后你会越来越清楚地感觉到技术题只是“入场券”商业敏感度才是“分水岭”。同样一道归因分析题有人只会说“GMV下降了是因为客单价和单量都下降了”但会思考的人会说“GMV下降先拆分新客还是老客再拆是流量下降还是转化率下降再拆是哪个品类在拖后腿最后再看是季节性因素还是平台策略调整。”这种层层下钻的思维京东叫“漏斗思维的降维应用”。但它不是靠背公式能学会的它需要你真的理解电商的业务逻辑流量怎么来、用户怎么转化、订单怎么履约、复购怎么发生。数据分析师只有在这个框架下才能把数据和业务串联起来。如果缺少这层理解你眼中就是一堆冷冰冰的字段而带着业务敏感度去看每一个字段都代表着一环被验证过的决策。3. 重点题型拆解那些让我印象深刻的题目3.1 业务指标类题目GMV下降怎么排查这类题目基本是京东笔试的保留节目2019年也不例外。它通常会给你一个场景某平台近一周GMV环比下降了10%请你分析可能的原因并提出排查思路。这道题考察的核心不是唯一的正确答案而是你的分析框架是否完整。我当时写的是这样的思路首先确认数据口径。有没有可能是统计延迟、接口故障、或者是去年的双11基数效应先排除数据本身的问题再谈业务问题。其次拆分GMV 用户数 × 客单价 × 购买频次。用户数再看新客vs老客、各渠道的流量变化客单价再拆是商品结构变化还是折扣力度变化购买频次看复购率有没有波动。最后再看垂直品类维度和区域维度锁定问题范围。这套思路用一个方法可以概括MECE原则相互独立、完全穷尽。京东非常吃这一套因为它能证明你有系统化拆解问题的能力而不是拍脑袋东猜一个西猜一个。整个排查过程其实不需要多高深的数学但需要把业务问题翻译成可量化、可拆解的指标树。3.2 数据清洗与特征工程题有一道题让我印象特别深刻它给你一份用户信息表其中年龄字段有一堆缺失值另外还夹杂着一些明显不合理的值比如“年龄999”或者“年龄0”。要求你提出清洗方案并说明理由。这道题考验的是你对“缺失值处理”和“异常值处理”两个知识点的理解深度。年份正常的做法无非是删除、填充均值、填充中位数、或用模型预测。但这道题最标准的答法是先判断缺失值的机制是完全随机缺失、随机缺失还是非随机缺失如果是非随机缺失比如年龄越大的人越不愿填那你直接用均值填充会产生系统性偏差。另外那个“年龄999”的异常值处理其实先不要急着删可以查一下它在原始日志里是不是默认值或占位符。很多时候999代表“保密”这在真实的用户数据里是常态。所以这道题的高分答案往往不在技术而在你对数据来源的理解——你会不会去追溯这个字段是怎么采集上来的。特征工程类似它考的也不是让你做多复杂的多项式组合而是你能不能解释清楚每个特征背后的业务含义。我当时在答案里提到“用户最后一次购买距今的天数”这个特征时特意强调了这个特征代表的是用户的活跃度和复购可能性比单纯的“购买次数”更能反映用户的即时状态。这种把特征和业务映射的能力才是京东等大厂反复考察的底层能力。3.3 A/B测试类题目从原理到机制统计类的AB测试题在笔试中出现的频率极高。2019年京东的卷子没有出那种纯理论题而是给了一个完完整整的业务故事商家App改版新首页曝光量增加了点击量也增加了但是最后的下单转化率没有显著提升需要你来分析。这类型的题如果你只回答“看p值是否小于0.05”那基本上拿不到高分。它背后真正想看到的是你对实验设计全流程的理解样本量怎么算是否能检测出1%的转化率提升、实验组和对照组怎么分配避免分流不均、实验周期应该多长覆盖完整的用户行为周期、以及如何判断是否存在“新奇效应”。“新奇效应”这个词是我当时在考场上突然想起的一个概念。当用户看到一个新界面时他们会因为好奇而多点击几次但这种效应会随时间消退。如果实验只跑了一周你测出来的点击率提升很可能是虚假的。我在答题时专门强调了这一点并且建议把实验周期延长到两到四周观察效果是否持续。我觉得这道题能拿高分很大程度上就是因为这个细节的思考。3.4 综合案例分析题从数据到决策最后一道大题分值最高是一道综合性案例题。我记得大致意思是京东平台上某个品类的销售额连续三个月下滑但流量没有下降市场占有率的行业排名也稳定需要你找出问题并给出解决方案。这道题没有标准答案我从头到尾都是按一个完整的数据分析项目流程来答的第一步定义问题。销售额下滑不等于收入下滑先明确目标是把销售额拉回增长曲线还是先稳住基本面。第二步数据采集。列出需要的数据表订单表、用户表、商品表、流量表、活动表。第三步分析假设。连续三个月下滑、但流量不变最可能的原因是转化率下降或客单价下降。转化率再拆是新用户转化变差了还是老用户复购变差了客单价再拆是商品结构出了问题比如低价商品占比提升还是折扣力度在收紧。第四步输出策略。针对不同的原因给出相应的运营策略比如优化商品推荐、调整定价策略、加强老客召回。这个案例题其实是在模拟一个数据分析师的完整工作闭环定义问题、假设驱动、数据验证、策略输出。也就是说它不再只是考某一个点而是要你把前面所有模块的知识串联成一个流水线。能答好这个题的人基本上已经拥有独立负责一个中小型分析项目的雏形了。4. 这些考题背后的业务逻辑与答案思路4.1 为什么京东喜欢考“指标异动归因”把2019年这份试卷的几道业务题放在一起看你会发现一个明显的共性大量题目都在围绕“某个业务指标突然变了你怎么查原因”展开。这不是巧合而是京东数据分析团队日常工作的真实缩影。在商业分析语境里指标异动归因大概是出现频率最高的需求场景。运营看到一个数据波动第一反应就是找数据团队问是好事还是坏事为什么变了是短期的还是长期趋势需要调整策略吗数据分析师的价值很大程度上就体现在能不能快速、准确地回答这些问题上。答卷想法的核心不是去尝试穷尽所有可能性那是不可能的而是要在有限的时间里用最合理的框架定位最可能的原因。这个框架可以简化为三个维度数据口径是否有变化、外部环境是否有结构性影响、内部业务动作是否有因果影响。其实所有异动归因都能被归入这三个大的框架之内没有例外。4.2 用户增长与RFM模型的分析思路用户相关题在试卷里也占了不少篇幅尤其是关于“用户分层”和“用户生命周期”的内容。我记得有一道题问的是如何评估一个用户的价值并设计分层策略。高频词除了“RFM模型”之外还有“LTV用户生命周期价值”和“CAC获客成本”。RFM模型是Recency最近一次消费、Frequency消费频率、Monetary消费金额三个维度的缩写它通过这三个维度把用户分成不同价值层级从而指导运营采用不同策略。这道题想考察的是你是否能把经典模型应用到业务场景中。我当时在答案里刻意加入了一步先计算R、F、M三个指标的分位数然后用打分法把用户分箱再结合业务对每个用户群定义动作。有人一上来就是“RFM模型”但被问到具体怎么分层、怎么定义各层级的运营策略时就支支吾吾了。所以关键是你不仅知道这个模型还要能落地执行。我在实际项目中用RFM 聚类做了用户分层效果比简单打分好很多因为聚类能自动发现一些你没想到的用户群。4.3 从答题到产研思维的转变我发现很多考生在准备京东这类大厂笔试题时容易陷入一种误区只关注单个知识点的背诵比如SQL语法、调参技巧、模型评估指标却没有把这些点串成一条线。从做题中我逐渐体会到数据分析师的核心竞争力其实不是某一个工具用得多熟练而是一种“将业务问题转化为数据问题再将数据结论转化为业务决策”的转化能力。这种东西光看书学不会必须在真实的业务场景里反复练习。你要培养这种思维其实可以从最简单的练习开始打开你们产品的后台看任意一个核心指标自己问自己三分钟——这个指标过去一周为什么涨了如果我要验证我的假设我需要哪三张表如果我的假设错了下一个替代假设是什么这三个问题连续练两个月你真的会对数据分析有完全不一样的理解。这也是我在备考京东这份试卷时用得最多的一个方法。5. 备考建议与常见误区5.1 时间分配与真题演练策略备考刷题和真正上考场是两个完全不同维度的挑战。限时压力下你会发现在家练习时忽略的小毛病全都冒出来了SQL写得慢、Python的库函数记不清、业务题写得太啰嗦抓不住重点。我建议准备时间充足的话可以按这个节奏来复习我自己的时间分配大致是第一周重点补SQL和Python基本功每天刷3-5道SQL题用真实业务场景去练习。第二周主攻统计学和AB测试先把假设检验的核心逻辑理清再练真题。第三周集中整理业务分析题按照“指标拆解—原因假设—数据验证—策略建议”这个框架手写10道以上的分析思路。第四周完整模考严格按照考试时间做题所有题目都手写答案训练答题节奏和卷面表达。这个节奏的核心思路是先夯实硬技能再搭软实力框架最后用模拟考来查漏补缺。很多人恰恰是跳过了第三步直接刷题结果一到业务分析题就写不出深度。5.2 容易被忽视的细节卷面表达与答题结构这里要提醒一个很反套路的建议笔试答题时字迹可以不太好看但结构一定要清晰。阅卷老师一般是资深分析师或技术Leader一天要改上百份卷子看到一团糟的答案就算你观点再对也很难拿到高分。我个人总结了一套百试不爽的答题格式不管什么题型都会按这个结构写先写结论用一句话说清楚这道题的核心答案或推荐方案。再写过程用什么数据、什么方法、分几个步骤得出结论。最后写延伸从这道题发散出去补充一个相关风险或下一步建议。举个例子如果题目问“某商品点击率下降怎么分析”我一般会这样答“核心建议是先拆分渠道、再对比竞品、再查近期策略调整定位点击率下降的主因。具体步骤为…其中最关键的是判断是否为季节性波动…额外要注意的是点击率下降未必是坏事如果同时转化率上升可能意味着流量质量更精准了。”这个格式的好处很明显它让你在最前面就把最关键的结论露出来后面所有文字都是为这个结论服务的。阅卷人只需要看第一行就知道你有没有抓到重点后面的部分再去验证你的逻辑是否严密。这就是典型的“写给读者看”的答题方式而不是“写给自己看”的思维过程。5.3 时间预警考场上的高频翻车点我再分享几个实际考场上容易踩的坑这些坑我在模拟考和真实笔试中都吃过大亏希望你直接避开第一个坑是SQL题先动手写不先理需求。很多题看起来是让你“查一下XX”其实里面藏着过滤条件、去重逻辑和分组口径。你要是上来就写写到一半发现漏了一个条件还得推倒重来时间就没了。正确做法是先花30秒在草稿纸上列出表结构、过滤条件和输出字段再开始写代码。第二个坑是业务分析题答成流水账。很多人分析GMV下滑从头到尾写的都是“先看用户量再看转化率再看客单价”但是完全没有“用户量怎么看、转化率从哪张表取、客单价如果与去年持平那问题应该出在复购上”这种落到具体操作层面的思考。这种答案虽然大方向对但没有价值太泛了等于什么都没说。第三个坑是在一道题上死磕。我考场上亲眼见过有人因为一道SQL题想不出来就花了四十分钟死磕那道题导致最后一道综合题只剩十分钟草草写了两行字就交卷了。结果那种题目分值最重。合理分配时间的原则是先做完全部会做的题再回头啃难题。如果一道题超过十分钟还没思路先标记下来跳过最后再回来。5.4 面试前最后一周的准备清单如果你的笔试已经通过接下来面试很可能还会追问笔试里的题目所以最后一周的复习策略要跟笔试前完全不一样。笔试侧重“我会不会”面试侧重“我怎么想”——所以你要把重点放在准备叙事逻辑上。我当时准备了一份“项目故事线”把简历里的每个项目都压缩成三句话项目背景是什么、我具体做了哪些分析、分析的结论最终带来了什么业务影响。这三句话背后有一套完整的逻辑背景说明你理解业务做了什么东西说明你有技术能力带来什么影响说明你有业务价值。同时我还准备了一张A4纸的“公式速查表”上面写满了笔试和面试中最常被问到的知识点提升公式、置信区间公式、样本量公式、RFM定义、AB测试流程、常见模型逻辑回归、决策树、随机森林的优缺点及适用场景。面试前二十分钟快速扫描一遍会极大增强信心。最后一点小小的个人体会数据分析师的成长路径并不是“学会所有工具”的目标而是“学会用数据解决一个问题”的能力。每次遇到不会的题、不熟悉的模型、不清晰的业务逻辑停下来把你最困惑的地方想清楚这比闷头刷一百道题对你的提升更大。京东那份2019春招的卷子给我的最大收获不是让我拿到了Offer而是让我第一次完整地看到了这个岗位需要我成为什么样的人。
返回列表