ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

招行信用卡中心数据挖掘笔试复盘:题型拆解与备考方向

招行信用卡中心数据挖掘笔试复盘:题型拆解与备考方向 二〇一九年秋招我参加了招商银行信用卡中心的数据挖掘方向IT笔试这是第一批次。事后复盘这批笔试的题型结构、考察侧重和面试官关注点和互联网大厂的数据岗笔试有挺大差异。如果你现在准备银行系的数据岗位或者正打算投招商银行信用卡中心的技术岗这份从题型到复习方向的拆解应该能帮你少走一些弯路。先说一个总体感受银行系的笔试尤其是信用卡中心这种业务属性极强的机构它考的不是你算法模型多前沿而是能不能用数据解决实际的业务问题。整张卷子看下来统计基础、SQL能力、机器学习基础、业务场景理解这四块是核心行测部分则是硬门槛。下面我按题型模块逐一拆开讲。1. 招行信用卡中心数据岗笔试的行测模块别在数学题上恋战第一块是行测也就是行政职业能力测验。很多人觉得这跟技术岗没关系随便做做就行其实不是。招行卡中心的笔试行测成绩是硬性筛选线如果行测不达标后面的专业题做得再好也可能进不了面试。它的行测题量不小时间又紧策略比实力更重要。1.1 行测四类题型的时间分配策略行测主要分四类言语理解、数量关系、判断推理、资料分析。我那年笔试的体感是言语理解占大头数量关系次之判断推理和资料分析各有一部分。言语理解类的题比如选词填空、段落主旨、语句排序这些只要你语文底子不太差按直觉快速选就行每道题控制在40秒以内。数量关系是很多人栽跟头的地方比如行程问题、工程问题、排列组合、概率这些每道题可能要花两分钟以上如果卡住了我的建议是直接跳不要在一个题目上耗太多时间。判断推理里的图形推理、逻辑判断这类题有套路比如图形推理无非是数量、位置、样式、属性几种规律刷过一遍粉笔或者中公的题集就能很快识别。资料分析是性价比最高的题型它给你一段统计材料然后让你算增长率、比重、平均数这些只要你会用截位直除、百化分这些速算技巧拿分很稳。我的个人经验是先做言语和判断推理这类靠语感和直觉的题把资料分析放在第二优先级数量关系放到最后因为数量关系是最可能做不完的部分。1.2 银行行测和公考行测的区别这里有个值得注意的差异银行的行测和公务员考试的行测不完全一样。银行系的行测更偏向经济金融背景比如言语理解的阅读材料可能是关于央行货币政策、信用卡消费分期、支付清算体系的文章逻辑判断题干里也可能出现金融术语。资料分析给的材料往往直接就是某家银行的年报数据、信用卡发卡量同比增长率、不良贷款率这些。如果你平时对财经新闻不太关注建议考前一周每天刷一些金融类资讯熟悉一下相关术语否则考试时读题速度会明显慢一截。另外一个细节是银行行测的题量通常比公考少但每道题的用时也被压缩得更紧。我当时拿到的卷子行测部分好像是60分钟做60道题左右平均一分钟一道所以几乎没有回头检查的时间。我的做法是每道题读完就立刻勾选答案标记不确定的题号全部做完后再集中犹豫。实测下来这个方法比一道一道仔细斟酌要稳得多因为行测第一直觉的准确率通常挺高反复纠结反而容易改错。2. 专业知识模块数据挖掘笔试真正的分水岭行测只是敲门砖专业知识才是拉分的关键。招行卡中心的数据挖掘笔试专业题覆盖了数据结构与算法、数据库、机器学习、统计学、业务场景题这几个方向。从我的做题体感来看统计和业务场景的权重很高而且考察方式很灵活不像很多互联网公司那样只考深度学习八股文。2.1 数据结构与算法题难度不大但考手感和边界意识数据结构和算法这块笔试里出现的主要是选择题和简答题现场手写完整代码的题目不多但这不代表你可以不准备。选择题考察的都是一些经典概念比如栈和队列的区别、二叉树的前中后序遍历、哈希表解决冲突的方式、排序算法的时间复杂度和稳定性。比如它可能会问你快排的平均时间复杂度是多少最坏情况是什么什么情况下会出现最坏情况。再比如给一个链表问你如何在O(1)时间内删除某个节点。这些都是《剑指Offer》和《程序员面试金典》里的基础题认真刷过一遍基本都能答上。简答题可能会让你描述某个算法的思路比如手写一个快速排序的核心逻辑或者讲一讲动态规划的思路。这里有个容易踩的坑你在IDE里写代码和有思路地写步骤是两回事。面试官看的不是你代码敲得多漂亮而是你的思路是否清晰、能不能考虑到边界条件。我当时写一个二分查找的变种题时第一遍没考虑到目标值不存在的情况后来补上了边界判断。这种细节在面试官眼里比单纯写对代码更重要因为它反映的是你有没有完备的思维习惯。2.2 数据库SQL题信用卡中心必考的重头戏数据库的题目尤其是SQL题在招行卡中心的笔试中占比不小。原因很简单在银行体系内数据量虽然大但业务的日常分析基本都离不开SQL无论是取数、报表还是特征工程SQL是数据挖掘工程师的基本功。笔试中的SQL题通常是给一个业务场景让你写查询语句。比如给你一张信用卡交易流水表、一张用户信息表让你统计每个用户的消费总额、消费频次、最近一次消费时间。你需要熟练掌握SELECT、JOIN、GROUP BY、HAVING、窗口函数这些基础语法。窗口函数是我特别想提醒你注意的一个点。我笔试那天就遇到一道题要求计算每个用户每月的消费金额以及和上月的环比增长率这个用窗口函数LAG很容易搞定。如果只停留在GROUP BY的层面你也能算出来但会非常繁琐。另外银行的数据量非常大动辄亿级所以笔试题里会考察你对SQL优化的意识比如什么时候用索引、什么时候避免SELECT *、什么时候用EXISTS代替IN。这些意识性考察你需要平时写SQL时就留心积累到一定量才能形成直觉。2.3 机器学习基础从经典算法到模型评估全覆盖机器学习部分的考题覆盖范围比较广从传统的逻辑回归、决策树、随机森林、SVM到集成学习、聚类算法、降维方法再到深度学习里的基础概念都会涉及。但考察的深度不算深基本以概念理解、算法原理和适用场景为主。比如它可能会问你逻辑回归为什么用交叉熵而不是均方误差作为损失函数决策树中信息增益和基尼指数的区别是什么随机森林的随机性体现在哪两个方面SVM的核函数有什么作用K-Means聚类的K值怎么确定PCA降维的原理是什么这些如果你系统学过机器学习基础应该都能答上来。关于深度学习部分我记得当时考到了过拟合问题问你有哪些防止过拟合的手段L1正则化和L2正则化的区别以及Dropout的原理。这些在面试中很常见但在笔试里出现说明银行也在快速拥抱深度学习技术尤其是个性化推荐、风险模型这类业务都会用到神经网络模型。另外模型评估指标也是高频考点比如精确率、召回率、F1、AUC、ROC曲线这些。信用卡中心对风险模型特别关注AUC几乎是所有信贷模型的核心指标所以你要对这些指标的定义、计算方式、业务含义吃得透透的。2.4 特征工程与数据预处理容易被忽视的分值大户这里提一个很多人会忽略的点特征工程和数据预处理在笔试题中出现频率很高。银行系数据挖掘岗的日常工作很大一部分时间其实是花在数据清洗、缺失值处理、异常值检测、特征构造这些环节上。所以笔试里会考察这些基础实操能力。比如给你一个包含缺失值的用户特征表问你有哪些处理方法均值填充、中位数填充、众数填充、模型预测填充各自的适用场景是什么。再比如问你如何检测异常值3σ原则、箱线图法或者问你怎么处理类别型特征是One-Hot编码还是标签编码什么场景用哪种。我记得当时有一道题是关于标准化和归一化的区别。标准化是让数据服从标准正态分布归一化是把数据缩放到0到1之间。题目问在什么情况下用标准化什么情况下用归一化逻辑回归用哪个更好SVM用哪个更好。这类题目没有固定答案考的是你对算法原理的理解深度。逻辑回归这类基于梯度的模型用标准化更好而决策树这类基于阈值的模型对特征尺度不敏感。你要能讲清楚背后的原因而不是死记结论。3. 统计学题数据挖掘的底层理论根基统计学是银行和互联网金融公司特别看重的一块这也是和很多纯互联网公司不一样的地方。互联网大厂的数据岗可能更侧重算法和工程能力但银行系会更看重统计功底。因为在银行做风控模型、信用评分卡本质上做的就是统计推断和概率分析没有扎实的统计基础很难真正理解模型在做决策时的概率逻辑。笔试中的统计题主要集中在描述性统计、概率分布、假设检验、回归分析这几个方面。3.1 描述性统计与概率分布理解数据的分布形态描述性统计是最基础的部分包括均值、中位数、众数、方差、标准差、四分位数、偏度、峰度这些概念。题目可能会给你一组消费数据让你判断分布形态是左偏还是右偏均值和中位数谁大谁小。你需要明白当数据右偏时均值大于中位数左偏时均值小于中位数。这在分析用户消费行为时特别常用比如一个用户群体的消费金额往往是右偏分布少数高消费用户拉高了均值如果直接用均值去衡量整体水平会产生严重误导。概率分布部分重点考察正态分布、二项分布、泊松分布、均匀分布、指数分布这些常见分布的特征和应用场景。比如信用卡欺诈检测的场景中每笔交易发生欺诈的概率可以用二项分布描述而单位时间内交易数量的分布则可以用泊松分布描述。给你一个实际场景让你判断服从什么分布这是笔试中的高频题型。另外正态分布的3σ原则也是常考点很多题目会直接用到这个原则来确定异常值阈值。3.2 假设检验与区间估计数据结论可信度的验证假设检验这块需要掌握原假设和备择假设的建立、第一类错误和第二类错误、显著性水平、p值、t检验、卡方检验、F检验这些基础概念。题目可能会给你一个场景比如某支付通道的日均交易额在改版后是否显著提升问你应该用什么检验方法怎么设置原假设p值小于多少可以拒绝原假设。这里有个容易混淆的点p值是“在原假设为真的情况下观察到当前样本数据或更极端数据的概率”它不是“原假设为真的概率”如果你能把这个区别讲清楚在面试环节会是一个很好的加分点。区间估计部分可能会考置信区间的含义和计算方法。比如给你一个样本均值和样本标准差让你算95%置信区间除了套公式外你还需要理解置信区间的统计含义如果我们重复抽样多次每次构造一个置信区间大约有95%的区间会包含真实的总体参数。这个理解上的差异能看出你是只会背公式还是有真正的统计思维。银行系考试的简答题很爱出这种概念辨析类的题目你不仅要写得出公式还要解释得清楚。3.3 回归分析线性回归到逻辑回归的关键细节回归分析在统计部分也是重点。线性回归的基本假设有线性关系、独立性、同方差性、正态性等笔试可能会让你写出线性回归的损失函数或者说明最小二乘法求解参数的过程还可能让你分析多重共线性的危害和处理方法。另一个高频考点是逻辑回归它虽然名字里有回归但实际上是分类模型输出的是样本属于某一类别的概率然后根据概率阈值决定最后分类结果。题目可能会问逻辑回归和线性回归的区别、逻辑回归的损失函数为什么选择交叉熵、逻辑回归的优点是什么、怎么解决样本不均衡问题。这里我建议你把逻辑回归作为复习的重中之重。因为信用卡中心的业务场景里无论是申请评分卡、行为评分卡还是催收评分卡逻辑回归都是最常用的基础模型。它解释性强输出结果可以转化成评分而且部署简便监管也容易接受。正因如此招行卡中心的笔试题一定会反复出现逻辑回归相关的内容对这个模型需要做到能推导公式、能说出业务意义、能写出代码实现三大能力缺一不可。4. 业务场景题从评分卡到用户画像的实战考察最后一块是业务场景题这个是最能体现招行卡中心特色的部分也是很多非银行系的候选人容易失分的地方。业务场景题通常不会考你特别细节的业务知识而是给你一个具体的业务问题让你提出分析思路或建模方案。它会考察你的业务理解能力、逻辑思维能力和方案落地能力这三者需要同时具备才能答得完整。4.1 信用评分卡场景从风险识别到额度授信典型场景比如如何构建一个信用评分卡模型来评估新用户的信用风险拿到这个题你不能只说一个逻辑回归就完事而要按数据挖掘的标准流程来拆解首先是业务理解明确评分卡是用于申请环节的风控还是存量用户的管理然后是数据准备考虑从哪里获取数据包括用户填写的信息、第三方征信数据、历史借贷行为数据等接着是特征工程把原始数据加工成有区分度的特征比如收入负债比、近三个月查询次数、历史逾期次数等再接着是模型构建常用的就是逻辑回归或者评分卡模型其中需要用WOE编码、IV值筛选、变量的单调性检验这些风控领域特有的处理方法最后是模型评估和上线监控包括KS值、AUC、PSI这些指标。这道题如果你能按流程完整展开面试官会认为你真的知道评分卡怎么做。相反如果你只回答“用逻辑回归跑一下”即使算法基础再好也会被打上“不接地气”的标签。我也遇到过一道很细致的题问评分卡模型中证据权重WOE的计算公式是什么以及它的业务含义是什么。WOE衡量的是某个分组中“好客户占所有好客户的比例”和“坏客户占所有坏客户的比例”的差异差异越大说明这个分组对风险区分的贡献越大。这种细节题没有认真准备过风控知识的人基本答不上来。4.2 用户画像与精准营销场景从分群到生命周期管理除了评分卡信用卡中心笔试还会考到用户画像、精准营销、流失预警这些场景。比如如何对信用卡用户进行分群怎么做精细化运营这种题目的答题要点是先明确分群目标是基于消费能力还是消费偏好再选择合适的分群特征比如月均消费金额、消费类别的多样性、夜间消费占比、分期使用频率、境外消费频次等然后选择分群算法K-Means、层次聚类、DBSCAN都是常见选项分群之后还要针对每个群体设计差异化的营销策略比如高消费高活跃人群推高端卡权益有分期需求的人群推分期优惠有流失倾向的人群推唤回礼包。业务场景题还会考察你对增长指标和用户生命周期管理的基本理解。比如用户生命周期分为获客期、提升期、成熟期、衰退期和流失期每个阶段的运营目标和数据指标都不一样。获客期关注新户首刷率和激活率提升期关注户均资产或消费金额的提升幅度成熟期关注交叉销售成功率和贡献度提升衰退期关注消费频次下降幅度、是否开始减少用卡流失期则需要建立流失预警模型。你在答题时如果能把生命周期角度纳入思考框架会让面试官觉得你对信用卡业务有体系化的理解而不只是会单个点上的模型算法。4.3 分层抽样与实验设计数据结论可信度的工程保障业务场景题中还会出现一类实践性极强的题目关于用户试验设计和效果评估。信用卡中心的运营活动非常多比如给一部分用户发消费返现券看这个活动是否提升了用户的消费频次和金额。这种题问你怎么设计实验、怎么评估活动效果、怎么排除干扰因素。我的建议是用互联网A/B测试的框架来回答同时补充金融业务的特殊性。比如实验组和对照组的划分要考虑用户的风险等级、消费水平、活跃度等特征做分层抽样而不是完全随机抽样因为银行用户群体差异大完全随机可能引入偏差。效果评估方面除了看消费金额的提升还要考虑到成本比如返现的支出是不是吃掉了收入增量所以经常需要算ROI。还有一个关键点用户被营销后产生的消费行为可能具有滞后性也就是说效果不是一个立竿见影的过程可能需要观察几周甚至更长时间这个视角在答题时提出来会显得你经验丰富。5. 实战复盘做题顺序、时间分配与易踩的坑前面讲完了各个知识模块最后我复盘一下整个考试过程中的实战经验和容易踩的坑。笔试通常在上机考试系统中进行系统是北森的在线考试平台题目的呈现方式、倒计时提示和交卷逻辑都需要提前熟悉。我记得正式开考前有一段模拟练习的时间这个一定要用起来哪怕只有十分钟也要认认真真做几道样题提前感受一下答题界面的交互逻辑判断哪些题型是选择哪些是简答答案框支持什么格式倒计时结束后会系统自动交卷还是需要手动提交。时间分配方面我的建议是先做行测再用完整的大块时间做专业题和业务题。行测可能会出现在前面也可能穿插在专业题之间这取决于考试系统如何编排题目。关键策略是行测要快专业题要稳业务题要框架化。我在时间分配上踩过一个坑在处理SQL题目时明明思路很清晰但我手写了很长时间的完整代码结果后面的业务题时间不够用只能草草答完。实际上考试系统通常不会要求你写完整的SQL代码更多是让你写出核心的语句逻辑比如关键的SELECT、FROM、WHERE、GROUP BY部分然后简单说明思路。我建议你在平时练习时刻意训练自己用简化表达写出题目要点不要追求代码的完整性和规范性那是面试环节的任务笔试答题的关键是抓住要点、节省时间。还有一个很关键的坑是选择题的“迷惑项”。银行机考的选择题选项设置通常很接近粗看每一个都像正确答案特别是关于机器学习指标计算、统计学概念辨析这些题。我的应对策略是第一遍先快速地凭直觉选用排除法排除明显错误的选项如果剩下两个选项犹豫不决就标记出来不恋战。等全部题目做完后再回头集中处理这些不确定的题。实测下来这样的答题效率比一步一停稳得多而且人的直觉判断往往比反复确认的准确率更高。业务场景题的答题格式也需要注意。有些人在业务题上太简略了只写两三行字比如“用逻辑回归建个模型”这几乎拿不到分。业务题答题一定要有框架感通常按照“业务目标、数据来源、特征工程、模型选择、评估方式、落地策略”这样的逻辑展开。你可以用分点或段落的形式写清楚不一定长篇大论但每个环节都要有一点实质性内容。面试官看你业务题答案时看重的是分析思路是否完整、能否从业务目标一步步推导到落地动作而不是看你的辞藻有多华丽。6. 从笔试看招行卡中心数据团队的工作日常能力要求反推岗位画像考完试后我做了一个很有意思的事情把整张卷子的题目和考察点列出来然后反推招行卡中心的数据挖掘岗到底做什么。结果发现这个岗位的工作内容比很多互联网公司的大而全的数据岗要聚焦得多也更贴近业务线。从笔试内容来看招行卡中心的数据团队大致可以拆分出三类需求。第一类是风控模型方向。这一方向的人主要负责信用评分卡、反欺诈模型、贷中/贷后风险预警模型。日常打交道的算法以逻辑回归为主近年也在探索XGBoost、LightGBM、深度神经网络在反欺诈方面的应用。日常工作核心是数据清洗、特征工程、模型训练、效果评估和监控上线同时需要配合业务团队做策略制定和规则调整。这个方向对应笔试里的统计学模块、机器学习模块和业务场景题里的评分卡场景是笔试考察的大头。第二类是用户运营和精准营销方向。这一方向的人负责用户分群、消费行为分析、营销活动效果评估、流失预警与唤回策略。日常用的是聚类、关联规则、协同过滤、用户生命周期分析等方法。工作场景是配合运营团队把数据洞察转化成可执行的营销策略评估活动的投入产出比持续优化营销对象和触达方式。这个方向对应笔试里的业务场景题中的用户画像、精准营销等内容也与行测资料分析里的数据解读能力相关。第三类是数据平台和特征工程方向。这个方向的人负责数据仓库的搭建和维护、ETL流程开发、特征平台的构建为建模团队提供稳定、高质量的数据基础。日常主要用SQL、Python、Spark这些工具工作重点是把杂乱的原始数据变成可以直接用于建模和报表分析的标准化特征表。这个方向对应笔试里的SQL题目和数据预处理题。虽然这部分在笔试中占比不是最大的但却是数据团队不可或缺的基础支撑如果你的优势在工程和数据能力上这个方向会非常契合。这些方向并不是完全割裂的数据挖掘工程师在实际工作中往往跨方向协作风控建模的人也需要懂用户运营的指标营销分析的人也要了解风控的基本逻辑。笔试考察这么全面其实就是在筛选那些既有扎实理论基础又有整体业务视野的候选人。7. 备考建议与个人复盘回顾整个备考和应试过程我总结了几个对银行系数据岗笔试特别有针对性的建议供你参考。第一数学和统计是必须要过的关卡。招行卡中心的笔试对统计和概率的重视程度明显高于一般的互联网公司假设检验、概率分布、回归分析这些内容需要系统地复习一遍。推荐用《概率论与数理统计》教材配合考公数量关系的题目来恢复手感再结合数据挖掘相关的统计应用场景做题考试时会轻松很多。第二SQL能力必须达到能直接处理业务问题的水平。在笔试里写SQL题时要特别注意窗口函数的使用、复杂查询的改写能力以及对SQL优化基本思路的理解。日常可以找一些线上SQL练习题比如LeetCode的数据库板块做30道左右的题覆盖聚合查询、多表连接、子查询、窗口函数等常见题型基本就能应对这类笔试的强度。第三业务场景题不要只背模型名词。你需要真正理解算法在业务里解决什么问题。准备时可以把经典的风控建模流程从业务定义到特征工程到模型训练到评估上线反复演练几遍就像准备面试问答一样把每一步的逻辑梳理清楚。如果你身边有在银行或消费金融公司做数据的同学、朋友不妨多请教一下他们的日常工作流程这会比书本知识更接地气。第四行测虽然枯燥但千万不要放弃。银行系的笔试行测成绩是硬门槛直接决定了你有没有机会被推进到专业面试环节。我的建议是考前两周每天做一套行测题严格计时重点训练做题速度和取舍能力。尤其是资料分析题分值高、性价比高值得花时间把速算技巧充分熟练。最后再分享一个小技巧考试过程中遇到完全不会的题不要空着。笔试的计分规则里很多选择题空着不给分但猜一个选项还有命中的机会业务题哪怕没有十足的把握也要把能想到的分析框架写上去写出的框架本身就可能带来部分得分。银行笔试的评审更看重你逻辑是否清晰、思维是否完整即使某个模型细节说得不够精准也不会因为你没答到标准答案就全盘否定这一点和纯客观题的评分逻辑很不一样。招商银行信用卡中心的笔试是我秋招中体验最“综合”的一场考试它考察的不仅是技术深度更是技术能力和业务思维的结合。希望这篇复盘能帮你更好地了解这场考试的构成和考察要点也祝你能顺利进入自己心仪的方向。
返回列表