十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

网易数据分析师校招笔试题全解析:概率统计、SQL与业务思维实战

网易数据分析师校招笔试题全解析:概率统计、SQL与业务思维实战 1. 试卷整体拆解网易校招数据分析师到底在考什么每年秋招季网易的笔试都是数据分析岗求职者绕不开的一道坎。2018年这套校招笔试卷在圈内一直有着“分水岭”的称号因为它的命题思路和市面上常见的刷题题库差别很大——不堆砌偏题怪题不追求计算量而是把考察重心放在业务直觉、统计思维和SQL功底这三个维度上。整套试卷大致分成四块概率论与统计基础、SQL与数据提取、业务案例分析、机器学习概念辨析。题型以选择、简答和场景题为主没有纯背诵类的内容所有题目都要求你在理解原理的基础上做推理和计算。换句话说如果你只会背公式、记结论碰到这套卷子会在第二题就开始卡壳。从能力模型上看网易这套题其实在传达一个信号数据分析师不是“跑数工具人”而是能理解业务、能设计分析方案、能对结果做出合理解读的角色。所以卷子里几乎没有“查一下某张表某个字段”这类机械题取而代之的是“如何评估活动效果”“如何判断指标波动是否异常”这类需要综合能力的题目。备考这套卷子我建议不要按传统“概率论SQL刷题”两条线分开准备而是以真题为锚点每道题都往业务场景上靠一靠想清楚这个考点在真实工作中对应什么分析场景。下面我就按模块逐一拆解每块都会讲清楚考点、思路和容易踩的坑。2. 概率论与统计基础为什么这些题能筛掉一大半人2.1 核心考点清单远远不止背公式概率论与统计基础部分在试卷中的权重不是最高的但往往是区分度最大的一块。网易选择的考点非常精准不是让你算复杂的联合分布而是考察你对基本概念的条件反射速度。常见考点包括条件概率与贝叶斯公式、随机变量的期望与方差、常见分布二项分布、泊松分布、正态分布、大数定律与中心极限定理、假设检验的基本逻辑、置信区间的含义。举个典型的例子卷子里有一道题描述了一个场景某产品每日新增用户数服从泊松分布平均每天新增100人问未来一天新增用户数超过120人的概率大约是多少。很多人拿到题就开始翻泊松分布的公式但这道题真正的考点是大样本下泊松分布近似正态分布用正态分布做连续性修正就能快速估算。我自己在带新人时发现大多数人对“泊松分布均值等于方差”这个结论记得很牢但真正遇到需要把它和正态近似结合起来的问题时就想不到这一步。这说明复习时不能只看单个知识点要主动建立知识点之间的连接。比如学完常见分布之后可以像做思维导图一样问自己什么时候用泊松近似二项什么时候用正态近似泊松中心极限定理在什么条件下能用、什么条件下不能用2.2 贝叶斯公式的考试陷阱先验概率别想当然贝叶斯公式几乎是网易这类互联网大厂笔试题的保留节目2018年那套卷子也不例外。题目通常给你一个比较绕的场景比如某推荐算法的点击率是10%在点击用户中有80%会完成购买在未点击用户中有5%会直接完成购买。问一个用户完成了购买他点击过推荐算法的概率是多少。这类题真正的难点不在公式本身而在于你能不能准确识别出题目中的条件概率和先验概率。很多人在这一步就会出错尤其是“在未点击用户中有5%会直接购买”这个条件容易被当成点击用户购买概率来处理。正确做法是先画一个简单的概率树把人群分为点击和未点击两组再分别乘以各自的购买概率最后用贝叶斯公式做归一化。我给大家一个自己的操作习惯拿到任何条件概率题先在草稿纸上把“全集”写清楚标注每个分组的占比再填入各组内的条件概率最后只问自己“分母应该是哪个集合里的事件概率”。这套流程听起来笨但能稳定保证正确率尤其在考场时间压力下它能避免你凭感觉做题。另外还要提醒一点题目如果出现了“有10%的用户点击了推荐位”这类描述这是在给你先验概率如果出现“点击用户中有80%会购买”这是条件概率。两者的位置一旦混淆算出来的答案会差出好几倍而且检查时还不容易发现。2.3 假设检验与置信区间理解“反证法”的business sense2018年试卷里有一道关于AB实验的简答题场景是做了一版新首页实验组转化率比对照组高了0.3个百分点问能否判断新首页更优。这道题表面上在问AB实验的显著性判断实际上是在考察你有没有建立假设检验的基本框架。标准答法要写清楚四步第一提出原假设和备择假设原假设是实验组和对照组转化率无差异第二根据样本量计算检验统计量这里大概率是用两比例z检验第三根据p值或置信区间做判断第四把统计结论转化为业务结论。但很多考生在第三步就卡住了因为他们记不清p值怎么算或者搞混了“显著差异”和“实际差异大”这两个概念。其实这里有个快速判断的土办法如果两组样本量都过万0.3个百分点的差异很可能是显著的如果每组只有几百人这个差异大概率不显著。所以答题时要写出对样本量的敏感性分析而不是只给一个孤立结论。这里顺便说一个重要误区不显著不代表两个版本没有差异只代表现有数据不足以证明有差异。样本量不足、指标方差过大都可能导致假阴性。这类理解深度才是网易的阅卷人在简答题里真正想看到的。2.4 概率题常见失分点与复习建议复习概率统计这part我建议大家抓住三个层次第一层是概念定义比如期望、方差、独立性的定义要能用自己的话解释清楚第二层是计算能力常见分布的期望方差公式必须滚瓜烂熟第三层是应用场景看到题目能判断该用哪个工具。比较容易丢分的点包括期望计算时忽略随机变量的取值范围条件概率题没有识别出独立事件把“至少发生一次”和“恰好发生一次”搞混置信区间的解释写成了“有95%的概率包含真实值”这种错误表述正确表述应该是“构造100个区间大约95个能覆盖真实值”。复习资料方面市面上的考研概率论教材可以看但更重要的是找互联网公司真题来练。真题的难度和风格跟教材课后题差异很大教材偏重计算技巧真题偏重概念理解和场景应用。如果有时间建议把近三到五年的大厂笔试题中概率统计部分全部做一遍做错的题按知识点归类考前集中复盘一遍效果会比盲目刷大量偏题好很多。3. SQL实战题每个数据分析师都绕不开的现场编程3.1 SQL题的设计思路从“会写”到“写得对”网易笔试的SQL题不算难但非常典型考的都是数据岗日常工作最高频的能力多表关联、聚合统计、窗口函数。2018年这套卷子里的SQL题主要围绕用户登录日志表、订单表、商品表这三类业务表展开。比如有一道题要求统计每个用户连续登录的最长天数。这类题现在大家已经见怪不怪了但放在2018年很多应届生对窗口函数不熟还在用自连接一行一行去对效率低还容易错。这类题的标准解法是先用窗口函数row_number按用户分组、按日期排序给每条登录记录标一个序号然后用登录日期减去序号得到一个“锚点日期”如果用户是连续登录的这个锚点日期是相同的最后按用户和锚点日期分组统计组内记录数就是某一段连续登录的天数。这个思路的关键在于“日期减去序号”这个变换把连续性问题转化成了分组问题。我见过很多人看完题解觉得不难但真正到笔试现场还是会卡壳。原因在于没理解窗口函数的执行顺序不知道在where过滤之后、group by之前窗口函数是怎么起作用的。所以复习SQL时不要只看语法要理解查询的逻辑执行顺序。3.2 留存率计算一个SQL题打开一扇业务门2018年卷子里还有一道留存率相关的题目要求计算某新增用户群体在次日、7日、30日的留存率。这种题看起来简单实际写起来容易在“分母”上翻车。留存率的定义是某日新增用户中在指定时间后仍然活跃的用户占比。关键是分母是“某日新增用户数”不是“某日活跃用户数”。很多初学者会把分母写成某日活跃用户数算出来当然不对。这个错误在笔试中很常见因为出题人有时会把表结构写得比较绕比如有两张表一张是用户注册信息表一张是用户活跃日志表你需要先明确“新增用户”是从哪张表来的。写法上要注意日期计算的实现方式跟SQL引擎有关在MySQL里可以用DATE_SUB或DATEDIFF在Hive里可以用DATE_SUB或date_add。笔试环境一般不指定数据库所以建议用标准的DATE_SUB与DATE_ADD这类函数避免用特定数据库的语法。留存率这道题虽然代码不难但它背后是数据产品最核心的指标之一。建议备考时把留存率、活跃率、转化率、复购率这几个经典指标的口径都梳理一遍能快速说出每一步的定义和计算方式。3.3 窗口函数从会用语法到会用场景SQL题里窗口函数是高频考点网易卷子基本必考。常见的有row_number、rank、dense_rank的区别sum/count配合over做累计统计lag/lead做前后对比。大家最头疼的是row_number、rank、dense_rank三者的区别。这里我用一个简单例子说明成绩表里有三个99分的学生row_number会给这三个学生分别标1、2、3rank会并列为1、1、1下一个分数是4dense_rank会并列为1、1、1下一个分数是2。考试时如果没看清题目要求“获取每个部门薪资前三名的员工”用row_number会漏掉并列的情况应该用rank或dense_rank。还有一类比较进阶的考察求同比环比、计算移动平均、分组内TopN。这类题看起来花哨核心都在窗口函数的框架内只是需要在over子句里定义好partition by和order by。备考阶段建议把窗口函数的执行顺序搞清楚理解它是先做分组排序、再逐行计算这样即使遇到没见过的场景也能靠推理写出来。3.4 SQL提分技巧白纸写SQL的三种境界笔试环境通常没有真实数据库你只能在代码框里写SQL写完也无法验证。这个约束下我给大家几个实用技巧第一先写骨架再填细节。不管题目多复杂先写select、from、where、group by、order by这些主干再逐步填充join条件和聚合逻辑。这样即使最后有语法错误阅卷人也能看到你的思路。第二注意表别名的使用。多表join时每个字段前都加上表别名既能避免字段歧义也是加分项。第三养成写注释的习惯。笔试阅卷人尤其是面试官看到注释会认为你是一个有工程素养的候选人。即使笔试不额外加分后面面试复盘时也能展现你的思考过程。第四时间分配上SQL题不要恋战。如果一道题卡了十五分钟以上先跳到后面的业务题最后再回来补思路。SQL题写不完整不丢分大方向对也能拿部分分。4. 业务案例分析拉开差距的核心战场4.1 从“会取数”到“会提问”评审指标波动类问题网易2018年笔试卷的业务案例分析题非常有代表性。它的题干一般是这样某App最近7天DAU连续下跌让你分析原因并给出排查思路。这道题看似开放实际考察的是你面对一个模糊业务问题时有没有一套系统化的分析方法论。我看到很多应届生的答案是这样写的“可能是有竞品上线了”“可能是假期原因”“可能是服务器宕机了”。这种罗列式的回答暴露了两个问题一是没有优先级二是没有数据验证方案。比较专业的答法应该搭一个分析框架按“内部因素-外部因素”“人货场”或者“用户-产品-渠道-技术”做分层拆解。比如说DAU下跌可以先把DAU拆成新增用户和存量用户再分别看新增渠道的质量变化、存量用户的留存和流失情况再结合版本发布、活动下线、竞品动态做交叉验证。每一步都要说明看什么数据、用什么指标、怎么判断。我看到比较优秀的答案会在开头写一句“先确认数据口径是否发生变化”这一句话就能让阅卷人眼前一亮。因为工作里很多指标波动其实是口径调整或埋点问题导致的先排除技术因素再做业务归因是专业分析师的基本素养。4.2 评估活动效果没有对比就没有结论另一类案例题是关于活动效果评估的题干通常是一个电商平台搞了促销活动活动期间订单量上涨了30%让你评估这次活动是否成功。这类题最容易犯的错误是只看活动期间的绝对数据。真正专业的分析必须建立对照组可以是同一时间窗内未参与活动的用户也可以是活动前相同时间长度的数据做趋势外推。如果没有对照组可以用断点回归、双重差分等准实验方法来近似因果效应。另外还要考虑“透支效应”也就是活动吸引的用户可能本来就是近期要买的只是把购买时间提前了。要评估活动的真实增量需要看活动结束后一段时间的销量是否有明显的“塌陷期”。如果不考虑这一点活动期间的数据会高估活动效果。作答时还要注意区分核心指标和辅助指标。GMV、订单量是核心指标但只看这些不够还要看毛利率、新老客占比、退货率等辅助指标综合判断活动是否健康。这类多维度的答法体现的是业务理解深度。4.3 指标口径的坑定义不清晰分析全白做网易这类大厂非常看重候选人对指标口径的敏感度。业务题里经常会出现“人均消费金额”这种指标但题目没告诉你是“人均消费用户数”还是“人均活跃用户数”。这时候如果你不指出这个歧义直接开算就会被扣分。我在实际工作中遇到过类似的坑。一次分析某个频道的ARPU值开发给的口径是“频道收入除以频道UV”但运营的理解是“频道收入除以频道下单用户数”两个口径一个算出来是2元一个算出来是80元差了一个量级。如果分析时没有对齐口径后面的结论全是错的。笔试题里遇到这类情况建议直接在回答开头声明“本题存在口径歧义我先定义如下”然后选择一种口径展开分析最后再做敏感性说明。这样做既展示了你的细心也避免了一头扎进去算错方向。4.4 如何系统训练业务分析思维业务分析题是笔试中最难突击的部分因为它考的是积累和思维习惯。但也不是完全没有训练方法。我建议按三个步骤来做第一步建立分析框架库。把常见的业务问题分类比如指标波动归因、活动效果评估、用户分层运营、产品上线评估每个类别整理一套分析框架和常用指标做到考试时能快速调用。第二步练习“倒推式分析”。看到任何数据结论都问自己一句如果这个结论要落地到业务动作我需要什么样的数据支撑如果有异动我按什么顺序排查这种倒推训练能帮助你建立因果链条的敏感度。第三步多看优质的案例复盘。大厂技术社区里有很多AB实验复盘、活动分析方法论的文章多看多拆解学习他们是怎么定义问题、拆解指标、形成结论的。但要注意看和自己写是两回事看十篇不如自己完整写一遍分析提纲。5. 机器学习概念题广度与深度的平衡考验5.1 必考的偏误方差与过拟合处理2018年那套卷子机器学习部分考察得中规中矩但覆盖面比较广主要集中在偏误与方差、过拟合与欠拟合、常见模型的适用场景这几类问题上。偏误与方差那类题一般会给一个模型场景问你当前是偏高偏误还是偏高方差如何判断、如何优化。答案的关键是理解“用训练集和验证集的误差表现来定位问题”如果训练集误差就很高说明模型欠拟合是偏高偏误如果训练集误差低但验证集误差高说明过拟合是偏高方差。对于偏高方差常规处理手段包括增加训练数据、降低模型复杂度、加入正则化、做特征筛选等。对于偏高偏误则需要增加特征数量、提升模型复杂度、减少正则化强度。这些知识点不难但要把“为什么”说清楚比如为什么增加数据能缓解过拟合——因为更多数据能让模型学到更稳定的规律减少对训练集噪声的拟合。5.2 常见模型的对比与应用场景判断网易比较喜欢考察候选人对不同模型特性的理解比如给一个场景问应该选线性回归、逻辑回归、决策树还是SVM。这类题没有唯一标准答案但你要能说出每个模型在这个场景下的优缺点。比如预测用户是否会购买样本量几十万特征既有连续值也有类别值还要求模型可解释性。这时逻辑回归是稳妥选择因为训练快、可解释性强、对大规模稀疏特征支持良好。但如果要求高精度并且数据中存在复杂的非线性关系可以考虑梯度提升树模型。回答这类题时我建议按四个维度展开数据规模、特征类型、业务对可解释性的要求、训练和推理的时效性要求。把这四个维度过一遍你的答案会显得既有逻辑又接地气而不是在“背八股”。5.3 特征工程容易被忽视的得分点机器学习部分有时还会出一两道特征工程相关的问题比如给一堆原始数据字段让你说说可以做哪些特征变换。这道题很多非算法岗位的同学会直接放弃但其实是送分题。常见的特征工程思路包括数值型特征做归一化或标准化、类别型特征做one-hot编码或目标编码、时间特征拆成年月日时分和星期几、组合特征比如“是否周末×是否促销”。还有对缺失值的处理要区分是随机缺失还是业务缺失比如用户没有填写年龄可能是不愿意填而不是没看到。这类题放在数据分析师笔试里的逻辑是分析师虽然不一定亲自建模但需要为算法团队提供高质量的特征数据。如果连哪些特征可能有用、怎么构造都不知道日常合作的效率会很低。5.4 算法候选人复习策略别被名词吓住机器学习的复习不需要啃完整个西瓜书更不需要手推所有公式。核心是把高频概念吃透比如过拟合、交叉验证、评估指标准确率、召回率、F1、正则化、特征重要性等。建议大家按“what-why-when”三层去复习每个概念它是什么为什么需要它什么场景适合用它。这样不管题目怎么换壳子你都能围绕本质来答。另外一个实操建议是每复习完一个模型就尝试用一个具体的业务场景来描述它的工作机制。比如随机森林可以类比成“一群各有主见的专家投票决定最终结果”虽然单个专家可能看走眼但多数投票能降低错误率。这种类比能力在笔试简答题里也是加分项。6. 实战应试策略从时间分配到心态管理6.1 整套试卷的时间分配建议网易2018年校招笔试的题量大概在三十道左右加上简答和案例分析总时长一般是120到150分钟。我建议大家把时间按4:3:3的比例分配40%给SQL和概率题30%给业务分析题30%给机器学习概念和其他题。为什么要这么分配因为SQL和概率题是确定性得分点只要你复习到位基本可以拿满业务分析题弹性大写得好能拿高分但写太快容易漏要点机器学习概念题分值相对小不需要花过多时间纠结。拿到试卷后我习惯先花两分钟快速浏览所有题目在心里给题目分出“确定得分”“有思路”“纯陌生的”三档。先做确定得分的再做有思路的最后碰陌生的。这个顺序能保证你在一道难题上耗过头时还有足够时间把后面容易的分保住。6.2 简答题的答题模板让阅卷人快速看到你的框架简答题和案例分析题是网易这套卷子的主观题重头答题方式直接影响得分上限。我给大家一个万能框架结论先行、框架其次、细节收尾。拿到问题后不要立刻写细节。先写一句总括性结论比如“我的分析角度是‘拆用户-拆渠道-拆版本’三个维度”。然后再分点展开每一点先给判断、再给数据方案、最后给预计结论。这样做的好处是即使你某条分支写得不完整阅卷人也能一眼看出你的整体思路是清晰的。答题时还有一个技巧多写“我会去看什么指标”而不是“我觉得是什么原因”。比如不要写“是运营活动效果不好导致的DAU下降”而写“我会对比活动期间的CTR和转化率 vs 活动前一周判断活动效果是否不及预期”。前者是主观臆测后者是可执行的分析动作两者的含金量完全不同。6.3 考场上的几个“不要”第一个不要是不要在某一道题上追求完美。笔试毕竟有时间限制一道题写80分的答案并给其他题留出时间比一道题写100分但后面的题全空着要强得多。第二个不要是不要空着不做。哪怕是完全陌生的题也要写一点相关的思路。真实笔试环境中零分和部分分的差异可能直接决定你能不能进面试。第三个不要是不要忽视题目中给出的任何一张表或一个字段。出题人不会平白无故给你一张没用的表所有信息都是线索。如果你发现某个字段不知道该怎么用往往意味着你的解题思路是有遗漏的。第四个不要是不要在心理上被前面不顺利的题目影响。数据分析师笔试的题量设置几乎注定会让你遇到几道不确定的题这是筛选机制的一部分。你感到难别人也一样难稳住节奏按计划走完通常结果不会太差。6.4 考后复盘从笔试卷到面试题的转化笔试结束不代表学习结束真正拉开差距的是考后复盘。我建议每做完一套笔试卷都按下面三个问题重新审视一遍第一哪些题是我完全不会的这些题对应哪个知识点是我没复习到还是复习了但没掌握应用方法第二哪些题我用了很长时间才做出来这类题暴露的是熟练度问题需要在考前做针对性提速训练。第三有哪些简答题我可以答得更有结构感主观题的提升空间通常比客观题大重新组织一遍答案会比做新题更有效。尤其要注意的是笔试中的很多题会变成面试时的追问素材。比如笔试题里让你分析DAU下跌面试官可能会继续问“如果新增渠道的次日留存率下降明显你会怎么深入排查”这种追问比笔试题目更难因为你需要把静态的分析框架转化成动态的决策过程。平时多看“数据人面试”类的经验帖了解常见的追问方向也很有帮助。根据我个人带新人和校招辅导的经验能把一套笔试卷用上述方式彻底消化吸收的候选人数据分析基础通常不会差后面面试时的表现也普遍更稳。备考不只是为了过笔试而是借这个过程把分析师的思维方式真正内化这才是这套卷子最大的价值所在。
返回列表