十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

小红书2020校招数据分析笔试题卷四深度复盘与考点解析

小红书2020校招数据分析笔试题卷四深度复盘与考点解析 1. 写在前面这套笔试题究竟在考什么聊到小红书2020校招数据分析笔试不少准备校招的同学第一反应是去刷LeetCode、啃《统计学习方法》结果真正上了考场才发现题目风格和自己准备的完全不是一回事。小红书的数据分析岗笔试从来不是单纯考你会不会写代码、会不会背公式而是看你能否用数据思维去理解一个内容社区的业务逻辑。卷四这套题在当年几套卷子里算比较有代表性的SQL、Python、统计学、业务分析都有涉及而且业务场景非常贴近小红书的真实产品形态。这套题适合谁来看主要三类人正在准备互联网公司数据分析校招的应届生想转行做数据分析但缺乏实战场景的职场新人以及已经入行但想系统梳理自己知识体系的数据从业者。如果你属于其中任何一类这篇文章都值得你花点时间认真读完。我会从题目背后的考察逻辑切入把每个考点拆开揉碎再结合我自己的答题经验和踩坑经历给你一份可以真正落地的备考思路。先说一个很多人容易忽略的事实小红书2020年的校招笔试和当时市面上大部分互联网公司的数据分析笔试题相比有一个很明显的差异——它极度重视业务场景的理解。同样是考SQL别的公司可能给你一张订单表问你销售额top10的城市小红书的题目大概率会给你一套笔记互动数据问你在不同内容垂类下用户互动率的差异怎么分析。这种题目本身并不难但它考察的不只是技术而是你能否快速理解这个平台的内容生态。我当时做完卷四最大的感受是这套题其实是在模拟一个数据分析师入职后前三个月会遇到的工作内容。取数、清洗、描述性统计、假设检验、业务归因、给出建议整套流程走下来基本就是一个完整的数据分析项目闭环。所以与其说这是一场考试不如说是一次入职前的实战演练。你能不能在有限时间内走完这个闭环并且每一步都有理有据这才是出题人真正想看到的。2. 高频考点逐个拆解到底考了哪些硬技能2.1 SQL题别只会写select窗口函数是分水岭小红书笔试里的SQL题难度通常介于“入门”和“进阶”之间但卷四有几道题是明显拉差距的。基础题无非是单表查询、分组聚合、多表join这些但稍微往上走一点就会考到窗口函数。比如让你计算每个用户连续登录的天数或者统计每个垂类下笔记发布量的周环比变化这类题目不用窗口函数硬写代码会特别繁琐而且在笔试环境里很容易出错。我的建议是备考时至少熟练掌握ROW_NUMBER、RANK、DENSE_RANK、LAG、LEAD、SUM/AVG OVER这六个窗口函数。其中LAG和LEAD在计算环比、同比时特别好用这一点在小红书这种内容平台的分析场景里尤其常见因为运营经常需要看笔记发布量、用户活跃度在时间维度上的变化。另外连续问题的解法也要提前准备好经典的那个“用ROW_NUMBER减去日期序列判断连续性”的思路最好能做到默写出来的程度。还有一个容易被忽略的考点是数据质量处理。卷四里有一道题给了一张用户行为日志表里面有时间戳重复、用户ID为空、设备类型大小写不统一等各种脏数据要求你写SQL把它清洗成可用于分析的表。这类题看似简单但其实很考察你对实际问题边界的感知。很多人在刷题网站从没见过这种题一到笔试就懵了不知道该不该在SQL里做CASE WHEN也不知道重复值该保留哪一条。我的经验是拿到这种题先别急着写代码第一步永远是明确业务口径——这个用户ID为空是设备未登录导致的还是埋点丢失导致的不同原因对应的处理方式完全不同。2.2 Python题数据清洗与分析能力比算法更重要小红书校招数据分析笔试的Python部分几乎不会考LeetCode那种纯算法题。我印象里卷四涉及的Python内容主要是pandas、numpy的常规操作加上一点数据可视化的思路。比如给一份笔记数据里面有发布时间、点赞数、收藏数、评论数、浏览数这些字段要求你用Python完成数据加载、缺失值处理、异常值过滤然后计算不同内容垂类的平均互动率并找出互动率最高的Top10笔记。这种题目的难点不在代码本身而在于你对数据清洗的理解深度。比如异常值过滤你是简单粗暴地删掉点赞数大于浏览数的记录还是会进一步思考这种异常可能是数据回传延迟导致的应该结合时间窗口来判断再比如缺失值处理某些字段缺失率高达30%你是直接填充均值还是会先分析缺失模式是有偏的还是随机的这些决策才是出题人真正想考察的东西。我个人的习惯是在笔试里遇到数据处理题先在草稿纸上写清楚处理流程再动笔写代码。流程大概是看数据概况shape、dtypes、describe— 处理缺失值 — 处理重复值 — 过滤异常值 — 构造衍生字段 — 分组聚合 — 输出结论。每一步做了什么处理、为什么这么做都要在注释里写清楚。这样做有两个好处一是代码逻辑清晰不容易出bug二是如果题目要求你解释处理思路你也能条理分明地回答出来。Python部分还有一个常见的考察方向是AB实验相关的模拟分析比如用Python模拟一个实验组的点击率是否显著高于对照组。这类题会用到随机数生成、t检验或者卡方检验等统计方法。startsimple一点的做法是用scipy.stats里的ttest_ind或chi2_contingency但你得知道什么场景该用哪个方法参数该怎么传结果怎么解读。2.3 统计与概率假设检验和AB实验是重头戏小红书这种DAU过亿的内容平台几乎所有的产品迭代都要靠AB实验来验证效果。所以校招笔试里考假设检验和AB实验完全不是书本知识点的堆砌而是真实工作场景的直接映射。卷四的统计题里我记得有一道是关于实验组和对照组留存率差异是否显著的题目给了样本量和转化率让你计算z值并判断结论。这类题目的关键在于你得把假设检验的完整流程记清楚先写原假设和备择假设再确定显著性水平然后计算检验统计量最后根据p值或临界值下结论。很多人容易漏掉的是原假设必须是“没有差异”或“没有效果”而不是“有差异”这个方向搞反了后面全错。另外两组样本的方差是否相等也会影响你用哪种t检验Student t检验还是Welch t检验这个细节在笔试里经常被拿来挖坑。除了假设检验概率题也是小红书笔试的常客。比如给你一个用户的行为数据说某用户今天浏览了A类笔记问他明天浏览B类笔记的概率是多少。这类题表面上是条件概率实际上需要你结合贝叶斯公式去算。备考的时候建议把条件概率、全概率公式、贝叶斯公式、期望和方差这几个基础概念彻底吃透尤其要能理解它们的业务含义。这里多说一句笔试里的统计题有时候并不会直接告诉你“请用假设检验”而是把业务场景描述出来让你自己判断该用什么方法。比如题目说“我们上线了一个新功能想验证它是否真的提升了用户发布笔记的意愿请设计一个分析方案”这时候你的回答应该是完整的分析框架——明确指标、设定实验组对照组、确定样本量、选择检验方法、预估实验周期而不是直接套一个公式。2.4 业务分析题小红书特色场景是核心区分点卷四最有区分度的题目其实是业务分析题。这些题目会给你一个很具体的小红书业务问题让你从数据角度给出分析思路。比如笔记的收藏量很高但点赞量很低可能是什么原因用户在某垂类下停留时长增加但发布量下降你会怎么分析连续两次打开App的用户和只打开一次的用户在行为特征上有什么差异这类题没有标准答案但出题人心里有一套比较好的答题框架。我的经验是回答业务分析题要遵循“定义问题—提出假设—拆解指标—设计分析方案—给出落地建议”这个逻辑。不要一上来就急着给结论而是把问题拆成可以验证的子问题再逐个说明用什么数据、什么方法去验证。比如“收藏量高但点赞量低”这个现象你可以先假设几种可能笔记内容属于攻略类、教程类用户觉得有用先收藏但内容本身不足以激发点赞冲动或者推送机制导致流量集中在“泛收藏价值”的内容上用户在碎片时间刷到后收藏但不会深度互动再或者某些垂类比如装修、菜谱天然存在收藏率高、点赞率低的属性。然后你要说明用什么数据验证这些假设以及不同假设成立的情况下运营策略分别应该怎么调整。小红书特别爱考用户增长和留存相关的分析题这跟它作为社区产品的基本盘有关。比如给你一组新用户的激活漏斗数据注册—浏览—关注—发布让你分析哪一步流失最严重应该优先优化哪一步。这种题其实是在考你对漏斗分析方法的掌握程度以及你能否结合小红书的内容社区特性去思考问题。3. 典型题目实操复盘从读题到作答的完整推演3.1 留存分析题算出留存率只是开始解读才是重点卷四里有一道留存分析题大致场景是给出某月新增用户按日的回访数据要求计算次日留存率、7日留存率并分析新用户留存偏低的原因。这类题在笔试中非常经典但很多人只做到了“算出留存率”这一步后面的原因分析完全没有展开。如果是我来答会分三步走。第一步先把留存率算清楚注意分母是当日新增用户数分子是这些新增用户在第N天回访的人数时间窗口要对齐这是最容易出错的地方。第二步做分层分析——把新增用户按来源渠道拆分看是否某些渠道带来的用户留存率明显偏低再按用户首次访问的笔记垂类拆分看是否内容偏好影响了留存。第三步才是落地方案比如针对高流失渠道做流量质量控制针对高留存内容垂类做个性化推荐加权。这里我想强调一个笔试中的隐性加分点不做多余的事情。有些同学喜欢展示自己会的东西明明题目只要求计算次日和7日留存非要把30日留存也算了还画个留存曲线。多算本身没错但如果计算过程耗时太长导致后面的业务题没时间写那就得不偿失了。筆試的时间永远是最稀缺的资源把每道题控制在合理时间内比追求每道题都完美更重要。3.2 内容推荐题指标的拆解逻辑要能自圆其说小红书本质是一个内容推荐平台所以笔试题里出现推荐相关的分析题几乎是可以预见的。卷四有一道题我记得很清楚大意是平台想要提升用户在信息流中的点击率给了你一篇笔记从曝光到点击的漏斗数据让你分析影响点击率的关键因素并提出优化方向。这种题的答题要点在于先把点击率拆解为可解释的成分。点击率低可能是内容封面吸引力不够可能是标题不够抓眼球可能是配图质量差也可能是推荐匹配精度低导致流量分发给了不感兴趣的人群。每一个可能的原因背后都需要一个对应的数据验证方式。我当时答题时给了一个“分层归因”的思路先看全局点击率是否在特定垂类、特定时段、特定用户群中差异显著锁定异常层再对异常层做内容特征分析比如点击率低的笔记是否集中在某些封面类型或标题句式上最后看推荐系统侧是否存在某些位置、某些流量类型的点击率被稀释。这样做的好处是你把一个模糊的“点击率低”的问题逐步变成了可操作的结论每一步都有数据支撑。这道题还有一个隐含的考察点你是否理解小红书的内容特点。其他平台可能更关注标题、封面这些基础因素但小红书的内容形式是“封面标题正文摘要”的组合有时候用户的点击动机不是内容本身而是“这个封面看起来和我的生活场景有关”。所以在分析点击率时用户与内容的匹配度比内容自身的质量更值得关注。3.3 商业化场景题数据指标要服务于商业目标小红书2020年正处于商业化加速的阶段所以卷四也有一道和商业变现相关的题目我记得大概是问品牌合作笔记的曝光量很高但导流到电商页面的转化率很低应该从哪些维度去分析这个问题。这类题的考察目标非常明确你是否具备用数据驱动商业决策的思维。我的分析框架是这样先明确这条链路的关键节点——曝光—点击—阅读—跳转电商—下单每一层都有对应的转化率。然后沿着链路逐层下钻锁定转化率断崖式下跌的环节。比如曝光到点击的转化率正常点击到阅读的转化率正常但阅读到跳转电商的转化率极低那问题大概率出在正文内容与商品关联度不够或者引导文案和跳转路径设置得不合理。接下来还要考虑外部分类和用户分层。不同类型的品牌笔记美妆、穿搭、家居本身的电商转化率基线就不同不同用户群新用户vs老用户、强购买意愿vs弱购买意愿对广告的接受度也不同。所以单看整体数据没有意义必须做维度下钻。答题时如果能补充一个关键的经验值会显得你的方案更落地——内容社区的商业化链路用户的耐心极短从阅读正文到跳转电商中间每多一步操作转化率都可能衰减一半以上。所以优化方向往往是减少跳转步骤、增加商品卡片嵌入、强化正文中的行动号召而不是单纯加大曝光量。4. 笔试实战技巧直接影响分数的隐藏细节4.1 时间分配不要在一道SQL题上死磕小红书笔试的总时长通常在90到120分钟之间题量不算少。以我的经验来估算卷四的整体题量大概在15到20道之间包括选择题、SQL编程题、Python编程题和业务分析题。我见过太多人在一道窗口函数题上卡了20分钟导致后面两道业务大题只能匆匆写两句。这是最典型的丢分方式。我建议的时间分配策略是选择题和填空题控制在15到20分钟内完成因为这些题要么会要么不会犹豫没有意义。SQL题每道控制在10到15分钟如果超过20分钟还没有明确思路先跳过最后有时间再回头。Python题类似。业务分析题虽然分值高但每题也不要超过15分钟回答时按照“结论先行、论据分层、建议落地”的结构快速输出。我自己做题有个习惯拿到试卷先把所有题快速浏览一遍在心里给每道题标一个难度等级优先做“会做的”和“分值高的”。这样能保证基础分全拿不至于因为一道难题耽误了后面一堆送分题。4.2 答题排版结构清晰比文采重要笔试里的业务分析题很多时候是简答题的形式需要你写出分析思路。这时候最忌讳的是写成一篇流水账想到哪写到哪。阅卷人一天要判几十份卷子你写的内容如果不结构化对方根本没耐心帮你提炼重点。我的建议是所有业务分析题的答案都按这个格式组织先写一句“核心结论”再分条目列出分析步骤最后给出建议。如果中途需要补充说明可以用括号加注。举个例子如果题目问“次日留存率下降了5个百分点你怎么排查”我会答核心结论是需优先排查版本更新和渠道投放变化第一步查看版本分布确认是否新版本存在体验问题第二步查看渠道构成变化是否新增了非精准渠道流量或遭遇了投放策略调整第三步对比不同用户群的留存表现定位是集中在某个群体还是全局性下降第四步结合竞品动态和社区热点判断是否存在外部因素影响建议先回滚版本或暂停低质量渠道投放同时建立留存监控看板对关键指标设置异常告警。这种结构一眼看去就知道你有清晰的思路就算分析得不够全面也比没有条理的答案拿分高。4.3 环境准备提前熟悉线上答题平台2020年的笔试基本都在线上进行现在更是如此。很多人忽略了一个看似不起眼但很致命的问题不熟悉答题平台的环境。有些平台自带的代码编辑器没有自动补全有些平台的缩进是用空格而不是Tab有些平台运行Python代码时默认版本是2.7这些细节都可能导致你在调试代码上浪费大量时间。我建议在笔试前先查清楚这家公司用的是哪个在线笔试系统如果找不到往年真题来练就找几个相似的平台体验一下。至少做到知道代码怎么提交、控制台在哪里看报错、能不能本地运行、有没有样例测试。这些看起来都是小事但在紧张的笔试环境下每减少一个不确定因素都是在给自己争取宝贵的答题时间。5. 笔试之后的复盘与面试衔接5.1 错题归因比分数更重要的是暴露出的能力缺口笔试结束后不管考得好不好我建议都花半小时做一个错题归因。把每道做错的题归类到具体的能力项——SQL语法不熟、窗口函数不会用、假设检验流程不清楚、业务分析没思路、时间不够用、平台操作不熟练然后针对高频薄弱项做专项补强。我见过太多同学笔试结束后就彻底松一口气等收到面试通知才慌张准备。其实笔试中暴露出来的问题大概率会在面试里被再次问到。比如你笔试里留存率计算错了面试官很可能就会追问“如果让你重新算一遍你会怎么算”。如果你笔试后做了复盘这时候就能很自然地回答出来如果没做就只能在面试现场现想效果天差地别。5.2 从笔试到面试的能力迁移最后说说笔试和面试的关系。小红书的面试风格尤其是在数据分析岗上非常偏好“场景题”——面试官会拿一个实际业务问题让你现场讲分析思路。你会发现这些场景题和笔试里的业务分析题几乎是同源的只是换了一种提问方式。所以备考笔试时形成的分析框架千万不要考完就丢掉。比如你总结的“定义问题—提出假设—拆解指标—设计分析方案—给出落地建议”这套方法论面试时同样能用。你笔试里刷过的SQL场景题面试时也可能会变成“现场写一段SQL处理某个具体取数需求”。能把这套能力迁移到面试场景里你拿Offer的概率自然会大很多。6. 一些实战心得这些坑希望你不用再踩文章最后分享几个我在准备和参加这类笔试过程中积累的真实经验不一定都是技术问题但都很实际。第一个坑是不重视选择题。很多人觉得选择题分值小随便蒙蒙就行。但小红书的笔试是标准分制整体通过率就卡在那里选择题往往是最容易拿分也最容易丢分的部分。尤其是统计概率相关的选择题概念清楚的人一眼就能选对概念模糊的人再怎么猜也大概率是错的。所以备考时不要只刷SQL和Python统计基础概念也要过一遍。第二个坑是写SQL时不考虑数据量。有的同学写SQL只追求逻辑正确完全不留意题目里给了一个千万级的大表。比如在where条件里对字段做函数运算导致索引失效这种写法在笔试环境里可能不会报错但在真实场景中就是慢查询的根源。虽然笔试判题大概率只看结果但如果你在注释里写了“考虑到数据量较大此处先过滤再关联”这种对性能的敏感性反而会成为加分项。第三个坑是业务分析题回答得太虚。比如题目问“怎么提升用户的发布意愿”有的同学写满一屏“加强内容引导”“优化推荐策略”“完善激励机制”每一句都是正确的废话。高分的答案一定会落到具体的指标和动作上比如“把新用户首月发布率从15%提升到20%具体动作是通过新手任务引导用户在48小时内完成首次发布并观察首月发布用户与次月留存的相关性”。有数字、有动作、有可检验的指标才是一份合格的分析答案。第四个坑也是我自己亲身体会最深的一点不要因为某一道题卡住了就心态崩掉。小红书2020年的笔试题量不低中间遇到不会做的题太正常了。我当年考的时候有一道概率题完全没思路直接跳过后来发现后面那道业务分析题才是整张卷子的压轴分值是那道概率题的3倍。如果我在前面那道题上死磕心态一旦崩了后面的题大概率也写不好。校招笔试是一场取舍游戏学会放弃某些分数是为了把其他更重要的分数稳稳握在手里。备考数据分析岗刷题是必要的但比刷题更重要的是理解每道题背后的业务逻辑和思维方式。小红书2020校招数据分析笔试题卷四本质上就是一场模拟真实工作场景的实战演练。把这道演练吃透你收获的不仅仅是一张试卷的解题能力更是一整套面对陌生问题时如何用数据去拆解、分析、落地的思维框架。这套框架才是数据分析师这份工作真正值钱的地方。
返回列表