拓冰建站拓冰建站
首页 / 资讯中心 / 正文

网易数据分析实习生笔试题解析:SQL、统计与业务思维

拿到这份网易2018年数据分析实习生笔试题的时候我第一反应是“题型怎么这么杂”SQL、概率统计、业务分析、开放问答甚至还有一部分性格测试。但仔细做完两遍再回头看这套题其实很有代表性——它不要求你把某个算法推到顶配也不考验你懂不懂最新的大模型应用它考的是数据分析师最底层的几件事会不会取数、懂不懂统计、能不能用数据讲清楚业务问题。这篇文章不打算给你“标准答案”式的内容因为网易没有公布过官方评分标准网上的回忆版题目也各有差异。我更想把这套题当成一个典型样本拆开讲讲背后考核的到底是什么以及我后来在带新人和准备校招时反复验证过的一套备考方法。不管你是正在找数据分析实习的学生还是想转行进这个行业的人这套分析思路都值得花二十分钟读完。1. 这套题到底在考什么从笔试题目反推网易的用人标准1.1 网易数据分析实习生的岗位画像当年网易的业务线覆盖很广游戏、云音乐、严选、考拉、传媒、有道每条业务线都有数据团队而数据分析实习生进去之后要承担的工作通常是日常报表、指标监控、临时取数、活动效果复盘做得好一点的会参与实验设计和业务专项分析。这个岗位的共同点在于你面对的不是算法题而是真实的商业场景和业务方的提问。所以笔试在设计时不会只考你会不会调包它需要确认三件事。第一你的数据基本功是否扎实也就是SQL能不能写出不报错的查询Excel或Python能不能做基本处理。第二你的统计和概率直觉是否过关因为A/B测试、留存分析、漏斗转化底层全是概率和分布。第三你看到一个业务指标波动时能否给出有理有据的拆解而不是拍脑袋说“可能是天气原因”或“可能是运营活动”。说白了网易想要的是一个“还没被雕琢但已经具备业务数据思维雏形”的人。技术可以进去再练思维懒惰才是实习面试官最怕的。1.2 题型分布与考核重点拆解根据历届面试者回忆汇总网易2018年数据分析实习生笔试卷子大致可以分成四块SQL与数据操作、概率统计、业务场景分析、开放与行为问题。不同回忆版略有出入但核心模块基本稳定。模块常见题型参考占比考察能力SQL与数据操作多表关联、分组统计、窗口函数、去重计算25%-30%数据提取与处理基本功概率统计条件概率、贝叶斯公式、期望、分布、显著性判断20%-25%统计直觉与数学基础业务场景分析指标异动归因、A/B测试设计、留存分析、活动评估30%-35%商业理解与结构化思维开放与行为个人经历、职业规划、产品数据评价10%-15%表达、自驱力、岗位匹配度这套占比本身就说明了一个道理单纯会写SQL还不够单纯懂统计也不够数据分析实习生的核心价值在于“连接”——把技术能力连接到业务问题上。业务题占比最高就是网易在筛选那些愿意站在业务视角思考的人。1.3 这套题背后的招聘逻辑现在依然适用2018年到现在数据分析岗位的招聘要求变了很多很多新兴工具层出不穷大模型也在改变取数和分析的方式。但笔试的底层逻辑没有变反而被强化了招聘方越来越不喜欢只会执行的人而是希望你能给出“所以呢”和“下一步怎么做”。网易这套题最值得玩味的是它没有出“手写一个机器学习算法”这种硬核题目而是用业务场景题来筛选候选人。这说明在当时的数据团队负责人眼里一个实习生最重要的不是建模能力而是拿到数据之后能不能提出好问题、能不能用数字讲清楚现状、能不能给出一个业务方可执行的建议。这个判断标准放到今天的产品数据分析、商业分析、运营分析岗位同样成立。2. 核心题型精讲把典型题目拆开揉碎2.1 SQL题分组统计与窗口函数的正确打开方式笔试里的SQL题往往不会直接给你现成的表结构而是用一段文字描述场景让你自己建模。比如有一道高频回忆版题目是这样的给定用户登录日志表 login_log(user_id, login_date)统计2018年1月每个自然周的活跃用户数以及每个用户当月的首次登录日期。这类题很多人第一反应是直接GROUP BY但容易忽略两个关键点。第一统计“每自然周”时如果数据库是MySQL通常用 WEEK(login_date) 或 DATE_FORMAT(login_date, %x-%v)两个函数在跨年边界上的处理不同一旦数据跨年就会踩坑。第二“首次登录日期”不能用GROUP BY MIN()以外的方法确实可以用窗口函数 ROW_NUMBER() OVER(PARTITION BY user_id ORDER BY login_date)这也是我更推荐的写法因为可读性强后面要扩展出“每个用户第2次登录日期”时不用重写整个查询。-- 统计2018年1月每自然周活跃用户数 SELECT DATE_FORMAT(login_date, %x-%v) AS week_num, COUNT(DISTINCT user_id) AS active_users FROM login_log WHERE login_date 2018-01-01 AND login_date 2018-02-01 GROUP BY DATE_FORMAT(login_date, %x-%v) ORDER BY week_num; -- 统计每个用户当月首次登录日期 SELECT user_id, login_date FROM ( SELECT user_id, login_date, ROW_NUMBER() OVER(PARTITION BY user_id ORDER BY login_date) AS rn FROM login_log WHERE login_date 2018-01-01 AND login_date 2018-02-01 ) t WHERE rn 1;关于COUNT(DISTINCT user_id)这里特别提醒一下很多面试者会在GROUP BY时图省事写成 COUNT(user_id)但这样会把同一用户在同一天重复登录算成多个人导致活跃用户数虚高。实际业务里企业都是按“UV去重用户数”来定义活跃不是按“PV登录次数”所以去重是必须的。反过来如果题目问的是“总登录次数”那就应该用COUNT(*)这就要看你会不会审题了。2.2 概率统计题贝叶斯公式不是背出来的网易那道经典概率题网上流传版本各不相同但基本都围绕“条件概率与贝叶斯”出题。我印象最深的一道是某游戏用户中付费用户占比20%付费用户次日留存率60%非付费用户次日留存率30%。现在随机抽一个次日留存用户问他是付费用户的概率。这类题如果去套公式很多人会把P(付费)0.2、P(留存|付费)0.6、P(留存|非付费)0.3 代入贝叶斯。但真正容易出错的是分式计算分子是 0.2 × 0.6 0.12分母是 0.2 × 0.6 0.8 × 0.3 0.12 0.24 0.36最后答案是 1/3。这个计算本身不难难的是你要理解“被留存用户”这个条件本质上是把全体用户重新划分成“留存人群”在这个人群里付费用户的比例被稀释了。我的建议是笔试遇到概率题不要一上来就默写公式先用表格把已知条件列出来。用户类型占全体用户比例次日留存率付费用户20%60%非付费用户80%30%然后构造一棵“概率树”先区分付费与否再区分留存与否最后只看留存这条分支付费用户的权重是0.12非付费用户的权重是0.24。这样不用背公式也能做出来而且不容易算错。这种表格化、树形化的思考方式在实际做用户分层分析时也一样适用。统计部分还会考到期望值和简单假设检验比如“如果AB实验的两组样本量分别是10000对照组转化率5%实验组转化率5.5%这个提升是否显著”。这题不需要手算卡方但你要能说清楚用两个独立比例的Z检验或者卡方检验判断p值是否小于0.05。实习生能答到这里并且说出“样本量足够大时差异可能显著但不代表业务上一定值得全量上线”就已经超出平均水平了。2.3 业务分析题从指标异动推导可落地结论业务场景题是网易这套笔试里最容易拉开差距的部分也是我后来在面试别人时最看重的能力。常见的出题方式是某App近一周DAU下降了5%请分析原因某电商活动GMV未达预期请给出排查思路音乐App的歌曲收藏量突然上涨判断是否异常。这些题没有唯一答案但高分回答基本都长一个样先拆解再假设最后给出验证方法。拿“DAU下降5%”来举例。新手会直接说“可能是竞品上线了新功能”“最近天气变好了大家都出去玩”这类答案看似有理但既无法验证也不结构化。老手会先把DAU拆成新增用户、留存用户、回流用户三部分DAU 日新增 昨日留存 历史用户回流然后逐层去看是哪个部分出了问题再按维度拆渠道、版本、机型、地区、新老用户。如果再往下走可以结合时间点去匹配版本发布时间、运营活动、市场投放变化。回答这类题时我会建议用一个公式开头“我会把它拆成几个相互独立的部分来定位第一看新增第二看留存第三看回流。”这句话一出来面试官就意识到你有结构化思维而不是在碰运气。然后再补充具体的排查动作比如“先看分渠道数据确认是不是某个买量渠道的量下滑再看版本分布确认是不是新版本崩溃率上升导致使用时长下降”。这种有假设、有验证思路的回答才是业务分析题想看到的。另一个高频考点是AB实验。网易很多产品线都在做实验笔试里让你设计一个实验或者判断实验结论并不奇怪。核心得分点包括明确实验组和对照组、控制其他变量不变、样本量要足够、实验周期要覆盖完整业务周期、看指标是否显著且有无副作用。能把“显著性”和“业务效果”分开讲就已经超越很多候选人了。2.4 开放与行为题别在最后环节丢掉印象分卷子最后通常有几道开放题比如“你最近分析过的一个产品是什么用了什么数据得出什么结论”“为什么想做数据分析”很多人会觉得这类题目是走流程随便写几句就交卷这其实是白白丢分。开放题真正考察的是你对数据分析的兴趣是不是真实且持续的以及你能不能把自己的经历讲成一个有逻辑的故事。推荐用STAR原则组织回答背景、任务、行动、结果。比如你说自己分析过网易云音乐的歌单推荐那就不要只说“我觉得推荐不准”而是说“我发现每日推荐歌单的点击率最近两周下降了10%我拉取了曝光、点击、收藏数据对比了不同歌单类型发现是发现页改版导致入口位置变化后来建议把推荐位往上移点击率回升了3个百分点”。哪怕这是课堂作业也有说服力。行为题里还有一个隐藏考点价值观匹配度。数据分析师需要顶住业务方压力、坚持数据结论所以如果题里问“如果你发现运营同事的活动数据造假或者你的分析结论和领导的预期相反你会怎么做”回答时一定要体现“以数据为准同时用对方能接受的方式沟通”的态度。千万不要为了迎合谁而说“领导说怎么样就怎么样”这对数据分析师来说是致命弱点。3. 备考与实操从零准备一套完整的笔试应对方案3.1 知识体系清单该复习什么、复习到什么程度很多同学备考时喜欢刷题但以我的经验先把知识体系捋一遍后面刷题效率才高。下面这张清单是我带过的人里面效果最好的复习框架按优先级排列。优先级知识点要求掌握的程度高SQL基本查询、聚合、多表关联、去重能够不看文档写出正确查询高条件概率、贝叶斯、期望、常见分布能用概率树解释题目不硬背公式高业务指标DAU、留存率、转化率、GMV、ARPU能解释口径并能拆解变化中AB测试的基本流程与显著性判断能设计一个简单实验并说明注意点中Python/Excel数据处理pandas、numpy基本操作或Excel透视表熟练中机器学习基础概念了解决策树、逻辑回归适用场景即可低算法与数据结构了解基本复杂度即可笔试很少涉及请注意这个清单和高校统计课的大纲不太一样它完全是按“数据分析实习生笔试实际考什么”来列的。概率统计不需要会推导大数定律但要会用机器学习不需要会手推梯度下降但要理解模型在业务里的角色。3.2 四周复习计划把时间花在刀刃上如果离笔试还有一个月我建议按四周来分配第一周主攻SQL和Python数据处理第二周主攻概率统计第三周主攻业务分析和真题练习第四周做模拟考和查漏补缺。第一周的目标只有一个SQL写顺手。不要只看书每一道练习题都要真的敲到编辑器里跑一遍。推荐去力扣的数据库题库或者SQLZoo上刷题从简单到中等每天至少5道。同时练熟pandas的筛选、分组、合并、透视表Excel的VLOOKUP和数据透视表最好也会因为有些公司的笔试平台是让你用Excel处理数据的。第二周把概率统计的框架搭起来推荐看《概率论与数理统计》教材前六章和《面向数据科学家的统计思维》一类的基础书重点理解条件概率、贝叶斯、常见分布、中心极限定理、假设检验。不要花太长时间去抠大数定律的证明你需要的是用例题来体会“什么时候该用什么分布”。第三周专门练业务题。很多人栽在这一块因为学校里不教。方法是从牛客网、知乎、公众号里收集笔试回忆题每道题先自己写一遍再对照别人的思路改。多准备一些框架比如指标拆解公式、漏斗分析、留存矩阵拿到题先套框架再往里填细节。第四周进入实战状态。找连续的两小时关闭手机完整做2-3套模拟卷题目可以从历年各大厂笔试题里拼凑。之后认真复盘错题把每道题的知识点写下来形成一份自己的薄弱清单。3.3 考场时间分配与答题策略数据分析实习生的笔试题量一般不算小加上开放题时间往往紧张。我的建议是把时间按“40%给SQL25%给概率统计25%给业务10%给开放题”来分配。前两类题有确定性答案拿分稳定业务题虽然分值高但写多了容易失控所以先保证前面拿满再回头完善业务题。答题时一定要先读两遍题。很多失分不是因为不会而是没看清条件比如题目要求统计“连续3天登录的用户”你却只做了“累计登录3天”这两者的计算逻辑完全不同。业务题里如果条件不完整干脆先写出你的假设比如“假设这里的GMV指成交金额且不含退款”这样即使中间有偏差面试官也能看到你有思考过程。还有一个很容易被忽视的点笔试平台如果支持本地运行写在代码块里的SQL和Python一定要保证语法正确因为网上笔试系统通常会跑测试用例你以为自己思路对结果连语法都跑不通等于白做。3.4 工具与资源推荐工具方面SQL练习用SQLZoo和力扣数据库题库Python用Jupyter Notebook跑pandas可视化练习可以用Streamlit或者DBeaver的图表功能快速看数据分布。统计概念看3Blue1Brown的视频配合教材理解会更直观。书籍方面入门阶段推荐《利用Python进行数据分析》这本书被很多人当成工具手册但我建议从头到尾读一遍因为它的数据清洗思路非常贴近实际业务。业务分析思维的培养看《精益数据分析》和《增长黑客》里面大量的指标框架和增长实验案例可以直接用在笔试题里答题。数据库基础薄弱的可以翻翻《SQL必知必会》快速、轻量。学习平台不用贪多选一个能刷题、一个能看视频、一本纸质书就够了。我见过太多人收藏了一堆课程链接最后真正看完的没几集。备考数据分析笔试动手写永远比看视频重要一百倍。4. 常见错误与避坑指南这些坑我当年都踩过4.1 审题不清条件看漏导致全盘皆输我当年笔试时就栽过一次。题目要求统计“2018年1月中每个用户连续登录的最大天数”我上来就写了个COUNT(DISTINCT login_date)结果统计的是这个月登录了多少天完全答非所问。连续登录问题的正确做法是给每个用户的登录日期按时间排序后减去行号差值相同的日期就是连续区间然后再统计每个区间的长度。审题不清的根本原因是太急。笔试时间紧张看到熟悉的字眼就容易联想到刷过的题然后按惯性写。对策是每一道题读完题干之后先在草稿纸上写出三个要素输入是什么、输出是什么、特殊条件是什么。不要超过30秒但能救回很多分。4.2 只写最终结果不展示推导过程笔试判卷和面试官看简历一样都是在很短时间内判断你行不行。如果你只写个答案即使答案对了也很难让面试官信任你的能力。尤其是概率题和业务题推导过程比结果更值钱。我建议每道计算题都按“已知条件、公式、代入、结论”四步来写哪怕只是写到草稿上最后再誊一遍。业务题一定要把分析步骤写清楚先拆指标再列假设再说明验证方法。这既方便面试官了解你的思路也方便你写完回头检查自己有没有遗漏。4.3 业务题答成技术题或报告题业务分析题最大的雷区是堆砌技术名词。“我用Python爬取了一堆数据然后随机森林建模”这种答案听起来很热闹但面试官根本不知道你要解决什么业务问题。反过来有些同学走了另一个极端写得像新闻通稿“我们要以用户为中心提升用户体验”从头到尾没有一个数字这也是零分。好的业务分析答案应该具有“可执行性”。分析完一个指标之后给出一两个具体的建议例如“建议将新手引导的第三步从5步缩短到3步并做AB测试验证对次日留存的影响”。这样的回答让人觉得你是真的在帮业务方解决问题而不是来展示技能的。4.4 统计口径不一致同一个指标定义完全不同我在真实工作中遇到过很多次统计口径的问题笔试里同样会出现。比如“GMV”是否含未支付订单“活跃用户”是按设备ID去重还是按用户ID去重“新增用户”是首次启动算还是完成注册算如果题目没写你就要先写明假设。这道题考的不是你会不会算数而是你有没有“数据治理”的意识。同一份数据口径不同结论可以完全相反。在答题时我习惯在最后加一句“以上计算基于XX口径若口径变化需同步调整结论”这个细节往往能让面试官眼前一亮。4.5 心态崩盘一题卡住就放弃全局笔试过程中难免遇到完全没思路的题千万别在一道题上耗太久。数据分析师的日常工作里你也不可能每个问题都马上有答案学会合理分配精力和识别优先问题是职业素养的一部分。我的建议是遇到卡壳超过10分钟的题先在草稿上简单写下思路和已经能确定的部分然后跳过等全部做完再回头补。最后想分享一个真实的体会。我后来参与校招面试时发现笔试分数高的候选人不一定是刷题最多的但一定是在答题时“把面试官当同事”的人写SQL时考虑数据可读性做业务题时想着业务方怎么落地写开放题时坦诚表达自己对数据分析的兴趣。这种把数据当成解决实际问题工具的态度比任何模板和套路都更能打动面试官。如果你正在准备这类笔试别只盯着“网易2018”这个标签把它当成一次能力体检看看自己在取数、统计、业务理解三条线上哪条最薄弱。笔试只是入行的第一道门后面的面试会更深入地考察你与数据的默契。这份能力值得在每一次实战中慢慢磨出来。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门