新闻详情

新闻详情

首页 / 资讯中心 / 详情

知乎数据分析岗笔试攻略:内容社区业务题与SQL考点全解析

发布时间:2026/9/1 21:49:59来源:尧图网络
知乎数据分析岗笔试攻略:内容社区业务题与SQL考点全解析
2023年秋招那阵子我在各种求职群里看到不少人吐槽知乎数据分析岗笔试说题量又大又怪。我自己也投了简历笔试链接发下来那一刻说实话心里有点发怵。按往年经验知乎这个岗位的笔试淘汰率相当高尤其是业务分析题很多科班出身的同学也会栽跟头。真打开试卷后我发现这场笔试不是单纯考SQL或统计学而是把所有题目都架设在内容社区的业务场景里从内容发布、用户互动到商业变现几乎每一道题都在问“你会不会用数据回答一个业务问题”。如果你是准备秋招数据分析岗的或者正在刷数据分析面试题想转行进互联网这篇文章应该能帮你搞清楚知乎这类内容平台笔试的底层逻辑和答题套路。我更想强调的是数据分析笔试已经过了“背题就能过”的阶段。哪怕你把python数据分析库的函数倒背如流把常见的商业数据分析案例看了一百个不掌握一套拆解业务问题的框架照样会在开放性案例题上丢大分。这篇文章我会结合自己的实战经历把知乎2023年秋招数据分析岗笔试的整体结构、高频考点、解题思路、时间分配以及考后复盘全部拆开讲全程干货没有废话。1. 知乎笔试的整体设计思路与岗位考察矩阵1.1 先搞清楚知乎要的是什么样的人知乎数据分析岗的JD里通常会写着“负责业务核心指标体系建设、AB实验设计与分析、专题数据洞察、数据产品支持”。这句话翻译成人话就是这个岗位不是让你坐在那儿写报表的而是希望你能通过数据帮助产品经理和运营团队做决策。所以笔试设计必然围绕三个维度展开能不能理解业务、能不能拿到数据、能不能用数据讲清楚一个结论。我拿到的这场笔试一共分三个部分客观题、SQL编程题、主观案例分析题。客观题以单选和多选为主覆盖统计学基础、概率论、机器学习入门概念和业务指标常识SQL题是限时在线完成场景包括内容推荐、用户留存、互动漏斗主观题则是给一段业务背景描述要求写出完整分析思路甚至伪代码。整体时长120分钟题量比想象中多很多人反馈做不完所以时间策略极其重要。提示知乎笔试用的系统是牛客网网页内直接写SQL没有本地IDE且会监测切屏。平时习惯在本地写SQL的同学务必提前去牛客网的在线练习环境适应一下。1.2 内容社区数据分析岗与其他行业的差异同样是数据分析笔试不同行业考察点差异很大。金融风控岗爱问逻辑回归、坏账率、KS值电商平台爱考GMV拆解、转化漏斗、复购率而知乎这种内容社区核心是内容生态和用户时长。考题里高频出现的指标包括DAU/MAU、人均浏览时长、内容发布量、互动率、答主留存、盐选会员消费时长、广告收入、知推广ROI。如果你只刷通用的数据分析面试题没有站在内容社区的业务逻辑里去理解这些指标看到“人均内容消费时长下降了5%如何定位原因”这种题一定会懵。说白了知乎想要的是懂内容生态的数据分析师而不是一个只会跑数的工具人。考察维度具体内容出题占比个人体感业务Sense与指标拆解核心指标波动归因、指标体系搭建35%SQL与取数能力多表关联、窗口函数、漏斗计算25%统计学与AB实验假设检验、实验设计、显著性判断20%Python与数据洞察pandas操作、简单可视化思路10%机器学习基础常见模型概念、适用场景10%2. 核心考点拆解知乎最看重的四层能力2.1 业务Sense与指标体系建设业务题是知乎笔试里最拉分的地方也是我认为最值得准备的部分。常见出题方式是给一个业务背景然后问“你会如何评估某个功能的上线效果”或者“某个核心指标下降了你会从哪些维度排查原因”。这类题目想拿到高分关键不在于堆砌指标而在于展现你的指标体系思维。比如问到“内容发布量下降”初级答案会说“看日活用户数和发布转化率”但高分答案会先定义一个完整框架先拆用户路径——从内容消费、互动、创作意愿、发布操作再到发布成功定位是哪个环节出了问题再拆用户分层——是新用户发布减少还是老答主流失是某个内容品类下降还是全品类下降最后再关联外部因素比如节假日、竞品变化、产品版本更新。我记得笔试里有一道题是“如果知乎回答的点赞率整体下降了你怎么分析”。我的答题框架是先确认数据口径排除数据采集误差然后从内容供给端看回答质量分布是否变化从用户端看点赞用户的结构是否有变化从互动场景看是否推荐策略变化导致触达人群变了。这种结构化拆解的方法其实可以套用到绝大多数归因题里。2.2 SQL与数据提取能力SQL题几乎是所有数据分析岗笔试的必考项知乎也不例外。它的SQL题不会给你那种十几行的大表而是模拟真实的社区业务表结构比如用户表、回答表、点赞行为表、关注关系表。题目要求通常是“统计某个时间窗口内的XX指标”考察点集中在JOIN、GROUP BY、窗口函数、去重逻辑。我遇到的几道典型SQL题包括统计近30天每日新增用户数、统计每个问题下的回答数并筛选超过10个回答的问题、计算某时间段的回答点赞率并排名。初看都不难但坑不少比如“新增用户”到底是按用户注册时间算还是按首次活跃时间算需要用窗口函数去重再比如点赞率的分子分母口径是点踩行为算不算“互动”这些细节都会影响结果。备考建议是重点练习Hive SQL和Spark SQL场景因为知乎这种量级的社区笔试里出现的SQL虽然是在小数据集上跑通但考察思路明显偏向离线数仓分析。窗口函数的典型场景比如ROW_NUMBER()做去重、LAG()看时间间隔、SUM() OVER()算累计值必须练到条件反射。2.3 统计学与AB实验统计学是知乎笔试客观题的主力也是很多非科班同学的短板。考得最多的是假设检验、P值含义、置信区间、中心极限定理以及AB实验的基本流程。2023年这轮笔试里有一道题是“某次AB实验显示新功能使点击率提升了1%P0.04下面哪个说法正确”。选项里设置了几个经典陷阱比如“有96%的把握认为新功能有效”“只有4%的可能新功能无效”“如果新功能真的无效那么做出当前样本差异的概率是4%”。正确答案是最后一个它考察的是P值在零假设成立条件下的概率含义而不是把P值解读为“新功能有效的概率”。这类题就是典型的“背定义没用得真正理解概念背后的统计逻辑”的题型。建议备考时把所有统计学概念的假设、计算过程和业务解读各练一遍尤其是第一类错误和第二类错误在AB实验场景下常考。AB实验设计题还会考察分流均匀性、样本量计算、实验周期确定、指标涨跌显著性判断。知乎的题特别爱问“什么情况下实验组和对照组的结果差异可能有偏”考察点包括新奇效应、样本互污染、SRM问题。这需要平时真的有跑实验的经验或者至少认真看过几篇AB实验的复盘文章只看教科书很难答出彩。2.4 Python分析与产品洞察Python题在知乎笔试中占比不高但也不是完全没有。2023年这场主要考pandas的基础操作比如筛选、分组聚合、合并数据框、处理缺失值。客观题里给了代码片段问输出结果或哪一行会报错。难度不算高但如果你平时数据分析全靠Excel没写过python代码这里也会丢分。有一道题印象很深给你一张用户行为日志表包含user_id、action、timestamp三列让你用pandas把每个用户的session切分出来。这题思路是先按用户和时间排序然后用时间间隔判断是否属于同一个session本质上是窗口函数的Python实现。如果你只会调用函数而没有理解数据处理的逻辑这题基本无从下手。备考时建议把pandas的groupby、merge、apply、rolling这几个核心操作练熟再配合一两个数据分析与可视化的小项目找感觉。3. 高频笔试真题类型与解题思路3.1 业务分析题内容社区的核心指标拆解知乎业务分析题的偏爱方向是内容生态、创作者激励、推荐效率、会员业务。比如“某季度回答提交量明显下降请从数据角度给出分析思路”或者“如何评估知乎新上线的关注页改版效果”。这类题目没有标准答案但给分点很明确逻辑清晰、口径明确、考虑全面、有落地建议。我个人的答题框架分四步走。第一步确认目标把“评估效果”或“定位原因”这类模糊问题转成一个明确的量化指标比如“回答提交量环比下降10%”第二步拆解指标把目标指标按维度拆到位比如回答提交量内容消费量×创作转化率×提交成功率第三步定位可能的影响因素包括产品改动、用户结构变化、竞品变化、外部环境第四步给出验证方案说明你会用什么样的数据或实验来证明你的判断。这套框架不只是应付笔试实际工作中写分析报告也是这个思路。注意写分析思路时一定要落到具体指标和计算公式上不要只写“分析用户的活跃度”这种空话。面试官想看到的是“用户活跃度DAU/MAU先按新老用户拆再看周活跃天数分布的变化”这样可执行的方案。3.2 SQL题从取数到漏斗分析的实战演示SQL编程题是唯一能拿到客观分的环节也是区分度最大的环节。知乎的SQL题通常会给3到4张表比如users表user_id, reg_date、questions表question_id, author_id, create_date、answers表answer_id, question_id, author_id, create_date、likes表like_id, answer_id, user_id, like_date。我遇到的一道经典题是统计2023年10月每个问题下的回答数并且筛选出回答数超过10的问题按回答数倒序输出。这题逻辑很直接关键是别把日期过滤条件放错位置。如果你先JOIN再过滤会先产生大量中间数据再筛在笔试环境下可能内存不足正确做法是先对answers表按日期过滤再做GROUP BY和HAVING。另一道值得说的题是求“内容互动漏斗”从浏览问题、查看回答、点赞、收藏到关注答主计算每一步的转化率。这题用SQL写其实不复杂把每一步的去重用户数分别算出来最后用CTE或者子查询合并再用LAG或者直接相除计算转化率。它考察的是你能不能把一个常见的业务过程翻译成可执行的SQL逻辑而不是背窗口函数的语法。3.3 概率统计题假设检验与AB实验的应用概率统计题在客观题里出现频率很高有些还结合了知乎的业务场景。比如问“如果一个回答的点赞数服从参数为λ的泊松分布随机选10个回答至少有一个点赞数超过5的概率是多少”这题需要你快速反应过来用泊松分布的性质计算。还有一类是条件概率题比如“已知某用户是创作者那么他是高活跃用户的概率”需要结合贝叶斯公式解题。AB实验相关的题是重头戏。有一道题给了两个版本的落地页要求设计实验来验证新版本是否提升了回答页的停留时长。正确的答题步骤一定要包含确定实验单位、估算样本量、设置合理的实验周期、确定核心指标和护栏指标、做分流合理性检验、最后才是显著性判断和上线决策。知乎这种平台有很强的网络效应用户之间的关注关系会让实验组和对照组互相影响所以很多题目会专门考察对“样本互污染”的理解。这里有个概念我经常在面试中问别人也被人问为什么AB实验不能只看P值还要看效应量。知乎的题也考到了这个点因为平台流量大样本量很容易让微小差异显著但业务上不一定有实际价值。所以答题时一定要区分“统计显著”和“业务显著”这几乎是内容平台数据分析师的基本职业素养。3.4 开放性案例题答题结构的组织方法开放性案例题是最让人头疼的因为题目本身没有标准答案但判分却有明确导向。我遇到的一道题是“知乎计划在回答页增加一个‘推荐阅读’模块希望你设计评估方案”。这种题其实是把业务题、SQL题和实验设计题融合在一起了需要你在一段文字里展现全方位的分析能力。我的答题结构是先明确业务目标比如提升用户人均阅读篇数和阅读时长再定义核心评估指标和护栏指标护栏指标包括回答页跳出率、回答完整阅读率、不感兴趣点击率然后设计实验方案包括实验分组、样本量、周期最后是数据监控和上线决策标准。关键是每个环节都要具体不要写成概念目录比如“用XX模型评估用户兴趣”不如“按用户历史阅读的话题分布做分层在实验分流时保证分层变量在两组间均衡”。开放性案例题还有一个加分项就是主动指出潜在风险。比如我看到“推荐阅读”模块第一反应是它可能影响原有回答的阅读深度所以护栏指标一定要关注“平均单篇回答阅读时长”是否下降。这种对业务权衡的敏感度比堆砌分析方法更让面试官眼前一亮。4. 做题策略与时间分配实战4.1 不同类型题目的建议用时知乎笔试120分钟题量大约在35到40题之间主观题至少有两道需要写几百字的分析思路。如果按顺序从头做到尾大概率会卡在客观题上导致后面的大题没时间写。我自己的策略是拿到试卷先花2分钟扫一遍所有题目心里给每道题分配好时间。题型题量建议总用时单题平均用时客观题20道左右40分钟2分钟SQL编程题3至4道40分钟10至13分钟主观案例分析题2道35分钟15至18分钟检查与补充-5分钟-客观题里如果遇到30秒内没有思路的题建议先标记跳过不要在单题上花超过3分钟。SQL题写完之后一定要检查窗口函数的边界情况尤其是PARTITION BY和ORDER BY的方向。主观题则至少要留出15分钟一道因为组织逻辑和润色表达都吃时间。4.2 做题顺序先拿稳分再啃硬骨头我的做题顺序是SQL题最先做因为它是客观的、有确定性答案的而且写完后心里有底然后做客观题按模块推进先做统计和概率再做机器学习和业务常识最后留大块时间写主观题。这么做的好处是即使最后主观题没写完你已经有了一大半分数保底。有同学习惯先做主观题觉得分值大但主观题一旦时间失控SQL题这种稳拿的分反而丢了非常不划算。另外SQL题早做还有一个好处就是可以让你提前进入业务场景状态后面做业务分析题时思路会更顺。如果你先被一堆概率题搞到心态崩溃再去看SQL大表很容易漏条件。4.3 草稿纸使用的隐藏技巧笔试系统虽然监控切屏但允许使用草稿纸。我强烈建议在笔试前把草稿纸分成三个区域左上角记SQL的关键表结构和字段名右上角记统计分布的公式和临界值下方空白区做计算和题目的思路草稿。这样做可以大幅减少来回翻题目的时间也不容易因为看错字段名而写错SQL。我自己在实际笔试中会把每个SQL题的“想要的结果字段”和“过滤条件”用一行字先写在草稿纸上确认无误后再开始写SQL。这个方法帮我避免了好几次把日期条件和JOIN条件放反的低级错误。如果你平时没有这个习惯考前练习时可以专门训练一下。5. 笔试中容易踩的坑和复盘心得5.1 时间失控是最常见的问题我和很多同样参加过知乎笔试的同学交流大家感同身受的一点是题目并不算特别难但时间真的不够用。尤其是主观题明明脑子里有很多想法写出来却需要大量时间组织语言。有些同学会在客观题上死磕一道概率题结果最后两道主观题只写了一行“我的思路是……”分数自然上不去。针对这个问题复盘时我给自己定了一条铁律客观题单题超时立即跳过所有题目都做完后再回来补。实际考场上这套策略帮我节省了至少10分钟够把SQL题检查一遍。如果你也想考这个岗位建议平时用牛客网的模拟笔试环境做几次限时训练感受一下时间压力。5.2 过度追求答案完美会丢了框架分主观分析题有一个很反直觉的评分特点就是“框架完整的低分答案”往往比“局部深挖的高分答案”得分更高。因为阅卷是在短时间内完成的阅卷人看的是你的整体思路是否清晰、是否覆盖多个维度而不是你某个环节写得多详尽。我第一年参加类似笔试时把一整套AB实验样本量计算公式写在第一道主观题里导致第二道题只写了两行字成绩非常不理想。后来我调整了策略每道主观题先用20分钟搭框架每个要点用一两句话说明保证所有维度都有覆盖最后有剩余时间再回来扩充某一个重点。这个策略在2023年知乎笔试里帮我拿到了比较理想的成绩。你要永远记得笔试考察的是你的分析思维不是让你写论文。5.3 SQL窗口函数和日期函数是重灾区SQL题丢分最常见的原因不是不会JOIN而是日期函数和窗口函数的使用不规范。知乎的题有一个特点经常要求“统计最近7天”“按月分组”“计算每个用户的时间间隔”这些全都依赖DATE_FORMAT、DATE_SUB、DATEDIFF这些日期函数以及LEAD、LAG、ROW_NUMBER这些窗口函数。我在笔试里就栽过一次有一道题要求“计算每个用户相邻两次点赞的时间间隔”我光想着用LEAD函数忘了加PARTITION BY user_id导致每个用户只保留了一条数据。这种错误在语法上不会报错但结果完全错误。复盘时我把所有窗口函数的场景题都重刷了一遍从“分组Top N”到“连续登录天数”每个场景都自己手写一遍才真正建立起肌肉记忆。5.4 AB实验题中容易忽略的细节陷阱AB实验相关的客观题里最常见的陷阱是“忽略了实验的随机化单位与分析单位不一致”。知乎这种社区产品实验分流通常按用户ID分但核心分析对象可能是“人均阅读篇数”这就存在用户级别的随机化和内容级别的分析之间的错配。如果你在答题时没有主动讨论这个问题面试官会怀疑你只是背过实验流程而没有真正操作过实验。另一个细节是基期数据的使用。很多同学答实验设计题时只写“看实验组的指标是否显著高于对照组”却不提“用实验前的基期数据做AA测试验证分流均匀性”。写不写这一句话给阅卷人的专业感差异很大。我在2023年笔试里特意加上了“先做AA测试”这一步个人感觉对主观题分数有明显帮助。6. 笔试之外考后复盘与面试衔接的准备6.1 笔试结束后的第一件事不是放松而是复盘走出笔试系统那一刻趁记忆还新鲜迅速把遇到的题目记下来。不用写完整答案只要把考点、场景和卡壳点记录下来就行。我习惯在备忘录里按“业务题/SQL题/统计题”分三类记录标注每道题考察的知识点和自己的薄弱环节。这些记录在后面的面试准备中价值巨大因为很多面试官会直接拿笔试里的题追问你“当时为什么这么答”。复盘时重点看三件事一是时间分配是否合理二是哪些知识点在题型中反复出现三是自己有没有在主观题上因为框架不全而丢分。我复盘2023年知乎笔试时发现业务Sense相关的题占比远超预期所以后续把内容社区的产品逻辑和指标体系完整梳理了一遍这个动作在后面的面试中直接派上了用场。6.2 把笔试题目扩展成项目经验如果你正在准备数据分析岗位笔试题目本身就是最好的练习素材。比如笔试里那道“回答点赞率下降如何归因”的题完全可以扩展成一个完整的分析项目自己造一份模拟数据用python数据分析与可视化做一遍探索性分析再用SQL做核心指标验证最后写一份分析报告。这样写进简历里的数据分析项目比网上下载的电商分析案例更有差异化也更贴合内容社区的数据分析场景。我后来在面试里被问到“你最近做的数据分析项目”时就主动把笔试里的指标归因题作为案例来讲面试官明显很感兴趣。因为这说明你对业务的思考是持续性的而不是为了应付笔试临时背的题目。数据分析面试题里最常问的“你最自豪的分析项目”完全可以用笔试题目改造升级。6.3 工具层面考前把环境问题彻底解决笔试前一定提前检查电脑、浏览器、网络和输入法这些细节很容易被忽视。牛客网的系统对浏览器版本有要求建议提前用Chrome登录测试一下能不能正常打开代码编辑器。输入法也要提前切到英文模式做SQL题时中文标点经常导致编译错误这种无谓扣分太可惜。另外在线笔试系统一般会实时保存代码但为了保险我习惯每写完一道题就手动点一下“保存”按钮。SQL题的编辑器不像本地IDE那样有语法高亮提示写完多检查几次字段名、表名、括号匹配。我们团队后来带实习生时我让他们先刷三套牛客网的模拟题再碰真实笔试也是为了让环境应激不至于成为额外的失分因素。6.4 心态准备笔试只是面试的预演最后想说一个容易被忽视的点笔试不仅仅是筛选更是一次很好的面试预演。笔试里遇到的新颖业务题很可能就是面试官在下一轮追问你的话题。比如2023年知乎笔试里那道关于“推荐阅读”模块的案例分析后来我听说有同学在面试中被要求进一步细化实验方案和上线决策标准。如果你笔试时只写了框架而没有深入思考面试时就会露怯。所以我的建议是笔试结束后不要急着把题目扔到脑后而是挑出2到3道有代表性的题模拟面试场景自己口头回答一遍再写成结构化文档。把自己练到能不用草稿就讲清楚分析思路的程度面试时你会感谢笔试时的自己。根据我个人经验2023年知乎数据分析岗笔试最大的分水岭不在于你背了多少题目而在于你有没有真正建立“业务数据”联动的思维习惯。业务Sense决定了你能不能识别关键问题SQL和统计学决定了你能不能把问题落到分析方案案例题决定了你能不能把分析结果讲清楚。把这四层能力连成线你就拿到了内容社区数据分析岗位的入场券。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

我原以为ML管道只有3步,上线两周后模型开始胡言乱语 2026/9/1 22:29:06

我原以为ML管道只有3步,上线两周后模型开始胡言乱语

我原以为ML管道只有3步,上线两周后模型开始胡言乱语 发版第三天的下午,推荐模型准时开始「胡言乱语」--首页给买了猫粮的用户强推狗粮,准确率从 0.82 掉到 0.61。群里我的消息一条接一条,我一边回滚到上一版模型,一边心里骂自己:当初搭建机器学习管道的时候,怎么就只做了数据预…

阅读更多 →
RVC新版实战:8G显存训练AI声音模型,实现实时变声与AI翻唱 2026/9/1 22:29:06

RVC新版实战:8G显存训练AI声音模型,实现实时变声与AI翻唱

最近在尝试用AI进行声音克隆和实时变声时,发现RVC(Retrieval-based-Voice-Conversion)项目迎来了近三年来的首次重大更新。这次更新不仅带来了性能上的飞跃,更重要的是大幅降低了使用门槛,让普通玩家用一张消费级显卡&…

阅读更多 →
大模型项目申请翻了5倍,我用这个框架砍掉了80%的无效投入 2026/9/1 22:29:06

大模型项目申请翻了5倍,我用这个框架砍掉了80%的无效投入

大模型项目申请翻了5倍,我用这个框架砍掉了80%的无效投入 当市场部想用大模型生成广告文案、客服部想用大模型替代人工、研发部想用大模型自动写代码注释的时候,我就意识到公司的 AI/ML 项目要出大问题了--这些需求听起来合理,但一算账全是坑。作为技术总监,我去年刚学完 面向…

阅读更多 →
Excel动态数组函数FILTER实战:构建智能查询面板与数据看板 2026/9/1 22:29:06

Excel动态数组函数FILTER实战:构建智能查询面板与数据看板

1. 先搞清楚这个“野路子”到底解决了什么实际问题如果你经常用Excel处理数据,尤其是那种需要从一堆信息里反复筛选、提取特定条目的表格,那你肯定对“筛选”功能不陌生。但常规的筛选,无论是自动筛选还是高级筛选,都有一个痛点&a…

阅读更多 →
Demo跑得欢,上线死得惨:我补完人工智能课程才搞清的工程化差距 2026/9/1 22:29:06

Demo跑得欢,上线死得惨:我补完人工智能课程才搞清的工程化差距

Demo跑得欢,上线死得惨:我补完人工智能课程才搞清的工程化差距 去年我用几周时间做了三个AI Demo,图像分类、文本分类、推荐排序,每个都能在笔记本上跑出漂亮的准确率。老板看完演示说:“下周上线。”我说好。结果三个项目上线后全崩了:第一个崩在数据格式,第二个崩在模型版本…

阅读更多 →
网易互娱游戏研发笔试复盘:题型考点与备考策略 2026/9/1 22:26:06

网易互娱游戏研发笔试复盘:题型考点与备考策略

每年秋招季,游戏研发岗的笔试都是不少同学的一块心病。今天想复盘一下我当年参加网易互娱2020校招游戏研发第一批在线笔试的完整经历,从题型分布到每道题背后的考点逻辑,再到一些考场上才体会得到的坑,一次性说清楚,给…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞