7大常用概率分布详解:从分布率、期望方差到业务实战
发布时间:2026/10/1 11:53:39来源:尧图网络
做数据分析这几年我有个越来越深的体会概率分布不是教科书拿来考试的它是分析业务、做决策的底层语言。面试的时候被问“你了解哪些概率分布”很多人能背出一串名字但一碰到实际问题就懵——用户留存率下降两个点该用什么分布建模双十一客服排班怎么预估峰值AB实验跑完怎么判断结果显著这些问题绕来绕去最终都会落到分布率、期望、方差这几个基本概念上。这篇文章想做的事是把概率论里出现频率最高的7个分布——0-1分布、二项分布、泊松分布、几何分布、均匀分布、指数分布、正态分布——挨个讲透。不止聊分布率怎么列还聊每个分布适合什么场景、期望方差怎么推、用的时候最容易踩哪些坑。适合正在系统补概率论基础的同学也适合做数据分析、算法、风控、运营的同行拿来当速查手册。1. 先建立一个整体框架分布到底在描述什么1.1 概率分布的本质概率分布解决的核心问题其实很简单一个随机试验结果有哪些每个结果出现的概率多大把这两件事对应起来就是分布率。对离散型随机变量这个对应关系叫分布律也叫概率质量函数PMF对连续型随机变量因为取值无穷多且每个单点的概率都是0所以只能用概率密度函数PDF配合积分来描述区间概率。举一个生活中的例子。你在做一个抽奖活动中奖率1%那么“抽一次是否中奖”就是典型的0-1分布。当你把抽奖重复100次关心的“100次里中奖多少次”就从0-1分布变成了二项分布。而如果你统计的不是抽奖次数而是每天有多少用户抽奖单位时间的事件计数通常落在泊松分布上。同样是抽奖这件事问法不同背后的随机变量类型就不同要用的分布也就不一样。这正是很多初学者觉得概率分布“学不会”的根源——他们背下了公式却没有建立“先定义随机变量再选择分布”的思维习惯。1.2 离散与连续两种计算路径离散型随机变量的分布率是逐点列出的。比如抛硬币正面记为1反面记为0那么 P(X1)0.5P(X0)0.5分布率列出来就两行。连续型随机变量不行因为像“身高恰好是175.0001cm”这种事概率为0只能求落在某个区间的概率比如 P(170X180)。这个区间概率要靠概率密度函数在区间上积分得到。两者的使用习惯也不一样。离散分布里分布率直接给每个取值的概率算期望就是每个值乘上对应概率再求和。连续分布里无穷多个取值不能逐个求和期望变成了密度函数和自变量乘积的积分。初学的时候把这两条路径分清楚后面所有关于期望、方差的推导都会顺畅很多。1.3 7个分布在实战中的“岗位分工”从业务视角看这几个分布各有各的主场分布典型问题业务场景0-1分布单次试验是否成功用户是否点击、是否转化二项分布n次重复试验中成功几次AB实验、质检抽检泊松分布单位时间内事件发生几次客服进线、系统报错、交通事故几何分布第几次才首次成功首次付费、首次点击、首次注册均匀分布区间内任意取值是否等可能随机数生成、模拟采样指数分布两个随机事件之间的等待时间设备寿命、电话间隔、排队时间正态分布大量微小因素叠加后的总和身高体重、测量误差、收益波动有了这个“岗位表”你在实际工作中遇到问题时第一步就不会慌先把问题定性成“计数”“等待时间”还是“单次结果”然后去对应区间挑分布。2. 离散型分布分布率是逐点写的2.1 0-1分布一切复杂分布的起点0-1分布又叫伯努利分布是整个概率论里最简单的分布也是很多复杂分布的积木块。它的随机变量X只有两个取值1表示成功0表示失败。设成功的概率为p则分布率为P(X1)pP(X0)1-p期望E(X)1·p0·(1-p)p。方差D(X)(1-p)²·p(0-p)²·(1-p)p(1-p)。别看公式简单业务里的点击率、打开率、转化率用户维度上每一个人对应的都是一个0-1分布。你算的所谓“总体转化率”其实就是在估计这个p。如果一个人只访问一次他买不买是一个0-1分布但如果他访问了多次每次都有可能购买这时就不能用0-1分布而要升级到二项分布。实操中一个容易忽略的地方0-1分布的方差在p0.5时最大达到0.25p越靠近0或1方差越小。换句话说当一个业务转化率特别高或特别低时单次观测的波动也相对有限而转化率在50%附近的业务单用户的行为最随机做AB实验需要的样本量也更大。这个直觉对后续实验设计的样本量估算非常有用。2.2 二项分布n次独立的0-1试验之和把0-1分布重复n次每次独立成功概率保持p不变关心的“n次中成功k次”就得到二项分布记作X~B(n,p)。分布率P(Xk) C(n,k) p^k (1-p)^(n-k)k0,1,...,n期望E(X)np方差D(X)np(1-p)。推导方式很多最直观的是把X拆成n个独立的0-1变量之和期望和方差直接相加。期望np很好理解做了100次试验、每次成功概率0.2平均成功20次符合直觉。方差np(1-p)在p0.5时最大这也是为什么AB实验在转化率接近50%时最难做出显著差异。二项分布是AB实验的底层模型。假设对照组1000人实验组1000人对照组转化率10%实验组转化率12%实验组多出来的20个人是不是真的来自策略提升还是抽样波动常规做法就是用二项分布来模拟“在真实转化率10%的情况下抽1000个人出现120个以上转化的概率”如果这个概率小于设定的显著性水平比如0.05就认为差异显著。理解了这一层你就知道网上那些“转化率提升20%”的结论背后其实是一套二项分布假设检验的逻辑。实操上有两个注意点。一是n要足够大、np和n(1-p)都不太小二项分布才适合做正态近似一般经验法则是np5且n(1-p)5否则计算尾部概率偏差较大。二是二项分布要求每次试验独立且p恒定业务中用户行为往往在不同批次间会有波动严格意义上p并不是一个固定值。如果实验周期跨越了活动大促p本身在波动直接用二项分布就会低估真实方差。2.3 泊松分布稀罕事件的计数之王泊松分布描述的是单位时间或空间内随机事件发生次数的分布记作X~P(λ)。它的分布率是P(Xk) (λ^k e^(-λ)) / k!k0,1,2,...期望E(X)λ方差D(X)λ。这是泊松分布一个非常重要的特征期望等于方差。数据如果表现出“均值近似等于方差”的特点通常就可以考虑用泊松分布来拟合。泊松分布通常用于三类场景一是罕见的离散事件计数比如交通事故、机器故障、网页报错二是高流量系统中的到达人数比如客服每小时进线量、门店每十分钟客流三是作为二项分布的极限近似当n很大、p很小时二项分布B(n,p)近似为泊松分布P(np)。历史上著名的“普鲁士士兵被马踢死”案例就是泊松分布的经典应用——每年每个军团的死亡人数服从均值约0.61的泊松分布。实际业务里我经常用泊松分布做容量预估。比如客服系统每天进线量均值是500想算一天内进线量超过600的概率直接套泊松分布算尾部概率。如果算出来这个概率很大说明按均值准备人力是不够的需要预留buffer。也可以用泊松过程叠加均值的方法把一天拆成两个班次各自独立泊松总进线仍是泊松分布均值相加即可非常方便。2.4 几何分布等第一次成功如果关心的是“独立重复试验中到第几次才第一次成功”这就是几何分布。设单次成功概率p则第k次才首次成功的分布率是P(Xk) (1-p)^(k-1) pk1,2,3,...期望E(X)1/p方差D(X)(1-p)/p²。期望1/p其实很好理解成功概率1%的事情平均要试100次才见第一次成功这与直觉一致。几何分布业务上常见于“首次行为”的分析。比如一个新用户从注册到首次付费中间隔了多少天一个用户从看到广告到第一次点击中间曝光了多少次。这些“首次等待”类的问题都可以用几何分布做基准参考。如果一个产品的首充转化数据明显偏离几何分布的预期那说明中间环节存在系统性的加速或阻碍因素值得深挖。需要提醒的是几何分布有“无记忆性”这个特性如果前面已经试了50次都没成功那么“再试k次才成功”的条件概率与从第0次开始“试k次才成功”的概率完全一样。这意味着历史失败次数不会影响未来的成功预期。在业务中这个假设要谨慎使用——比如用户连续点击50次都不转化你真的相信第51次点击和第一次点击的转化概率一样吗通常不会所以几何分布更适合描述机器过程或“每次独立无记忆”的场景用在用户行为上时要小心。2.5 超几何分布不放回抽样的二项分布超几何分布经常被拿来和二项分布对比因为它俩长得很像差别只在抽样方式。二项分布对应有放回或无限总体的独立重复试验超几何分布对应无放回抽样。设总共有N个物品其中M个是“成功品”不放回地抽n个抽到k个成功品的分布率是P(Xk) C(M,k)C(N-M,n-k) / C(N,n)期望E(X)nM/N方差比二项分布多了一个修正因子(N-n)/(N-1)。当抽样比例很小比如从十万件货里抽100件N很大n相对N很小超几何分布就几乎等同于二项分布修正因子约等于1。所以在实际工程里只要抽样比例小于5%很多人会直接用二项分布近似误差可以忽略。质检、彩票、扑克牌抽取都是超几何分布的典型场景。值得注意的是业务中常见的“从用户池中抽一批用户发优惠券统计其中活跃用户数”如果不放回且用户池有限严格说应该用超几何分布。不过当用户池有几百万、抽样只有几千时二项分布近似完全够用这也是为什么超几何分布实际出场频率远低于二项分布。3. 连续型分布密度函数里的区间概率前面几个离散分布处理的是“数个数”的问题但业务里还有一类非常常见的数据——连续测量值比如响应耗时、订单金额、用户身高。这类数据的取值是连续的分布规律得靠概率密度函数来刻画。3.1 均匀分布最简单也最容易忽略均匀分布描述的是在某个区间[a,b]内任意位置的概率密度都相等记作X~U(a,b)。密度函数f(x) 1/(b-a)a ≤ x ≤ b其他位置为0期望E(X)(ab)/2方差D(X)(b-a)²/12。均匀分布最常见的应用是随机数生成。几乎所有编程语言的random库底层生成的都是[0,1)均匀分布随机数再通过各种变换生成其他分布。在做蒙特卡洛模拟或A/B分流时如果你需要给用户随机分桶用的就是均匀分布。均匀分布的方差公式(b-a)²/12值得留意。12这个分母来自积分结果不是拍脑袋定的。它告诉我们两个信息一是区间长度越大数据越分散二是均匀分布的方差其实比直觉上要小——区间[a,b]内极差是b-a但方差只有极差平方的1/12标准差约为极差的0.29倍。这个结论在评估“随机误差”范围时经常用到。比如系统时间戳的低位理想情况下应该近似均匀分布如果发现某些位的分布明显不均匀说明随机源质量有问题可能影响分桶的随机性。3.2 指数分布等待时间的经典模型指数分布描述两个随机事件之间的“等待时间”。如果事件发生过程满足单位时间内平均发生λ次那么“从此刻到下一次事件发生的时间”X服从参数λ的指数分布密度函数f(x) λe^(-λx)x0期望E(X)1/λ方差D(X)1/λ²。指数分布和泊松分布是一对“孪生兄弟”泊松分布数的是单位时间内的次数指数分布算的是相邻两次之间的时间间隔。客服平均每小时接20通电话那么两通电话之间的间隔时间服从期望为3分钟的指数分布。设备平均使用寿命是1000小时那寿命分布也可以用指数分布来近似这时λ1/1000。指数分布最“反直觉”的性质是无记忆性。一台设备已经平稳运行了1000小时它再继续运行1000小时的概率和一台新设备运行1000小时的概率相同。这在数学上非常漂亮但用在寿命预测上要谨慎——现实中有磨损、有老化设备“记得”自己已经工作了多久并不是真正无记忆的。指数分布更适合描述那些“失效原因完全随机、与年龄无关”的过程比如放射性原子衰变、纯随机到达的呼叫。3.3 正态分布统计世界的霸主正态分布是概率论里最重要的分布。它的密度函数f(x) 1/(√(2π)σ) · e^(-(x-μ)²/(2σ²))记作X~N(μ,σ²)其中μ是均值σ是标准差。期望E(X)μ方差D(X)σ²。正态分布曲线呈钟形对称中间高两边低在μ±σ处有拐点。为什么正态分布无处不在中心极限定理给出了答案大量独立同分布的随机变量之和或均值不管原始分布长什么样当数量足够大时都近似服从正态分布。人的身高受无数基因和环境微因素影响测量误差由无数小误差叠加月销量由无数用户独立购买行为累加这些“叠加”的结果最终都汇聚到正态分布上。这就是为什么现实中大量数据都长着一张“正态脸”。实战中最常用的是3σ法则。正态分布下X落在μ±σ内的概率约68.27%落在μ±2σ内的概率约95.45%落在μ±3σ内的概率约99.73%。质量控制里的“六西格玛”讲的就是均值偏离目标不超过6个标准差时超出规格线的概率极低。做异常检测时一条线上监控指标如果突然超出均值3个标准差通常就会触发告警——因为正常波动几乎不会走到这一步。处理正态分布时标准化是绕不开的操作。令Z(X-μ)/σZ就服从标准正态分布N(0,1)。任何正态分布都可以先标准化再查标准正态分布表或调用统计函数计算概率。比如用户月均消费服从N(500,100²)问月消费超过700元的用户占比多少先算Z(700-500)/1002查表得知P(Z2)≈2.28%。整个过程不需要背复杂的积分。4. 分布率、期望、方差一表看完4.1 7个常用分布的核心参数速查表我把前面提到的7个分布整理成一张对照表建议直接收藏。分布参数分布率/密度函数期望方差0-1分布pP(X1)p, P(X0)1-ppp(1-p)二项分布B(n,p)n,pC(n,k) p^k (1-p)^(n-k)npnp(1-p)泊松分布P(λ)λ(λ^k e^(-λ))/k!λλ几何分布p(1-p)^(k-1)p1/p(1-p)/p²均匀分布U(a,b)a,b1/(b-a)(ab)/2(b-a)²/12指数分布λλe^(-λx)1/λ1/λ²正态分布N(μ,σ²)μ,σ1/(√(2π)σ)·e^(-(x-μ)²/(2σ²))μσ²注意两点。第一泊松分布期望等于方差这是它区别于二项分布、也区别于正态分布的重要标志。当你拿到一个计数数据如果样本均值约等于样本方差泊松分布通常是第一候选。第二指数分布的期望和标准差相同都是1/λ这也是一个很强的特征——如果一个正数数据的样本均值约等于样本标准差可以考虑指数族模型。4.2 手算期望与方差的两个技巧期望的计算有两条实用性质E(aXb)aE(X)bE(XY)E(X)E(Y)。后一条无论X和Y是否独立都成立。二项分布的期望np就是靠把X拆成n个0-1变量逐个取期望再加起来得到的不需要背公式拆开就出来了。方差的计算则要小心Var(aXb)a²Var(X)始终成立但Var(XY)Var(X)Var(Y)只对独立或至少不相关的随机变量成立。业务中要特别注意相关性——比如同一个用户的多个行为之间通常不独立如果硬把它们当作独立变量相加方差会被低估。这也是为什么实验分析里要用“用户”而不是“点击”作为独立样本单元目的就是尽量避免违反独立性假设。还有一个常用的计算关系式Var(X)E(X²)-[E(X)]²。在不知道分布类型、只有样本数据时先算平方均值再减均值平方就能估算方差。不过这个公式在数值计算时容易有严重的精度损失——当X的均值很大、方差很小时两个大数相减会吃掉有效位。工程上更稳妥的做法是用更稳健的增量算法Welford算法计算而不是直接套E(X²)-μ²。5. 实战面对一个业务问题怎么选分布5.1 选分布的三步走我自己的习惯拿到一个问题先按三步走。第一步看数据是离散的还是连续的。数据是“多少个”还是“多少量”。用户数、点击次数、报错次数是离散的响应时长、订单金额、温度是连续的。这一步决定了你要在离散分布还是连续分布里选。第二步看数据生成过程。单次试验还是多次试验是否有放回关心的是成功次数还是等待时间是固定试验次数还是事件随机发生如果是固定n次独立试验统计成功数去二项分布如果是单位时间的随机计数去泊松分布如果是等首次成功去几何分布如果是连续测量值且没有明显偏态优先看正态分布。第三步看业务目标。你是要算某个阈值以上的概率尾部风险还是估计均值是建模整个分布还是只需要期望和方差目标不同对分布精度的要求也不同。很多业务场景其实不需要精确建模只需要一个分布假设来估算大致量级那均匀分布、正态分布就够用了。5.2 业务问题“翻译”成分布的小抄分享几个我常用来给团队做培训的映射双向可用。左侧是业务问法右侧是对应的分布。业务问题对应分布这个用户这次会不会买0-1分布1000个用户里有几个人会买二项分布一小时内客服会接到几个电话泊松分布一个新用户第几天首充几何分布随机分桶用户进哪一组均匀分布备件库存够撑多久指数分布用户月消费金额的分布正态分布或对数正态最后一栏值得多说一句。收入、销量这类数据通常不是纯正态因为它们的取值被卡在0以上且右尾特别长。这时候取对数后再看往往就接近正态了这个分布叫对数正态分布。分析GMV、用户在线时长这类强右偏数据时先取log再建模比硬套正态分布可靠得多。5.3 三个常见的选型误区误区一计数数据一律用正态分布。样本量足够大时中心极限定理确实会让均值近似正态但“计数数据本身”的分布仍然更适合泊松或二项。你用正态分布拟合每天的投诉次数很可能算出负数区间的概率这在业务上毫无意义因为投诉次数不可能为负。误区二忽略了“放回”还是“不放回”。小样本无放回抽样要用超几何分布大样本下超几何和二项差别不大才可以用二项近似。如果用户池一共只有500人你抽了200人做实验这就是典型的小样本不放回场景直接用二项分布会高估方差、得出偏保守的结论。误区三把指数分布当作万能寿命模型。指数分布的无记忆性意味着“用多久都跟新的一样”这对机械磨损、用户流失这类有状态变化的过程并不成立。遇到这类问题可以考虑威布尔分布甚至更复杂的半参数模型不要迷信简单模型。6. 常见问题与排查实录6.1 典型问题速查问题原因处理建议用正态分布拟合数据QQ图两端明显翘起数据右偏严重不满足正态假设尝试对数正态、指数或威布尔分布计数数据的均值远小于方差过离散泊松假设不成立改用负二项分布或加入随机效应泊松近似二项分布时概率明显偏差n不够大或p太大检查np是否稳定经验上要求p0.1实验组差异看起来很大但检验不显著样本量不足或方差被低估计算最小样本量检查是否违反独立性数据取值有下限但正态分布算出了负数用错了分布族换成有下界的分布提高建模合理性6.2 我踩过的三个实操坑第一个坑是泊松近似用得太随意。刚工作那年做广告点击预估CTR只有0.3%展示量几百万用泊松分布没问题。但后来换到注册转化转化率到了8%拿泊松近似二项就开始出现明显偏差。后来养成习惯用泊松替换二项之前先看p是否小于0.1、n是否足够大不满足就老实算二项。第二个坑是正态近似的连续性修正。用正态分布逼近二项分布计算P(X≥k)时直接算P(X≥k)不如算P(X≥k-0.5)准确。这个0.5的修正在做小样本AB实验的显著性估算时特别重要。第一次做实验分析时没加修正算出来的p值偏小差点得出错误的显著结论。第三个坑是指数分布误用在实际用户行为上。曾经用指数分布建模用户活跃间隔假设用户每次活跃“无记忆”结果预测明显偏差。原因是用户活跃行为有明显的习惯性和周期性根本不符合独立随机到达的假设。后来换成分层模型效果才好起来。这给我的教训是任何分布都有前提假设业务数据不会自动满足假设建模之前先检验。这些分布我用了很多年越用越觉得它们像是工具箱里的固定扳手——型号固定、适用场景固定关键是你要知道该用哪一把。刚开始学概率论总想把公式记得滚瓜烂熟但真正到业务里比公式更重要的是先判断这问题属于哪一类再决定用哪个分布最后才是套公式算。建议你把第4节的速查表存下来遇到拿不准的问题时先对号入座多实践几次选择分布的感觉自然就有了。
网站建设高端定制企业官网