先厘清:同期群分析和留存分析是什么关系
同期群分析(cohort analysis)是把具有共同特征或共同经历的用户分成组,再比较各组后续表现的分析方法。它回答的问题是:不同批次、不同类型的用户,后来的表现差在哪里。
它和留存分析的关系常被搞混。把留存分析抽象一层就清楚了:留存分析是通过某个关键行为把用户圈出来,再观测他们后续一段时间的表现,本质是在探究一个事件对另一个事件的影响。
这个抽象很有用,因为它意味着留存分析模型能做的事,远不止"看次日留存":
- 初始事件选"账号注册"、回访事件选"付费",得到的是新增用户的付费转化曲线。
- 再叠加"付费金额的周期累计人均值",得到的就是 LTV。
- 初始事件换成"参加活动",回访事件选"付费",得到的是这场活动对付费行为的实际影响。
换句话说,同期群分析的大部分需求,都可以用留存分析模型实现。差别只在于人群怎么划分。
五种人群划分方式
最常见的同期群是按时间分——不同日期注册的用户,比较他们各自的留存曲线。但时间只是其中一种切法,实际业务里更有价值的往往是另外几种:
| 划分方式 | 典型场景 |
|---|---|
| 时间 | 不同日期注册的玩家群体之间的比较 |
| 关键行为 | 购买过促销礼包的玩家 vs 未购买的玩家 |
| 指标规模 | 首日付费 500 元以上 vs 500 元以下的玩家 |
| 用户习惯 | 每月付费 10 次以上 vs 不足 10 次的玩家 |
| 行为序列 | 战斗失败后选择付费的玩家 vs 战斗失败后选择抽卡的玩家 |
按时间划分可以直接用留存模型构建;后四种需要先用标签把人群区分出来,再进入留存模型比较。这一步的前提是标签体系能覆盖这些行为特征,也是很多团队做不了深度同期群分析的真正卡点——不是不会分析,是分不出人群。
两条容易踩的禁忌
第一,用于比较的人群必须互不重叠。
这条最常被违反。比如"通过第 3 关的用户"和"通过第 4 关的用户"就不能作为两个同期群比较,因为通过第 4 关的用户必然也通过了第 3 关,两组人有交集,比较结果没有实际意义。同期群的前提是分组互斥。
第二,同期群分析只给出差异,不给出原因。
它能告诉你 A 组和 B 组的后续表现不一样,但不会告诉你为什么不一样。原因需要靠其他分析手段去查。把同期群的结论直接当成因果结论,是这个方法最常见的误用。下面案例二就是一个典型:差异很明显,但真正的原因要再往下挖一层才找得到。
怎么读一张同期群数据表
一张同期群表格有两个读法,横着读和竖着读回答的是完全不同的问题:
- 横向:同一群用户,随着时间推进表现如何变化。这条曲线的形状告诉你产品的长期留存能力。
- 纵向:不同批次的用户,在同一个时间点上的表现差异。这个差异告诉你哪一批用户质量更好,或者哪一次改动起了作用。
多数人只看横向,但纵向对比往往才是发现问题的地方。
案例一:发行团队怎么用它评估买量质量
发行团队衡量新增用户质量最常用的两个指标是 LTV 和 ROI。这两个指标本质上都是标准的同期群分析:以"用户注册"作为圈选行为,观测不同批次用户后续的指标表现。
- LTV 分析:看不同日期新增的用户,其累计价值随时间的变化趋势;纵向比较不同批次之间的 LTV 差距。
- ROI 分析:看回本周期是否符合预期,并构建 ROI 增长率指标,判断增长是否健康,进而决定要不要调整投放策略或游戏内容。
这个场景的关键不在于把数字算出来,而在于纵向对比:同样是买量进来的用户,上周批次和这周批次的 LTV 曲线如果明显分叉,说明渠道质量或者素材定向发生了变化,这是投放策略需要调整的信号。
案例二:活动效果复盘,一个反直觉的结论
某卡牌游戏在五一期间做了一个养成资源掉落数量提升的活动。设计意图很清楚:拉平玩家实际养成进度与策划预期进度的差距,让玩家能顺畅体验后续核心内容,从而保住长期留存。
活动结束后,团队按"参与活动天数"给玩家打标签划分同期群,再看各组活动结束后的中长期留存。
结果和预期相反:
参加满 5 天的满勤玩家,留存率衰减最快,到后期甚至略低于整体水平。表现最好的反而是参与了 4 天的玩家。
活动参与越深、留存越差,这个结论违反直觉。顺着往下查才找到原因:满勤玩家的养成进度被推得太快,提前把可玩内容消耗完,过早进入了"长草期"——没有新目标可追,于是流失。
这个案例说明两件事。一是同期群分析的价值在于暴露差异,而这个差异靠拍脑袋想不出来;二是它确实只给差异不给原因,"为什么满勤反而留存差"这一步,是靠后续的行为路径分析和业务判断补上的。
运营层面的启发也很直接:资源投放型活动的设计需要考虑参与深度的边际效应,最高参与度未必对应最优的长期表现。
案例三:付费留存为什么不能用常规口径
某二次元游戏想看付费用户的留存情况,发现常规的付费留存口径不好用。原因有三个:
- 发生时机后置。这类玩家通常会体验很久、认可内容之后才付费,付费行为不像注册那样集中在生命周期早期。
- 生命周期组成不同。同一批"首次付费用户"里,有人玩了三天就付费,有人玩了三个月才付费,两者的后续行为规律完全不同。
- 组别可能重复。按常规口径统计,同一个玩家可能在不同分组里重复出现,导致口径失真。
解决办法是重新定义付费留存的口径,用同期群的方式来算:
对于每日新增的用户,某日的付费留存率 = 该日活跃的、付过费的用户数 ÷ 该新增用户群体至今累计的付费用户数
换句话说,看的是"今天还活跃的历史付费用户,占这批人历史付费用户总数的比例"。这个口径回答的是一个更有意义的问题:已经愿意掏钱的这批人,还在不在。
这个案例的启发不在于这个具体公式,而在于口径本身是需要被设计的。当标准指标不匹配业务场景时,正确的做法是重新定义指标,而不是将就着用一个会误导决策的数字。这也是为什么指标口径需要沉淀在平台的语义层里,而不是散落在各人的取数逻辑中——相关讨论见Agent 为什么需要语义层。
落地需要什么前提
同期群分析本身不复杂,难的是前置条件。按上面三个案例倒推,至少需要三样东西:
- 行为数据采集完整。案例二要按"参与活动天数"分组,前提是活动参与行为有埋点、且能按天聚合。埋点方案怎么从业务问题倒推,见数据采集与埋点的 Agent 化。
- 标签体系能表达业务特征。五种划分方式里有四种依赖标签。标签能力的上限,直接决定了同期群分析的深度上限。
- 口径统一且可复用。案例三重新定义了付费留存,这个定义如果只存在于某个分析师的取数脚本里,下次换人就要重来一次。
在 ThinkingAI Agentic Engine 上,这三件事分别对应数据采集能力、标签与人群圈选能力、以及承载指标口径的统一语义体系;分析 Agent 在这套底座上工作,可以用自然语言完成人群圈选与留存对比,把原本需要反复配置的分析动作压缩成一次提问。
常见问题
同期群分析和留存分析有什么区别?
留存分析是一个分析模型,同期群分析是一种分析思路。把留存分析抽象来看,它就是"用某个行为圈选人群,再观测这群人后续的表现",所以大部分同期群分析都可以用留存分析模型来实现。区别在于人群怎么划分:普通留存分析通常按时间分批,同期群分析则可以按关键行为、指标规模、用户习惯、行为序列来分。
同期群分组时最容易犯的错误是什么?
分组有交集。比如把"通过第 3 关的用户"和"通过第 4 关的用户"当成两个同期群比较,但通过第 4 关的人必然也通过了第 3 关,两组人重叠,比较结果没有意义。同期群的前提是分组互斥。
同期群分析能得出因果结论吗?
不能。它只能告诉你不同人群的表现存在差异,不能告诉你差异的原因。本文案例二就是例子:数据显示满勤玩家留存反而更差,但"养成进度过快导致提前进入长草期"这个原因,是靠后续的行为分析和业务判断得出的,不是同期群分析本身给出的。
付费留存为什么要单独定义口径?
因为付费行为的发生时机比注册晚得多,且同一批首次付费用户内部的生命周期差异很大,直接套用常规留存口径会失真,还可能出现同一玩家在不同分组重复计算的问题。可行的做法是按同期群重新定义:某日付费留存率 = 该日活跃的付费用户数 ÷ 该新增群体累计付费用户数。
做同期群分析需要什么数据基础?
三样:行为数据采集完整(能按天聚合到用户粒度)、标签体系能表达你要区分的业务特征、指标口径统一且能复用。第二项是最常见的卡点——多数团队不是不会分析,是分不出想要的人群。
下一步
同期群分析的价值在于暴露那些拍脑袋想不到的差异。找一个最近做过的活动或者一批新增用户,按参与深度或者渠道分个组,看看纵向对比会不会给你一个意外的结论。
延伸阅读
- 游戏数据分析完整指南:留存、付费、LTV、流失四大指标体系与行业基准
- 智能用户运营 Agent 实战:把分群结论接到策略与触达的完整闭环
- Agent 为什么需要语义层:指标口径统一的具体建设方法
- 数据采集与埋点的 Agent 化:从业务问题倒推埋点方案

