--- name: bi-cohort-analysis description: 把用户按同一批/同一类分组,比较各群体后续表现。触发条件:对话涉及同期群分析、分群后表现对比、用户生命周期分群跟踪等任务时触发,如出现「同期群」「cohort」「按起始特征分群后表现如何」「不同客群后续转化/留存对比」「注册周/获客渠道分群跟踪」等相似问题时触发。 --- # bi-cohort-analysis 把用户**按同一批/同一类分组,比较各群体后续表现**:定义 cohort 规则 → 取数 → 划分 cohort → 按 cohort 汇总后续表现 → 跨 cohort 对比 → 解读与输出。 ## 前置条件 开始执行前,确认以下信息已就绪: - **分析对象**明确,通常为「用户」,且能唯一标识(如 `user_id`) - **cohort 规则**已确定,即按什么分群(如注册周、获客渠道、首单金额档、首日行为等) - **跟踪指标**已确定,即 cohort 形成后要比较的后续指标(如留存、转化、LTV、复购等)及其时间窗口 - **数据获取能力**可用,能取到对象级起始特征数据及对应后续行为/指标数据 若 cohort 规则或跟踪指标不明确,需先回到规划阶段补充,或向用户确认后再开始执行。 ## 分析原则 ### 同期群定义 同期群(cohort)指在相同时点或具备相同起始特征的用户集合。本 workflow 通过 **cohort 规则分群** 定义 cohort,再比较各 cohort 在 **后续时间窗口** 内的指标表现。 ### 主要步骤 | 步骤 | 用途 | 是否必选 | |------|------|----------| | 定义 cohort 规则 | 确定分群依据与跟踪指标 | **必选**,见步骤 1 | | 取数 | 取用户 ID、起始特征、后续行为/指标 | **必选**,见步骤 2 | | 划分 cohort | 将每个用户分到对应群体 | **必选**,见步骤 3 | | 汇总后续表现 | 按 cohort 聚合跟踪指标 | **必选**,见步骤 4 | | 跨 cohort 对比 | 对比各群差异、幅度与显著性 | **必选**,见步骤 5 | | 解读 & 输出 | cohort 画像、表现对比、业务建议 | **必选**,见步骤 6 | **典型产出**:cohort 矩阵、群间对比表、cohort 留存曲线(多条线对比)等。 **最短路径**:定义分群规则 → 划 cohort → 跟踪各群指标 → 跨群对比(即步骤 1 → 3 → 4 → 5,取数随分群展开)。 本 workflow 主要提供 cohort 场景下的编排与数据衔接逻辑,各步骤的具体执行按相应分析方法的标准流程进行。 --- ## 1. 定义 cohort 规则 明确「按什么分群」与「跟踪什么指标」,这是后续取数与划分的基础: | 要素 | 含义 | 常见取值 | |------|------|----------| | **分群依据** | 划分 cohort 所依据的起始特征 | 注册周/注册月、获客渠道、首单金额档、首日关键行为、获客活动等 | | **跟踪指标** | cohort 形成后要比较的后续指标 | 留存率、转化率、LTV、复购次数等 | | **时间窗口** | 在哪些 dayn 观测跟踪指标 | D1/D7/D30 留存、30 日内 LTV、首周转化率等 | 要点: - 分群依据可为**单一维度**(如注册周)或**多维特征组合**(如消费 + 活跃 + 渠道,优先走聚类,见步骤 3) - 对象粒度须为「一行一用户」;若原始数据为事件级,先聚合到用户级 - 规则一旦确定,后续取数、划分、汇总须保持一致 --- ## 2. 取数 按步骤 1 的规则取数,准备划分 cohort 与汇总后续表现所需的数据。 ### 数据准备 整理 CSV,包含: - **对象标识列**(如 `user_id`) - **起始特征列**:用于划分 cohort(如注册周、获客渠道、首单金额;多维聚类可有多列数值特征) - **后续行为/指标列**:用于汇总跟踪指标(如各 dayn 是否留存、是否转化、累计付费金额等) 示例: ```csv user_id,注册周,获客渠道,D7是否留存,30日LTV u001,2025-W01,自然量,1,128.0 u002,2025-W01,广告,0,0.0 ``` 后续指标若来自另一张表,可仅取用户 ID + 起始特征,待步骤 3 划分后再按 `user_id` 关联后续指标表。 --- ## 3. 划分 cohort 以步骤 1 的规则为输入,将每个用户分到对应群体。 ### 划分方式 - **按已有特征分群**:以起始特征列(如注册周、获客渠道、首单金额档)为分组键,直接将用户归入对应 cohort - **两维策略型分群**(如「增长 × 份额」):优先波士顿矩阵法 - **多维综合分群**:优先 K-means / 分层聚类 / DBSCAN 分群结果保存为 JSON,键为 cohort 标识(如 `"2025-W01"`、`"cluster 1"`),值为该 cohort 内的用户 ID 列表(供步骤 4 按 `user_id` 关联)。 ### 产出检查 - [ ] 各 cohort 样本量可解释,无异常空簇(DBSCAN 噪声点单独标注) - [ ] 分群依据与方法在结论中可复现 --- ## 4. 按 cohort 汇总后续表现 基于步骤 3 的划分结果,为每个 cohort 汇总跟踪指标: 1. 将 cohort 划分结果与用户级后续指标按 `user_id` 关联 2. 按 cohort 聚合跟踪指标(如 cohort 均值、中位数、率值指标的分子/分母汇总等) 3. 整理为 **对比分析用 CSV**:每列对应一个 cohort(或参照 cohort),每行对应一个时间点或汇总口径 示例(三群 D7 留存率对比): ```csv 指标,cohort_1,cohort_2,cohort_3 D7留存率,0.42,0.38,0.51 ``` 若需绘制 **cohort 留存曲线**,按 dayn 逐行整理多群留存率(每列一群、每行一个 dayn),供步骤 6 多线对比。若需与总体或某一基准 cohort 对比,在 CSV 中一并纳入参照列。 --- ## 5. 跨 cohort 对比 对步骤 4 整理的数据执行对比分析,判断哪个群体最好/最差、差异幅度与显著性。 ### 分析要点 - **比较维度**:通常为 **空间对比**(横向比较不同 cohort 之间差异) - **基准设定**:明确参照 cohort(如总体、最大群、或业务指定的对照群) - **计算方式**:按指标类型选择绝对差值或相对差值;多 cohort 间不遗漏任一对比对 - **显著性**(可选):样本为多个用户或多次观测时,按显著性检验规则执行 t / z / 卡方检验 保存对比分析结果。 --- ## 6. 解读 & 输出 完成以上步骤后,围绕**各群体后续表现差异**汇总并输出。 | 字段 | 说明 | |------|------| | 执行内容 | 本步骤做了什么 | | 取数文件 | 起始特征数据、后续表现数据路径 | | 中间产物 | 分群 JSON、对比用 CSV 路径 | | 计算结果 | 对比分析结果路径 | | 结论 | 各 cohort 的起始画像、后续表现差异及显著性 | 汇总结构建议: 1. **Cohort 划分**:分群规则、起始特征、各群规模与占比(含 **cohort 矩阵**) 2. **起始画像**:各 cohort 在起始特征上的差异(辅助解读分群合理性) 3. **后续表现对比**:各 cohort 在跟踪指标上的水平、差异幅度与显著性(含 **群间对比表** 与 **cohort 留存曲线**) 4. **业务解读**:表现最优/最劣 cohort 的可能原因与可执行建议 5. **局限与不确定性**:样本量、时间窗口、特征选择、分群稳定性等