先给结论:如果咨询记录里只有手机号、微信号或昵称这类可重复使用的标识,你无法可靠地把“次数”还原成“人数”,只能得到“多少个不同标识”这个中间量。要区分人数与次数,前提是每次咨询都留下可跨次拼接的稳定标识,并且你愿意接受标识复用带来的误差;如果做不到这一点,任何按次数折算人数的做法都只是估算。
“有多少人来问过”和“一共问了多少次”是两个不同口径。前者关心去重后的人,后者关心互动总量。旧内容或旧合作关系准备退出时,这两个口径的用途不同:判断是否还有真实需求,看人数;判断某个入口或话术是否仍在触发咨询,看次数。若把次数直接当人数,会高估仍需保留的部分;若把人数当次数,又会低估反复沟通的成本。先写下你这次要用它做什么决定,再决定去重规则。
假设一个场景:三个月内收到 40 条咨询,其中 12 条来自同一个手机号,其余手机号各出现一次。按手机号去重,得到 29 个标识。这个 29 是“至少有多少个不同标识”,不是“至少有多少个人”。原因很直接:同一个人可能换号、用家人号、用工作号;不同人也可能共用一部电话或一个客服微信。因此去重后的人数是下限,次数是上限,真实人数落在两者之间,且无法仅凭这批记录收窄。
要让这个下限更接近真实人数,需要增加可拼接维度,例如同一会话内的时间连续性、咨询内容的承接关系、对方主动提供的订单号或旧称呼。多个维度同时吻合时,判定为同一人的把握更大。但维度越多,误合并的风险也越高:两个不同的人恰好在同一时间段问同一件事,很容易被错并成一个。
反例:如果咨询渠道本身不保留历史会话,或者每次咨询都重新分配匿名标识,那么跨次拼接从一开始就不成立。此时你看到的“次数”只是离散事件,连“多少个不同标识”都算不出来。另一个失效条件是标识被批量复用,例如同一台公用设备被多人使用,或某个入口被自动化程序反复触发。这两种情况下,次数会明显偏离人数,且偏离方向不确定,不能靠调参修正。
还有一个容易被忽略的点:第三方估算、渠道后台报告与站内记录的口径本来就不同。渠道后台可能按设备或账号去重,站内记录按会话计数,两者对不上是正常的,不能据此断定某一方漏记。若某个入口的咨询量突然归零,合理解释至少包括入口下线、跳转失效、记录中断、统计口径变更,不能单独用它证明该入口已无价值。
取最近一个完整周期(例如一个自然月)的咨询明细,做三步:
做完后你会得到三个数:总次数、标识数、人工校正后的人数区间。下一步动作取决于你要做的决定:如果目的是决定旧内容是否退出,看校正后的人数是否仍稳定出现;如果目的是评估某个入口的触发强度,看次数与标识数的比值是否长期偏高。比值高说明同一批人在反复问,可能问题出在答复本身,而不是需求规模。
在记录里注明统计口径、去重规则和不确定区间,例如“本月 40 次咨询,29 个标识,人工校正后估计 25 至 29 人”。这样下次有人拿次数当人数时,你能直接指出差异来源。需要强调的是,这套方法只处理“同一用户多次咨询”的区分问题,不涉及单次咨询内部的行为拆分,也不适用于没有留下任何可拼接痕迹的场景。若你的记录连时间戳都不完整,先补记录,再谈去重。