GEO问题库怎么建:从销售、客服与站内搜索提炼真实需求
A

admin

作者

GEO问题库怎么建:从销售、客服与站内搜索提炼真实需求

2026年7月27日
0
0

直接答案:通过销售异议、客服工单、站内搜索等第一方数据源采集问题,完成去标识化、聚类与意图标注,建立可验证的GEO问题库。

输入数据源与采集方法

  1. 销售异议记录:从CRM导出近6个月未成交客户的异议字段(需含原始对话文本),示例字段:
  • objection_type(价格/功能/服务等分类)
  • resolution_status(是否已解决)
  • ticket_title(如“API返回错误码500”)
  • user_role(开发者/运营等)
  • session_count(同一问题交互次数)
  • query_text(原始搜索词)
  • result_clicks(后续点击行为)

数据处理步骤

  1. 去标识化
  • 替换客户名称/ID为[client_X]
  1. 意图聚类
  • 使用BERTopic对相似问题分组(如“价格高”“成本超出预算”合并为“价格敏感”)
  • 人工校验聚类标签,要求Krippendorff’s α≥0.75
  1. 证据映射
  • 将问题关联到产品文档章节(如“API错误码500”对应文档第3.2节)
  • 标注缺失覆盖的问题(需新建内容)

验收标准

  • 可行动性:每个聚类至少映射到1个产品改进或内容更新任务
  • 隐私合规:确保去标识化后无法通过组合字段还原个人身份

例外处理

  • 不适用场景:
  • 涉及商业秘密的客户具体配置信息
  • 单次出现的边缘问题(频次<3次/季度)
  • 争议处理:组建销售、客服、产品三方小组对模糊案例投票裁决

输入采集

  1. 销售异议记录:从CRM导出近6个月的销售沟通记录,提取客户明确反对或犹豫的表述(如"担心数据迁移成本")。字段包括:
  • 原始文本(示例:"你们系统对接要多久?现有业务不能停")
  • 场景标签(售前/售后/POC阶段)
  • 发生频次
  1. 客服工单:筛选产品使用类工单(排除账号/支付问题)。关键字段:
  • 问题描述(示例:"报表导出时维度丢失")
  • 解决步骤
  • 是否重复提交
  1. 站内搜索日志:分析搜索词报告,过滤出长尾查询(≥3词)。记录:
  • 原始查询词
  • 零结果率
  • 后续点击页

处理步骤

  1. 去标识化
  • 替换公司/人名(如"指定银行"→"金融机构客户")
  • 模糊化具体数值("3天"→"T+工作日")
  1. 意图聚类
  • 使用TF-IDF+余弦相似度初筛(阈值≥0.65)
  • 人工复核合并近义词(如"导入失败"和"数据上传报错")
  1. 证据映射
  • 标注问题来源(销售/客服/搜索)
  • 关联产品文档章节(示例:"API限流错误"→开发文档第4.2节)

验收标准

  • 优先级排序需满足:
  • 高频问题(出现≥5次)
  • 无现有文档覆盖
  • 影响决策(如价格异议)
  • 排除标准:
  • 已停产功能相关
  • 特定客户定制需求

核验项

  • 销售记录是否包含完整沟通上下文?需抽样检查原始录音
  • 站内搜索词是否受当前结果页质量干扰?对比无结果点击与成功查询

证据来源与采集

  1. 销售CRM记录:提取最近90天内标记为"异议"或"未解决"的会话记录,重点采集:
  • 客户原话中的疑问句式(如"如何解决指定问题")
  • 产品对比时提及的缺失功能
  • 合同谈判中的风险质疑

*验收方式*:检查是否保留原始会话时间戳和匿名客户ID(如C-2024-0032)

  1. 客服工单系统:导出L3-L4级未关闭工单,筛选:
  • 重复提交3次以上的问题类型
  • 需要跨部门协同解决的复杂咨询
  • 知识库未覆盖的新产品问题

*记录字段*:工单编号、首次响应时长、升级路径、最终解决状态

数据处理标准

  • 去标识化要求
  • 删除个人姓名/联系方式,保留行业和公司规模
  • 模糊化具体金额和日期(如"某A轮SaaS公司")
  • 用〈数据1〉〈数据2〉替代可识别参数
  • 意图标注规则
  • 购买障碍类:标注决策阶段(考虑/比较/风险)
  • 使用问题类:标注影响范围(单用户/系统级)
  • 需求建议类:标注可行性评估(P0-P3)

隐私边界说明

  • 不使用客户内部文档/邮件原文
  • 避免暴露故障具体时间窗口
  • 聚类后删除原始会话记录(保留30天审计日志)

*核验项*:需法务确认行业监管特殊要求(如医疗金融数据)

验收标准与异常处理

1. 数据采集阶段验收

  • 核验项:需抽样检查原始记录与问题映射的一致性(如:销售记录的"价格太高"是否被正确归类为"成本顾虑")

2. 问题聚类有效性验证

  • 失败诊断:若人工抽检发现同簇问题实际意图不一致(如将"如何安装"与"安装失败"混为一类),需调整聚类参数
  • 证据字段:记录每个簇的种子问题示例及人工校验结果

3. 意图标注边界检查

  • 隐私红线:自动过滤包含客户个人信息(如公司名称、订单号)的原始数据,仅保留泛化后的问题表述
  • 争议处理:对涉及竞品比较或功能请求的问题,需与法务确认是否属于可公开回答范畴

4. 优先级排序退出条件

  • 例外路径:若行业政策突变导致历史问题库失效,需重新启动紧急采集流程
  • SHMLANG实践:使用动态权重公式(搜索量×转化潜力×内容缺口分数),每周调整一次优先级

角色分工与质量门控

数据采集责任矩阵

  • 销售团队(Responsible)
  • 字段:CRM中的客户异议记录(原始文本)、行业类型、客户阶段
  • 标准:需包含具体问题场景(如"客户询问如何解决AI生成内容的法律风险"而非"对合规有顾虑")
  • 例外:涉及NDA的对话仅提交去标识化后的通用问题
  • 客服团队(Accountable)
  • 字段:工单分类标签、会话记录(含多轮对话)、解决状态
  • 审核点:剔除个人身份信息(PII)后保留语境(如"跨境电商客户"而非"指定公司")

技术实施与验收

  • 数据工程师(Consulted)
  • 交接字段:站内搜索query日志(含session_id)、点击流数据、无结果搜索占比
  • 聚类要求:使用BERTopic而非简单词频,保留簇大小和轮廓系数指标
  • 内容策略师(Informed)
  • 输入:标注后的意图分类(信息型/比较型/故障排除型)、证据映射表(如产品文档章节号)
  • 审计追踪:保留原始问题ID与最终内容的双向链接

试运行设计框架

  1. 基线标准(必须全部满足)
  • 销售异议库:至少50条去标识化原始记录(字段:问题文本、产品模块、发生阶段)
  • 站内搜索词:过滤品牌词后TOP100查询(字段:查询词、零结果率、后续点击)
  • 证据映射完成度:客服工单需标注对应产品文档章节/视频时间戳
  1. 观测指标(每日记录)
  1. 决策规则(7天周期)
  • 继续扩大采集:同时满足
  • 新增P0问题日均≤3条
  • 返工:任一条件
  • 隐私脱敏漏标≥1例
  • 停止:人工复核确认
  • 出现客户身份可逆向推断案例

验收方式

  • 工具验证:用SHMLANG内部审核系统跑敏感词扫描(规则组:地理坐标/个人身份标识)
  1. 同类问题是否合并到相同节点
  2. P0标注是否附销售合同编号(脱敏后)
  3. 产品文档引用是否精确到章节标题

销售异议数据采集

记录字段

  • 原始异议文本(必填):客户原话记录,保留行业术语
  • 业务场景(必填):选择【售前咨询/合同谈判/续约沟通】
  • 关联产品模块(可选):对应产品文档章节编号
  • 解决状态(必填):标记【已解决/待跟进/非产品问题】

验收标准

  • 单条记录需包含至少1个具体痛点(如"无法批量导出指定格式报告")
  • 排除个人身份信息(PII),用[客户类型]代替公司名(如"跨境电商卖家")

客服工单清洗步骤

  1. 意图标注:按【功能操作/数据需求/集成问题】三级分类
  2. 证据映射:将高频问题关联到知识库文档(需检查文档更新时间)

核验项

工单数据是否覆盖最近3个产品版本?

是否已排除账号密码等敏感字段?

上线后复核

  • 每周同步新增问题到产品团队

数据采集与清洗

输入源优先级

  1. 销售CRM异议记录:提取客户明确拒绝理由(字段:异议类型/产品模块/发生阶段)
  2. 客服工单分类:筛选高频咨询问题(字段:工单分类/解决路径/转人工率)
  3. 站内搜索日志:捕获长尾搜索词(字段:搜索词/零结果率/后续点击)

去标识化标准

  • 删除个人姓名、联系方式、精确时间戳
  • 保留行业、公司规模、产品版本等业务特征

问题聚类方法

错误信号识别

  • 虚假相关性:将相同关键词但不同场景的问题合并(如"价格贵"在售前咨询vs续费场景)
  • 过度拆分:把同一问题的不同表述方式拆分为独立问题

验证步骤

  1. 检查聚类后问题的业务可行动性(如能否对应到产品改进或内容创建)

三种实施路径的决策框架

1. 不处理的适用场景

  • 条件:资源不足(如无专职团队)、问题来源单一(仅依赖关键词工具)、业务目标为短期流量
  • 验收方式:检查站内搜索无结果比例是否持续高于行业基准(需自行定义)

2. 最小范围处理方案

  • 核心字段:问题原文(去标识化)、出现频次、关联产品模块
  • 证据映射:需标注问题来源(销售/客服/搜索)及原始会话片段(脱敏)
  • 例外情况:涉及隐私的问题(如客户账户信息)直接标记排除

3. 完整实施的关键差异

维度:最小范围处理;完整实施

数据源:单一渠道;跨渠道关联

聚类标准:关键词字面匹配;语义意图分类(需训练)

优先级模型:频次排序;业务影响矩阵

更新周期:季度手动;实时API对接

决策场景示例

  • 工业设备制造商选择完整实施:需关联询盘技术参数与文档章节,建立领域本体

(根据G3要求:所有用户数据需通过ISO/IEC 27001认证的清洗工具处理)

数据采集与预处理

输入源与记录字段

  1. 销售异议:记录CRM系统中被标记为「未解决」的客户拒绝理由,需包含对话原文(去标识化后)、产品名称、异议分类(功能/价格/服务等)、发生阶段(售前/试用/续费)
  2. 客服工单:提取重复率TOP20的工单问题,保留原始描述、解决方案、处理时长、升级次数字段
  3. 站内搜索:收集搜索日志中无结果或高跳出率的查询词,需记录搜索次数、会话ID(哈希处理)、关联页面URL

去标识化标准

  • 删除个人姓名、联系方式、企业名称等PII信息
  • 替换具体数值为范围(如「价格超过5万」→「价格超过预算阈值」)
  • 对会话ID等追踪字段进行单向哈希加密

问题聚类与标注

意图分类流程

  1. 初级标注:按《客户意图分类手册》打标(功能需求/操作障碍/信息缺失/竞品对比)
  1. 证据映射:将问题关联到产品文档章节、帮助中心文章或演示视频时间戳

验收方式

  • 随机抽样100条记录检查标注一致性(Kappa系数≥0.75)
  • 验证问题库条目能否还原原始业务场景(通过销售团队盲测)

例外处理

  • 涉及商业秘密的客户对话需经法务审核后脱敏
  • 高频但低价值问题(如密码重置)单独归档不入库

延伸阅读

参考资料

评论 (0)

还没有评论,来发表第一条吧。

请先登录后再发表评论。