
A
admin
作者
GEO问题库怎么建:从销售、客服与站内搜索提炼真实需求
2026年7月27日
0
0
直接答案:通过销售异议、客服工单、站内搜索等第一方数据源采集问题,完成去标识化、聚类与意图标注,建立可验证的GEO问题库。
输入数据源与采集方法
- 销售异议记录:从CRM导出近6个月未成交客户的异议字段(需含原始对话文本),示例字段:
objection_type(价格/功能/服务等分类)
resolution_status(是否已解决)
ticket_title(如“API返回错误码500”)user_role(开发者/运营等)session_count(同一问题交互次数)
query_text(原始搜索词)result_clicks(后续点击行为)
数据处理步骤
- 去标识化:
- 替换客户名称/ID为
[client_X]
- 意图聚类:
- 使用BERTopic对相似问题分组(如“价格高”“成本超出预算”合并为“价格敏感”)
- 人工校验聚类标签,要求Krippendorff’s α≥0.75
- 证据映射:
- 将问题关联到产品文档章节(如“API错误码500”对应文档第3.2节)
- 标注缺失覆盖的问题(需新建内容)
验收标准
- 可行动性:每个聚类至少映射到1个产品改进或内容更新任务
- 隐私合规:确保去标识化后无法通过组合字段还原个人身份
例外处理
- 不适用场景:
- 涉及商业秘密的客户具体配置信息
- 单次出现的边缘问题(频次<3次/季度)
- 争议处理:组建销售、客服、产品三方小组对模糊案例投票裁决
输入采集
- 销售异议记录:从CRM导出近6个月的销售沟通记录,提取客户明确反对或犹豫的表述(如"担心数据迁移成本")。字段包括:
- 原始文本(示例:"你们系统对接要多久?现有业务不能停")
- 场景标签(售前/售后/POC阶段)
- 发生频次
- 客服工单:筛选产品使用类工单(排除账号/支付问题)。关键字段:
- 问题描述(示例:"报表导出时维度丢失")
- 解决步骤
- 是否重复提交
- 站内搜索日志:分析搜索词报告,过滤出长尾查询(≥3词)。记录:
- 原始查询词
- 零结果率
- 后续点击页
处理步骤
- 去标识化:
- 替换公司/人名(如"指定银行"→"金融机构客户")
- 模糊化具体数值("3天"→"T+工作日")
- 意图聚类:
- 使用TF-IDF+余弦相似度初筛(阈值≥0.65)
- 人工复核合并近义词(如"导入失败"和"数据上传报错")
- 证据映射:
- 标注问题来源(销售/客服/搜索)
- 关联产品文档章节(示例:"API限流错误"→开发文档第4.2节)
验收标准
- 优先级排序需满足:
- 高频问题(出现≥5次)
- 无现有文档覆盖
- 影响决策(如价格异议)
- 排除标准:
- 已停产功能相关
- 特定客户定制需求
核验项
- 销售记录是否包含完整沟通上下文?需抽样检查原始录音
- 站内搜索词是否受当前结果页质量干扰?对比无结果点击与成功查询
证据来源与采集
- 销售CRM记录:提取最近90天内标记为"异议"或"未解决"的会话记录,重点采集:
- 客户原话中的疑问句式(如"如何解决指定问题")
- 产品对比时提及的缺失功能
- 合同谈判中的风险质疑
*验收方式*:检查是否保留原始会话时间戳和匿名客户ID(如C-2024-0032)
- 客服工单系统:导出L3-L4级未关闭工单,筛选:
- 重复提交3次以上的问题类型
- 需要跨部门协同解决的复杂咨询
- 知识库未覆盖的新产品问题
*记录字段*:工单编号、首次响应时长、升级路径、最终解决状态
数据处理标准
- 去标识化要求:
- 删除个人姓名/联系方式,保留行业和公司规模
- 模糊化具体金额和日期(如"某A轮SaaS公司")
- 用〈数据1〉〈数据2〉替代可识别参数
- 意图标注规则:
- 购买障碍类:标注决策阶段(考虑/比较/风险)
- 使用问题类:标注影响范围(单用户/系统级)
- 需求建议类:标注可行性评估(P0-P3)
隐私边界说明
- 不使用客户内部文档/邮件原文
- 避免暴露故障具体时间窗口
- 聚类后删除原始会话记录(保留30天审计日志)
*核验项*:需法务确认行业监管特殊要求(如医疗金融数据)
验收标准与异常处理
1. 数据采集阶段验收
- 核验项:需抽样检查原始记录与问题映射的一致性(如:销售记录的"价格太高"是否被正确归类为"成本顾虑")
2. 问题聚类有效性验证
- 失败诊断:若人工抽检发现同簇问题实际意图不一致(如将"如何安装"与"安装失败"混为一类),需调整聚类参数
- 证据字段:记录每个簇的种子问题示例及人工校验结果
3. 意图标注边界检查
- 隐私红线:自动过滤包含客户个人信息(如公司名称、订单号)的原始数据,仅保留泛化后的问题表述
- 争议处理:对涉及竞品比较或功能请求的问题,需与法务确认是否属于可公开回答范畴
4. 优先级排序退出条件
- 例外路径:若行业政策突变导致历史问题库失效,需重新启动紧急采集流程
- SHMLANG实践:使用动态权重公式(搜索量×转化潜力×内容缺口分数),每周调整一次优先级
角色分工与质量门控
数据采集责任矩阵
- 销售团队(Responsible):
- 字段:CRM中的客户异议记录(原始文本)、行业类型、客户阶段
- 标准:需包含具体问题场景(如"客户询问如何解决AI生成内容的法律风险"而非"对合规有顾虑")
- 例外:涉及NDA的对话仅提交去标识化后的通用问题
- 客服团队(Accountable):
- 字段:工单分类标签、会话记录(含多轮对话)、解决状态
- 审核点:剔除个人身份信息(PII)后保留语境(如"跨境电商客户"而非"指定公司")
技术实施与验收
- 数据工程师(Consulted):
- 交接字段:站内搜索query日志(含session_id)、点击流数据、无结果搜索占比
- 聚类要求:使用BERTopic而非简单词频,保留簇大小和轮廓系数指标
- 内容策略师(Informed):
- 输入:标注后的意图分类(信息型/比较型/故障排除型)、证据映射表(如产品文档章节号)
- 审计追踪:保留原始问题ID与最终内容的双向链接
试运行设计框架
- 基线标准(必须全部满足)
- 销售异议库:至少50条去标识化原始记录(字段:问题文本、产品模块、发生阶段)
- 站内搜索词:过滤品牌词后TOP100查询(字段:查询词、零结果率、后续点击)
- 证据映射完成度:客服工单需标注对应产品文档章节/视频时间戳
- 观测指标(每日记录)
- 决策规则(7天周期)
- 继续扩大采集:同时满足
- 新增P0问题日均≤3条
- 返工:任一条件
- 隐私脱敏漏标≥1例
- 停止:人工复核确认
- 出现客户身份可逆向推断案例
验收方式
- 工具验证:用SHMLANG内部审核系统跑敏感词扫描(规则组:地理坐标/个人身份标识)
- 同类问题是否合并到相同节点
- P0标注是否附销售合同编号(脱敏后)
- 产品文档引用是否精确到章节标题
销售异议数据采集
记录字段
- 原始异议文本(必填):客户原话记录,保留行业术语
- 业务场景(必填):选择【售前咨询/合同谈判/续约沟通】
- 关联产品模块(可选):对应产品文档章节编号
- 解决状态(必填):标记【已解决/待跟进/非产品问题】
验收标准
- 单条记录需包含至少1个具体痛点(如"无法批量导出指定格式报告")
- 排除个人身份信息(PII),用[客户类型]代替公司名(如"跨境电商卖家")
客服工单清洗步骤
- 意图标注:按【功能操作/数据需求/集成问题】三级分类
- 证据映射:将高频问题关联到知识库文档(需检查文档更新时间)
核验项
工单数据是否覆盖最近3个产品版本?
是否已排除账号密码等敏感字段?
上线后复核
- 每周同步新增问题到产品团队
数据采集与清洗
输入源优先级
- 销售CRM异议记录:提取客户明确拒绝理由(字段:异议类型/产品模块/发生阶段)
- 客服工单分类:筛选高频咨询问题(字段:工单分类/解决路径/转人工率)
- 站内搜索日志:捕获长尾搜索词(字段:搜索词/零结果率/后续点击)
去标识化标准
- 删除个人姓名、联系方式、精确时间戳
- 保留行业、公司规模、产品版本等业务特征
问题聚类方法
错误信号识别
- 虚假相关性:将相同关键词但不同场景的问题合并(如"价格贵"在售前咨询vs续费场景)
- 过度拆分:把同一问题的不同表述方式拆分为独立问题
验证步骤
- 检查聚类后问题的业务可行动性(如能否对应到产品改进或内容创建)
三种实施路径的决策框架
1. 不处理的适用场景
- 条件:资源不足(如无专职团队)、问题来源单一(仅依赖关键词工具)、业务目标为短期流量
- 验收方式:检查站内搜索无结果比例是否持续高于行业基准(需自行定义)
2. 最小范围处理方案
- 核心字段:问题原文(去标识化)、出现频次、关联产品模块
- 证据映射:需标注问题来源(销售/客服/搜索)及原始会话片段(脱敏)
- 例外情况:涉及隐私的问题(如客户账户信息)直接标记排除
3. 完整实施的关键差异
维度:最小范围处理;完整实施
数据源:单一渠道;跨渠道关联
聚类标准:关键词字面匹配;语义意图分类(需训练)
优先级模型:频次排序;业务影响矩阵
更新周期:季度手动;实时API对接
决策场景示例:
- 工业设备制造商选择完整实施:需关联询盘技术参数与文档章节,建立领域本体
(根据G3要求:所有用户数据需通过ISO/IEC 27001认证的清洗工具处理)
数据采集与预处理
输入源与记录字段
- 销售异议:记录CRM系统中被标记为「未解决」的客户拒绝理由,需包含对话原文(去标识化后)、产品名称、异议分类(功能/价格/服务等)、发生阶段(售前/试用/续费)
- 客服工单:提取重复率TOP20的工单问题,保留原始描述、解决方案、处理时长、升级次数字段
- 站内搜索:收集搜索日志中无结果或高跳出率的查询词,需记录搜索次数、会话ID(哈希处理)、关联页面URL
去标识化标准
- 删除个人姓名、联系方式、企业名称等PII信息
- 替换具体数值为范围(如「价格超过5万」→「价格超过预算阈值」)
- 对会话ID等追踪字段进行单向哈希加密
问题聚类与标注
意图分类流程
- 初级标注:按《客户意图分类手册》打标(功能需求/操作障碍/信息缺失/竞品对比)
- 证据映射:将问题关联到产品文档章节、帮助中心文章或演示视频时间戳
验收方式
- 随机抽样100条记录检查标注一致性(Kappa系数≥0.75)
- 验证问题库条目能否还原原始业务场景(通过销售团队盲测)
例外处理
- 涉及商业秘密的客户对话需经法务审核后脱敏
- 高频但低价值问题(如密码重置)单独归档不入库
延伸阅读
参考资料
评论 (0)
还没有评论,来发表第一条吧。
请先登录后再发表评论。