传统BI仪表板的平均企业采用率仅为25%——这意味着为它们构建的对象中有四分之三从未使用过它们。这不是用户的失败,而是设计的失败。仪表板是为分析师构建的,却被部署给不会用拖放过滤器和数据透视表思考的销售经理、市场主管和高管们。对话式BI通过在用户所在的地方与他们对话,彻底翻转了这个等式。
为什么传统仪表板正在失去对决策的掌控力?
仪表板之所以失灵,并不是因为它们做得不好,而是因为真实的决策方式从来就不符合仪表板所假设的方式。一块仪表板把一组固定的问题固化下来,这些问题由最初提出需求的人预先选定,然后永远只回答这些问题。而真实的决策不会以成形的样子到来。有人看到一个出乎意料的数字,而第一个有价值的问题几乎从来不在图表上。
其结果是一个被充分记录下来的模式。分析师建好一块仪表板,使用率在几周内冲高,然后随着用户撞上它能回答的边界而衰减。每一个新问题都产生一个请求,每个请求都排进队列,而队列就成了瓶颈。一年之内,大多数大型组织都有了成百上千块仪表板,其中被规律使用的只占一小部分,而报表积压则以周为单位计量。
有三个结构性局限能解释这一点,而且它们都无法靠更好的图表设计来解决:
- 粒度固定。一块仪表板只能承诺一个细节层级。高管要看总额,区域经理要看细分,分析师要看异常值背后的行级明细。要同时服务这三类人,就要么建三个制品,要么做一个谁都难用的折中物。
- 无法追问。图表回答不了「为什么」。看到北部地区毛利率下滑,是分析的开始而不是结束。接下来发生的一切——细分、下钻、与基线对比——都发生在仪表板之外,通常发生在电子表格里。
- 对变化中的问题保持静态。业务问题变化得比仪表板快。一次组织调整、一个新的定价模型或一次供应中断,都会让上个季度的框架失效,而重建仪表板所需的时间,比这个问题本身保持有效的时间还长。
最终迫使变革发生的是经济信号。维护一大片仪表板资产,需要为每个制品、每次数据模型变更、每次访问请求付出分析师工时。当一个对话界面能够回答那些仪表板本来也覆盖不到的长尾问题时,再去建第四百块仪表板的边际成本就变得无法自圆其说了。
用对话取代仪表板,真正改变的是什么?
这个转变的核心并不是语音或聊天这种交互形式,而是「由谁来组装查询」以及「在什么时刻组装」。
在仪表板模型中,查询在设计时由分析师组装,用户在使用时沿着预建路径做过滤和下钻来使用它。在对话模型中,查询在提问的那一刻、由系统根据用户的意图以及一层约束了「什么可以被组装」的语义层来组装。这一个改变,把瓶颈从分析师队列转移到了语义模型的质量上——而后者是一个可扩展性高得多的位置。
实践中有四件事会发生变化:
- 问题成为工作的单位。团队不再维护制品,而是维护指标定义,并监测人们正在问什么问题。问题日志取代仪表板清单,成为「业务到底需要什么」的第一手事实来源。
- 迭代在使用端变成免费的。「按渠道拆开」「现在排除企业客户群」「和去年同期比一比」——每一句都是一句话,而不是一个工单。第五个追问的成本,降到与第一个大致相当。
- 歧义变得可见。在仪表板上,一个含糊的指标会被建表的人悄悄消解掉。在对话中,系统必须要么消解要么追问,而它追问的那些问题,恰恰揭示了定义在哪些地方不清楚。这令人不适,但极其有价值。
- 受众扩大了。一线员工、客户经理和运营人员从来不会打开 BI 工具,但他们愿意键入一个问题。这是价值的最大来源,也是风险的最大来源,因为这些用户无法像分析师那样对错误数字做合理性检验。
值得直说的是什么没有变:底层数据依然必须被建模、被测试、被治理。对话式 BI 消除的是「写查询」的瓶颈,而不是「做数据工程」的瓶颈。假设相反的方案,会在未建模的数据仓库之上交付一个自信的界面,产出流畅、流利却错误的答案。
对话式 BI 是如何回答那些仪表板答不了的问题的?
对话最有力的论据,是那类「从来不值得建一块仪表板、却始终需要答案」的问题。这类问题目前散落在即时通讯群里、会议间隙中,以及分析师的待办清单里。
| 问题类型 | 仪表板的结局 | 对话的结局 |
|---|---|---|
| 开放式调查 | 需要新建仪表板或手工取数 | 直接提问;每个答案都会引出下一个切分维度 |
| 一次性对比 | 很少被建出来;凭记忆回答或干脆不答 | 几秒内回答,且不留制品 |
| 跨领域问题 | 需要一次没人建模过的连接 | 只要语义层覆盖这些领域就有可能 |
| 定义对比 | 不可见;两块图表悄悄给出不同数字 | 系统说明它用了哪个定义,并提供备选 |
| 异常解释 | 只显示异常,不显示原因 | 追问逐步下钻到影响因素 |
举一个具体的例子。收入仪表板显示北部地区的净收入环比下降了百分之十一。仪表板到此为止。接下来的问题——这是量的问题还是价的问题,是集中在一条产品线还是普遍存在,是集中在少数几个客户还是广泛发生,折扣政策是否变了,上月是否包含一次一次性的收入确认——这些才是分析本身。在仪表板上,每一个问题都需要不同的视图或手工查询;在对话中,它们只是五句话,而且每一句都在收窄搜索范围,而不是重新开始。
复利式的优势在于,对话系统会从日志中学习。六个月之后,问题日志就成了「业务真正关心什么」的精确规格说明,比任何需求研讨会的产出都准确。按季度复盘这份日志的团队,总会发现自己的仪表板资产中有三分之一不再服务于任何活跃问题,同时存在一批从未被表达出来的、无人服务的问题。
在哪些时候仪表板仍然胜过对话?
这种取代是部分的,而假装不是这样会损害方案的可信度。有若干类别中,一块做得好的仪表板仍然是更好的工具,成熟的方案会有意保留它们,而不是把所有东西都转掉。
- 监控与告警。当任务是「注意到某个数字动了」,一块扫一眼就能读、始终在线的显示屏胜过一次对话。没有人愿意每天早上问一句「有什么不对劲吗」。保留运营墙板,并加上从它出发追问「为什么」的能力。
- 跨多维度对比扫描。小倍数网格或热力图能让眼睛一次性在五十个单元格里发现模式。对话是串行的,无法向你展示一个你没想到要问的模式。
- 受监管与需审计的报表。当某个具体数字必须按固定周期、以经过签核的定义可复现地产生时,一份静态、有版本的报表才是正确的制品。对话擅长调查,不擅长鉴证。
- 高风险、周期性重复的叙事。董事会材料与月度经营评审,受益于一份稳定、经过策展、所有人在会前都已看过的视图。对话的补充价值在于处理这些材料必然会引发的追问。
- 地理空间与高度视觉化的模式。路线密度、区域覆盖和空间聚类是视觉问题。用文字去问,比看一眼地图更慢。
可落地的结论不是「取代仪表板」,而是「不要再为了多回答一个问题去新建仪表板」。保留监控界面,退役长尾上那些单一用途的报表,把探索性和追问型的问题交给对话。大多数成熟的数据资产最终会稳定在「少量真正承重的仪表板加一层对话能力」,而不是走向任何一个极端。
在对话能够工作之前,数据层必须具备什么条件?
对话式 BI 把含糊数据的代价,从「一张令人困惑的图表」抬高到了「一个自信的、以自然语言给出的错误答案」。因此,它对数据层的要求比仪表板更严格,而不是更宽松。
六项前提条件:
- 带有指标感知定义的语义层。实体、维度、度量、粒度以及允许的连接,只定义一次并通过 API 暴露。没有这一层,系统就是在猜测表结构,而每一次猜测都是一个潜在的错误答案。
- 无歧义的指标所有权。每个业务概念有且只有一个已认证的定义。如果存在两种「活跃客户」的定义,系统会挑一种,而不同的问法会挑到不同的那一种。
- 已声明的粒度与可加性。系统需要知道一个度量能否跨时间求和,以及一行代表什么。比率和去重计数是需要重新计算的,不能相加。
- 在查询时强制执行的行级与列级安全。从数据仓库继承,绝不在对话层重新实现。对话界面让人极其容易开口索取本不该看到的数据,因此执行点的位置比以往任何时候都更关键。
- 经过测试并带有新鲜度监控的模型。dbt 测试、新鲜度检查,以及对底层表的异常检测。一张过期的数据表,会就上周的现实给出一个流利的、被当作今天的答案。
- 查询成本上限。对话式问题在构造上就是无边界的。必须强制执行扫描上限,并把昂贵请求导入异步通道,否则第一个开放式问题就会产生一笔没人批准过的仓库账单。
跳过这些的方案不会渐进式失败,而会在某一次会议上一次性失败:有人问了一个合理的问题,得到一个看似可信的数字,据此采取了行动,一周后才发现这个数字建立在未经测试的模型上。从这种事故中恢复的代价,远高于事先做准备。
如何在一个无人亲手写出的答案上建立信任?
信任是对话式 BI 的采纳瓶颈,而这是一个工程问题,不是沟通问题。用户不需要理解系统如何工作,他们需要关于「何时可以依赖它」的可靠信号。
五种机制贡献了大部分作用:
- 展示定义。每个答案都应当用业务语言说明用了哪个指标,并附上完整定义的链接。例如:「净收入,不含退货与内部公司间交易。」这一个功能就能在大多数争议开始之前化解它们。
- 展示查询。让用户展开生成的查询,理想情况下还能看到 SQL。分析师会去检查,而他们的检查正是组织信心形成的过程。
- 展示新鲜度与覆盖度。「数据截至 3 月 14 日;210 家门店中还有 3 家未上报。」把不完整的数据当作完整数据呈现,是报表系统中最常见的静默错误来源。
- 在存在不确定性时把它标出来。小样本、插补值和估算分摊都应当被标注。一个由四条记录推导出的数字应当说明这一点。
- 在不知道的时候承认不知道。拒绝回答远比糟糕地回答更便宜。一个会说「我没有这个指标;这里是最接近的三个」的系统,比一个总能给出答案的系统更能建立信任。
再加上一个反馈闭环,并把它当作产品信号来对待。对答案点踩时,应当捕获问题本身、生成的查询以及用户的预期。每周复盘这份日志,是让系统可见地变快的最快路径,而可见的进步正是让怀疑者转投的原因。
还有一项实践能加速信任建立:在上线之前,用历史问题让系统跑一段影子模式,并在内部公布准确率。一句诚实的「上个季度的问题答对了百分之八十二」,比一次承诺完美却交付不足的上线更能赢得可信度。
如何衡量这一转变是否奏效?
「仪表板更少」并不是目标,决策质量与决策速度才是。四类指标能让这一转变得以度量,而每一类都需要在动手之前先采集基线。
| 类别 | 指标 | 为什么重要 |
|---|---|---|
| 采纳度 | 每周提问用户数、每用户问题数、第八周留存 | 区分「新鲜感」与「习惯」;留存才是诚实的信号 |
| 质量 | 首次尝试成功率、纠正率、升级率 | 信任的先行指标;质量问题总是先于采纳崩塌出现 |
| 速度 | 从提问到获得答案的中位时长 | 与它所取代的分析师队列相比,后者以天计量 |
| 替代度 | 即席请求量、仪表板数量、分析师投入报表的工时 | 真实的成本削减就体现在这里 |
这些数字会按特定顺序变化,不要对中间状态惊慌。质量首先上升,因为指标定义改善了。采纳随后跟上,通常先慢后快,一旦几位有影响力的用户养成习惯就会加速。替代度最后出现,往往滞后一到两个季度,因为退役一块仪表板需要的是人的决策,而不只是存在一个更好的替代品。
需要留意一种失败特征:提问量很高,但留存持平或下滑。这意味着人们在试用这个系统、没有得到需要的东西、然后回到了旧的变通做法。这几乎永远是语义层的缺口,而不是模型质量问题,修复点在指标定义里,不在提示词里。
应该如何推进从仪表板到对话的迁移?
一个奏效的迁移是逐领域、以证据为驱动的,而不是一次性的整体替换。
- 选一个有投入的负责人、且有现存积压的领域。收入、留存和供应链是常见起点。你需要一位愿意编写定义的领域负责人,以及一份能证明当前模式正在失效的积压清单。
- 为基线做埋点。采集两周数据:收到的即席请求数、中位交付时长、该领域内的仪表板数量及其使用情况,以及人们实际在问什么问题。
- 先为该领域建好语义层。二十到四十个指标、业务方撰写的描述、已声明的允许维度、从数据仓库继承的安全策略。忍住不要去建模所有东西。
- 对照现有仪表板做验证。对话系统必须能精确复现该领域承重仪表板上的数字。任何偏差都是定义缺陷,必须在上线前解决。
- 向一个带反馈闭环的小群体发布。二十到四十名用户,每周复盘失败与被纠正的问题,每周交付可见的修复。
- 第一个季度先扩张问题覆盖度,而不是用户数。早期深度胜于广度。一个在单个领域内答对九成问题的系统,比一个横跨五个领域只答对四成的系统更能赢得信任。
- 有意识地退役。只有当对话层在一个完整业务周期内被证明能回答某块仪表板的问题、且其负责人同意时,才下线它。没有证据就停掉,会摧毁对替代品的信任。
- 按季度汇报。对照基线公布采纳度、质量、速度和替代度。公布这些数字的方案能保住预算,不公布的方案则会被追问「为什么没人用这个聊天机器人」。
终点不是一家没有仪表板的公司,而是一家仪表板数量很少、确实承重、且保持稳定的公司;是一家长尾问题无需工单就能得到回答的公司;也是一家把分析师的时间投入建模与调查、而不是投入去建第四百零一个制品的公司。
常见问题
仪表板把一组预先选定的固定问题固化下来,而真实的决策会不断产生预建图表没有预料到的追问。每一个未被预料到的问题都变成分析师队列中的一个请求,而队列就成了瓶颈。对话式 BI 在提问的那一刻、根据用户的意图与语义层来组装查询,把瓶颈从分析师的产能转移到了语义模型的质量上。
不会,成熟的方案会有意地在几个类别中保留仪表板:监控与告警、跨多维度对比扫描、受监管与需审计的报表、董事会材料等高风险周期性叙事,以及地理空间模式。可落地的目标是「不要再为了多回答一个问题去新建仪表板」,而不是消灭每一块仪表板。
需要连续追问切分的开放式调查;从来不值得建制品的一次性对比;需要没人建模过的连接的跨领域问题;能下钻到成因而不只是显示异常的异常解释;以及定义对比——系统可以说明它用了哪个指标并提供备选。
六项前提:通过 API 暴露指标感知定义的语义层;每个业务概念有且只有一个已认证的定义;已声明的粒度与可加性;由数据仓库在查询时强制执行的行级与列级安全;经过测试并带有新鲜度监控的模型;以及用于约束开放式问题所触发扫描的查询成本上限。
把它当作工程问题来做。展示所用的业务定义,展开生成的查询,显示数据新鲜度与覆盖度,标注小样本、插补值等不确定性,并让系统在不知道时敢于承认。再加上反馈闭环、每周复盘失败案例,以及上线前用历史问题跑影子对比。
对照上线前的基线追踪四类指标:以每周提问用户数和第八周留存衡量的采纳度;以首次尝试成功率和纠正率衡量的质量;以从提问到获得答案的中位时长衡量的速度;以及以即席请求量、仪表板数量和分析师报表工时衡量的替代度。
因为每一个新问题都产出一个新制品,而不是一个新答案。一年之内,大多数大型组织都有了成百上千块仪表板,其中被规律使用的只占一小部分,报表积压以周计量。最终变得无法自圆其说的,正是去建第四百块仪表板的边际成本。
以自然语言给出的、自信却错误的答案。仪表板把歧义呈现为一张令人困惑的图表,而对话把它变得流畅而权威。风险集中在数据层而非模型上,这正是含糊的指标定义、未经测试的模型和过期的数据表在这里远比在传统报表中危险的原因。
应当逐领域推进,而不是一次性整体替换。单个领域通常需要的节奏是:两周的基线埋点、覆盖二十到四十个指标的语义层、对照现有仪表板的验证,以及一个季度以深度为先的问题覆盖,之后才向外扩张。质量先改善,采纳随后跟上,现有仪表板的替代则最后发生。