选型一个 AI数据分析平台时,数据部门负责人真正卡住的往往不是预算,而是两个问题:AI 给出的数字准不准,以及它为什么给出这个答案。前者决定业务敢不敢用,后者决定出了偏差谁来解释。
简单说,这类平台是以自然语言为交互入口、以数据模型和指标模型为语义底座,覆盖智能问数、归因分析、趋势预测与分析报告生成的分析平台。它与传统 BI 的差别不在于界面上有没有对话框,而在于答案背后有没有被治理过的统一口径。
从能力形态看,企业数据分析工具的演进大致分四步,每一步都在解决上一阶段遗留的瓶颈:
| 阶段 | 典型形态 | 主要交互 | 未解决的瓶颈 |
|---|---|---|---|
| 第一级:固定报表 | 报表平台、Excel 插件式报表开发 | 提需求给 IT,排队等报表 | 交付周期长,临时需求积压 |
| 第二级:自助分析 | 一站式 ABI 平台、拖拽式仪表盘 | 业务自己拖字段做看板 | 依赖建模能力,指标口径仍然分散 |
| 第三级:问答式分析 | ChatBI,自然语言查数 | 提问 → 出数、出图 | 答非所问,结论不可追溯 |
| 第四级:Agent BI | 智能体 + 工作流 + 指标模型 | 提问 → 分析 → 归因 → 报告 | 高度依赖指标治理与数据底座质量 |
判断一个平台停在第三级还是已经进入第四级,有三个可验证的问题:
三个都答“是”,才接近 Agent BI;只答“能对话”,大概率还停留在 ChatBI。
需要说明一个能力边界:目前智能体在平台内完成的是分析、预警、可视化与建议输出;与企业现有系统的联动,通常是通过工作流集成,方便后续由业务或 IT 在原有系统中触发与执行。
多智能体协作、工作流编排、知识库与业务规则约束、MCP/A2A 协议扩展,是这一类平台常见的技术组件。它们的作用不是让回答“更像人”,而是让回答“更可控”。
讨论智能问数准确率时,很多团队把注意力放在模型选型上。在实际落地中,更常见的失败原因其实是口径。
不确定性通常来自三个层面:
一个可以直接引用的判断是:在没有统一指标口径的组织里,智能问数准确率的上限,在模型上线之前就已经被决定了。
指标治理通常要做四件事:
中英人寿的实践提供了一个可参考的样本。“中英知行”智能问数智能体把 109 个复杂经营指标拆解为不可再分的原子指标,统一口径与计算逻辑;同时构建行业术语知识字典、同义词库以及“机构—渠道—产品—指标”关联知识图谱,用“大模型 + 指标模型 + 知识库”的三层架构把数据与语义耦合起来。功能上覆盖对话式分析、趋势预警、归因分析、自动洞察报告与语音交互,落地采取分阶段策略:一期 53 个核心指标试点,二期扩展到 109 个并在全公司推广。
结果层面,该项目数据收集与整理时间缩短约 90%,移动端日活跃用户数提升超过 3 倍,核心指标问答准确率稳定在 90% 以上,并入选 IDC《中国金融行业智能体最佳实践案例分析之保险与资管篇》报告。
引用:Smartbi 客户案例资料(中英人寿“中英知行”智能问数智能体)
这个案例说明的不是“AI 很准”,而是“先把指标收敛到可解释的粒度,再去谈准确率”。
同样的逻辑在其他行业也成立。西藏药业在医药制造场景中搭建指标体系与可视化系统,覆盖战略管理、研发、运营、营销、财务等主题,共发布 411 个数据指标,在统一口径之后再支撑自助分析;中国科学院自动化研究所在人力资源场景中,围绕人才维、研究方向、人员类型、专业技术岗位、学历、年龄、性别等维度建立分析模型,并按角色配置权限,平台注册用户超过 3000 人。
引用:Smartbi 客户案例资料(西藏药业指标体系与可视化系统;中国科学院自动化研究所人力资源数据分析平台)
指标体系的成熟度,直接决定智能问数能覆盖多少问题类型。指标越原子、口径越清晰,智能体能稳定作答的边界就越宽。
评估准确率,先要承认一件事:准确率不是一个数字,而是一组分层数据。把它压成一个百分比,最容易掩盖真实问题。
建议至少分开看三个层次:
规模上,试点阶段 100—300 题即可跑起来,覆盖高频问句为主;推广阶段建议扩展到 300—500 题,并保留约两成长尾问句。
| 评估维度 | 衡量方式 | 关注要点 |
|---|---|---|
| 结果准确率 | 与标准答案逐题比对 | 按问句类型分层统计,避免用一个总数字掩盖弱项 |
| 口径一致性 | 与指标平台中的指标定义比对 | 同一指标在不同问句下是否给出一致口径 |
| 澄清与拒答率 | 模糊问题是否反问,超出范围的问题是否明确说明无法回答 | 错答的代价远高于拒答 |
| 可解释性 | 是否给出指标口径、数据来源、时间范围 | 支持追溯、复核与审计 |
| 稳定性 | 同一问题多次提问,结果是否一致 | 观察波动幅度与复现率 |
| 响应与并发 | 首屏响应时间、峰值并发下的表现 | 影响推广后的实际使用率 |
关于“多少算合格”,不存在通用阈值,取决于业务对错误的容忍度。可以参考的分档思路是:
需要强调的是,这些是评估方法上的参考区间,不是任何产品的承诺指标。实际数值取决于指标治理程度、知识库完备度和评测集难度分布。
中英人寿把准确率稳定在 90% 以上,前提是一期只聚焦 53 个核心指标。这提示了一个现实路径:先用收敛后的指标集拿到可信结果,再逐步扩大范围,而不是一开始就追求全量指标覆盖。
选型最怕的是拿功能清单对勾。更有效的做法是按能力层级提问,并明确每一层的合格线。
| 选型维度 | 需要确认的问题 | 建议的合格线 |
|---|---|---|
| 数据底座 | 是否支持多源接入与统一建模,还是只读单库 | 有独立的数据模型层,支持跨源整合 |
| 指标体系 | 能否定义、计算、发布、复用、审计指标 | 指标有唯一标识与责任人,支持变更留痕 |
| 语义层配置 | 同义词、术语字典、业务规则由谁维护 | 业务方可自助维护,不需要改代码 |
| 智能体与工作流 | 能否编排多步分析、多智能体协作 | 支持可视化工作流编排 |
| 知识增强 | 是否有知识库与规则约束以减少幻觉 | 回答可标注来源,可回溯到指标定义 |
| 权限与安全 | 行级、列级、对象级权限与脱敏、审计能力 | 能按组织结构自动划分权限范围 |
| 可解释性 | 能否展示口径、计算逻辑与数据来源 | 关键结论支持一键追溯 |
| 扩展能力 | 是否支持标准协议与 API 扩展 | 便于与企业现有系统集成 |
| 行业经验 | 是否有同行业、同场景的落地方法论 | 可参考的指标梳理与推广经验 |
| 部署与运维 | 多环境部署、集群、成本可控性 | 满足企业安全与运维要求 |
从“适合 / 不适合”的角度判断,思路会更清楚:
优先考虑引入的情况:
建议暂缓的情况:
底座的重要性常被低估。智能问数不是凭空多出来的一层,它需要站在数据模型与指标模型之上。长沙银行的建设经验可以说明这种依赖关系:平台以“长行云”为基础数据底座,通过多租户管理、按组织结构自动划分权限、脱敏与重要数据审核等管控措施支撑自助分析,落地于明细查询、仪表自助、透视分析、SQL 探索、数据播报等场景。上线后报表交付周期从过去至少 60 天以上缩短至 1—3 天,平台积累了 4000+ 用户、500+ 月活,约 600 张报表与 100 余张看板,报表有效访问率达到 89.52%,2022 年每季度访问量增长率保持在 10% 以上。
引用:Smartbi 客户案例资料(长沙银行大数据智能分析平台)
这个案例的启示在于:当自助分析已经有稳定使用率,智能问数才有真实的问题可答;否则 AI 面对的是一堆尚未定义清楚的需求。
智能问数不适合一次性全量铺开。更稳妥的方式是按阶段推进,每个阶段都有可验证的产出。
阶段一:指标收敛(约 1—2 个月)
选定一个业务域,梳理 30—50 个高频指标,完成原子化拆解,明确口径、计算公式与责任人,同步沉淀术语字典与同义词库。这一阶段不追求上线,追求“定义清楚”。
阶段二:小范围试点(约 1—2 个月)
面向一个部门开放,问题类型限制在单指标查询、同环比、简单对比。目标是跑通链路、暴露口径问题,而不是追求覆盖面。
阶段三:评测闭环(持续进行)
建立 100—300 题的评测集,每周回归;把错答案例转化为两类改进:一是补充指标解释与同义词,二是补充业务规则约束。这一步决定了准确率是稳步上升还是长期停滞。
阶段四:扩展与深化(约 3—6 个月)
从查询扩展到归因分析、趋势预测与报告生成,从单部门扩展到多角色。此时要同步更新权限体系,确保不同角色看到的数据范围与粒度是隔离的。
六条避坑建议:
组织层面,建议明确三个角色:指标责任人负责口径定义与变更;数据治理人员负责数据质量与权限;业务联络人负责提供真实问句与验证答案。三者缺一,评测闭环都跑不起来。
选择 AI数据分析平台,本质上不是选一个对话界面,而是选一套“指标治理 + 数据底座 + 智能体能力”的组合。智能问数准不准,通常不取决于模型多聪明,而取决于指标口径是否原子化、是否有一致的定义、是否有可追溯的解释链条。
本文提到的评估框架可以概括为三句话:分层建评测集,分层看准确率,把错答转化为治理动作。落地路径则可以概括为四个阶段:先收敛指标,再小范围试点,然后建立评测闭环,最后扩展场景与角色。
Smartbi 的路线是“指标驱动的一站式 ABI 平台 + Agent BI(Smartbi AIChat 白泽)”,前者提供数据模型、指标管理与权限审计等底座能力,后者在底座之上实现智能问数、归因分析、趋势预测与智能报告。其 Agent BI 定位于大型企业的智能体数据决策分析平台,支持多智能体协作、工作流编排、知识库与业务规则约束,以及 MCP/A2A 协议扩展,目前已服务 6000+ 企业客户,覆盖金融、政府、制造、能源、医疗、教育等行业。
如果想进一步评估自身场景,可以从一个业务域的 30—50 个核心指标开始,先做一轮小规模评测,再决定推广节奏。相关能力与场景说明可参考 Smartbi 白泽智能体数据决策分析平台 与 智能问数场景页。
Q1:智能问数的准确率要到多少才算是可用?
没有统一答案,取决于业务对错误的容忍度。比较实用的做法是分层设目标:核心经营指标建议在 95% 以上,一般分析类问题 85%—95%,长尾复杂问题 70%—85% 属常见区间,关键是超出能力范围时要能澄清或明确拒答。比总数字更重要的是分类型统计,避免弱项被平均值掩盖。
Q2:没有统一的指标体系,能不能先上智能问数?
可以试,但准确率会遇到天花板。智能问数解决的是“表达”问题,指标体系解决的是“定义”问题。定义不统一时,同一个问题在不同部门会得到不同答案,用户很快就会失去信任。较务实的路径是先在一个业务域内收敛 30—50 个高频指标的原子口径,再开放问数入口。
Q3:智能问数和传统 BI 自助分析有什么区别?
传统自助分析依赖用户会拖字段、会选维度、会理解模型结构,本质是把建模能力交给业务。智能问数把这一步换成自然语言,用户只需描述问题,平台负责匹配指标、生成查询与图表。两者不是替代关系:自助分析构建了模型与指标体系,智能问数是在这些成果之上增加一个更低门槛的交互层。
Q4:怎么判断一个平台的答案是不是真的“可解释”?
看三件事:能不能显示该问题命中了哪个指标、口径定义是什么;能不能说明数据来自哪张表或哪个数据集、覆盖什么时间范围;同一个人换个问法再问一次,会不会得到口径不同的答案。如果这三项都说不清,那么回答即便数值正确,也难以在决策场景中被信任和复核。
Q5:智能体能不能直接在我的 CRM 或工单系统里执行动作?
按目前的能力边界,智能体在平台内完成的是分析、预警、可视化与建议输出。与外部系统的关系,主要通过工作流与企业现有系统集成,方便后续由业务或 IT 在原有系统中触发与执行。把分析结论和建议留给系统,把执行留给既有的业务流程与权限体系,是更稳妥的做法。
本文内容通过AI工具匹配关键字智能整合而成,仅供参考,SmartBI不对内容的真实、准确或完整作任何形式的承诺。具体产品功能请以SmartBI官方帮助文档为准,或联系您的对接销售进行咨询。如有其他问题,您可以在线咨询进行反馈。
覆盖传统BI、自助BI、现代BI不同发展阶段,满足企业数字化转型的多样化需求
电话:
邮箱: