大于(上海)智能科技有限公司 logo 大于智能 DAYU 咨询电话 18601688206
首页 / 方法论笔记 / 为什么我们不给 AI 可见性打一个综合评分

为什么我们不给 AI 可见性打一个综合评分

很多同类工具会给你一个分数:AI 可见性 72 分、品牌影响力 8.4。我们不做这个。不是做不了 —— 加权求和是最容易写的代码 —— 而是它会把该暴露的问题盖住。

评分掩盖的第一件事:样本量

AI 的回答是概率性的。同一个问题问两次,答案可能不同。所以「有没有提到你」这个二值判断,在单次测量下几乎没有信息量。

我们只报原始命中率,形如「8 次中命中 3 次」。这个写法有点笨,但它把分母摊开了 —— 你一眼能看出这个结论建立在多少次测量上。

换成一个 37.5 分的评分,分母就消失了。8 次里中 3 次和 800 次里中 300 次,是完全不同强度的证据,但折算成分数一模一样。

怎么自查一份 AI 可见性报告

下面四种形态,不需要懂统计也能当场识破 —— 都是能用小学算术算出来的矛盾。拿到任何一份报告(包括我们出的),都建议往这几个地方看:

  • 分项全是 0,综合分却不为 0。 分项为零而总分非零,说明总分里掺了与实测无关的成分。
  • 百分比落在样本量算不出的位置上。 三个样本的可能取值只有 0%、33.3%、66.7%、100% 四个。如果报告给出 0.01% 这种数,它不是数出来的。先看分母,再看百分比 —— 两者对不上就要追问。
  • 没有历史数据却显示环比。 当天开始测的账号显示「较昨日 +3.2%」,没有昨日就不该有环比。
  • 指标从不显示零。 真实的零起点很常见 —— 我们给自己公司测品类词,八个 AI 全是零。一个从来不出现零的指标,通常是被设计成不出现零的。

这四条不是针对某个产品,是任何量化报告都适用的自查方法。我们把它写出来,也包括希望你用同样的标准查我们 —— 我们的报告里分母是摊开写的,可以直接对着算。

我们的三条测量纪律

对应上面这些坑,我们给自己定了三条硬规矩,写进服务说明里:

  • 样本不足不出结论。 测得太少就只报读数、不给判断,不用「趋势向好」这类话补位。
  • 无基线不显示环比。 没有上一轮同口径的数据,就不显示增减 —— 口径变了的两次测量之间,环比是没有意义的。
  • 被反爬拦截的请求单独标注、不计入分母。 抓取失败不等于没命中。混进分母里会系统性地压低命中率,而且这种误差是不可见的。

还有第四条是关于呈现的:不生造综合评分。所有对外数字都必须能回溯到某一次具体的测量。

代价是报告不好看

老实说这么做有代价。一个分数便于汇报,「本月 62 分,上月 55 分」听起来就是有进展。一堆「某问题 8 次中 3 次、另一问题 12 次中 0 次」不便于往 PPT 里塞。

但一个能自己解释的指标,客户才有可能自己复核。而只要客户能复核,我们就没有空间糊弄 —— 这个约束对双方都是好事。

如果确实需要一个汇总口径,可以由双方在项目开始时共同约定(比如「目标问题清单中命中率不低于三成的问题数占比」),写进合同当验收标准。区别在于:那是事先说清楚的口径,不是我们事后造的分数。

要点回顾

  • 只报「N 次中命中 M 次」,因为评分会让分母消失
  • 四条自查法:分项全零而总分非零、百分比与分母对不上、无历史却有环比、指标从不为零
  • 三条纪律:样本不足不出结论、无基线不显示环比、被拦截的请求不计入分母
  • 需要汇总口径就在签约前约定并写进验收标准,而不是事后造一个分数

依据:本文的自查方法为算术推导,任何人可自行验证;三条测量纪律与「N 次中命中 M 次」的输出格式,见我们探针脚本的实际输出与服务说明。文中不针对任何特定产品。

想知道你们公司现在的读数?

提 3 个你的客户实际会问的问题,我们在四个底座上各测一遍,把原始读数给你。