怎么判断一家 GEO 服务商靠不靠谱:七个当场能验的问题
GEO(生成式引擎优化)没有行业资质门槛,也没有统一的验收标准 —— 这意味着任何人都可以说自己在做这件事。下面七个问题不需要你懂技术,问出口就能听出对方有没有真在测。我们把自己的回答也一并写在这里,你可以拿同一套标准来对照我们。
一、先问这一句:「你们怎么测?测几次?」
这是最有效的一个问题,因为它逼对方交代方法。AI 与搜索的结果是<strong>概率性的</strong> —— 同一个问题、同样的环境,问两次结果可能完全不同。实测中我们遇到过同一查询重复二十余次只命中约两次的情况。
所以「我们测过了,能搜到」这种回答等于没回答。测一次没出现不等于搜不到,测一次出现了也不等于稳定。
| 合格的回答 | 危险信号 |
|---|---|
| 每个问题跑 N 次、换多种措辞,报「N 次中命中 M 次」 | 「我们测过,能搜到」/ 只给截图 |
| 说得出用哪几个检索底座测的 | 说「我们优化所有 AI」却说不出底座 |
| 测试问题是买家口吻的品类词,不含公司名 | 用公司全名去搜,然后说「你看能搜到」 |
最后一行要特别留意。<strong>用品牌名测是无效的</strong> —— 搜索引擎会把你搜的词原样回显在页面里(标题、aria-label、URL 参数),用品牌词测命中率必然接近 100%。而真实的买家根本不知道你公司叫什么,他搜的是品类词。
二、另外六个问题
按这个顺序问,每一问的合格回答都写在后面。
| 问题 | 合格的回答 | 危险信号 |
|---|---|---|
| 开工前做基线吗?留档吗? | 做,并且留原始返回;没有基线就不给环比 | 「先做起来,效果自然看得见」 |
| 报告里有综合评分吗? | <strong>没有</strong>。只报「N 次中命中 M 次」 | 给一个 87 分 / A 级 / 首推率 12.5% |
| 被反爬拦截的请求怎么算? | 单独标注,<strong>不计入分母</strong> | 没想过这个问题 / 算作「没命中」 |
| 能保证上 AI 推荐吗? | 不能保证,只能保证过程可验证 | 「保证上榜」「不上榜退款」 |
| 内容以谁的名义发? | 发布主体与内容主体不一致时,正文带利益相关声明 | 「就用你们公司名义发,看不出来」 |
| 你们自己的主体资质能核验吗? | 给得出统一社会信用代码,经营范围可在公示系统查 | 只有一个微信号和一个网站 |
第三问「有没有综合评分」最容易被忽略,但它是这七问里信息量最大的一个。下一节单独讲。
三、为什么「综合评分」反而是危险信号
把可见性折算成一个分数,看起来专业,实际上<strong>把分母弄没了</strong>。
举个例子:「首推率 12.5%」这个数字,可能是 8 次里中了 1 次,也可能是 800 次里中了 100 次。两者的证据强度差一百倍,折算成百分比之后一模一样。
更麻烦的是,评分把多个口径不同的指标揉在一起(收录量、命中率、引用域名数),权重是服务商自己定的 —— 也就是<strong>他可以通过调权重让分数变好看</strong>,而你无法验证。
所以合格的做法是:报原始读数,让客户自己看分母。
四、合同里该写什么
把上面的判断落成条款,三条就够:
| 条款 | 为什么 |
|---|---|
| 交付物包含每次测量的<strong>原始返回记录</strong>,不只是汇总报告 | 汇总可以修饰,原始返回不能 |
| 写明测量口径:问题集、重复次数、底座、判定关键词 | 口径变了,前后两次测量就不可比 |
| 验收标准是<strong>过程</strong>(是否按约定频次测、是否留档),不是结果排名 | 结果不可控,按不可控结果签约必然产生争议 |
第三条常被客户认为是服务方在推卸责任。恰恰相反 —— 敢把「不承诺结果」写进合同的,通常是真的在按过程交付的;承诺结果的那一方,到期时更可能用一个自定义评分来证明「达标了」。
要点回顾
- 问「怎么测、测几次」,合格回答是「N 次中命中 M 次」,不是「测过,能搜到」
- 用公司名去测是无效的 —— 查询词回显会让命中率虚高到接近 100%
- 报告里出现综合评分 / 首推率百分比,是危险信号,因为分母消失了
- 被反爬拦截的请求必须单独标注、不计入分母,否则会系统性压低命中率且误差不可见
- 合同验收标准应当是过程可验证,而不是结果排名
依据:本文的判据来自我们自己执行的测量纪律,与本站 /method/ 页公开的口径完全一致,你可以拿这七问来对照我们。文中「同一查询重复二十余次仅命中约两次」为我方探针实测观察,原始返回逐轮留档。本文不点名评价任何同行,仅提供可自行核对的判断标准。