品牌AI可见度工具测的数不准:同一品牌,三家工具给出三个数

摘要:同一家品牌、同一批问题、同一段时间,三家主流工具能给出三个不同的数。这篇说清楚这个分数为什么不能当考核依据,它哪两类用途还能用,以及一个下午能做完的三步自检。
先给结论:现在市面上那些品牌 AI 可见度监测工具,报出来的分数不能拿去考核。
这不是唱反调。工信部上个月底刚启动 AI 应用服务商培育专项行动,7 月 1 日国内首部 GEO 团体标准 T/CGCC 119-2026 已经实施两个多月,8 月 20 号 AISS2026 全球 AI 搜索峰会上,央视网、宝洁、知乎、36 氪坐在一起反复念叨”可验证”三个字。行业正在从”谁先做”转向”谁更可信、更可验证”。
方向没问题。尴尬的是,现在给品牌打 AI 可见度分的那些工具,自己就经不起”验证”这一关。
这篇就干一件事:把分数不准的原因讲清楚,告诉你它哪两类用途还塌不了,以及如果你老板非要一个数字,怎么用半天时间自己验一遍。
同一品牌,三家工具给出三个数
行业里跑得最多的是 Profound、Peec、Otterly、AthenaHQ,加上国内一堆名字都差不多的”AI 可见度监测平台”。我手头有一个公开的实测样本,2026 年中旬有人在 30 天里用同一批 40 个提示词、同时跑 Profound、Otterly、Peec 三家工具。结果很直接:Profound 命中 22,Otterly 命中 19,Peec 报 24。
三个数,谁都没算错。它们把”被点名”、”被链接”、”被提到”三件不同的事叫成了同一个词,所以同一家品牌能给你三个答案。
这意味着一件事:你拿任何一家的截图去汇报,截图都是真的,但它只截了它自己定义的那种”真”。跨工具比数字这件事,从一开始就不成立。
这分数到底是怎么算出来的
主流做法是厂商自己建一批提示词,拿去问各个 AI,跑很多轮,统计你的品牌被提到多少次,除一下,得出一个百分比。听着挺科学,问题出在四个地方。
第一个坑在被测对象本身。Thinking Machines Lab 去年做过一个实验,他们把 Qwen 那个开源大模型用 temperature 设成 0(这个档位一般被认为”完全确定”),跑同一个 prompt 一千次。结果你猜怎样,出来 80 种不同答案。根因挺反直觉,不是模型自己”心情不好”,是 GPU 跑的批次大小在变,浮点运算顺序跟着变,最后放大成不同的 token。所以”AI 可见度”本质上是个概率分布,不是一个你能读到小数点的刻度。工具报给你的,永远只是一次抽样。
第二个坑是抽样量。多数工具每个 prompt 只跑 10 到 30 次。今天跑 30 次测出 34%,明天再跑 30 次可能是 28%,不是你掉了 6 个点,是噪声。每个 prompt 至少 60 到 100 次才开始收敛,但绝大多数工具不公开这个数,你根本不知道自己买的是几轮采样。
第三个坑在提示词库,它是厂商替你猜的。我见过一份工具的 prompt 库,里面塞着”XX 品牌好不好用”这种词。模型既然在问题里看到了你的名字,回答里当然会提你,这不算”AI 看见你”,这算”AI 复读你”。真正有意义的是非品牌词,比如”这个品类哪个牌子靠谱”,但很多工具的可见度分数里品牌词占比还不小。另外,名字撞通用词也是雷区,”光年”、”信号”、”Pulse”这类品牌名,工具的实体消歧没做好的话,别的话题里被提到的次数也会算到你头上。
第四个坑是口径,还夹带利益冲突。被提到算不算引用?带链接和不带链接算不算一回事?我的建议只有一条:又做监测又卖优化投放的供应商,报告里你的位置天然难看,他们的下游生意就是赚这个”难看”的钱。优先选只做监测、不接优化单的。
既然不准,那还能怎么用
别一杆子打死。绝对值不可信,但有两类用途是塌不了的:看 14 天以上的趋势方向,看 AI 到底在引你的哪些第三方页面。这两个动作不依赖绝对精度,够你做内容决策。
如果老板坚持要看一个数字,这周末花半天做三件事,能筛掉八成水分。
抽 10 到 15 条工具的 prompt,自己去豆包、DeepSeek、腾讯元宝手敲一遍对比结果。工具显示 55% 你手测 30%,这工具就别续费了。
强制把品牌词和非品牌词拆成两组看,只信后者那组。品牌被点名(”XX 好不好”)和被推荐(”哪家最好”)是两件事,混在一起就是自己骗自己。
要求每条数据能回溯到 AI 当时的回答原文 + 信源 URL。给不出原文存档的,等于没数据。一个没有原文的可见度分数,跟算命没区别。
国内这摊,躲开这两个坑
现在很多服务商在宣传”监测精准度 99.5%”。这个数字我每次看到都打个问号,因为行业根本没有公认的 ground truth 让你去比,99.5% 是没法被证伪的。看到这种精确到小数点的承诺,跟看到”年化 30% 无风险”一样,绕着走。
另一个坑上面提过了,这里再说一遍因为它最容易踩:既卖监测又卖优化服务的,两份钱都从你身上赚,报告里你的位置一定难看。选的时候先问一句”你们接不接优化单”,对方犹豫就换一家。
我自己在 GEO 体检里,宁愿让客户多看两周趋势,也不拿一个分数去拍胸脯。打开你的同行群、CMO 群,谁没聊过 AI 可见度这事?聊归聊,可信比”高”重要得多。
8 月 31 号新华网在 GEO 日报里提了那么一句:行业进入”依规运行”新阶段。规是有了,但打分的人还在用手里那把没校准的尺。这才是当下最拧巴的地方。
如果你最近正好在选 GEO 工具,或者已经在为某个 AI 可见度分数头疼,评论区聊一句你的实际用法,我挑几个有代表性的,下一篇接着拆。
(完)
主要参考
- 工信部 AI 应用服务商培育专项行动,2026 年 8 月底启动,GEO 日报(来源:新华网、凤凰网)
- 《商贸流通业生成式引擎优化(GEO)智能营销技术服务规范》T/CGCC 119-2026,2026 年 7 月 1 日实施
- AISS2026 全球 AI 搜索峰会,2026 年 8 月 20 日
- “On the Sources of Non-Determinism in LLM Inference”,Thinking Machines Lab Connectionism,2025 年 9 月(实验对象:Qwen 235B / DeepSeek 3.1,temperature=0,1000 次生成出现 80 种不同输出)
- “Profound vs Otterly.AI vs Peec AI: I Tracked 3 Brands Across ChatGPT, Perplexity, and AI Overviews for 30 Days”,designcopy.net,2026
