- 测试AI可见度的核心工具是一个固定问题库,通常 30~50 个问题,覆盖买家从了解到采购的各阶段。
- 每个问题要在同一平台多次提问,因为AI回答有随机性,单次结果不能代表常态。
- 记录项至少包括:是否提及、在名单中的位置、描述是否准确、引用了哪些来源。
- 问题库一旦确定就尽量不改,这样每月的数据才可以前后对比。
测试品牌在 AI 中的可见度,最可靠的方法是建一个固定的问题库:整理 30~50 个海外买家真实会问的问题,按统一规则在 ChatGPT、Perplexity、Gemini 等平台提问,记录你是否被提到、排在第几、描述是否准确,然后每月复测一次对比。
随便问几句然后截图,是最常见也最不可靠的做法。AI 的回答有随机性,同一个问题问三次可能得到三份不同的名单。只有固定问题、固定方法、多次取样,结果才有参考价值。
第一步:搭建问题库
问题要站在买家角度写,用英文(或目标市场语言),覆盖以下几类:
| 问题类型 | 示例(中文示意,实际用英文提问) | 建议数量 |
|---|---|---|
| 供应商推荐 | 中国有哪些可靠的铝型材制造商? | 10~15 |
| 细分需求 | 哪些工厂能做小批量定制的阳极氧化铝型材? | 8~12 |
| 选型比较 | 6063 和 6061 铝合金型材分别适合什么用途? | 5~10 |
| 品牌直接询问 | 某某公司是做什么的?可靠吗? | 3~5 |
| 竞品对比 | 某某公司和某某公司相比怎么样? | 3~5 |
问题从哪里来
- 业务员整理的客户询盘原话,这是最好的来源。
- 谷歌搜索控制台里带疑问词的搜索查询。
- 展会上买家常问的问题。
- Reddit、Quora 上的行业讨论帖标题。
第二步:定好提问规则
- 用全新对话:每个问题开一个新对话,避免前文影响。
- 关闭个性化记忆:如果平台有记忆功能,测试账号要关掉,否则 AI 可能因为你以前问过而偏向你。
- 每题问三次:记录三次中出现几次,比单次结果可靠得多。
- 记录日期和平台版本:平台模型更新会影响结果,注明日期便于解释波动。
- 原样提问:不要临时改措辞,问题库里怎么写就怎么问。
第三步:记录这些字段
- 是否提及你(三次中几次)
- 在名单中的位置
- 描述是否准确:公司类型、主营产品、所在地、规模有没有说错
- 同时被提及的竞争对手
- 引用来源(Perplexity 和谷歌AI概览会列出,ChatGPT 联网时也会显示)
引用来源这一列特别有用:它告诉你 AI 从哪里了解这个行业,你就知道该去哪些网站争取被收录或提及。这部分可以参考第三方信源建设。
没有固定问题库的AI测试只是“看看”,有了问题库才是“测量”。
第四步:计算提及率并定期复测
提及率的简单算法:被提及的次数除以总提问次数。比如 40 个问题每题问 3 次,共 120 次,其中 18 次提到你,提及率就是 15%。这个数字本身没有好坏标准,重要的是它随时间的变化,以及和主要竞争对手的差距。
建议每月测一次。问题库确定后尽量不改;确实要加问题,就单独标记,不要混进历史对比里。具体怎么看这些数据,见GEO效果怎么衡量。
常见误区
- 只问品牌名——“某某公司怎么样”能测描述准确度,但测不出你是否会被推荐。
- 用中文问面向海外买家的问题——结果和英文提问差别很大。
- 看到一次没提到就认定“没效果”——要看多次取样的平均值。
- 用公司内部常用的叫法提问——买家不会用你们的内部型号名,要用他们的说法。
测试记录表怎么设计
建议用一张电子表格,每行是一次提问,列设计如下:
| 列名 | 填写内容 |
|---|---|
| 日期 | 测试当天日期 |
| 平台 | ChatGPT、Perplexity、Gemini 等 |
| 问题编号 | 对应问题库中的固定编号 |
| 第几次 | 1、2、3 |
| 是否提及 | 是或否 |
| 位置 | 名单中的第几位,未提及留空 |
| 描述是否准确 | 准确、部分错误、错误,并备注错在哪里 |
| 竞争对手 | 同时出现的其他企业名 |
| 引用来源 | 回答列出的网址 |
每次测试保存回答截图或全文,作为原始记录。几个月后回看,你能清楚看到 AI 对你的描述是怎么变化的。
工作量估算
以 40 个问题、3 个平台、每题 3 次计算,一轮是 360 次提问。熟练后一个人大约需要两到三个工作日。如果工作量太大,可以先把每题次数降为 2 次,或者先只测两个平台。
测完第一轮之后看什么
第一轮结果出来后,不必急着和别人比数字,先回答这几个问题:
- 哪些问题类型完全没有提到你?是推荐类、细分需求类还是选型类?
- 哪个平台对你最“陌生”?是否和该平台爬虫能否访问你的网站有关?
- AI 对你的描述里,有没有明显的事实错误?
- 经常和你同时出现、或者代替你出现的是哪几家企业?它们在哪些引用来源里出现?
这几个答案,基本就决定了接下来三个月的工作重点:描述有错先修信息,平台陌生先查抓取,推荐缺席先补信源。
另外,测试结果最好在公司内部共享。业务员看到 AI 如何描述自家公司和竞争对手,往往能补充很多市场人员不知道的细节,比如某个竞争对手最近在哪个展会很活跃、某个说法是客户常有的误解。这些信息会反过来帮你完善问题库和内容计划。
下一步
先从业务员那里收集 20 个客户原话,翻成英文,就是问题库的第一版。测完第一轮,你就有了基准线。如果需要一个现成的问题库模板和测试表格,可以联系我们索取。
常见问题
问题库需要多少个问题才够?
一般 30~50 个比较合适。太少容易被随机波动影响,太多则每月测试工作量过大。细分产品线多的企业可以按产品线各建一组。
有没有工具可以自动测试?
市面上有一些自动化监测工具,可以批量提问和记录。但建议先手动测一两轮,理解AI回答的规律后再决定是否用工具,避免只看数字不看内容。
为什么同一个问题每次答案不同?
大模型生成回答有一定随机性,联网检索的结果也会变化。所以要每题多问几次,看出现的频率,而不是看某一次的结果。
