我们测量了4个品牌如何在ChatGPT和Gemini中出现——我们发现的数字
我们围绕一个所有品牌迟早都会问的问题展开工作:当有人向 ChatGPT、Gemini 或其他助手寻求推荐时,我的品牌会出现吗?
这不是一个修辞性问题。AI 助手已经在中介购买决策——选择能源供应商、保险公司、DIY 商店。而且,与 Google 不同,它们不会展示十条蓝色链接:它们会展示一个简短的名单,上面有名字,就这样。要么你在名单里,要么你在那个回答中不存在。
过去几个月,我们对四个不同行业的真实品牌进行了可见性审计——能源、保险、DIY 和营销机构。这篇文章就是能从这些数字中学到的东西:我们如何衡量、数据显示了什么,以及什么让我们感到意外(有些事,相当意外)。
Share of voice:在 AI 回答中真正重要的指标
我们衡量的核心指标是 share of voice(SoV):在模型生成的所有回答中,品牌在多少个回答里自发出现,没有任何赞助或在 prompt 中的诱导。
这是那个古老 SEO 问题(“我排在第几位?”)的 "answer engine" 版本,但有一个巨大差异:在 Google,你可能在第 2 页仍然获得点击。在 LLM 的回答中,不在名单里就是出局。
我们如何衡量(完整方法)
每次审计都始终遵循同样的设计:
- 每种语言 12 个问题,写法像一个真实消费者会问的那样(而不是像一个专家)
- 3 个不同的 AI 模型,通过 API 查询(我们使用 GPT-4o-mini、Llama 3.3 70B 和 Gemini 2.5 Flash,经由 OpenRouter)
- 每次审计 2 种语言(大多数情况下,欧洲葡萄牙语和巴西葡萄牙语)
- 计数:当一个回答文本中自发出现品牌名称时,该回答“包含品牌”;当回答带有排名名单时,我们还会记录品牌出现的平均位置
模板问题的真实示例({nicho} 会被细分领域替换):
</div>以及计数规则,并不神秘:
<div class="highlight js-code-highlight">```
<span class="c1"># share of voice = 品牌单独出现的回答所占比例
</span><span class="n">sov</span> <span class="o">=</span> <span class="n">respostas_com_mencao_espontanea</span> <span class="o">/</span> <span class="n">total_de_respostas</span>
4 份报告中的数字
共有 4 次审计、4 个行业,总共分析了 293 条 AI 回答。每份报告都将所分析品牌与该细分领域的竞争对手进行比较。
| 品牌(细分领域) | 品牌 Share of voice | 领先的竞争对手 | 差距 |
|---|---|---|---|
| Galp(能源) | **22.1%**(68 条回答中的 15 条) | EDP — 35.3% | 13.2 个百分点 |
| Tranquilidade(保险) | **20.6%**(63 条中的 13 条) | Allianz — 77.8% | 57.2 个百分点 |
| Fullsix(营销机构) | **7.5%**(93 条中的 7 条) | VML — 23.7% | 16.2 个百分点 |
| Leroy Merlin(DIY/家居建材) | **81.2%**(69 条中的 56 条) | —(领先者;AKI 以 49.3% 位居第 2) | — |
在 pt-PT + pt-BR 的三次审计中(Galp、Tranquilidade、Leroy Merlin),方法论完全一致:12 个问题 × 3 个模型 × 2 种语言。Fullsix 则运行了 4 个模型,语言为 pt-PT + 英语,属于 6 月的一批(另外三个是 9 月的)。
结果中令人意外的地方
1. 同一品牌在你切换语言后消失了
这是最强的发现。看同一对品牌,相同的细分领域,只是改变提问的语言:
| 品牌 | pt-PT | pt-BR |
|---|---|---|
| Galp | 42,4% | **2,9%** |
| Tranquilidade | 40,6% | **0,0%**(31 个回答中 0 次) |
| Leroy Merlin | 82,4% | 80,0% |
| Fullsix | 2,2%(pt-PT) | 以英语测试:12,8% |
相比之下,Leroy Merlin 在两种语言中都稳定在约 80%。也就是说:问题不在于抽象的“葡萄牙语”——而在于每个市场中关于该品牌的结构化内容密度。AI 模型继承的是每种语言的网络对你的说法。如果你的目标市场是巴西,而你只在葡萄牙语来源中建立了存在感,那么在 LLM 看来,你在那里没有历史。
2. 被提及还不够——平均排名才重要
仅仅记录“品牌出现了”只揭示了一半的真相。当它出现时,在列表中的什么位置?
- Leroy Merlin:在推荐列表中平均排名 1.7(几乎总是出现,而且几乎总是排第一)
- Galp:平均排名 4.7
- Tranquilidade:平均排名 6.6
- Fullsix:平均排名 12.7
一个拥有 20% 声量份额但平均排名 6.6 的品牌,实际上是在争夺剩余的注意力。在移动端消费场景中,答案简短,很少有人会展开列表。Position, not just presence。
3. AI 眼中的“市场领导者”可能并非你所想
在建材领域,Leroy Merlin 占 81.2%,而其竞争对手 Bricomarché 和 Bricodepot 为 0.0%——在 69 条回答中字面意义上是零提及。而在我们的数据中,争夺第二名的是 AKI(49.3%)。
在保险领域,AI 的领奖台是 Allianz(77.8%)、Fidelidade(44.4%)、Zurich(34.9%)。在能源领域:EDP(35.3%)、Iberdrola(33.8%)、Endesa(23.5%)、Galp(22.1%)、Repsol(4.4%)。
关键在于:模型衡量的不是真实市场份额——而是它所吸收内容中提及的一致性。一个品牌可以在现实中很强,但在 LLM 中很弱(Galp 在 pt-BR 中正是这种情况)。谁不在模型所读取的渠道(权威网站、对比文章、目录、新闻媒体)中持续产出文本存在感,谁就会被排除在列表之外,即便它在离线世界是领导者。
4. 对于代理商市场,英语比葡萄牙语回报更高
Fullsix 出现在 12.8% 的英语回答中,而 pt-PT 仅为 2.2%(46 条回答中仅 1 次提及)。这很合理:关于营销代理商的全球内容主要以英语存在(国际排名、奖项、目录)。这提醒我们,“GEO”不仅仅是翻译你的内容——而是要理解你所在行业的来源生态系统在哪种语言中更为密集,并确保你的提及存在于那里。
5. Share of voice 只在同一基准内才可比较
一条由测量得出的教训,后来变成了内部规则:SoV 并不是一个普适的绝对数字——它取决于问题集合、模型以及语言组合。采用不同基准的两次测量彼此之间不可比较;真正重要的变化,是同一品牌与自身对比、重复使用同一基准随时间产生的 delta。这与任何实验的原则相同:固定协议,测量变化。
如何利用这些数字(可执行的部分)
每份报告中最有用的不是那个汇总数字——而是品牌没有出现的那些问题清单。它实际上就是一份按真实需求排好优先级的内容路线图。我们基于这些数据推荐的做法是:
- 找出你缺席的那些 query,并针对每一个直接产出能回答它的内容(不要泛泛而谈:把确切的问题作为标题/H2,能起到语义锚点的作用)。
- 发布到模型会看的地方:自有技术博客、行业媒体、目录站、第三方对比评测。LLM 倾向于引用提及密度稳定的来源——稀疏的存在无法累积。
- 把语言当作独立渠道。 如果你在(或想在)不止一个市场运营,每种语言都需要单独构建自己的存在感。Tranquilidade 的案例(在 pt-BR 中为 0%)无法靠翻译解决——它靠的是存在关于该品牌的巴西葡萄牙语内容。
- 衡量平均排名,而不只是是否被提及。 即使 share of voice 不变,从第 6 位升到第 3 位也会改变局面。
- 每月重复同一基准。 SoV 是一条时间序列,而不是一张快照。
Nenhum desses passos exige orçamento de mídia. Exigem método — e uma régua.
这些步骤都不需要媒体预算。它们需要的是方法——以及一把尺子。
Fechando
收尾
A pergunta "minha marca aparece no ChatGPT?" é respondível com dados, não com achismo. E os dados, quando você olha, costumam doer um pouco: três das quatro marcas medidas aparecem em menos de 1 resposta em 4 — e a web que os modelos leem em cada idioma é bem menor do que a que existe.
“我的品牌会出现在 ChatGPT 里吗?”这个问题可以用数据回答,而不是靠臆测。而当你去看数据时,往往会有那么一点扎心:被测的四个品牌中有三个,出现在不到四分之一(1/4)的回答里——而且模型在每种语言中读取到的网络内容,比实际存在的要小得多。
Foi para esse tipo de medição que construímos o GEO Tracker: ele roda as perguntas contra os modelos, calcula share of voice vs. concorrentes por idioma e devolve a lista de oportunidades (existe um teste gratuito de 3 perguntas, e os relatórios completos custam €49 no plano Essencial e €99 no Completo, com breakdown por concorrente — menciono porque alguém vai perguntar, não é o foco do post).
正是为了这类测量,我们构建了 GEO Tracker:它把问题跑给各个模型,按语言计算相对竞争对手的 share of voice,并给出机会清单(有 3 个问题的免费试用,完整报告在 Essencial 套餐为 €49、在 Completo 套餐为 €99,并包含按竞争对手的拆分——我提一句是因为总会有人问,这不是本文的重点)。
Se você medir a sua marca — com o nosso produto, com um script próprio ou num notebook à mão — o conselho é um só: estabeleça o benchmark, rode, e trate o número como linha de base. A partir daí, qualquer melhoria de presença vira dado, não opinião.
如果你要测量自己的品牌——用我们的产品、用自己的脚本,或者在随手打开的一个 notebook 里——建议只有一个:先确立基准(benchmark),跑起来,并把这个数字当作基线。从那时起,任何曝光度的提升都会变成数据,而不是看法。
为品牌在AI搜索时代的可见性提供了可量化框架,适合出海、多语言市场及依赖AI推荐的行业,提醒企业将GEO纳入日常监测与内容路线图。