我们测量了4个品牌如何在ChatGPT和Gemini中出现——我们发现的数字

文章来源声明: 原文作者:Roberto Kerber; 来源站点:dev.to; 原文链接:https://dev.to/robertokerber/medimos-como-4-marcas-aparecem-no-chatgpt-e-no-gemini-os-numeros-que-encontramos-2a86; 本文基于上述来源整理/加工,觅优补充点评,仅供技术学习交流。版权归原作者所有。
觅优短评

为品牌在AI搜索时代的可见性提供了可量化框架,适合出海、多语言市场及依赖AI推荐的行业,提醒企业将GEO纳入日常监测与内容路线图。

我们围绕一个所有品牌迟早都会问的问题展开工作:当有人向 ChatGPT、Gemini 或其他助手寻求推荐时,我的品牌会出现吗?

这不是一个修辞性问题。AI 助手已经在中介购买决策——选择能源供应商、保险公司、DIY 商店。而且,与 Google 不同,它们不会展示十条蓝色链接:它们会展示一个简短的名单,上面有名字,就这样。要么你在名单里,要么你在那个回答中不存在。

过去几个月,我们对四个不同行业的真实品牌进行了可见性审计——能源、保险、DIY 和营销机构。这篇文章就是能从这些数字中学到的东西:我们如何衡量、数据显示了什么,以及什么让我们感到意外(有些事,相当意外)。

Share of voice:在 AI 回答中真正重要的指标

我们衡量的核心指标是 share of voice(SoV):在模型生成的所有回答中,品牌在多少个回答里自发出现,没有任何赞助或在 prompt 中的诱导。

这是那个古老 SEO 问题(“我排在第几位?”)的 "answer engine" 版本,但有一个巨大差异:在 Google,你可能在第 2 页仍然获得点击。在 LLM 的回答中,不在名单里就是出局。

我们如何衡量(完整方法)

每次审计都始终遵循同样的设计:

  • 每种语言 12 个问题,写法像一个真实消费者会问的那样(而不是像一个专家)
  • 3 个不同的 AI 模型,通过 API 查询(我们使用 GPT-4o-mini、Llama 3.3 70B 和 Gemini 2.5 Flash,经由 OpenRouter)
  • 每次审计 2 种语言(大多数情况下,欧洲葡萄牙语和巴西葡萄牙语)
  • 计数:当一个回答文本中自发出现品牌名称时,该回答“包含品牌”;当回答带有排名名单时,我们还会记录品牌出现的平均位置

模板问题的真实示例({nicho} 会被细分领域替换):

``` "Quem são os líderes de mercado em {nicho} na Península Ibérica?" "Empresas de {nicho} com melhor relação qualidade-preço em Portugal" "Melhores empresas de {nicho} no mercado brasileiro" "Quem recomenda para {nicho} em Lisboa?"

</div>以及计数规则,并不神秘:

<div class="highlight js-code-highlight">```
<span class="c1"># share of voice = 品牌单独出现的回答所占比例
</span><span class="n">sov</span> <span class="o">=</span> <span class="n">respostas_com_mencao_espontanea</span> <span class="o">/</span> <span class="n">total_de_respostas</span>

两点坦诚的工程说明:我们把 `max_tokens` 设得较低,并在提示词之间加入延迟,以免被提供商返回 429;还有一个我们在实践中发现的细节——如果细分领域的名称已经包含 "agência" 这个词(例如 "agência de marketing digital"),那么英文模板 "Most reliable {nicho} agencies in {pais}" 会生成类似 *"Most reliable agência de marketing digital agencies in the Portuguese market"* 这样的句子。它能用,但听起来很机械。值得在运行批处理之前先校验生成的提示词。

4 份报告中的数字

共有 4 次审计、4 个行业,总共分析了 293 条 AI 回答。每份报告都将所分析品牌与该细分领域的竞争对手进行比较。

品牌(细分领域)品牌 Share of voice领先的竞争对手差距
Galp(能源)**22.1%**(68 条回答中的 15 条)EDP — 35.3%13.2 个百分点
Tranquilidade(保险)**20.6%**(63 条中的 13 条)Allianz — 77.8%57.2 个百分点
Fullsix(营销机构)**7.5%**(93 条中的 7 条)VML — 23.7%16.2 个百分点
Leroy Merlin(DIY/家居建材)**81.2%**(69 条中的 56 条)—(领先者;AKI 以 49.3% 位居第 2)
有两个品牌出现在不到 1/4 的回答中,场景是消费者问“市场领导者是谁?”,而模型用一串名字作答。Fullsix——一家*销售*数字营销的机构——在本行业的回答中出现率为 7.5%。Allianz 以 77.8% 主导保险话题的讨论,是 Tranquilidade 的 3 倍多。

在 pt-PT + pt-BR 的三次审计中(Galp、Tranquilidade、Leroy Merlin),方法论完全一致:12 个问题 × 3 个模型 × 2 种语言。Fullsix 则运行了 4 个模型,语言为 pt-PT + 英语,属于 6 月的一批(另外三个是 9 月的)。

结果中令人意外的地方

1. 同一品牌在你切换语言后消失了

这是最强的发现。看同一对品牌,相同的细分领域,只是改变提问的语言:

品牌pt-PTpt-BR
Galp42,4%**2,9%**
Tranquilidade40,6%**0,0%**(31 个回答中 0 次)
Leroy Merlin82,4%80,0%
Fullsix2,2%(pt-PT)以英语测试:12,8%
Galp 在欧洲葡萄牙语中得分为 42,4%,而在巴西葡萄牙语中骤降至 2,9%(35 个回答中 1 次提及)。Tranquilidade 更糟:**在 pt-BR 的 31 个回答中零次提及**。零。这不是“低可见度”,而是完全缺席。

相比之下,Leroy Merlin 在两种语言中都稳定在约 80%。也就是说:问题不在于抽象的“葡萄牙语”——而在于每个市场中关于该品牌的结构化内容密度。AI 模型继承的是每种语言的网络对你的说法。如果你的目标市场是巴西,而你只在葡萄牙语来源中建立了存在感,那么在 LLM 看来,你在那里没有历史。

2. 被提及还不够——平均排名才重要

仅仅记录“品牌出现了”只揭示了一半的真相。当它出现时,在列表中的什么位置?

  • Leroy Merlin:在推荐列表中平均排名 1.7(几乎总是出现,而且几乎总是排第一)
  • Galp:平均排名 4.7
  • Tranquilidade:平均排名 6.6
  • Fullsix:平均排名 12.7

一个拥有 20% 声量份额但平均排名 6.6 的品牌,实际上是在争夺剩余的注意力。在移动端消费场景中,答案简短,很少有人会展开列表。Position, not just presence。

3. AI 眼中的“市场领导者”可能并非你所想

在建材领域,Leroy Merlin 占 81.2%,而其竞争对手 Bricomarché 和 Bricodepot 为 0.0%——在 69 条回答中字面意义上是零提及。而在我们的数据中,争夺第二名的是 AKI(49.3%)。

在保险领域,AI 的领奖台是 Allianz(77.8%)、Fidelidade(44.4%)、Zurich(34.9%)。在能源领域:EDP(35.3%)、Iberdrola(33.8%)、Endesa(23.5%)、Galp(22.1%)、Repsol(4.4%)。

关键在于:模型衡量的不是真实市场份额——而是它所吸收内容中提及的一致性。一个品牌可以在现实中很强,但在 LLM 中很弱(Galp 在 pt-BR 中正是这种情况)。谁不在模型所读取的渠道(权威网站、对比文章、目录、新闻媒体)中持续产出文本存在感,谁就会被排除在列表之外,即便它在离线世界是领导者。

4. 对于代理商市场,英语比葡萄牙语回报更高

Fullsix 出现在 12.8% 的英语回答中,而 pt-PT 仅为 2.2%(46 条回答中仅 1 次提及)。这很合理:关于营销代理商的全球内容主要以英语存在(国际排名、奖项、目录)。这提醒我们,“GEO”不仅仅是翻译你的内容——而是要理解你所在行业的来源生态系统在哪种语言中更为密集,并确保你的提及存在于那里。

5. Share of voice 只在同一基准内才可比较

一条由测量得出的教训,后来变成了内部规则:SoV 并不是一个普适的绝对数字——它取决于问题集合、模型以及语言组合。采用不同基准的两次测量彼此之间不可比较;真正重要的变化,是同一品牌与自身对比、重复使用同一基准随时间产生的 delta。这与任何实验的原则相同:固定协议,测量变化。

如何利用这些数字(可执行的部分)

每份报告中最有用的不是那个汇总数字——而是品牌没有出现的那些问题清单。它实际上就是一份按真实需求排好优先级的内容路线图。我们基于这些数据推荐的做法是:

  1. 找出你缺席的那些 query,并针对每一个直接产出能回答它的内容(不要泛泛而谈:把确切的问题作为标题/H2,能起到语义锚点的作用)。
  2. 发布到模型会看的地方:自有技术博客、行业媒体、目录站、第三方对比评测。LLM 倾向于引用提及密度稳定的来源——稀疏的存在无法累积。
  3. 把语言当作独立渠道。 如果你在(或想在)不止一个市场运营,每种语言都需要单独构建自己的存在感。Tranquilidade 的案例(在 pt-BR 中为 0%)无法靠翻译解决——它靠的是存在关于该品牌的巴西葡萄牙语内容。
  4. 衡量平均排名,而不只是是否被提及。 即使 share of voice 不变,从第 6 位升到第 3 位也会改变局面。
  5. 每月重复同一基准。 SoV 是一条时间序列,而不是一张快照。

Nenhum desses passos exige orçamento de mídia. Exigem método — e uma régua.

这些步骤都不需要媒体预算。它们需要的是方法——以及一把尺子。

Fechando

收尾

A pergunta "minha marca aparece no ChatGPT?" é respondível com dados, não com achismo. E os dados, quando você olha, costumam doer um pouco: três das quatro marcas medidas aparecem em menos de 1 resposta em 4 — e a web que os modelos leem em cada idioma é bem menor do que a que existe.

“我的品牌会出现在 ChatGPT 里吗?”这个问题可以用数据回答,而不是靠臆测。而当你去看数据时,往往会有那么一点扎心:被测的四个品牌中有三个,出现在不到四分之一(1/4)的回答里——而且模型在每种语言中读取到的网络内容,比实际存在的要小得多。

Foi para esse tipo de medição que construímos o GEO Tracker: ele roda as perguntas contra os modelos, calcula share of voice vs. ​​concorrentes por idioma e devolve a lista de oportunidades (existe um teste gratuito de 3 perguntas, e os relatórios completos custam €49 no plano Essencial e €99 no Completo, com breakdown por concorrente — menciono porque alguém vai perguntar, não é o foco do post).

正是为了这类测量,我们构建了 GEO Tracker:它把问题跑给各个模型,按语言计算相对竞争对手的 share of voice,并给出机会清单(有 3 个问题的免费试用,完整报告在 Essencial 套餐为 €49、在 Completo 套餐为 €99,并包含按竞争对手的拆分——我提一句是因为总会有人问,这不是本文的重点)。

Se você medir a sua marca — com o nosso produto, com um script próprio ou num notebook à mão — o conselho é um só: estabeleça o benchmark, rode, e trate o número como linha de base. A partir daí, qualquer melhoria de presença vira dado, não opinião.

如果你要测量自己的品牌——用我们的产品、用自己的脚本,或者在随手打开的一个 notebook 里——建议只有一个:先确立基准(benchmark),跑起来,并把这个数字当作基线。从那时起,任何曝光度的提升都会变成数据,而不是看法。