GEO 可见度判定助手刚上线时,能回答的问题很单一:把一条 ChatGPT 或 Perplexity 的回答粘进来,告诉你这一条里,品牌有没有被提及、排第几、有没有被引用。

用了一段时间后,一个新问题冒出来了:测得越多,越不知道该怎么看这堆结果。

10 条记录里,3 条提到了,7 条没提到,这算好还是不好?某个引擎总是不提,是巧合还是真的有问题?光靠翻测试记录表,答不出来。所以这次升级加了四个板块,核心思路是把工具从"查一次"变成"能持续用来做判断"。


一、汇总记分卡:把单条结果变成有统计意义的结论

单条判定只能说"这一次出现了",汇总记分卡回答的是"整体表现怎么样":可见率、被引率、检索命中率、SOV(按记录是否出现计 1,不按提及次数,避免一条啰嗦回答刷高份额)、自家与竞品的出现率对比、平均位次、按引擎拆开看的覆盖矩阵。

有个细节是刻意设计的:样本量不足 5 条,或者单个引擎不足 3 条时,卡片会显示"样本不足",而不是硬算一个百分比给你。1 条记录里出现了 1 次,不该被读成"可见率 100%"。这种情况下宁可不给结论,也不给一个会误导决策的假结论。


二、行动建议:告诉你问题出在哪一层,不是只报个分数

记分卡说清楚了"现状如何",但更常被问到的是"那我该做什么"。行动建议板块按结果分布自动匹配诊断,目前有 9 条规则,覆盖这几类典型情况:

  • 样本不足:先去测试计划矩阵把问题和引擎补够,再看结论
  • 可能是可抓取性问题:一半以上测试里 AI 既没提到你、检索层也很少命中,大概率不是内容不行,是 AI 压根没找到你,会指向 robots.txt / llms.txt / IndexNow 这类地基问题
  • 被抓到了但没被采信:AI 检索到了页面,却没把内容用进正文,多半是内容不是"答案优先"的写法
  • 被引用了但品牌名没进正文:官网链接被当来源用了,但用户读回答时未必注意到你是谁
  • 提到了但排得靠后:品牌确实出现,但平均位置偏后
  • 某个引擎明显掉队:整体表现和某个引擎差距很大,说明这个引擎的主要信息源里你没铺到
  • 竞品占了你的位置:有竞品出现率比你高,该去查它是从哪些渠道被引用的
  • 判不出引用层:「无引用数据」占比高,通常是复制方式漏了来源信息,不是 AI 真的没引用
  • 表现健康:大部分测试都被提及,提醒你继续做周期性监测,AI 推荐本身有天然波动

每条建议都配了具体动作和对应的站内打法文章链接,不是甩给你一个"再优化一下内容"就完事。


三、引用来源情报:AI 到底在从哪抄答案

这一块单独拎出来,是因为它回答的是一个跟"我怎么样"完全不同的问题:AI 在这个话题上,实际引用的是哪些网站?

工具会把所有测试记录里出现过的第三方域名汇总、按命中次数排序,并标出"品牌官网 / 竞品官网 / 第三方渠道"。默认只看第三方渠道,因为这份清单本质上就是一份"该去铺内容的渠道列表"。如果某个评测网站或社区经常被 AI 引用来回答你这个赛道的问题,那就是值得优先争取露出的地方。


四、测试计划矩阵:让"测了多少"变成可控的事

前面三个板块都依赖一个前提:样本量够。但手动一条条测很容易漏,也不知道自己到底测全了没有。

测试计划矩阵解决的就是这个问题:把客户可能会问的问题列成清单,工具自动生成"问题 × 引擎"的矩阵,点还没测过的格子会直接预填好问题和引擎、跳到测试步骤。凑够样本量、覆盖主力引擎之后,前面三个板块给出的结论才站得住。


五、顺带解决的两个老问题

测试记录以前是刷新就没了,现在改成本地持久化(localStorage,跨会话累积,上限 200 条),关掉浏览器再回来,之前的记录还在,记分卡才有可能积累出有意义的样本。

记分卡下面还藏了一个"优化前 / 优化后对比":按时间点把记录分成两段,同时跑两次统计并排显示。改完内容、修完 robots.txt 之后,能直接看到可见率和 SOV 有没有真的变化,而不是凭感觉说"应该有效果"。


六、合起来看,这次升级在解决什么

单条判定回答"有没有",这次升级加的四个板块,实际是在把它拼成一个完整的闭环:测试计划矩阵保证测得够、测得全 → 汇总记分卡告诉你现状统计上站不站得住 → 行动建议告诉你该往哪使劲 → 引用来源情报告诉你具体去哪铺内容。改完之后,用"优化前/优化后对比"验证有没有效果,再回到测试计划矩阵开始下一轮。

工具本身还是那个免费、纯本地、不联网的GEO 可见度判定助手,只是现在测的每一条记录,都能沉淀成看得懂、用得上的结论。