技术 GEO 是怎样一种 GEO 技术?
你听说过 cats.txt 吗?
这是个英国 SEO Mark Williams-Cook 故意发明的”标准”。规则很简单:你新建一个文本文件,在里面用最正经的措辞描述你家养的几只猫——名字、品种、职位(是的,职位)、一个叫 PurrLevel 的”必要爱意指标”(满分 10 分),然后把它传到网站根目录。Mark 写了一篇正经的”规范说明”挂在博客上,又发了一篇 LinkedIn 文章介绍它是”SEO 和 GEO 的缺失标准”——当然,是用一张正经脸。
文件长这样:
# cats.txt — Standard for Declaring Cats
## Odd — Chief Mouse Catcher (Tuxedo)
Odd has worked in the role of chief mouse catcher for 5 years.
He is a Tuxedo cat, PurrLevel 9/10, known for his patience.
## Pixel — GUI Purrfectionist (British Shorthair)
Pixel oversees all UI testing on the couch.
PurrLevel 8/10.

Mark 不是在做猎奇。他是在做一组对照实验——用一个明显荒唐的”标准”,去测试 GEO 圈正在用来证明 llms.txt 有效的”证据标准”。
证明 llms.txt 有用的论调,通常是这四点:
- 大模型爬虫会爬它并且读里面的内容(access.log 里有记录)
- 它能被 Google 索引
- 大模型能回答里面描述的东西(读过并理解)
- ChatGPT 自己承认能帮助排名
但同样的四条验证,套在 cats.txt 上全部成立:
- 大模型爬虫会爬它——access.log 里有记录
- 它能被 Google 索引(Google 甚至会在 Search Console 里”邀请你认领”cats.txt 文件,给它一份”索引和排名数据”,脸上写满了正经)
- 大模型能回答里面描述的东西——LLM 能完整地告诉你一只只存在于这个文件里的 Tuxedo 猫 Odd 的职位、品种、PurrLevel
- ChatGPT 自己承认能帮助排名——ChatGPT 主动承认:”cats.txt 能帮 Odd 排到类似 Mr. Whiskers 相关的话题”。原因是:在所有”猫档案”这个话题里,只有 Mark 一人在写,ChatGPT 自然只能引用这一份猫档案。
“ChatGPT confirmed, at length, that cats.txt could help me rank. None of which is evidence of anything, which was rather the point.”
这就是马老师今天这篇技术 GEO 文章的入口——
这些被用来证明 llms.txt 有效的”证据”,只是任意一个 txt 文件都能做到的事。GEO 圈的”证据门槛”低到了这个程度,Mark 把它叫做 GEO astrology(GEO 占星术)。
而这还不是最糟的。Ahrefs 在 137K 域名上的实测数据显示,97% 的 llms.txt 文件根本没有任何 AI 爬虫请求过——连 cats.txt 那个”4 条证据都能成立”的对照实验都不成立。绝大多数 llms.txt 部署,等于在数字荒漠里放了一块告示牌,连路过的爬虫都没有。
在这样一片混乱里,真正决定 AI 能不能找到你、理解你、引用你的,是技术。是结构。是地基。
而绝大部分 GEO 从业者,并不打算跟你聊这些。
国内 GEO 圈正在流行的两种典型姿态
把时间往回拨十几年,SEO 圈经历过一模一样的事——内容农场。
当年做 SEO 不需要懂技术:雇一群写手,每天产出几百篇带有关键词的文章,往各种低质量站点群一推,等着搜索引擎把流量送上门。SEO 圈当时的主流声音是”内容为王,外链为皇”,但绝大多数人既不知道搜索引擎是怎么爬的,也不知道 PageRank 是怎么算的,只知道”做得越多越好”。结果呢?2010 年前后 Google 推出 Panda、Penguin 算法,把内容农场扫荡得七零八落——那些不懂技术的人一夜之间全被淘汰,留下的少数是那些早就建好内容架构、Schema 干净、用户体验扎实的网站。
今天的国内 GEO 圈,本质上是在重演 2010 年的 SEO 内容农场剧本。
只是把”搜索引擎”换成了”大模型”,把”关键词密度”换成了”信源覆盖”,把”批量发文章”换成了”批量发小红书”。剧本没变,演员变了。
观察这一两年的 GEO 市场,两种典型姿态在反复出现。它们看起来都”有些道理”,但都在同一个关键环节上自欺欺人。
姿态一:不懂技术,只说信源和发文章 + 只追短期效果
这一类是国内 GEO 圈最常见的声音,也是最有迷惑性的声音。
它的两种表现形态:
表现一:被动无知。 主张是”多做内容,多发文章,多覆盖信源,AI 自然会引用你”。这套话术的问题在于,它完全跳过了检索机制本身——AI 不是你写得多就引用你。AI 是先检索、再生成。你的内容再多,如果 RAG 系统在你的内容里检索不到你想要的那个事实,或者检索到了但抽取出的片段在余弦相似度上输给竞品,你的内容就是不存在。这是一种典型的SEO 思维惯性——把”内容数量”等同于”被检索概率”。SEO 时代关键词密度和外链数量确实有这种相关性。SEO 不是 GEO,但把 SEO 的方法直接套到 GEO 上是行不通的。
表现二:主动逐利。 主张是”按效果付费 GEO 服务”——盯着 LLM 当前的联网检索结果做 spamdexing,刷量,让品牌在 RAG 的检索结果里临时占个位置,但完全不在意品牌在下一轮模型权重里是否还有位置。这种模式马老师在之前的文章里已经批判过:本质是”短期 KPI 博弈”——供应商只需要在那几百个 prompts 中等待”下雨的一天”,而非努力”人工降雨”。久而久之,这变成一个 hamster wheel(仓鼠轮)——你跑得越快,离原地越近。
这两种表现虽然形态不同,但本质是同一种姿态:既不懂 RAG 怎么检索,也不在意下一次模型权重怎么算——只想在当前窗口里占个坑位。
姿态二:传播错误方法 + 跨平台幻觉
这一类是 2026 年最新、也是最会包装的一种姿态。它也有两种表现形态,但本质上都是“看起来在做 GEO,实际上在做无效动作”。
表现一:工具错——推 cats.txt / llms.txt 这种伪标准。
前文已经讲了 cats.txt 的故事。但更值得说的是 llms.txt——这是一个相对严肃的提案,被一些人当成”GEO 的标准方案”在兜售。问题在于,没有任何主流 LLM 正式承诺消费 llms.txt。 对 1000 个 Adobe Experience Manager 域名的 CDN 日志审计发现,LLM 专用机器人几乎从未请求过 llms.txt,而 Google 自己的抓取器占了文件获取的绝大多数。Ahrefs 的大规模数据进一步证实,97% 的 llms.txt 文件从未被任何 AI 爬虫请求过。
这意味着如果你的 GEO 团队给你提了”加一个 llms.txt 文件”的方案,他们要么没做过最基本的验证,要么在把一个 SEO 圈的旧路径当成新事物兜售给你。
表现二:渠道错——把小红书/抖音/公众号当 GEO 的”流量池”。
“GEO 应该是多平台的,你要去小红书、抖音、公众号铺内容,让品牌在所有 AI 训练语料里都有曝光。”
听起来很合理,对吧?
我们直接看一下小红书的 robots.txt (这个robots.txt文档写得很业余,但是说明问题):
User-agent: Googlebot
Disallow: /
Allow: /worldcup26
User-agent: Baiduspider
User-agent: BaiduSpider-ads
User-agent: bingbot
...
Disallow: /
Allow: /$
Allow: /explore
...
User-agent: *
Disallow: /
对所有 User-agent(包括 Googlebot、百度、Bing、所有 AI 爬虫),小红书默认 Disallow: /。连 Google 都基本进不去,只允许一个特别活动 /worldcup26。
抖音也是类似的路数。robots.txt 里显式列出 GPTBot、ClaudeBot、PerplexityBot、OAI-SearchBot 等所有 AI 爬虫的名字,但实际 Disallow: /follow Disallow: /user/?enter_from=* Disallow: *vid=* 等路径几乎把所有有内容价值的页面都禁掉了。注册了 bot,但不让 bot 抓。
微信公众号的 robots.txt 稍微”开放”一点——Allow: /$、Allow: /debug/、Allow: /qa/、Allow: /wiki——但核心的内容页面全部 Disallow: /。
这意味着什么?
你在小红书、抖音、公众号发的所有内容:
- 对其他非同体系的大模型训练阶段抓不到——这些 AI 爬虫被 robots.txt 拒绝,你的内容不会进入它们的下一轮预训练语料
- 对其他大模型联网检索时也抓不到——那些大模型所用的搜索工具在索引过程中同样被 robots.txt 拒绝
对其他大模型来说,等于零 GEO 价值。
但对关联的 LLM——比如字节系的豆包和抖音、腾讯系的元宝和公众号——它们可以帮助这些”自家兄弟”。 字节和腾讯对自己的内容生态有内部数据通道,不需要通过公开爬虫。所以你在这些平台发的内容,对豆包和元宝确实有间接价值(关联 LLM 可以优先调用自家生态的内容),但对 ChatGPT、Claude、Perplexity 这些外部 AI 完全没用。
如果你的目标受众主要用豆包或元宝,这种”跨平台铺内容”是合理的。如果你的目标受众中的部分群体用的是其他大模型,这套打法就完全跑偏了。
但即使对关联 LLM 有效,这些内容也只是关联 LLM 偏好的生态内容——不是真正的”权威信源”。GEO 的主战场,从来不在任何一个社交平台。GEO 的主战场在官网。遗憾的是企业做官网GEO需要捡起被荒废多年的资产,牵扯到多个部门,从立项到落地想想就头皮发麻,哪有发发文章来得直接干脆。对供应商来说更是如此,官网优化到交付在2026年不单挣不到钱,甚至可能倒贴,哪有发文章来钱快。这一点我们后面会详细讲。
这两种姿态有一个共同点:都默认 GEO 是单一战场的游戏。
实际上,GEO 是两条战场的游戏。
真正的 GEO 是两条战线:离线 + 在线

要理解 GEO 是怎么运作的,你必须先理解 RAG 的基本结构。
RAG——Retrieval-Augmented Generation,检索增强生成——是今天几乎所有主流 LLM 在回答”实时性问题”或”事实性问题”时的工作方式。它分四步走:
- Embedding:把用户的问题转成一个高维向量(语义向量)
- Retrieval:用这个向量去向量数据库里检索相似度最高的内容片段
- Reranking:对检索到的片段做重排序,挑出最相关的几个
- Generation:把这几个片段作为”参考资料”喂给 LLM,让 LLM 基于这些片段生成最终回答
这套架构跨厂商、跨模型是相似的——不管是 ChatGPT、Claude、Perplexity、豆包、元宝还是 Gemini,底层都是这个工作流。
但 RAG 检索的是”在线知识库”——也就是 LLM 联网时能抓到的内容。
而 LLM 还有一个”离线知识库”——也就是 LLM 在训练阶段从全球公开网络吸收的语料,压缩进参数的内容。
当你问 ChatGPT “什么是向量数据库” 时,它不需要联网,因为向量数据库的概念已经在它的训练语料里——这是离线知识库。
当你问 ChatGPT “iPhone 17 Pro Max 现在多少钱” 时,它必须联网,因为最新价格不在它的训练语料里——这是在线知识库。
而国内 GEO 圈绝大多数人的盲区在于:他们默认 GEO 只是”在线知识库”这一条战线——也就是 RAG 检索这一条线。他们所有的”信源、发文章、跨平台覆盖”全是为这条线服务的。
但真正决定一个品牌能不能被 AI 推荐的,往往是离线知识库这一条线。
直接看 Suganthan Mohanadasan(原博客链接)在 2026 年 8 月发在 SEJ 上的实验数据:
他做了 27 个对话测试——问 ChatGPT “哪款 AI 笔记应用最好”、”哪款 CRM 适合 5 人创业公司”、”哪款扫地机器人值得买”——这类问题对 ChatGPT 来说必须联网才能回答(涉及具体产品推荐)。
然后他读 ChatGPT 在做联网搜索之前自己写出来的子查询(这些查询可以从浏览器开发者工具的 search_queries 字段读到)。
他发现:
- 在 21 个对话(共 27 个)里,ChatGPT 在搜索之前就已经把品牌名写进了它的子查询(Fan-out,我们后文展开)。比如他问”哪款 AI 笔记应用最好”,ChatGPT 在搜索前写的子查询是:
best AI note taking apps 2026 official pricing features Granola Notion AI Otter Fireflies Fathom Mem Limitless——七款产品的名字已经写好了,用户一个都没提到。
然后他统计了这些品牌的”被引用情况”:
| 品牌在 ChatGPT 子查询里出现的情况 | 数量 | 被引用率 |
|---|---|---|
| Named in query(被 ChatGPT 写进查询里) | 119 | 68.9% |
| Fetched only(被搜索抓到,但没在查询里) | 515 | 2.1% |
33 倍的差距。
被 ChatGPT “想到”的品牌,有 68.9% 被写进了最终回答。被搜索抓到但 ChatGPT 没”想到”的品牌,只有 2.1% 被引用。
这是个什么信号?
这是个非常清晰的信号——ChatGPT 在联网检索之前,已经有一个”Shortlist”。这个短名单来自它的离线知识库(训练语料)。如果你不在这个 Shortlist 里,你联网检索做得再好,也只是那 2.1%。
这就是为什么”只追短期效果”是错的。这就是为什么”忽视离线知识库”是错的。明白了吗?在线知识库只是离线知识库中知识空缺时的备胎!离线知识库决定哪些在线知识库的内容被引用。
但同时——这是个好消息。
因为这条短名单虽然是由训练阶段决定的,但下一轮训练还没开始。你今天做的所有事情——PR、用户评论、行业评测、第三方报道——都会进入下一轮训练语料,成为下次模型权重里的”Shortlist 成员”。
一张表小结一下:
| 维度 | 离线知识库(Parametric Memory) | 在线知识库(Retrieval-Augmented) |
|---|---|---|
| 数据来源 | 全球公开网络预训练语料,压缩进模型参数 | LLM 联网实时检索的内容 |
| 何时起作用 | 用户问一般事实性问题(历史、概念、常识等) | 用户问实时性问题(价格、新闻、最新规格等) |
| 触发机制 | 模型从参数中直接调取 | RAG 检索 + 离线知识库认知 → 喂给模型作为参考 |
| 谁在争夺 | 多源独立第三方以多样化措辞对品牌的描述(权威媒体、Wikipedia、行业评测、Reddit 类社区),以及官网本身(占语料比例极小但仍存在) | 当前 RAG 检索可调用的内容(依赖搜索工具排名) |
| 决定因素 | 训练语料是否被多源、多种方式提到 | 内容向量能否跟用户问题向量匹配并且被离线知识库认可 |
| 时间尺度 | 跨年累积(每次模型迭代才有变化) | 实时(每次检索都能调用) |
| 进入门槛 | 看起来极低(控评、刷量、水军)→ 但 LLM 一眼看穿 | 极低(官网本来就有,编辑团队把”我们产品很好”改成”针对 X 场景解决 Y 问题”就能立刻见效) |
| 真正门槛 | 极高(品牌实力,不可控的第三方真实动作,靠长期积累) | 中等(技术优化,官网、媒体和UGC覆盖) |
Duane Forrester 在 SEJ 上的文章里专门讲过离线知识库和在线知识库。他用了几篇重要论文来说明离线知识库的形成机制:
- Kandpal 等人(ICML 2023)的研究表明,模型对事实的准确性直接跟踪它在预训练中见过的相关文档数——这是因果关系,不是相关性。重复一个来源不算数,多样化措辞 + 独立第三方来源才算数。
- Allen-Zhu & Li(2023)进一步证明,知识只有在预训练期间以足够多样化的措辞出现时,才能被可靠提取。单源重复不产生效果,多源多样才有效。
- Mallen 等人发现,扩容模型主要改善的是流行端的表现,长尾实体的表现几乎不变——等着模型变大不会解决你的问题。
- Elazar 等人的 “What’s In My Big Data”项目分析了 10 个常用训练语料,发现即使最常见的域名也只占训练语料的 不到 0.05%。
这告诉我们一个残酷的事实:单靠自家官网的内容,撑不起离线知识库。哪怕你每天发 10 篇高质量内容,你的官网在整个训练语料里依然是可忽略不计的微小占比。
但这并不意味着”做官网没用”——官网是当被问及你的品牌产品或服务时当前 RAG 检索的首选权威信源,决定 LLM 在做实时检索时优先信任谁。而且官网是唯一能够埋入结构化数据的载体。而离线知识库的扩展,则需要依靠更多独立第三方以不同措辞对你的描述——这里”独立第三方”既包括各种百科、权威行业评测、权威新闻媒体(不是仅仅带一个新闻网站的域名下的自媒体),也包括你在公开论坛上由用户自发产生的讨论。它们共同的特点是:不是你在自我推广,而是别人在说你。
这就是为什么 PR、earned media、用户评论、第三方评测——这些”老派的、不能直接归因到效果”的东西——今天有了全新的价值。但前提是,它们得是真的。
而这就是国内 GEO 圈另一个很容易踩进去的坑——把 spam 包装成 earned media。
什么叫”把 spam 包装成 earned media”?典型的几种操作:
- “素人种草”:雇一批账号在小红书、知乎、什么值得买批量发”真实用户评测”,写得跟个人体验一模一样。用户看不出来,平台看不出来,但 LLM 在训练语料里看到的是同一套剧本的不同版本——措辞不”多样化”,来源不是”独立第三方”,是同一个营销团队在自说自话。
- “独立 KOL 评测”:找几个看起来独立的 KOL,写”客观第三方测评”,但脚本、关键结论、关键卖点话术全部由品牌方提供。KOL 收了钱,但内容看起来”不是广告”。LLM 不懂广告法和公关费,它只看到”很多来源都在说同样的话”——这正是 Allen-Zhu 论文里讲的多源同质化(homogenized multi-source),而非真正的多样化。
- “真实好评”刷单:电商平台刷”5 星好评”,每条都是 50 字以上的”详细使用体验”。控评的痕迹 LLM 不一定能识别,但平台自己的反作弊系统能——这批评价在语料里可能根本进不了 RAG 检索池。顺便提一下亚马逊的评论真实性较高的原因就是严格控制返利索好评。
- “各种百科词条”:花钱请人写百科词条,编辑立场明显偏袒自家产品。好在这种平台监督机制比较健全,一般有自己的编辑规则和反付费编辑机制,这种内容通常存活不了多久,而且根本不被权威百科官方收录。
这些操作的共同点是:它们在表面上看似由独立第三方发出,但本质上是同一个营销团队在不同渠道发出的”同一种声音”。
Duane Forrester 那篇文章里反复强调的一句话是:”parametric standing 不是被 authorable 的,是被描述出来的。”但他没说的是——它必须是真正被独立第三方描述出来的,不是被精心伪装过的同源声音。
真正的 earned media 长什么样?
- 没有脚本的真实用户讨论:你完全控制不了用户在小红书写什么、在大众点评给几分、在知乎回答里提不提到你。控评出来的内容不是”独立来源”。
- 独立编辑的媒体评测:记者编辑有独立判断权,写什么不写什么品牌方控制不了。公关发稿后被原样照登的不是 earned media。
- 行业分析师的判断:Forrester、Gartner、艾瑞、易观的报告里有分析师的独立分析,不是品牌方话术的搬运。
- 维基百科词条:严格遵守中立观点、有可靠来源标注。
- Reddit 这类难以被操纵的社区:这是最有意思的一个例子。在国外,Reddit 被各大 AI 引擎引用率非常高,2026 年 8 月 SEJ 报道了 OpenAI、Google、Perplexity 都跟 Reddit 签了内容授权协议——为什么?因为 Reddit 的社区自治机制(upvote/downvote、版主自治、官方反 AstroTurfing)让它很难被操控。LLM 在训练语料里学到这一点,所以 Reddit 的内容被识别为”最不可能是品牌方自说自话的来源”。多伦多大学 2025 年 9 月的研究 测得在消费电子领域,AI 引用第三方权威源占 92.1%(而 Google 仅 54.1%)——其中 Reddit 是引用前几名的常客。
这些内容的共同点是:不是你在推广自己,是别人在以他们的视角说你。而 Allen-Zhu 论文里讲”多样化措辞”的前提,正是这些独立来源本来就没有统一的措辞——因为不同的人会从不同角度、用不同词描述同一件事。
而国内 GEO 圈最容易出问题的地方,恰恰是把这条边界踩糊了。国内的论坛、小红书笔记、知乎回答,看上去是 UGC,但操纵,雇水军的难度和成本远低于 Reddit——批量注册的账号、控评产业链、被脚本化的 KOL 评测,在国内看上去是 earned media,在 LLM 看来可能什么都没发生。这也是为什么很多国内品牌做完一轮”小红书种草”,AI 引用率几乎不变的根本原因——LLM 已经学会了识别同源声音的微妙模式。
短期 KPI 路线——刷量、做 spamdexing、做”看起来 earned 的伪 earned media”——只影响当前 RAG 检索(如果能影响的话),不影响下次模型权重。这是两种不同的资产,不能混为一谈。
国内 LLM 的”信源偏好”,只是成本考虑,不是技术必然
这是很少有人讲清楚的一点,但必须讲清楚。
国内 LLM 厂商在选信源时,确实存在明显的”自家生态偏好”:
- 字节系的豆包爱引用抖音内容
- 腾讯系的元宝爱引用公众号内容
GEO 圈据此推论:”国内 LLM 就是偏爱自家生态,没办法。”
这个推论前提就是错的。
这些”信源偏好”只是当下成本结构的商业选择,不是技术必然。
为什么这么说?因为 LLM 在做 RAG 检索时,调一次外部官网的成本和调一次自家生态内容的成本有巨大的差距:
- 调自家生态(豆包调抖音头条、元宝调公众号腾讯新闻、文心调百家号):数据已经在自家数据库里,几乎零爬虫成本、零数据合规成本
- 调外部官网:要重新抓抓、解析解析、解决可能的 robots.txt 问题、可能要处理数据合规——成本高得多
不是技术上不能引用官网,是大部分网站不是没内容就是爬虫不友好。
但这种成本结构不会一直持续。原因有三:
第一,竞争会打破成本壁垒。当更多 LLM 厂商进入这个市场(DeepSeek、Kimi、智谱、文心一言、通义千问、字节豆包、腾讯元宝、阿里通义……),竞争激烈,LLM 必须调用最优秀的搜索工具包含最权威的外部信息源才能给出最准确的回答。一个调用抖音的视频脚本生成的答案,怎么跟调用维基百科、调用品牌官网、调用学术论文生成的答案比?用户会投票。
第二,技术成本在持续下降。Cloudflare 2026 年 2 月推出的 Markdown for Agents 已经把 RAG 抓取官网的成本大幅降低——LLM 可以直接通过 Accept: text/markdown 请求头拿到干净的 Markdown 版本,不需要重新解析 HTML 噪声。W3C 2026 年 2 月发布的 WebMCP 草案进一步把”AI 代理可调用的工具”作为浏览器原生能力——官网变成 AI 代理的标准入口。这可比llms.txt技术上效率高多了。
第三,数据合规和爬虫成本在持续优化。Cloudflare Radar 2026 年 4 月数据显示,目前已经有 3.9% 的头部网站主动为 AI 爬虫做了内容协商。随着这个比例上升,调官网的成本会进一步降低。
所以:国内 LLM 的”信源偏好”是个短期偶然,不是长期事实。
那 GEO 的主战场在哪?
在官网。
这听起来像废话——但请仔细想想。你官网的技术 GEO 准备程度,决定了:当未来 LLM 成本结构改变、必须调用权威信源时,你是否能进入那个权威信源池。
而技术 GEO 的四项——Embedding、Chunking、Fan-out、Schema Markup——就是为这一刻准备的。
技术 GEO 的四项:决定 AI 能不能找到你、理解你、引用你

Embedding:余弦相似度决定 AI 能不能检索到你
Embedding 是 RAG 工作流的第一步。
用户提问时,LLM 会先把问题转成一个高维向量(语义向量),然后用这个向量去向量数据库里找最相似的内容片段(关于内容是怎么被切成片段的,我们后面在 Chunking 一节会展开)。
这里的关键指标叫余弦相似度——两个向量在空间中的角度越小,相似度越高,被检索到的概率越高。
听起来很技术对吧?但这是 GEO 圈最被忽视的环节。
因为很多从业者把”Embedding”当成一个黑箱——”AI 会自己处理”。但事实是:AI 不会处理你散乱的内容。
你的内容如果是这样的:
“我们的产品是一款非常好的产品。我们的优势是质量好、服务好。我们的客户遍布全球。”
Embedding 之后,这是一个毫无区分度的向量——它跟”哪款相机最好”、”哪款 CRM 适合创业公司”这些查询的余弦相似度都很低,因为你的内容里没有任何具体的语义锚点。
你的内容应该是这样的:
“问:针对 5 人创业团队,哪款 CRM 既能管理销售线索又能自动化邮件跟进?答:HubSpot Sales Hub Starter 套餐支持无限用户、基础销售线索管理、Gmail 集成邮件追踪,月费 $20/用户;Pipedrive 标准套餐月费 $14/用户,包含 5 个自定义字段的销售管道…”
Embedding 之后,这是个高度结构化的向量,跟用户具体问题的余弦相似度会高得多,被检索到的概率会高得多。
这就是为什么 Moz 的 Dr. Pete 在 50K Fan-outs 研究里专门用余弦相似度(Alignment 分数)来衡量内容质量——他们的实测显示,50,000 条扇出 prompt 与它们对应主题的余弦相似度平均是 0.67,范围 0.22-1.00。即使 0.22 仍然 topic-relevant,但 0.67 是个更健康的区间。
那么,余弦相似度怎么优化?核心原则只有一句话:正面回答问题,不绕弯。
具体来说:
- 直接列出概念的定义。不要假设用户已经知道术语。如果你的内容是关于 CRM 的,开篇就要说”CRM(Customer Relationship Management,客户关系管理)是用于…”;关于向量数据库的,开篇就要说”向量数据库是专门用于存储和检索高维向量的数据库…”。LLM 在做语义匹配时,第一眼就锁定明确的概念定义。
- 正面回答用户的提问,不要”先讲故事再说答案”。Moz 的实测里余弦相似度高的内容都有一个共同特征:段首第一句就是答案,剩下的段落是支撑和细节。而低相似度的内容往往是”我们先来看一下背景…”、”这件事说起来话长…”这种铺垫式开头。
- 少说废话,多用数据。少说废话减少篇幅可以保证答案出现在一个chunk里。把”我们的产品是一款非常好的产品”换成”我们的产品 X 解决了 Y 问题”。把”我们的优势是质量好、服务好”换成”我们的优势是 X 行业平均水平的 Y 倍”。LLM 不需要营销修饰语,需要可被向量化的具体语义。
- 段落里的概念要明确对应用户可能的提问方式。如果用户在问”哪款 CRM 适合 5 人创业团队”,你的段落里就要直接出现”5 人创业团队”、”小团队”、”初创企业”这些用户实际会用的措辞——而不是”中小企业”、”小微企业”这些听起来差不多但语料分布不同的同义词。
离线知识库视角
Embedding 不只影响当前的 RAG 检索。预训练阶段,你的内容(在 C4 等公开语料里)被向量化压缩进参数。余弦相似度的”距离”训练时就决定了——内容越散乱,参数化记忆里你的”指纹”就越模糊。
Chunking:AI 怎么切你的内容,决定 AI 怎么引用你
AI 不排名页面,AI 挑片段。
谷歌早就开始采用Passage Indexing,而微软 Bing 的 Krishna Madhavan 在 2025 年 10 月的官方指南里讲得非常直接:
“AI 助手会把内容拆小,这一过程称为解析,变成更小的结构化片段,以便评估权威性与相关性。随后这些片段被组装成答案,通常来自多个来源,形成单一连贯回答。”
这就是 Chunking 的本质——你的长文要被切成自包含的小块,每个 chunk 配 metadata,才能被 RAG 系统检索,被模型在回答时原封不动地搬进答案。
这是什么意思?
意思是:如果你写了一篇 8000 字的完整长文,覆盖”AI 代理如何看你的网站”的全部细节,但没有 Chunking 设计——没有使用H2/H3 作为边界,整篇爆流水账——那么 RAG 在检索时会抓不到重点,稀释语义浓度,AI上下文无法妥善切抓到错误段落直接被引用概率。
正确的 Chunking 应该是这样的:
- 每个 H2/H3 是天然的 chunk boundary
- 每个 chunk 自包含——独立成立,AI 抽取后能直接被引用
- 描述性标题——H2 不是”了解更多”,是”AI 怎么切你的内容”
微软 Bing 官方原话:”强标题是帮 AI 知道完整想法起点与终点的信号。”
还有一个被广泛忽视的 Chunking 杀手:折叠面板、标签页、SPA ( Single Page Application )动态加载。
微软 Bing 官方警告:
“别把答案藏在标签页或可展开菜单里:AI 系统可能不渲染隐藏内容,关键细节会被跳过。”
换句话说:你的 SPA、JS 动态加载、懒加载内容,AI 爬虫根本看不见。
Chunking的前提条件是网站直出HTML,用SSR。SSR(服务端渲染 Server-Side Rendering)不是性能优化,是 GEO 可视性的硬性要求。
你应该在浏览器开发者工具里关闭 JavaScript,然后看你网站的主要页面——如果关闭 JS 后主要内容消失,那对 AI 爬虫来说你的网站就是空壳,无法分块。
离线知识库视角:Chunking 在预训练时也会起作用——训练语料里的页面如果结构清晰、标题明确,模型学到的”你的品牌”就更准。C4 语料里你官网的页面被切成多少段落、每段讲什么,会被压缩进权重。
Fan-out:AI 怎么扩展你的查询,决定你的品牌能不能进入”Shortlist”
Fan-out(扇出)是 2025-2026 年 GEO 圈最被讨论的技术名词。
它的核心机制是:用户问”哪款相机最好”,AI 不会只搜这一句。AI 会拆出 N 个子查询分别检索。
Moz 的 Tom Capper 总结了 10 类扇出方向:语义、实体、后续、属性、预判、事实、教程、视角、对比、交易。
但 Fan-out 有一个你必须知道的真相——
ChatGPT 等模型在做扇出之前,已经决定了你的品牌要不要参与这场扇出。
这就是上文 Suganthan Mohanadasan 在 SEJ 上的实验 所揭示的——ChatGPT 在联网搜索之前就已经把品牌名写进了它的子查询。
这意味着什么?
意味着 Fan-out 不是让你在”哪款相机最好”这个查询的扇出结果里出现——那是你进入扇出之前就要解决的问题。
Fan-out 是让你已经进入LLM的Shortlist之后,能在多个扇出角度都有对应内容——比如:
- 实体扇出(”Sony A7M4 怎么样”)→ 你有 Sony A7M4 评测页
- 对比扇出(”Sony vs Canon 哪个好”)→ 你有对比表
- 教程扇出(”Sony A7M4 怎么设置”)→ 你有设置教程
- 交易扇出(”Sony A7M4 哪里买便宜”)→ 你有购买指南
Moz 的 Dr. Pete 在 50K Fan-outs 大规模研究里进一步发现:
- 50,000 条扇出 prompt 里,只有 12.8% 包含主品牌或两个竞品之一
- 但这 12.8% 里,97% 的品牌提及集中在 Entity(实体)和 Comparison(对比)两个扇出类型——其他 8 个扇出类型的品牌提及加起来不到 3%
这是一个非常清晰的信号——GEO 内容策略的重心应该在”实体”和”对比”两个扇出类型。这种类似的情况我们在国产大模型中也屡见不鲜,我们通常认为是多维度对比,实质上是扇出的体现。一些大模型在中等推理模式下还会进行多轮检索。
前面我们已经用 33 倍差距证明了”被 ChatGPT 想到”才是 GEO 的真实战场,这里聚焦扇出本身——真正决定Fan-out 胜负的,依然是离线知识库——也就是你的品牌能否从离线知识库制定规则的“海选”中成功晋级进入“淘汰赛”。同样,能否被第三方独立描述、被权威媒体报道、被行业评测覆盖、被用户在多个扇出场景下以不同的措辞提到至关重要。
怎么做好Fan-out优化呢?要应对扇出,就需要以客户为中心来思考问题,包括不同层次的客户。他们会有不同的需求,不同的价值观,不同的偏好。你的内容铺设需要满足大部分审视角度。
比如数码产品,你的角度至少能有:
- 屏幕
- 续航
- 存储
- 音质
- 系统生态
- 安全
- 外观
- 性能
- 保值
- 售后
我们进行内容创作,就必须围绕着客户真正关心的问题来。
Schema Markup:官网作为机器可读的事实层
这是技术 GEO 的最后一项,也是最重要的一项。
Schema 是机器可读的事实层。它把”你的店周六 9 点关门”从模糊文本变成机器能信的、跨平台一致的事实。
但 Schema 不是给 Google 富结果用的——至少不只是。
Schema 在 GEO 里是可信度的核心机制。
先讲一个反直觉的事实——
马老师之前在《豆包女孩叫什么名字?今天开始 GEO 没有秘密》那篇里就讲过:许多 LLM 爬虫根本不跑 script,那当然无法读取动态生成的 标签里的内容 ,所以 LLM 爬虫读不到。
这意味着什么?意味着你花了大量精力写的 JSON-LD,对 LLM 来说可能是装饰品。
真正能被 LLM 读到的是 Microdata——写在 HTML 属性里的结构化数据。比如:
<div itemscope itemtype="https://schema.org/Product">
<h2 itemprop="name">Sony A7M4</h2>
<span itemprop="brand">Sony</span>
<span itemprop="price">¥14,999</span>
<div itemprop="offers" itemscope itemtype="https://schema.org/Offer">
<meta itemprop="availability" content="https://schema.org/InStock">
</div>
</div>
这是 LLM 能直接读到的结构化数据。
JSON-LD 不是没用——它对 Google 富结果仍然有用。但GEO 时代,Microdata 的优先级要高于 JSON-LD。
还有一个常见的误区——Schema 不是”一次设置,一劳永逸”的。
Gaetano Pizzi 在 Search Engine Land 的文章里直接指出:
“当 Schema 与 GBP(Google Business Profile,谷歌商家资料)、内容、目录不一致时,Google 和 AI 系统直接忽略整块标记。一次冲突 = 忽略,多次冲突 = 整个网站失去可见度。”
Schema 必须进行季度审计 + 触发式更新——Schema 必须随业务变化同步。你的店改了营业时间、加了新服务、换了品牌名、撤了某产品线,Schema 必须第一时间同步。
否则你的 Schema 会反噬你的品牌——AI 系统会认为你的信息不一致,降权处理。
真正的”机器优先架构”(Slobodan Manic 的文章)由四大支柱构成:
- Identity(身份) → Schema
- Structure(结构) → SSR + 语义 HTML
- Content(内容) → Chunking 设计
- Interaction(交互) → 可访问性树
四项 Schema 是地基。没有 Schema 的官网对 AI 来说是普通网页,RAG 调用成本高(要去噪)。有 Schema 的官网对 AI 来说是结构化数据库,RAG 的调用成本低(直接抽取事实)。
但 Schema 并不是孤立存在的——它的价值要靠 Semantic HTML 和结构鲜明的元素来放大。
语义 HTML(Semantic HTML)是减噪器。 用
结构鲜明的元素 让 LLM 直接抽取可引用的片段:
- 对比表(”X 套餐 vs Y 套餐对比”)。LLM 可以直接把整个表格作为一个 chunk 引用。
- LLM 把列表项视为天然的 self-contained chunks——微软 Bing 的 Krishna Madhavan 在 2025 年 10 月指南 里明确说:”项目符号、编号列表、对比表格、分步教程——这些格式给 AI 干净的可提取片段。埋在长段落里的信息不如三行列表易抽取。
反过来,不要用
GEO-16 框架从学术侧证实——结构化数据是预测 AI 引用概率的三大因子之一,与元数据/新鲜度、语义 HTML 并列。
离线知识库视角:Schema 在预训练阶段也起作用——模型从公开网络吸收的语料中,有 Schema 的页面更可能被压缩进参数化记忆以保留结构化的事实(品牌、产品线、关键人物)。
写在最后
GEO 是 SEO 的延伸,是网站作为机器可读实体的第一次架构升级。
马老师之前写《豆包女孩叫什么名字?》《市场对 GEO 的认知还停留在傻白甜的区间》《数字广告必死?AI SEO?再谈 GAIO》这几篇时,已经反复强调过这个方向——但那时候市场还没准备好接受”技术 GEO”这个概念。现在市场更没准备好——至少国内 GEO 圈还停留在”信源、发文章、按 KPI 付费”的阶段。
但市场会变的。
当国内 LLM 厂商进入更激烈的竞争、当 Cloudflare 的 Markdown for Agents 部署率从 3.9% 上升到 30%、当 W3C 的 WebMCP 正式成为浏览器标准——官网会成为 AI 代理的标准入口。到那个时候,高相似度,精心切块,全面扇出,有完整 Schema 的官网会成为 LLM 优先调用的权威信源。未能满足条件的官网会变成噪声源——即使你发了 1000 篇文章,对 AI 来说也是 1000 个噪声源。
做好技术GEO,编排内容,并且重视官网。这是穿越 LLM 成本结构变化的稳健做法。而不是把希望寄托在 llms.txt、cats.txt、小红书笔记、抖音视频脚本上。那些东西长期来看帮不了你。
如果你读过我在《2026 年数字营销趋势有哪些?》里写的”B2A 元年”那段,你会发现我一直在观察 AI 时代营销基础设施的迁移路径。
2026 年这个节点,市场开始准备好了。
三个额外的信号:
- RAG 的两战线模型 已经被大量独立研究者反复验证。不再是少数人的猜想,而是 GEO 圈必须接受的共识。
- 国内 LLM 厂商进入战国时代。豆包、元宝、Kimi、文心一言、通义千问、DeepSeek、智谱……各家都在拼差异化,而差异化的关键之一就是信源质量——调自家生态容易,调权威官网更难,但调权威官网给出的答案质量更高。当竞争激烈到一定程度,调权威官网必然成为优先选择。
- WebMCP / Markdown for Agents / Content Signals 等基础设施陆续落地。这些标准让官网与 AI 代理的对接成本指数级下降,未来 12 个月内会出现一波”AI 代理优先适配”的官网改造潮。
这意味着技术 GEO 不再是”未来概念”,而是”当下窗口”。窗口期大概 6-12 个月——错过这一波,等所有竞争对手都把 Schema、Chunking、Embedding、Fan-out 做完,你再进场就要花几倍的成本。
我做了二十多年数字营销,每一代营销基础设施的迁移,都奖励那些提前布局的人,惩罚那些按惯性继续的人。
2007 年 Facebook 广告刚出来时,提前押注的人吃到了红利。2012 年移动端 SEO 切换时,提前做移动适配的人吃到了红利。2017 年信息流广告成熟时,提前入局的人吃到了红利。
GEO始于2023年,而2026 年依然是 Technical GEO 的红利窗口。
这也是为什么我决定现在正本清源写这篇。不是要把”技术 GEO”包装成一个新概念卖给你,而是帮你识别这个窗口、提前布局。
如果你想聊 GEO,有一定预算,想评估你的 GEO 现状、想看你的官网在 AI 搜索里的实际表现,欢迎联系我。技术 GEO 的事,越早开始,越有时间积累优势。