AI搜索不再只看关键词,而是看网站能否清晰表达实体关系。

过去十年,SEO的核心是让页面被传统搜索引擎收录和排序。如今生成式AI搜索兴起,开发者需要把注意力转向Generative Engine Optimization,简称GEO。GEO不是写文案,而是构建让AI能可靠读取、连接和返回信息的网站架构。核心目标是减少歧义,让AI清楚知道“这个组织提供什么服务、由谁负责、在哪里、和哪些主题相关”。

这种转变值得中文开发者关注。因为中文内容在全球AI模型训练数据中占比相对较低,如果网站结构再模糊,AI检索时就更容易出错或干脆忽略。把组织、服务、人员、地点、主题和支撑内容之间的关系用技术手段明确表达出来,能显著提升内容在Perplexity、ChatGPT Search等生成式引擎中的可见度。

实体清晰度成为AI检索的前提

AI搜索本质上是实体检索加生成。模型需要先识别出页面上的“实体”——人、组织、地点、概念,然后建立它们之间的关系。如果一个网站把公司名称、创始人、办公地址、服务项目混在不同段落且没有明确关联,AI就很难把它们当作一个连贯的实体图谱。

开发者能做的是在HTML中用明确的语义标记。比如用schema.org的Organization、Person、Service、Place等类型,通过JSON-LD把这些实体及其属性一次性说清楚。中文网站常见问题是人名和公司名同时出现却没有@type区分,导致AI把创始人当成公司本身。加上正确的@id和sameAs链接,能帮助AI把实体指向维基百科或百度百科等权威知识库,进一步降低歧义。

结构化数据如何在中文站落地

很多中文企业站至今只在head里塞几行meta description和keywords,对schema支持极少。GEO要求至少添加Organization、WebSite、BreadcrumbList和FAQPage四类结构化数据。

以一家做SaaS产品的北京公司为例,它的主页应该同时包含:

  • Organization类型,标明legalName、foundingLocation、founder(指向Person实体)、url、logo;
  • 多个Service类型,每个服务都有name、description、areaServed(用Place实体说明服务城市);
  • 所有服务页面用sameAs指向公司主页,形成闭环。

这些数据不一定要用户看得见,但必须让爬虫和AI索引器能直接读取。测试工具可以用Google的Rich Results Test或Schema Markup Validator,中文开发者还可以配合百度站长平台的结构化数据提交接口。

让内容真正可被AI检索而非仅被收录

被收录不等于被检索。AI生成式引擎在回答问题时会做向量检索和图谱查询。如果网站内容藏在JavaScript渲染的无限滚动页面里,或者用图片形式展示关键信息,检索成功率就会大幅下降。

实践上需要做到三点:一是核心信息用服务端渲染或静态HTML输出,确保爬虫第一时间拿到文本;二是重要概念用标题、列表、表格等语义化标签包裹,避免全页只有;三是为长内容添加清晰的目录和锚点,让AI能精准定位到回答问题的段落。

一家做在线教育的中文机构把所有课程名称、讲师、适用人群、学习时长都做成结构化表格,同时在JSON-LD里重复这些关系,结果在AI问“哪个课程适合零基础成人”时被直接引用。相比之下,很多竞品网站虽然排名靠前,却因为内容碎片化而被AI忽略。

内部链接与实体图谱的构建

GEO强调“关系明显”。开发者应有意识地建立实体之间的超链接:从服务页链接到负责该服务的团队成员页,从成员页链接回公司关于页,从关于页链接到所有服务落地城市页。这种链接不是为了SEO权重传递,而是为AI提供明确的图谱路径。

推荐做法是维护一个中央的知识图谱页面,或至少在footer放置“关于我们-团队-服务-联系方式”的固定导航。中文网站常犯的错误是把“联系我们”做成弹窗或表单,导致AI无法提取地址、电话等实体属性。把这些信息放在可爬取的纯文本页面,并用PostalAddress schema标记,能大幅提升本地实体清晰度。

中文网站适配AI检索引擎的额外注意事项

中文的语义复杂性给AI带来额外挑战。同一个公司名称可能有全称、简称、英文名、旧称,开发者需要在schema里用alternateName数组全部列出,并用sameAs指向不同语言的官方页面。

多语言网站还要处理hreflang和语言版本的实体映射。假如一个公司同时运营简体中文站和繁体中文站,需要让AI明白这是同一个Organization在不同地区的表达,而不是两个独立实体。

另外,中文内容常使用大量语气词和口语化表达,AI在抽取事实时容易出错。因此关键事实最好用 bullet points 或定义列表呈现,并配以结构化数据。一些领先的中文科技媒体已经在文章底部增加“本文实体”区块,用JSON-LD列出涉及的公司、产品、人物,效果明显好于纯文本。

技术团队在GEO中的具体职责

GEO把优化责任从内容团队部分转移到前端和后端开发者身上。他们需要:

  1. 在构建CMS时默认输出结构化数据模板;
  2. 确保所有动态页面都能生成唯一的实体ID;
  3. 监控AI搜索工具的引用情况并迭代架构。

目前还没有成熟的GEO专用分析工具,但可以通过观察ChatGPT、Bing Copilot、Perplexity等平台对自身内容的引用频率来间接衡量。引用时是否准确提到公司全称、服务名称、城市等细节,就是最好的反馈。

一家中型电商平台的开发团队在2024年下半年集中做了三件事:把所有产品分类用Product schema重构、为每个品牌建立Brand实体、把物流覆盖城市做成Place实体列表。三个月后,他们发现AI回答“哪家平台支持XX城市次日达”时,自身被提及的概率提升了接近四倍。

GEO不是操纵,而是降低AI理解成本

需要强调的是,GEO的目标不是保证被AI永远引用,而是让网站成为AI可信的信息源。AI模型训练和检索机制仍在快速迭代,今天有效的结构化方式可能半年后就需要调整。但清晰的实体关系、机器可读的内容架构、明确的内部关联,这些原则大概率会长期有效。

对中文开发者来说,现在开始投入GEO不是追热点,而是把网站从“能被搜到”升级为“能被AI正确理解和使用”。这既是对流量来源变化的适应,也是对自身信息资产的长期保护。当AI成为越来越多用户获取信息的第一入口时,结构化程度低的网站将被逐步边缘化。

未来AI搜索可能会更依赖知识图谱而非单纯的向量相似度。开发者现在打下的实体基础,将直接决定自家内容在下一代搜索系统中的权重和准确性。把GEO思维融入日常开发流程,已经成为技术团队必须掌握的新能力。

参考来源