网站建设顺序错了:信息优先架构如何重塑AI时代的中文互联网
大多数网站从站点地图开始:先决定需要首页、产品页、关于页、集成、文档、案例研究和博客,设计师把需求转为界面,开发者实现为组件,CMS提供存储位置,最后才添加结构化数据描述页面含义。
这种“先界面后信息”的做法在过去二十年里几乎成为行业默认路径。中国互联网也不例外。多数内容平台从产品经理画出信息架构图开始,确定首页、频道页、详情页、个人中心等核心页面,再由UI设计师输出高保真稿,工程师用React或Vue搭建组件,最后把内容塞进CMS。结构化数据往往是SEO部门后期补的补丁,用于百度蜘蛛抓取。
这种顺序在移动互联网时代还能运转,因为用户主要通过浏览器和App浏览,由人来阅读。但当AI搜索、对话式助手成为主要流量入口时,机器先读、机器先理解的需求就暴露了传统流程的缺陷。信号明确指出,我们正在把网站建反了。
中文内容平台仍沿用站点地图优先的建设顺序
在中国,内容平台建设几乎都从站点地图起步。字节跳动系产品先规划抖音、今日头条的首页推荐流、搜索页、个人主页,再逐步添加话题页、商品卡、直播间。腾讯新闻、百度百家号同样先定频道分类、文章列表页、作者中心,再考虑内容如何被外部系统理解。阿里系的UC浏览器、夸克也遵循相同路径:先定视觉交互,再让后端提供JSON数据,最后才在页面底部或head里零散添加Schema.org标记。
这种做法让产品快速上线,设计师和前端能快速迭代视觉效果。但结果是,AI系统拿到页面后只能靠自然语言处理去猜测标题、作者、正文、发布时间等核心事实,准确率受限。平台为了让内容被百度、豆瓣、微信索引,又得额外维护一套结构化输出接口,造成重复劳动。信号中描述的“先建页面再描述含义”在中国内容平台里体现得尤其明显:CMS里存的是渲染后的HTML片段,而不是干净的实体关系。
信息优先架构要求把结构化数据放在页面设计之前
信息优先架构的核心是反转顺序:先定义信息模型,再生成展示界面。开发者不再从sitemap出发,而是先建立领域本体(ontology),明确“文章”包含标题、作者、发布日期、关键词、实体提及、引用关系等属性,“产品”包含规格、价格、评价、库存等字段。这些定义用JSON-LD、RDF或自定义Schema表达,成为整个系统的单一事实来源。
之后,设计和前端工作变成“把信息模型映射到不同终端”的过程。同一份结构化数据可以渲染成网页、生成小程序卡片、喂给大模型做摘要、输出语音播报,而不需要为每种终端单独维护一套模板。商业上,这意味着内容一次生产、多处分发,降低维护成本。信号强调,传统流程是先有界面再补数据,而新架构是先有可被机器直接消费的数据模型,界面只是衍生品。
这种做法在技术上要求团队具备知识工程能力,需要数据架构师而非仅UI工程师。商业上,它让平台从“内容分发者”变成“可信知识提供者”,为AI时代的内容授权和付费API打下基础。
百度文心等AI搜索将倒逼网站提供机器可读信息模型
百度文心一言、阿里通义千问等中文大模型搜索产品越来越依赖结构化信息来减少幻觉。它们不再满足于爬取HTML文本,而是希望直接拿到实体级知识图谱。当网站能提供清晰的JSON-LD标记时,AI搜索就能准确提取产品价格、文章作者、事件时间线,从而给出更可靠的答案。
这对内容平台构成直接压力。如果平台继续只提供渲染后的网页,AI助手可能引用错误信息或干脆不引用,导致流量流失。信号指出,结构化数据最初是为了帮助传统搜索引擎识别产品、组织和人物,现在这一需求被AI搜索放大了十倍。百度已经开始在搜索结果中大量使用结构化数据生成的摘要卡片,未来文心一言的“深度搜索”功能很可能只优先展示提供了完整信息模型的站点。
对平台而言,这意味着必须把结构化数据建设从SEO部门的边缘工作提升为产品核心功能。拒绝提供机器可读模型的站点,将在AI流量分配中处于劣势。
前端开发从界面组件转向语义数据建模
传统前端工作流是把设计师给的界面切成React组件,再用useState、useEffect管理状态。现在信息优先架构要求前端工程师首先成为数据建模者。他们需要定义TypeScript接口或GraphQL schema,这些定义同时服务于后端存储、前端渲染和外部AI消费。
组件库的重点从“这个按钮长什么样”转向“这个实体有哪些属性、与其他实体是什么关系”。渲染逻辑变成根据设备、用户偏好、AI上下文动态决定用卡片、表格还是语音播报来呈现同一份数据。信号中提到的“开发者把界面转为组件”的环节被彻底前置:组件只是信息模型在特定视图上的投影。
这对开发者技能提出新要求。熟悉JSON-LD、Schema.org、知识图谱的前端工程师将更抢手。工作成果也不再是像素完美的页面,而是可被大模型直接索引的语义层。短期内,这会增加开发复杂度,但长期能大幅减少因界面改版导致的数据重新抓取成本。
中国互联网落地面临数据标准化与合规双重障碍
在中国推行信息优先架构面临两方面现实障碍。首先是数据标准化程度低。不同平台对同一概念的定义差异巨大:一篇文章的“作者”在A平台可能是字符串,在B平台可能是对象,字段命名、枚举值都不统一。缺乏全国性或行业级的共享本体,导致信息无法跨平台流动。
其次是合规压力。个人信息保护法、数据安全法对结构化输出提出严格要求。如果把用户评论、行为数据以机器可读形式大规模暴露,可能触及敏感数据跨境传输或二次利用的红线。企业担心一旦建立公开信息模型,就难以控制下游AI如何使用这些数据,潜在法律风险较高。
目前还不清楚监管部门是否会出台针对AI可读内容的专门指引。多数平台因此采取观望态度,只在内部系统小范围尝试信息模型,对外仍维持传统HTML优先的输出方式。
内容平台与阿里系产品可抢先建立信息层优势
尽管存在障碍,率先行动的内容平台和阿里系产品仍有明显机会。字节跳动、腾讯内容平台如果把现有海量文章转化为结构化知识图谱,就能为自己的AI产品提供高质量训练和检索数据,降低对外部数据的依赖。阿里系的夸克搜索、通义听悟如果要求入驻商家和媒体先提供完整信息模型,就能构建起封闭但高质量的知识层,在AI搜索竞争中形成壁垒。
商业模式上,平台可推出“信息API”付费服务,让开发者或企业级AI直接调用结构化内容,产生新的收入来源。开发者则能围绕这些信息模型开发垂直Agent,专注于特定领域而非通用爬虫。信号提出的“AI Web”概念在中国可能以平台主导的“可信知识网络”形式落地。
谁先完成从页面中心到信息中心的转变,谁就能在下一波AI流量红利中占据先机。目前中国互联网仍处于站点地图优先阶段,但AI搜索的倒逼效应已经显现,转变窗口正在打开。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/stock002/post/20260902/%E7%BD%91%E7%AB%99%E5%BB%BA%E8%AE%BE%E9%A1%BA%E5%BA%8F%E9%94%99%E4%BA%86%E4%BF%A1%E6%81%AF%E4%BC%98%E5%85%88%E6%9E%B6%E6%9E%84%E5%A6%82%E4%BD%95%E9%87%8D%E5%A1%91AI%E6%97%B6%E4%BB%A3%E7%9A%84%E4%B8%AD%E6%96%87%E4%BA%92%E8%81%94%E7%BD%91/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com