← 知识整理
出海增长 / 知识整理 · 中文

SEO × LLM 时代(跨作者主题综合)

3 视角的 SEO × LLM 立场融合。Google Search Central(官方:how-not-who 框架 + scaled content abuse 边界 + Who/How/Why 三问 + AI Overviews / Succeeding in AI Search)/ newtype llms.txt 综合指南(两种格式提案:Access Control Model 类 robots.txt + Inference Guidance Model Markdown / Karpathy "为 Agent 重写软件基础设施")/ newtype 知识系统(wiki.newtype.pro 第三层 = 发布层 = 自有"LLM 友好语料")。覆盖 Google 对 AI 内容立场、llms.txt 提案现状、E-E-A-T 与 AI 内容兼容、Agent 时代基础设施

资料来源:跨来源主题整理 · 本站发布:2026-09-26 · 笔记更新:2026-05-18

SEOAI 搜索内容规范

何时打开:你在做内容站 / 想搞 AI Overviews 流量 / 要不要写 llms.txt / 要怎么把站点改造成"LLM 友好"。本 wiki 把 Google 官方立场、Karpathy "为 Agent 重写基础设施"主张、newtype "发布层做 LLM 友好语料"三派放在一起对照。

一句话核心:Google:how-not-who(评质量不评工具)+ 反 scaled content abuse;Karpathy:robots.txt → llms.txt(给 Agent 重写网络基础设施);newtype:与其等 Google 派糖,不如自己做 LLM 友好语料层。

0. 3 视角的"SEO × LLM"

视角 来源 立场 一句话
Google 官方 GSC Blog: AI 搜索演化与 Google 对 AI 内容的立场(2015-2026) 监管者 / 平台 "We focus on quality, not how content is produced."
Karpathy / 协议派 Karpathy · Software in the era of AI(Software 3.0) newtype 杂项实战:llms.txt 协议 + CrewAI Obsidian 项目 + n8n MCP 工作流 基础设施重写者 "Software 3.0 时代要为 Agent 重写网络(robots.txt → llms.txt)"
newtype 创作者 newtype 知识系统与 Life OS 全演化 第三方发布者 "我做自己的 wiki 站,做 LLM 友好语料,绕开搜索引擎"

1. 跨作者共识(4 条)

  1. AI 生成内容不会被一刀切封杀 —— Google 明确"AI 内容不违规,除非操纵排名";Karpathy / newtype 默认 AI 是协作者
  2. 内容质量 + 真实价值是唯一长期标准 —— Google 的 E-E-A-T / Helpful Content;newtype 的"持续把外部信息转化成自己的东西"
  3. 网页结构对 LLM 重要性 ↑ —— Google 让 AI Overviews 引用结构清晰的页面;llms.txt 提案直接为此设计;newtype wiki 用 Markdown / H1 / blockquote 简洁结构
  4. 创作者要主动披露 AI 参与 —— 当读者会问 "How was this created?" 时披露(Google FAQ);newtype 默认在帖子里标注哪段是 AI 协作

2. 显式分歧(3 条 —— 不抹平)

分歧点 Google 立场 Karpathy / llms.txt 立场 newtype 实战立场
要不要写 llms.txt 官方未表态 / 不承诺读取 "应该重写网络基础设施" / 是 Software 3.0 配套 写了 / 但不指望 Google,主要给 OpenAI / Anthropic Bot 看
AI 当作者署名 "probably not the best way"(2023/02 FAQ) 不讨论 默认人为主作 / AI 为协作
是否依赖搜索引擎流量 隐含假设 Karpathy:Agent 直接读 llms.txt 绕开搜索 newtype:主动绕开搜索,做自有 AI 流量(Skill 引用 / wiki 站直链)

3. Google 官方立场详解

GSC Blog: AI 搜索演化与 Google 对 AI 内容的立场(2015-2026) + GSC Blog: 质量政策与 E-E-A-T 演化(Webmaster Guidelines → Search Essentials):

3.1 核心命题:质量先于"是谁/什么写的"

"Our focus on the quality of content, rather than how content is produced, is a useful guide that has helped us deliver reliable, high quality results to users for years." —— Danny Sullivan + Chris Nelson, 2023/02

历史类比:2011 Panda 时代 Google 没有 ban "人写但批量低质",而是升级系统识别质量;面对 LLM 时代 Google 重申同样路径 —— 不 ban AI 内容,而是评估质量。

3.2 边界:scaled content abuse

"Using automation—including AI—to generate content with the primary purpose of manipulating ranking in search results is a violation of our spam policies."

判定的是意图不是工具:

  • ✅ AI 生成天气、体育、转录 → 长期合规
  • ✅ AI 辅助创造性表达 → 合规
  • ❌ AI 以"骗排名"为首要目的批量产出 → spam policy 违规

执法系统:SpamBrain。

3.3 给创作者的官方建议(2023/02 FAQ)

问题 Google 立场(原话精简)
AI 内容违规吗? 不违规 —— 除非用来操纵排名
为什么不直接 ban AI 内容? 自动化在出版业一直有合法用途
AI 内容会优待吗? "It's just content." 不优待不打压
我该用 AI 写吗? 用 AI 产出有用原创 = 可以;当便宜刷排名工具 = 不要
要署名作者吗? 当读者会问 "Who wrote this?" 时应署
要披露 AI 参与吗? 当读者会问 "How was this created?" 时应披露
能把 AI 列为作者吗? "probably not the best way"

3.4 Who / How / Why 三问框架

Google 在 Creating helpful, reliable, people-first content 帮助页里加了新框架:

  • Who 写的
  • How 写的(含是否用 AI 工具)
  • Why 写的(为人还是为搜索引擎)

"Evaluating your content in this way, whether you're using AI-generated content or not, will help you stay on course."

3.5 E-E-A-T 与 AI 兼容

GSC Blog: 质量政策与 E-E-A-T 演化(Webmaster Guidelines → Search Essentials):

维度 含义 AI 时代要求
Experience 第一手经验 AI 无法替代亲历 → 须有真人体验加成
Expertise 专业 AI 辅助合成 + 人类专家审核
Authoritativeness 权威 真实作者 + 域名信誉
Trustworthiness 可信 来源、披露、可追溯

4. llms.txt 提案(协议派)

newtype 杂项实战:llms.txt 协议 + CrewAI Obsidian 项目 + n8n MCP 工作流:

4.1 现状:还是社区提案

  • 目前不是正式标准
  • 由开发者 / 公司提出,各方采纳后才能成为标准
  • 目前存在两种格式互不兼容的提案(无法在根目录同时放两个)

4.2 提案 A:Access Control Model(类 robots.txt)

目标:控制网站内容是否被用于模型训练。

指令 用途
user-agent 指定规则适用的模型 / 爬虫
allow / disallow 允许 / 禁止访问特定路径
license 链接到许可协议(CC)
crawl-delay 最小间隔(秒)
sitemap 站点地图 URL

4.3 提案 B:Inference Guidance Model(Markdown 格式)

目标:解决 LLM 上下文窗口有限的问题。用简洁 Markdown 文件帮 LLM 快速理解网站核心内容和结构,在用户提问时表现更像"专家"。

核心动机:

  • 提升 LLM 推理时对网站的理解和使用效率
  • 克服解析复杂 HTML(导航 / 广告 / JS)的困难
  • 为软件文档、API 参考、业务介绍等场景提供 AI 友好的入口

文件结构:

  • 必需:H1 标题 + Blockquote 摘要
  • 可选:H2 分隔的部分 / 文件列表 / Optional 部分(短上下文可跳过)

4.4 工具生态

  • llms_txt2ctx —— 把 llms.txt 转成 LLM 可消费的 context
  • 一些主流文档站点(FastAPI / Anthropic Docs / Hugging Face)开始试水

4.5 Karpathy 主张:为 Agent 重写软件基础设施

Karpathy · Software in the era of AI(Software 3.0) §七:

"robots.txt → llms.txt;HTML → Markdown / API;搜索 → Agent 调用"

Karpathy 在 YC AI Startup School(2025-06)演讲明确:Agentic Decade 需要为 Agent 重写整套软件基础设施,而不是让 Agent 苦苦解析为人类设计的 HTML。


5. newtype:主动绕开搜索的"发布层"

newtype 知识系统与 Life OS 全演化 §三层架构:

5.1 第三层 = 发布层(wiki.newtype.pro)

┌─────────────────────────────────────┐
│  1. 知识库层(Knowledge Layer)       │
│     - 外部资料 / 个人资料             │
├─────────────────────────────────────┤
│  2. 技能层(Skill Layer)            │
│     - Skills / Sub-agents / OS       │
├─────────────────────────────────────┤
│  3. 发布层(Publish Layer)           │ ← wiki.newtype.pro
│     - LLM 友好语料                    │
│     - Skill 直接引用                  │
│     - 与流量解耦                      │
└─────────────────────────────────────┘

5.2 设计哲学

  • 不为搜索引擎做 SEO,为 LLM Agent 做"可读语料"
  • 严格 Markdown / H1 / 简洁链接 / 无导航污染
  • 内容直接被自己的 Skill 引用(closed-loop)
  • 也允许其他 Agent 抓取(open language model commons)

5.3 与 Google SEO 的关系

维度 传统 SEO newtype 发布层
目标受众 Google 用户 LLM Agent + 用户
优化方向 关键词 / 链接 / E-E-A-T Markdown 结构 / 主题完整性
流量来源 Google 搜索 Skill 引用 / 直链 / X 分享
更新频率 持续 持续
核心 KPI 排名 / 点击 被 Skill 引用次数 / 转化

关键认知:与其押注 Google AI Overviews 派糖,不如自己做"被 LLM 引用的语料源"。


6. AI Overviews / Succeeding in AI Search 立场

GSC Blog 2021-2026:Helpful Content / Page Experience / AI Overviews 时代 + 2025/05 Succeeding in AI Search + Google Search 5 大 AI 算法里程碑(RankBrain/BERT/MUM/HCU/AIO) §6:

6.1 AI Overviews 的工作方式

  • Google AI Overviews(原 SGE)= custom Gemini model(2024-05-14 Liz Reid)
  • 被引用的页面会拿到 link citation
  • 不是 zero-click —— Google 强调还会有点击
  • 优化建议:让你的页面成为"被引用的那一个"

6.2 Succeeding in AI Search(2025/05)

Google 官方 5 条建议:

  1. Authentic, original content —— 不要伪原创
  2. Strong page experience —— 加载快 / 移动友好
  3. Meaningful structure —— H1/H2/列表清晰
  4. Multi-modal content —— 图 / 视频 / 表
  5. Trust signals —— author / 出版机构 / 引用

6b. Google 算法 5 大里程碑(2015-2024)—— SEO 必读宪法

详见 Google Search 5 大 AI 算法里程碑(RankBrain/BERT/MUM/HCU/AIO) 完整官方原文整理:

里程碑 年份 SEO 实操含义
RankBrain 2015 第一个深度学习排序 / 词→概念 → 不要堆关键词
Neural Matching 2018 模糊匹配查询↔文档 → 写自然语言段落,不用精准词
BERT 2019 Transformer 理解句内词与词关系 → 小词如 "for/to/no" 也重要,自然写
MUM 2021 1000x BERT / 75 语言 / 多模态 → 非英语高质内容反哺英语;加图加视频
HCU 2022-08 站点级"为人写 vs 为搜索引擎写" → 清理站内低质 > 加新好页
AI Overviews 2024-05 custom Gemini / 生成式答案 → 争"被引用的那一个"

关键认知(Pandu Nayak 2022-02 官方综述):

"Google's Search infrastructure runs hundreds of algorithms and machine learning models that work in combination rather than isolation."

SEO 含义:任何"专门针对 X 算法做优化"的建议都是错的(如"为 BERT 优化标题"/"针对 MUM 优化")。优化的是内容质量本身。


7. 怎么做 —— 按身份的 SEO × LLM 路径

你是谁 主用方法 起点
内容站 / 媒体 Google how-not-who + E-E-A-T + Succeeding in AI Search 真人作者 + 第一手 Experience + Markdown 结构
文档站 / API llms.txt Inference Guidance Model 写一份 /llms.txt + H1 + blockquote 摘要
AI 训练数据控制 llms.txt Access Control Model disallow + license CC-BY-NC
创作者 / 知识库 newtype 发布层模式 自有 wiki + LLM 友好 Markdown + 不依赖 Google
担心 AI 内容降权 Google "It's just content" + 披露 把 AI 当协作者 + Who/How/Why 三问自检
想押 AI Overviews Succeeding in AI Search 5 条 original + 结构 + multi-modal + trust signals

通用纪律:

  1. AI 内容本身不违规(Google 明确)
  2. 意图比工具重要(scaled content abuse 看 primary purpose)
  3. 披露 AI 参与(Who/How/Why)
  4. 不要 AI 当作者(Google FAQ)
  5. llms.txt 不强求(但写了无坏处,且文件成本极低)
  6. 真长期主义:自有 LLM 友好语料层 + 不押单一渠道

8. 引用清单

来源与关联资料