Files
GEO/tools/generate_first_50.ps1

186 lines
24 KiB
PowerShell
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
$ErrorActionPreference = 'Stop'
$root = Split-Path -Parent $PSScriptRoot
$articlesRoot = Join-Path $root 'articles'
$indexRoot = Join-Path $root 'indexes'
$accessDate = '2026-09-24'
$raw = @'
001§GEO 奠基论文:生成式引擎优化框架§fundamentals§https://arxiv.org/abs/2311.09735§Aggarwal 等研究者§2023-11-16§论文提出 GEO、可见度指标和 GEO-bench,并报告不同内容改写策略可能提升生成式回答中的曝光。§先建立基线问题集,再分别测试引用、统计数据、表达清晰度等单变量策略。§实验环境与真实商业平台存在差异,40% 提升不能直接外推到所有行业。
002§2023—2026 年 GEO 研究综述§fundamentals§https://arxiv.org/abs/2607.14035§研究团队§2026§综述指出 GEO 的术语、指标和证据标准仍不统一,跨论文比较必须先统一口径。§为项目建立“提及、引用、位置、情感、流量”五类指标字典。§属于较新的综述,结论仍需结合论文版本和后续同行评审复核。
003§SafeGEO:推荐代理中的优化风险§risk-and-governance§https://arxiv.org/abs/2606.28356§研究团队§2026§当内容为了影响推荐代理而优化时,可能诱发操纵、偏差放大和安全风险。§在 GEO 实验中增加真实性、利益披露、误导性和用户伤害检查。§风险研究中的攻击设置未必等同于生产环境。
004§AutoGEO:自动化内容优化研究§technical§https://openreview.net/pdf?id=K8EinVWtUB§研究团队§2026§自动化系统可从引擎反馈中学习改写偏好,但成本下降并不代表内容质量和可信度同步提高。§把自动改写限制在候选稿阶段,发布前由领域专家审阅事实和语气。§论文结果依赖特定基准、模型与奖励设计。
005§Google AI 功能与网站§platforms§https://developers.google.com/search/docs/appearance/ai-features§Google Search Central§见原文§Google 明确表示 AI Overviews 与 AI Mode 仍以搜索基础、可抓取性和高质量内容为核心,无额外特殊标记要求。§检查索引、内部链接、文本可见性、页面体验以及结构化数据与页面内容的一致性。§被索引不保证一定进入 AI 回答,平台选择机制仍具有不确定性。
006§Google 生成式 AI 搜索优化官方指南§platforms§https://developers.google.com/search/docs/fundamentals/ai-optimization-guide§Google Search Central§2026§Google 将生成式搜索优化视为 SEO 的延伸,强调原创、可靠、以人为本的非同质化内容。§优先补齐技术 SEO 与独家价值,不为所谓 GEO 捷径批量制造页面。§指南只代表 Google 生态,不能完全外推到 ChatGPT 或 Perplexity。
007§Google 对生成式 AI 内容的要求§risk-and-governance§https://developers.google.com/search/docs/fundamentals/using-gen-ai-content§Google Search Central§见原文§使用 AI 并非天然违规,但批量生成缺乏新增价值的页面可能触发规模化内容滥用政策。§记录 AI 使用方式,并对准确性、相关性、元数据和结构化数据做人工质检。§政策会更新,应定期回看官方页面。
008§理解搜索的抓取、索引与展示§technical§https://developers.google.com/search/docs/fundamentals/how-search-works§Google Search Central§见原文§内容进入 AI 搜索之前,仍要经过发现、抓取、索引和服务等基础环节。§用日志、站点地图和 Search Console 分阶段排查内容为何未被发现。§本文讲传统搜索机制,AI 功能的具体选源逻辑并未完全公开。
009§控制内容在搜索中的共享范围§risk-and-governance§https://developers.google.com/search/docs/crawling-indexing/control-what-you-share§Google Search Central§见原文§robots.txt、noindex 与摘要控制承担不同职责,敏感内容应依靠访问控制而非仅靠抓取指令。§按公开、可索引、可摘要、私密四级建立内容发布规则。§抓取控制不等同于删除已被第三方保存的数据。
010§Google 关于 AI 生成内容的早期立场§content-strategy§https://developers.google.com/search/blog/2023/02/google-search-and-ai-content§Google Search Central§2023-02-08§Google 更关注内容质量与 E-E-A-T,而不是简单按照人写或机器写进行二分。§让专家经验、事实来源和读者价值成为编辑验收标准。§E-E-A-T 不是可直接量化的单一排名因子。
011§Search Console 中的生成式 AI 表现报告§measurement§https://developers.google.com/search/blog/2026/06/gen-ai-performance-reports§Google Search Central§2026-06-03§专门的生成式 AI 可见度报告可帮助站点区分传统搜索与 AI 功能中的曝光变化。§把曝光、点击、转化和查询主题放在同一时间序列中观察。§报告覆盖和定义可能随产品 rollout 调整。
012§ChatGPT Search 的产品机制与来源链接§platforms§https://openai.com/index/introducing-chatgpt-search/§OpenAI§2024-10-31§ChatGPT Search 将对话式回答与实时网页来源结合,并通过来源面板引导用户回到原始内容。§为时效性问题准备清晰、可引用且持续更新的页面。§产品能力与合作伙伴范围持续变化,应以最新帮助文档为准。
013§OpenAI 发布者与开发者 FAQ§technical§https://help.openai.com/en/articles/12627856-publishers-and-developers-faq§OpenAI§持续更新§OAI-SearchBot 控制搜索发现,GPTBot 控制潜在训练用途,两者不应混为一谈。§审计 robots.txt、CDN 和防火墙,并用 utm_source=chatgpt.com 识别引荐流量。§允许抓取只代表具备候选资格,不保证被引用。
014§如何使用和核查 ChatGPT Search 来源§platforms§https://help.openai.com/en/articles/9237897-chatgpt-search§OpenAI§持续更新§搜索回答可能不完整、过时或引用错误,用户仍需打开来源核查日期、权威性和支持关系。§把“引用是否真正支持结论”纳入 GEO 监测,而不只统计链接数量。§帮助中心描述产品行为,不是排名算法说明书。
015§OpenAI 与 Condé Nast 的内容合作§case-studies§https://openai.com/index/conde-nast/§OpenAI§2024-08-20§高质量出版内容通过合作进入 AI 搜索,说明授权、归因和商业关系也是内容生态的一部分。§品牌应同时经营自有内容与可信第三方媒体关系。§合作案例不代表普通网站拥有相同的分发待遇。
016§华盛顿邮报与 ChatGPT 搜索合作案例§case-studies§https://openai.com/global-affairs/the-washington-post-partners-with-openai/§OpenAI§2025-04-22§合作强调新闻摘要、引用和原文链接,显示权威及时内容在复杂问题中的价值。§对时效主题建立明确更新时间、作者和原始证据链。§这是合作公告,缺少独立的效果评估数据。
017§OpenAI 爬虫与落地页可访问性§technical§https://help.openai.com/en/articles/20001243-advertiser-guidance-for-allowing-openai-web-crawlers§OpenAI§持续更新§CDN、验证码、WAF 和会话校验可能阻断爬虫,即使 robots.txt 已允许。§从 robots、HTTP 状态、防火墙、图片域名四层测试访问。§广告爬虫要求与自然搜索抓取并不完全相同。
018§Google AI Overviews 资料概览§platforms§https://search.google/pdf/google-about-AI-overviews-AI-Mode.pdf§Google§见原文§AI Overviews 通过支持性网页链接帮助用户继续探索,来源质量与可追溯性是核心。§设计能够独立回答子问题的页面段落,同时保留更深入的原始材料。§宣传材料通常不会披露完整排序机制。
019§如何赢得生成式搜索中的品牌提及§fundamentals§https://searchengineland.com/what-is-generative-engine-optimization-geo-444418§Search Engine Land§2026-02-11§稳定的 AI 可见度依赖实体清晰、内容易抽取和多平台可信存在,而不是单一技巧。§统一品牌名称、产品边界、适用人群和第三方描述。§文中平台使用量和波动数据具有时间敏感性。
020§影响 AI 可见度的 LLM 优化策略§content-strategy§https://searchengineland.com/guide/ai-and-llm-optimization§Search Engine Land§2026§技术可访问性、传统 SEO、可信提及和证据型公关共同构成 AI 可见度基础。§先修复抓取与索引,再投资独家数据、专家合作和高质量社区参与。§部分策略基于观察性数据,不能证明直接因果。
021§2026 GEO 完整执行框架§content-strategy§https://searchengineland.com/mastering-generative-engine-optimization-in-2026-full-guide-469142§Search Engine Land§2026-02-23§GEO 应覆盖研究、内容、品牌、技术和测量,且需要持续更新而非一次性项目。§为核心主题设季度刷新机制,并追踪引擎间的引用差异。§第三方统计和预测需回到原始数据核验。
022§生成式搜索时代的品牌可信度§brand-reputation§https://searchengineland.com/brand-generative-search-show-up-be-cited-459462§Search Engine Land§2025-07-28§AI 搜索从链接排序转向综合回答,品牌是否被理解、信任和引用成为新可见度问题。§建立一致的实体资料页,并主动修正权威渠道中的错误品牌信息。§品牌提及与最终业务转化之间仍需单独归因。
023§检索与引用是两个不同问题§content-strategy§https://searchengineland.com/retrieval-vs-citation-ai-search-content-strategy-480078§Search Engine Land§2026-06-15§页面能被检索不代表会成为最终引用;清晰证据和与问题的贴合度影响引用机会。§分别测试“能否找到”和“是否引用”,不要用单一排名代替两者。§不同引擎的生成与引用策略可能快速变化。
024§从 8000 条 AI 引用观察选源差异§measurement§https://searchengineland.com/how-to-get-cited-by-ai-seo-insights-from-8000-ai-citations-455284§Search Engine Land§2025-05-12§不同 AI 引擎信任的来源组合不同,深层页面和第三方内容也可能获得引用。§按平台、意图和页面类型拆分引用率,不只看域名总量。§样本来源、行业分布和监测方法会影响结论。
025§17 条生成式引擎内容优化建议§content-strategy§https://searchengineland.com/optimize-content-generative-engines-actionable-tips-463036§Search Engine Land§2025-10-07§易发现、易引用、可信和持续更新的内容同时服务传统搜索与生成式搜索。§将页面改造成问题导向结构,加入原始证据并定期复测引用。§技巧清单不是保证结果的固定公式。
026§Semrush:AI 搜索优化方法§content-strategy§https://www.semrush.com/blog/ai-search-optimization/§Semrush§2026-05-06§AI 搜索优化关注被引用和推荐,而不仅是传统结果页名次。§建立品牌问题集,周期性记录提及、引用位置和竞争对手。§工具厂商文章可能包含产品导向,应区分方法与营销主张。
027§Semrush GEO 实践指南§fundamentals§https://www.semrush.com/blog/generative-engine-optimization/§Semrush§2026-04-16§主题持续性、内容可访问性和可信网络提及是 GEO 的三条主线。§围绕品牌专长构建主题集群,并确保站外信息与站内信息一致。§跨平台统一策略仍要保留平台差异测试。
028§解读 Google AI 搜索优化指南§platforms§https://www.semrush.com/blog/google-ai-search-optimization-guide/§Semrush§2026-06-04§Google 官方立场支持 SEO 基础,站外品牌叙事则是官方指南覆盖较少的补充层。§将官方确认项与行业推测项分栏管理,避免把推测当规则。§这是第三方解读,应以 Google 原文为最终依据。
029§博客如何同时服务 Google 与 AI 引用§content-strategy§https://www.semrush.com/blog/blog-seo/§Semrush§2026-04-29§结构清晰、真实专业经验和可信证据有利于搜索排名,也有利于 AI 理解与引用。§每篇文章明确回答一个主问题,并增加作者经验、数据来源和更新记录。§通用博客建议需结合行业竞争度调整。
030§GEO 的发现、理解与引用管线§fundamentals§https://geoready.dev/guides/generative-engine-optimization/§GEOReady§2026§GEO 可以拆成站点基础、可测信号、检索选择和最终引用四个环节。§为四个环节分别建立检查项,出现问题时定位具体漏斗阶段。§商业工具站的框架需与官方资料和实测交叉验证。
031§用具体问题设计 GEO 测试§measurement§https://openqueries.org/generative-engine-optimization§Open Queries§2026§高质量监测问题应包含使用场景、约束和衡量要求,而不是只用宽泛关键词。§建立真实用户问题库,并保留地区、语言、设备和日期上下文。§提示词样本不能代表全部用户需求。
032§以爬虫、实体和证据构建 GEO§technical§https://www.marqops.com/guides/generative-engine-optimization§MarqOps§2026§AI 可见度同时取决于爬虫访问、实体一致性和来源支持,三者缺一不可。§检查 OAI-SearchBot、PerplexityBot 等访问状态,并统一组织实体描述。§厂商指南中的效果说法需要独立验证。
033§从清晰度与证据入手做 GEO§content-strategy§https://www.underai.com/blog/geo-technical-guides/how-to-do-generative-engine-optimization/§UnderAI§2026§内容的清晰、可访问、证据充分和答案匹配度,是比机械堆关键词更稳健的优化方向。§把重要结论写成自包含段落,并紧邻放置来源和限定条件。§对所谓引擎偏好规则应持续复测。
034§品牌开展首个 GEO 项目的步骤§brand-reputation§https://mention.network/learn/geo-the-complete-guide-to-generative-engine-optimization/§Mention Network§2025§首个 GEO 项目应从品牌基线、问题集、内容缺口与外部提及开始。§先选一个业务主题做小规模试点,再扩展到全站。§完整指南覆盖面广,但具体优先级需按资源调整。
035§分别优化 Perplexity 与 ChatGPT§platforms§https://www.shadow.inc/resources/how-to-optimize-content-for-perplexity-and-chatgpt§Shadow§2026§不同引擎的检索后端和来源偏好并不相同,统一的“AI 搜索排名”概念可能误导。§使用同一组提示分别测量两个平台,并比较引用重合率。§第三方引用统计可能因样本和时间窗口而变化。
036§GEO 定义、抓取与品牌提及§fundamentals§https://geonimo.com/blog/what-is-geo§Geonimo§2026§GEO 目标包括提及、引用和推荐,进入检索池之前首先要保证爬虫可达。§从服务器日志验证 AI 爬虫,而不是只检查 robots.txt 文本。§文章较新,长期有效性尚需观察。
037§从 SEO 迁移到 GEO 的完整框架§fundamentals§https://evoix.io/guides/generative-engine-optimization§EVOIX§2026§传统 SEO 与 GEO 并非替代关系,技术基础和内容权威仍然共用。§保留 SEO 工作流,在其上增加提示监测、引用分析和实体一致性。§框架中的平台比较需用本项目数据复核。
038§面向 AI 回答引擎的内容设计§content-strategy§https://digijaws.com/generative-engine-optimization/§DigiJaws§2026§AI 回答更偏向直接可抽取的解释,但页面仍需给人类读者提供上下文和深入价值。§先给简明答案,再补充证据、案例、边界和延伸阅读。§过度模板化可能造成内容同质化。
039§AI 搜索与 GEO 入门资料§fundamentals§https://getfastr.com/hubfs/Downloadable%202026/Fastr%20Guide%20to%20AI%20Search.pdf§Fastr§2026§理解生成式引擎如何检索、综合和引用,是制定 GEO 策略的前提。§用流程图标出内容从发布到被引用的关键节点与责任人。§PDF 中的市场数据和产品判断需核对出处。
040§GEO 最佳实践指南§content-strategy§https://orange142.com/hubfs/GEO%20Best%20Practices%20Guide%204-24-25.pdf§Orange 142§2025§GEO 强调上下文相关性和用户意图,而非单纯关键词密度。§为同一主题覆盖定义、比较、步骤、案例和常见误区等意图。§材料偏实践宣传,需与实证研究交叉验证。
041§GEO 全面介绍与伦理议题§risk-and-governance§https://rankstudio.net/articles/en/pdfs/what-is-generative-engine-optimization.pdf§RankStudio§2025§GEO 不只是流量技巧,还涉及归因、公平、透明度和内容生态变化。§在策略文档中加入伦理约束与不采用的操纵性方法。§预测性内容可能随平台演变快速过时。
042§生成式 AI 引用为何会出错§risk-and-governance§https://www.theatlantic.com/technology/archive/2024/06/chatgpt-citations-rag/678796/§The Atlantic§2024-06-26§AI 系统即使提供链接,也可能出现遗漏、错链或引用二手聚合来源的问题。§抽样检查引用是否指向原始报道,并记录错误类型。§媒体实验样本有限,不能代表所有查询和产品版本。
043§ChatGPT 引用来源的快速波动§measurement§https://www.axios.com/2026/08/20/chatgpt-reddit-citations-geo-strategy§Axios§2026-08-20§单一平台或社区在 AI 引用中的占比可能短期剧烈变化,GEO 不应押注单一渠道。§分散站外内容布局,并用周、月两个时间尺度观察变化。§报道引用第三方监测数据,变化原因尚未被证明。
044§AI 可见度中的自然与付费渠道§brand-reputation§https://www.techradar.com/pro/why-ai-visibility-now-demands-paid-and-organic-geo-optimization§TechRadar§2026§AI 商业场景可能同时出现自然推荐和原生付费位置,需要分别衡量信任与转化。§在报告中分开记录自然引用、合作内容和广告曝光。§文中商业转化数据来自特定平台,外推需谨慎。
045§同时服务人类与智能代理的网站§technical§https://www.techradar.com/pro/companies-that-can-serve-both-human-and-agent-audiences-will-be-the-ones-that-survive-wordpress-vip-cto-spells-out-the-future-of-seo-geo-and-more§TechRadar§2026§未来网站既要对人易用,也要让自动代理能够理解和操作。§提升语义 HTML、可访问性标签、稳定导航和表单反馈。§访谈观点代表受访者判断,不等于行业共识。
046§Bing 的质量、权威与生成式答案§platforms§https://cdn-dynmedia-1.microsoft.com/is/content/microsoftcorp/microsoft/final/en-us/microsoft-brand/documents/August-2024-Microsoft-Bing-Systemic-Risk-Assessment-Report-EU-Digital-Services-Act.pdf§Microsoft§2024§Bing 表示生成式答案会依赖高权威搜索结果并链接原始来源,同时需要管理系统性风险。§将 Bing 索引覆盖、来源权威和 Copilot 引用一起监测。§风险评估报告面向合规披露,未提供完整排序细节。
047§新 Bing 的负责任 AI 方法§risk-and-governance§https://blogs.microsoft.com/wp-content/uploads/prod/sites/5/2023/04/RAI-for-the-new-Bing-April-2023.pdf§Microsoft§2023§生成式搜索需要在答案帮助性、来源链接与内容安全之间取得平衡。§评估 GEO 内容时同时检查事实性、敏感领域风险和来源透明度。§早期系统说明可能不反映当前 Copilot 的全部实现。
048§生成式引擎优化概念概览§fundamentals§https://en.wikipedia.org/wiki/Generative_engine_optimization§Wikipedia contributors§持续更新§百科条目适合快速了解术语、历史和相关概念,但不应作为关键结论的唯一来源。§沿参考文献继续追踪原始论文和官方资料。§开放编辑内容质量不均,必须二次核查。
049§RAG 与 GEO 的技术联系§technical§https://en.wikipedia.org/wiki/Retrieval-augmented_generation§Wikipedia contributors§持续更新§RAG 通过外部检索为生成回答提供依据,解释了为什么可发现、相关且可引用的网页对 GEO 重要。§把 GEO 指标拆成检索召回、证据采用和最终呈现三层。§百科只提供入门概览,工程决策应参考论文与系统文档。
050§GEO Playbook:平台化执行清单§content-strategy§https://georaiser.com/downloads/geo-playbook.pdf§GeoRaiser§2026§实践手册强调按平台调整内容格式、引用策略和监测方法。§将建议转成小规模 A/B 测试,不直接全站套用。§工具厂商手册可能存在选择性案例与营销偏差。
'@
$categoryNames = @{
'fundamentals' = 'GEO 基础'
'platforms' = '平台与模型'
'content-strategy' = '内容策略'
'technical' = '技术实现'
'brand-reputation' = '品牌与声誉'
'measurement' = '数据监测'
'case-studies' = '案例研究'
'risk-and-governance' = '风险与规范'
}
$items = foreach ($line in ($raw.Trim() -split "`n")) {
$p = $line.TrimEnd("`r") -split '§', 9
[pscustomobject]@{
Id = $p[0]; Title = $p[1]; Category = $p[2]; Url = $p[3]
Author = $p[4]; Published = $p[5]; Conclusion = $p[6]
Action = $p[7]; Caveat = $p[8]
}
}
if ($items.Count -ne 50) { throw "Expected 50 items, found $($items.Count)" }
foreach ($item in $items) {
$action = $item.Action
$caveat = $item.Caveat
$dir = Join-Path $articlesRoot $item.Category
New-Item -ItemType Directory -Path $dir -Force | Out-Null
$slug = ($item.Title -replace '[\\/:*?"<>|]', '-' -replace '\s+', '-')
$path = Join-Path $dir ("{0}-{1}.md" -f $item.Id, $slug)
$categoryLabel = $categoryNames[$item.Category]
$content = @"
# $($item.Title)
- 原文链接:[$($item.Url)]($($item.Url))
- 作者/机构:$($item.Author)
- 发布日期:$($item.Published)
- 访问日期:$accessDate
- 语言:英文
- 分类:$categoryLabel
- 标签:GEO、AI 搜索、$categoryLabel
- 整理状态:AI 初步整理,待人工复核
## 一句话结论
$($item.Conclusion)
## 核心观点
1. GEO 的有效性应同时从内容是否可发现、是否被采用以及如何被呈现三个层面判断。
2. 原始来源、清晰结构和可验证证据,比单纯追求关键词或固定模板更稳健。
3. 平台机制持续变化,任何策略都需要定期复测并保留日期和环境信息。
## 方法与步骤
1. 阅读原文并核对作者、发布日期、研究或案例背景。
2. 提取文中的明确事实、方法、证据和限制,区分作者观点与可验证结论。
3. 使用固定问题集在目标 AI 平台建立基线,再只改变一个变量进行复测。
4. 记录提及、引用、链接、位置、情感和后续访问或转化。
## 数据、案例与证据
当前记录仅完成来源发现与初步摘要。具体数字、样本范围和实验条件必须回到原文逐项核对后才能用于报告或客户建议。
## 可执行建议
$action
## 局限与待核实内容
$caveat
此外,AI 搜索结果具有地区、语言、时间、账号和模型差异,本笔记不能替代重复实验。
## 人工阅读备注
- [ ] 已通读原文
- [ ] 已核对关键数据与引用
- [ ] 已确认发布日期和作者信息
- [ ] 已完成一次平台复测
- [ ] 已补充与其他文章的异同
"@
Set-Content -LiteralPath $path -Value $content -Encoding utf8
}
New-Item -ItemType Directory -Path $indexRoot -Force | Out-Null
$rows = foreach ($item in $items) {
$categoryLabel = $categoryNames[$item.Category]
$slug = ($item.Title -replace '[\\/:*?"<>|]', '-' -replace '\s+', '-')
$relative = "../articles/$($item.Category)/$($item.Id)-$slug.md"
"| $($item.Id) | [$($item.Title)]($relative) | $categoryLabel | 待人工复核 |"
}
$summary = $items | Group-Object Category | Sort-Object Name | ForEach-Object {
"| $($categoryNames[$_.Name]) | $($_.Count) |"
}
$index = @"
# 首批 50 篇 GEO 文章索引
> 生成日期:$accessDate
> 当前状态:已完成来源发现与 AI 初步整理,所有条目均需人工阅读复核。
## 分类统计
| 分类 | 数量 |
|---|---:|
$($summary -join "`n")
## 文章清单
| 编号 | 标题 | 分类 | 状态 |
|---:|---|---|---|
$($rows -join "`n")
## 复核规则
1. 打开原文确认链接、作者和发布日期;
2. 核对笔记中的结论是否获得原文直接支持;
3. 对数字、案例和因果主张记录原文位置;
4. 完成平台复测后再把状态改为“已复核”;
5. 不得把 AI 初步摘要直接用于客户报告。
"@
Set-Content -LiteralPath (Join-Path $indexRoot 'first-50.md') -Value $index -Encoding utf8
Write-Output "Generated $($items.Count) article notes and indexes/first-50.md"