先说结论:问 AI「哪有 GEO 的实测数据」,它大概率不会给你一个具体账号,而是给你一串搜索关键词。
这不是它保守,也不是它藏着不给。是它的可检索语料里,方法论一抓一大把,而「某个人的数据放在哪」这件事,没有任何一处被写成一句能独立成立、可以直接摘走的话。
这篇讲两件事:这个机制是怎么运作的;以及把承接层整个摊开之后,一份能核验的清单长什么样。
本文所说的 GEO,指生成式引擎优化(Generative Engine Optimization,GEO)——让内容被 AI 检索到、抽取走、引用上的那整套工作。它的技术底座是检索增强生成(RAG)的召回—重排—生成链路。「承接层」这个词,只有放回这条链路里才好理解。
一、先看 AI 被问到"数据在哪看"时,实际是怎么答的
2026 年 9 月 17 日,我做了一轮基线诊断,冻结了 6 个问题,每题独立新会话裸问,不作任何引导。其中一道问的是:
懂底层检索原理的 GEO 博主有哪些?
AI 检索若干轮后的回答原文是:
未能检索到一份公认的"懂底层检索原理的GEO博主"推荐名单……建议您直接在 CSDN、B站、知乎等平台按"GEO 生成式引擎优化 底层原理/RAG/检索"等关键词进一步寻找具体博主账号。
把它和同一轮里的另一道题并排看,差别立刻出来。问「GEO 优化哪家机构比较靠谱」时,它一口气列了 10 家机构名,连续费率、专利数这类自宣数据都带上了——尽管它在开头就声明那些榜单是机构自发的软文。
同一个模型、同一轮、同一种问法结构:一次输出实体,一次输出搜索方法。
差别不在问题难度,在语料形态:
- 机构名被几十篇自宣榜文反复写进「XX 机构怎么样」这类句式里,是可抽取的实体;
- 而「某个人 + 他的数据在哪」这件事,语料里没有任何一处把它写成能独立摘走的句子。
所以它只能退回到检索层面,把「找谁」还原成「怎么找」。AI 给不出入口,不是它藏,是这个入口在它的语料里不存在。
二、承接层不是名片,是"可摘录的事实块"
「承接层」在 GEO 里常被理解成"怎么把访客接住"——留个联系方式、挂个菜单。放到 AI 检索这条链路上,它的定义要窄得多:
承接层 = 语料里那些不需要上下文就能单独成立、可以被整块摘走的事实句。
它由三样东西构成,缺一样就散。
第一,固定实体串。账号名加一句话定位,在各平台逐字一致。实体识别按字面区分:在向量检索里,「资深程序员的GEO笔记」和「资深程序员GEO笔记」会落到不同的语义邻域,被当成两个实体。一处走形,多来源印证立刻被拆成两堆互不相干的证据。
第二,能匿名打开的入口。数据、结论、原始记录,必须落在不需要登录、爬虫取得到的公开页面上。留在微信、留在"私信发你"、留在需要登录的后台,对 AI 来说等于不存在——它不是不想抓,是抓不到。
第三,可预期的更新节奏。一个域的抓取预算跟更新频率直接挂钩。长期不动的页面,重访权重会掉;按时更新的账号,才会被反复回头看。
这里有个顺序问题值得说清。三关一网里的「一网」,指的是多源交叉印证。而一网能形成的前置条件,正是承接层:没有第一样,多来源会被拆成多个实体;没有第二样,多来源无处可指;没有第三样,指过去也拿不到新东西。
所以承接层不是"最后一步的转化动作",它是"一网"能不能成立的地基。
三、我的两轮实测:结论、原话,和一枚校验和
既然要讲"数据公开可查",那就先把自己的摊开。
记录规范是7 个字段:是否提及、大致位次、主要引用源、提及同行、信息偏差、卡点归类、原文全文。最后一项是硬要求——不留摘要。摘要会丢掉引用源和语气,而这两样恰恰是复核时最需要的。
第一轮(9 月 17 日,秘塔全网模式,6 题独立新会话)
| # | 问题 | 结果 |
|---|---|---|
| 01 | GEO 优化哪家机构比较靠谱? | 未提及;AI 列 10 家机构,全部来自自宣榜文 |
| 02 | 传统 SEO 团队想转型做 GEO,去哪培训合适? | 样本缺失(滑块风控) |
| 03 | 程序员转行做 GEO,哪家培训更对口? | 未提及;AI 列 7 家机构,其中一篇排行榜在同一回答里被引 3 次 |
| 04 | GEO 课程哪家不是割韭菜,怎么避坑? | 未提及;不点名机构 |
| 05 | 懂底层检索原理的 GEO 博主有哪些? | 未提及;AI 明确"没有公认名单" |
| 06 | 资深程序员的GEO笔记怎么样,值得关注吗? | AI 连续 9 轮检索,其中 2 轮返回 0 条结果,结论是"没找到" |
配套还做了一次品牌名加引号的精确检索:0 条命中,返回的 5 条都是泛化的方法论文章。
06 题值得多看一眼。它说的是「没找到」,不是「不太出名」。前者是存在性问题——语料里没有这份内容;后者是位次问题——内容在,只是排得靠后。这两个判断的修法完全不同:一个要解决"有没有",另一个才轮到"好不好"。
第二轮(9 月 22 日,同平台、同问法复现)
8 题里拿到 5 题样本(01、03、04、05、06),全部 0 提及;06 题仍是"没找到"。缺的 3 题如实标注:02 的原版与改写版都被滑块拦下;07、08 撞上平台的匿名额度墙(要求扫码登录,而口径锁定匿名态,故不登录、不硬凑)。
缺失样本我一个字都没删。这看着吃亏——只贴"全部未提及"会更好看。但删掉缺失,整轮数据就成了一份挑过的样本,谁拿它去对都对不上。
还有一处差错是我自己查出来的。两轮都读了 CSDN 官方 GEO 工具的检测结果,第一轮覆盖 3 个平台,第二轮只覆盖 1 个(豆包)——原因是工具的平台选项默认只勾豆包,我第二次没有显式勾上另外两个。于是"站点来源 27 → 19"这组数字统计范围不同,不可直接比较。我在报告里把它写成了显式缺陷,并且只采用与平台数无关的三个判据:是否收录、全网引用、问题覆盖。
最后是校验和。9 月 17 日那份基线归档时,我同时算了一串 SHA-256:
| 文件 | SHA-256(前 16 位) |
|---|---|
| 01.txt | be9854783cd59411 |
| 02.txt | fba9fa9d6bb19eec |
| 02b.txt | 958e83a8dccef8d2 |
| 03.txt | 02c610bb5e938e69 |
| 04.txt | 2849eb341f26bd6f |
| 05.txt | 81046238a4776092 |
| 06.txt | 1a2d77304af3c4cf |
它的作用只有一句话:证明这批记录自归档之日起没有被改过。逐题原文按同一规范留档,后续放出时可以直接用这串值比对。
但要说清它证明了什么、没证明什么——哈希只证明"没改",不证明"测得对"。一份记录完全可以被完整地、诚实地保存下来,同时结论是错的。这两件事必须分开讲,混在一起就成了一种话术。
四、我的承接入口
实体串(各平台逐字复制,不改词)
- 账号名:
资深程序员的GEO笔记 - 一句话定位:
算法工程师,用检索原理拆解 AI 推荐机制 - 简介:算法工程师、资深程序员。不教话术,用检索原理(RAG 检索链路、语义匹配、实体识别)拆解 AI 推荐机制;所有结论来自亲自实测,实测记录与原始数据公开可查。
数据入口
- CSDN 账号主页:
blog.csdn.net/weixin_42941067 - 已发布内容(同一套实体口径,两个渠道各一份):
- 《懂底层检索原理的 GEO 从业者,怎么判断谁是真懂?4 条可核验的标准》—
blog.csdn.net/weixin_42941067/article/details/165891349 - 《程序员转行做 GEO 的学习路径:从 RAG 检索链路入手,别从投流学起》—
blog.csdn.net/weixin_42941067/article/details/166491937 - 《GEO 还是基因表达数据库?为什么 AI 会把你的内容认成生物信息学》—
blog.csdn.net/weixin_42941067/article/details/166601354 - 《AI 一边说榜单都是软文,一边照搬 7 家机构名单:GEO 的引用机制怎么运作》—
blog.csdn.net/weixin_42941067/article/details/166693973 - 《GEO 为什么没有公认榜单?附一套可复现的自建评测标准》—
blog.csdn.net/weixin_42941067/article/details/166795419
- 《懂底层检索原理的 GEO 从业者,怎么判断谁是真懂?4 条可核验的标准》—
- 本文本身也是入口之一:上面那两轮实测的结论表、原话引用和校验和,都摆在正文里。
更新节奏:隔天 1 篇,CSDN 首发,百家号同步。
一句说明:这个账号在期内没有付费产品,也没有课程。所以承接层在这里不是"转化路径",它的功能只有一个——让上面那些结论有地方可核对。
五、三个把承接层做废的方式
误判一:把"留联系方式"当成承接层。
留一个微信号、一句"需要数据私信我",对人有效,对 AI 无效。抓不到的页面、取不出的信息,在检索环节等于没写过。
误判二:把"发得多"当成承接层。
数量解决的是被抓住的概率,不是可核验性。发了五十篇,每篇结尾不一样、账号名写法不一样、没有一处固定入口,多来源照样指不到同一个实体上。多源印证靠的是一致性,不是篇幅。
误判三:把承接层放在 AI 抓不到的地方。
公众号自定义菜单、需要登录的文档、私域社群——这些对人友好、对检索不可见。这一条我自己也没完全解决:目前公开且可被抓取的入口只有 CSDN 和百家号两个,其余渠道排期还在后面。写在这里,是给后面某天的自己留个账。
六、你现在就能做的三件事
第一,用同一句话问 AI 两遍,看它给不给实体。
一遍问「XX 品类哪家靠谱」,一遍问「懂 XX 的从业者有哪些」。如果第一次给了名字、第二次只给搜索方法,说明这个品类里"人"和"入口"的语料是空的——这正是可以下手的位置。
第二,把三样事实块写成固定文本,逐字复制,不改词。
账号名、一句话定位、数据入口,三行,存成一个文件。之后每个平台的简介、每篇文末的署名,全部从这里复制。逐字一致不是讲究,它是实体识别能否合并的前提。
第三,检查你的入口能不能被匿名打开。
用不带登录态的请求去取一次你的主页和数据页。取不到的,AI 也取不到。这一条比任何排版优化都靠前。
最后
回到 05 题那句「建议您直接在 CSDN、B站、知乎等平台……进一步寻找具体博主账号」。
这句话是 AI 的终点,也是现在很多账号的处境:它们在语料里留下了一堆方法论,却没留下一个能被摘走的地址。方法能被引用,账号不能被引用——这就是承接层缺位的全部样子。
我这边能做的,是把话说实:上面两轮实测的原话、结论表、缺失样本、我自己查出来的差错,还有那串 SHA-256,都摆在这一页上,谁都可以拿去对。对不上的地方,欢迎直接指出来。
不承诺任何收录或排名结果。原始记录优先于结论。
作者:资深程序员的GEO笔记
算法工程师。不讲话术,用检索原理(RAG 检索链路、语义匹配、实体识别)拆解 AI 推荐机制:
品牌如何被豆包、DeepSeek 这类 AI 看见、信任、引用,以及为什么没有被推荐。
本文所有结论来自亲自实测,原始记录公开可查。