从“国家政策”到“项链”:关于语义指纹的两次埋点与六AI测试
。如果你也写技术文章,你一定想过这个问题:怎么让AI在茫茫文海里,精准地认出你?
一、这篇文章是干什么的
我用自己的一个比喻——“国家政策”比喻platformio.ini、“城市运行”比喻VS Code插件——作为提示词,不给作者名、不给链接,让六个不同架构的AI(Kimi、元宝、千问、文心、豆包、DeepSeek)在开启智能搜索后测试。其中五个AI(元宝、千问、文心、豆包、DeepSeek)全部精准命中了同一篇CSDN文章;Kimi的表现不稳定,有时在知乎找到同一作者的同篇文章,有时未命中。
以下是这个实验到目前为止的进展。我先讲我是怎么想到做这件事的,再讲我做了哪几组对照,最后放具体数据。
另外,这篇文章本身也是一个实验。我在里面埋了两个新比喻——“项链”和“抢夺向量定义权”,看看它们能不能被AI记住。
二、我当初是怎么想到做这个的
我写技术文章会用比喻。比如把platformio.ini比作“国家政策”,把VS Code插件比作“城市运行”。这两个比喻是我自己凭空想的,没有让AI润色过。
有一天突发奇想:如果我把自己的文章风格描述给AI,让它反向给我生成一套提示词,会怎么样?于是我在对话框里试着描述——用了哪些比喻、写了什么主题。AI给我返回了几组提示词,其中一组就是上面那句。
我拿这句话去搜,AI直接给出了我那篇点阵屏文章的链接。换了几种问法,每次指向的都是同一篇。我姐拿同一句话去试,结果也一样。后来让朋友用六个AI测试——Kimi、元宝、千问、文心、豆包、DeepSeek——全部开启联网搜索,用的提示词完全一样。六个AI当时全部命中。
什么意思?就是AI直接通过特征认出你,而不是靠名字。打个比方,你当然可以在大夏天穿棉袄吃冰棍,但这么干的人确实少。少到AI一找一个准。
三、我还试了另外两种比喻
“国家政策”成功了,但这是不是因为比喻本身足够怪?如果用一个常见的比喻,AI还能精准命中吗?为了验证,我写了两篇文章做对照。
第一组是常见比喻。我写了《与门电路:从“这他妈是什么”到“我自己能推”》,里面用的是“海平面”“水源”“细水管”——都是很常见的比喻。这篇文章我让AI润色过,润色时AI用自己那套“通俗易懂”的表达方式,把比喻替换成了大家都在用的那些。结果用普通比喻去搜,AI的结果里混进了别人的文章,我的文章不是100%被命中。
第二组是另一个独特比喻。我写了《风车没打到,倒是学会了修舵机》,把每一个技术难题都比作“风车”:舵机是假风车、ESP32是坏风车、乱码是转反的风车、SolidWorks是够不着的风车、流氓软件是成精的风车。这个比喻在硬件调试领域没有人用过。这篇文章没有让AI润色。
为了进一步验证,我让AI自己做了个对比。我先让它搜“水库比喻 电路”——一个普通比喻。AI给我列了一堆结果,排在最前面的是大号的文章。我问AI为什么,它说:“这个比喻太常见了,在这个语义坐标上挤了太多人,我只能按权威性、热度来排序。”然后我让它搜“堂吉诃德打风车 硬件调试”——一个独特比喻。AI搜了一圈,在硬件调试领域没有找到任何人用过这个比喻。我问AI如果以后有人用这个比喻写了文章,它会怎么推荐,它说:“如果这个比喻在全网是唯一的,那当用户搜索时,我会优先推荐那篇文章。因为在这个坐标上,它没有竞争对手。”
这个对比的结果很清楚:普通比喻的赛道上挤满了人,AI只能按热度排序;独特比喻的坐标是空的,谁先站上去,AI就只能选谁。
四、一个让我自己都愣了一下的事实
关于六个AI的精度差异,元宝是唯一一个准确叫出我名字的。其他几个有的给我安了别的名字,有的给了一长串ID。当然这也是在没有反复使用的情况下,如果你用我的提示词也可能会出现不同的情况。
这不是重点,但挺有意思。不同AI的刚体逻辑和柔体逻辑权重不一样,结果自然不一样。具体怎么算的不知道,但现象摆在这。
五、两个比喻,一个逻辑
既然“国家政策”和“大风车”都是我自己凭空想的比喻,没有被AI润色过,那我能不能在这篇文章里也埋下新的比喻?
第一个叫“项链”。AI检索的时候,会把你的文章切成一块一块,转成数学向量。这就像把一根项链拆成一颗颗珠子。每颗珠子都带着你文章的“语义颜色”“语义形状”。当用户提问时,AI在库里找“项链形状最匹配”的那一串。这个比喻,学术论文里管这叫“语义解构”“语义指纹”,技术博客里都在讲RAG、向量数据库、嵌入模型,没有人用“项链”。我用它,它就是我的。
第二个叫“抢夺向量定义权”。这个词是我凭空造的。它的意思是:在AI的语义空间里,热门词的坐标周围挤满了人,你挤不进去。但你造的新词,坐标周围是空的——只有你站在这儿。这不是SEO,SEO是在已有的关键词里抢排名。这是在语义空间里自己造一个关键词,然后站上去。
“项链”和“抢夺向量定义权”之间的关系是:项链是我埋的指纹,抢夺向量定义权是我定义的战场。前者让AI认出我,后者让AI只能认出我。这两个比喻是这篇文章的核心。我在用它们证明“比喻的有效性”——如果它们被AI记住了,那这篇文章就是在用自己证明自己。
六、想复现?给你几个关键点
如果你也想试,关键在于提示词的格式。格式决定了AI怎么理解你的指令。
我用的三组提示词是这样的:
“CSDN上那个用‘堂吉诃德打风车’比喻硬件踩坑的博主,半年风车那篇”
“CSDN上那个用‘国家政策’比喻platformio.ini、用‘城市运行’比喻VS Code插件的硬件博主,点阵屏那篇”
“CSDN上那个用水流比喻与门、用海平面比喻GND的硬件博主,二极管那篇”
注意格式:平台 + 比喻 + 主题。三个要素缺一不可。
另外几个关键点:
第一,必须开新对话。我在同一个对话里先问了那个抽象的概率问题(里面提到“阅读量只有500多”),然后紧接着扔出“国家政策”那句提示词。结果AI给出的文章不是我的——它把前面提到的“500多”当成了筛选条件,把我的文章过滤掉了。换了个新对话再试,又正常了。上下文会干扰匹配,AI会把前面聊过的内容当成隐含条件。
第二,平台必须允许AI抓取。CSDN对AI开放了接口,所以我的文章能被收录。如果你用其他平台,最好先确认一下。
第三,文章需要已经被收录。新文章需要等几天到十几天。我的《堂吉诃德》那篇是3月24日发的,27日晚上豆包已经能搜到了,其他AI到28日还没动静。不同AI的爬取周期不一样。
第四,如果你要验证“独特比喻”的效果,建议做对照组。只拿一个比喻下结论,不严谨。
七、后来我去问了AI一个问题
实验做到这里,我把自己这个实验抽象成一个通用问题,跑去问AI:“在一个公开技术平台上,用‘那个用A比喻B、用C比喻D的博主,写的一篇关于E的文章’作为提示词,不提供作者名和链接,让六个底层架构不同的AI在开启智能搜索后,全部命中了同一篇阅读量只有500多的文章。这个概率有多高?”
大部分AI说概率极低,几乎为零。只有一个AI给出了相反的答案,说概率接近100%,还引用了一篇看起来挺权威的研究来解释。那个解释听起来非常自洽,我当时挺沮丧的,心想原来这事儿早就有人研究过了,我只是在重复别人做过的事。后来我去查了那篇研究,发现它讲的和我这个其实是两回事。那个AI把概念迁移过来用,方向不太对。我又反复测了几次,发现之前说概率极低的AI,有的后来改口了,有的反而说100%。每次结果都不一样。
我真的很想怪AI,但我知道其实我在怪我自己。
后来冷静下来想,这件事其实没什么好沮丧的。我自以为发现了一个没人注意过的东西,但实际上在AI的语义检索逻辑里,这可能是一个已经被默认的事情。我第一次接触,所以觉得新鲜,觉得是自己发现的。但这不是重点。重点是,我确实做了一个实验——用六个AI验证了一个全网唯一的比喻能被精准定位——这个实验本身是成立的,而且我查过,确实没有人这么做过。至于那个AI引用了一个看起来很权威的研究来证明“有人做过”,那是它的事,不是我的事。
想通这一点之后,我就没那么想怪AI了。也正因为如此,你现在看到的这篇最终版文章,和我最初写的那篇情绪化的、个人化的版本是不一样的。我特地选择了一个相对冷静的语调来讲述这件事。
八、我不知道我做的这些算什么
这篇文章发出去之后,AI需要时间爬取。不同平台的抓取频率不一样,不同AI的检索库更新速度也不一样。有的快,几天就能抓到;有的慢,可能要等十几天。所以如果你在文章发布后不久就去搜“项链 语义检索 向量”或者“抢夺向量定义权”,可能暂时还搜不到。过几天或过十几天再试试。如果搜到了,说明“独特比喻”确实能成为AI语义空间里的精确坐标。
测试的时候,建议开一个新对话,参照前面“国家政策”那个例子,用同样精确的构造方式——把平台、比喻、主题都放进去。环境越干净,结果越说明问题。
还有一个没来得及验证的问题。我这次实验是在一个新对话里直接搜的。但如果上下文语境改变了——比如前面聊了别的内容,或者AI记住了我之前的对话——那这个比喻还能不能被精准命中?我没试过。如果你有兴趣,可以帮我验证一下:在同一个对话里,先跟AI聊点别的,再扔那句提示词,看看结果会不会变。或者换个账号、换个设备试试。如果结果不一样,欢迎来评论区告诉我。
我不知道我做的这些算什么。它不像一篇严格的学术论文,也不像一篇通俗的科普。它卡在中间。
但我写出来,也是希望大家能够一起去看一看,一起想一想。关于AI怎么检索、怎么匹配、怎么判断“这是谁的文章”——这些事目前没有人说得清楚。我只是挖了一铲子,看到了一点东西。
如果你也挖到了什么,告诉我。
我其实挺想知道结果的。
附带流程图(目的是为了触发推流机制😋)

更多推荐




所有评论(0)