文 | 蒋旭峰(资深金融从业者)
2026年8月的某一天,OpenRouter平台上突然冒出来一个叫「Ox Alpha」的模型。
1M上下文窗口、多模态能力、免费使用,编程能力被社区测出接近前沿水平。参数表上的每一项都很能打。但最引人注意的是它的「匿名」身份,没有厂商信息,没有技术报告,连模型卡都写得含糊不清。
社区立刻炸了。有人兴奋,说这可能是某大厂偷偷放出来的内测版。有人怀疑,说搞不好又是套壳。
然后有人做了一件事。给它发了几条探测请求,测了测它的「行为指纹」。
结果很快出来了,分词器偏移75个token,跟GLM-5.3完全一致。特定错误提示字符串,跟z.ai的输出一模一样。温度参数的响应曲线,和某款已知模型高度重合。
结论,Ox Alpha大概率是GLM-5.3 Air或者Mimo V3的变体。换了个名字,换了层皮,但核心的「出厂信息」一点没变。
AI 模型无论改名换壳,其「出厂信息」都无法隐藏(示意图)
这件事有意思的地方不在于又揪出了一个「套壳模型」。这种事在AI圈已经不新鲜了。真正值得聊的是,在一个模型可以随便改名、换壳、二次封装的时代,我们靠什么知道「它到底是谁」?
答案正在从两条独立的技术路线上同时浮现。一条叫「行为指纹」,一条叫「内容水印」。一外一内,一被动一主动,最终指向同一个结论,
⚡ 核心洞察
AI生成的东西,终将带着不可磨灭的身份信息。
一、行为指纹,AI藏不住的「数字执念」先从那个「无聊到天才」的实验说起。
2026年7月,布拉格经济大学的研究员托马什·布鲁克纳在arXiv上挂了一篇论文,标题叫《One Token Is Enough》。一个Token,就够了。
他做了什么呢?对165个不同的大模型,反复问同一个问题,「给我一个1到100的随机数。」每个模型问30遍,然后统计答案分布。
结果出来,整个AI圈都被震了一下。不是因为发现了什么新大陆。AI不会生成真随机数,这事2023年就有人提过了。真正让人拍大腿的,是布鲁克纳看这件事的角度。
看数据有多离谱,
•GPT-4o,30次回答里,42出现13次,37出现7次,57出现5次。三个数字加起来占了80%以上。
•Claude Sonnet 5,疯狂输出47,几乎是条件反射级别的执念。
•Llama 3.3,多数回答集中在53,像被刻了思想钢印。
•Qwen3-Max,最夸张,30次回答全部是42,一次例外都没有。
1到100,理论上每个数字被选中的概率应该是1%,均匀分布的熵值应该是6.64 bit。但165个模型的熵值中位数只有1.0 bit,差了6倍多。
信息量只有真随机的六分之一。高度集中,高度可预测,高度不随机。
如果故事到这里结束,那这只是又一篇「LLM有缺陷」的普通论文。但布鲁克纳的厉害之处在于,他没有把这当成一个缺陷然后翻篇。
他问了一个没人认真问过的问题,如果每个模型的偏差都不一样,如果每个模型都有自己独特的「数字执念」,那这些偏差组合起来,会不会就是每个模型的身份证?
布鲁克纳把这种独特的输出分布命名为Behavioral Fingerprint,行为指纹。
不同模型在「随机生成 1–100」任务上的概率分布各不相同,构成唯一的行为指纹(示意图)
就像每个人的指纹独一无二,每个模型在随机输出任务上的概率分布也独一无二。而且这个指纹有一个极厉害的特性,只需要模型输出一个Token,就能锁定身份。
他设计了一套类似生物特征识别的验证协议,先在官方可信API上采集目标模型的参考指纹,相当于录指纹。然后对待验证的API端点发起少量探测请求,采集待验指纹。最后用Jensen-Shannon散度计算两份指纹的相似度,低于预设阈值就判定为同一模型。
整个实验覆盖了10类探测任务,从随机数、随机字母、随机颜色,到随机动物、随机城市、抛硬币。性能数据很惊人,完整40个探测单元,约400次请求,验证错误率仅7.3%。精简8个探测单元,约120次请求,错误率也只有10.6%。
这个精度已经和此前业界最复杂的LLMmap指纹技术持平,但成本和复杂度降了不止一个数量级。
为什么这招几乎无解传统的模型验证方法有一个致命弱点,探针太特殊了。
你发一条精心构造的、一看就不像正常对话的请求过去,中转站的系统一旦识别出这是探测行为,临时给你切回真模型就能蒙混过关。这就像查酒驾,司机远远看见交警就换了个人开,根本抓不到现行。
但「说一个1到100的随机数」这种话,放在任何聊天记录里都毫不起眼。它跟你问「今天天气怎么样」「帮我写封邮件」没有任何区别。中转站根本无法判断这是正常用户对话,还是一次指纹采集。
这就是行为指纹最精妙的地方,不可对抗性。
探测请求都是日常化语义,完全没有特殊构造的对抗性Prompt特征。服务商识别不出来,也就没法临时切换为真模型蒙混过关。
更绝的是可扩展性。探测任务可以用无穷多种语言、无穷多种表达方式改写。你用英文问和用阿拉伯语问,测出来的是同一个模型的不同切面,但每个切面都带着完整的身份信息。你封了「随机数」这个说法,我可以问「随便说个数字」「脑子里第一个蹦出来的数字是多少」。变体无穷无尽。
而且成本低到可以忽略。单次探测只需要模型输出1个Token,审计一批端点的成本也就几美分。大规模批量巡检上百个API端点,一杯咖啡的钱就够了。
从Palmyra X5到Ox Alpha,被实锤的「自研旗舰」165个模型测下来,布鲁克纳发现了一个很劲爆的案例。
OpenRouter上有一个叫Palmyra X5的端点,以某公司自研旗舰的身份售卖。听名字,你可能以为这是哪家公司花了大价钱训练出来的独家模型。
但它的行为指纹,跟Qwen3-235B几乎一模一样。指纹差异值只有0.141。
作为参照,同一个模型在两个不同供应商部署,因为服务器环境、推理框架、量化方式的差异,指纹也不会100%一致。这种「自己跟自己比」的正常波动大约是0.140。
0.141和0.140,差了0.001。几乎没有区别。
布鲁克纳在论文里措辞很克制,说这只是统计性观察,不是对意图的指控。但数据和代码全部公开,任何人都可以复现。
这是2026年的事。到了2026年,同样的戏码还在上演,只是主角换成了Ox Alpha。
而且更值得注意的一个数据是,德国CISPA安全实验室在2026年3月发布调查,对17个第三方影子API端点审计,结果是45.83%未通过模型指纹验证。比例几乎跟一年前一模一样。
一年过去了,技术在进步,工具在迭代,但造假的比例纹丝不动。
这说明什么?说明这不是一个技术问题,这是一个经济问题。旗舰模型和轻量版之间3到5倍的推理成本差,摆在那里。只要有足够的利润空间,就永远有人愿意铤而走险。
行为指纹能做的,不是消灭造假,而是把「造假」从一个「没人能发现」的暗箱操作,变成一个「随时可能被实锤」的高风险行为。
就像DNA检测技术普及之后,犯罪率并没有降到零,但至少罪犯知道了,现场留下的每一点痕迹,都可能成为定案的证据。
厂商主动在生成内容中嵌入隐形标识,实现可溯源(示意图)
如果说行为指纹是「从外面观察模型的输出习惯」,那另一条路线走得更直接。厂商主动把身份标记「埋」进生成内容里。
2026年8月,Anthropic宣布(8月11日公布,适用于8月2日及以后发布的Claude模型),在生成文本中嵌入人眼无法察觉的隐写数字水印。
这不是简单的「在文章末尾加一行字」。它的思路更有意思。
Anthropic用的是一种叫「绿名单/红名单」的机制。简单说,就是给每个词的同义词分两组,绿名单和红名单。模型生成文本的时候,遇到可以替换的词,会优先选择绿名单里的词。人眼读起来完全正常,意思一点没变,但在统计层面,绿名单词的出现频率会明显偏高。
检测的时候,只要拿检测器扫一遍文本,看看绿名单词的比例是不是异常,就能判断这是不是Claude生成的。准确率超过99%。
而且这种水印有一定的鲁棒性。复制粘贴、截图后OCR识别、甚至手抄一遍再让另一个AI听写,只要文本的统计特征没被完全破坏,标记就还在。
这不是Anthropic一家的事。谷歌走的是另一条路,它的SynthID技术把水印嵌在图像和音频的像素或频域里,肉眼和人耳都察觉不到,但专用检测器能读出来。即使经过裁剪、压缩、转码,仍有一定概率被检测到。
还有C2PA标准,相当于给数字内容发一张「出生证明」。内容是谁生成的、用什么工具生成的、经过了哪些修改,全部记在元数据里,随文件一起传播。
一个主动加标记,一个把标记藏得更深。两家巨头路线不同,但底层逻辑是一致的,AI生成内容必须可溯源。
攻防拉锯,你加我就去有加水印的,就有去水印的。而且去水印的速度,往往快得惊人。
Anthropic的文本水印8月2号上线,8月3号就有人在GitHub上放出了去水印工具watermarks-remover。上线两天涨了2700星,「AI watermark remover」的搜索热度环比涨了60%。
这个工具号称三层清理机制,第一层清隐形字符和零宽空格,第二层用同义词替换和句式重构打乱统计水印,第三层擦除元数据签名。
听起来很厉害,但它有明确的边界。
第一层和第三层最容易。隐形字符和元数据,一扫就没。难的是第二层,也就是真正的统计水印。同义词替换、句式重构确实能干扰检测,但改多了,原文的意思和风格也会变。你改得越狠,水印去得越干净,但内容也越不像原文。
这是一个永恒的矛盾,去水印的强度和内容的保真度,永远是此消彼长的关系。
图像领域也是一样。
可见水印最好去。AI智能修复Inpainting对静态水印的识别率接近100%,复杂渐变背景下去除成功率也能到92%。单张1080P图片处理只需要0.3秒,画质损失控制在5%以内。
但像素级隐形水印,比如SynthID那种嵌入频域的标记,没那么好去。重压缩、AI重绘、加噪声确实能破坏一部分水印信号,但代价是画质受损、内容变形。
某知名图库平台做过实测,他们嵌入的频域水印,即使用Stable Diffusion进行二次创作后,仍有78%的提取成功率。
你越想彻底去掉水印,付出的代价就越大。这是一种经济威慑。当去水印的成本高于水印本身带来的收益时,大多数人就会选择放弃。
⚠️ 关键辨析
去水印不等于过AI检测。
你去掉了厂商埋的统计标记
你去掉了厂商埋的统计标记,但文本的风格、句式、用词习惯,这些属于模型本身的「行为指纹」特征,去水印工具改不了。就像你把一个人的身份证烧了,但他的指纹、虹膜、DNA还在。
watermarks-remover的作者自己也承认,这个工具只能去除显式的水印标记,不能保证内容能通过所有AI检测工具。模型本身的输出风格,它改不了。
这恰恰说明,行为指纹和内容水印,是两个层面的东西。
三、两条路线,一个终点行为指纹和内容水印,到底是什么关系?我整理了一张对比表:
看起来是两条完全不同的技术路线,但如果你往深了看一层,会发现它们的底层逻辑其实是通的。都是在概率分布里藏身份信息。
行为指纹观测的是模型天然的概率分布偏好,它偏爱哪些数字、哪些颜色、哪些表达方式。内容水印做的是同一件事,只不过是主动给概率分布「加一个偏移」,让模型在同义词里优先选某一组,在像素里优先调某几个值。
一个是天然的,一个是人工的。但,都是「通过统计特征识别身份」。
而且这两条线正在互相渗透。行为指纹的思路启发了水印技术。既然天然的分布特征就能用来识别身份,那主动制造的分布特征当然也能。反过来,水印技术的鲁棒性研究,也在帮行为指纹研究者更好地理解「哪些特征经得起扰动,哪些一触即碎」。
真正的推手是监管技术路线的合流只是表象。真正把这两件事往一块推的,是监管。
2026年,三条监管线同时在收紧,
第一条在欧盟。欧盟AI法案的透明度行为准则已经有190家组织签署,明确要求通用AI模型必须具备「生成内容可检测」的能力。合成图像、音频、视频,都得有可识别的标记。
第二条在国内。大模型备案制度从「备案vs登记」双轨制落地,API封装服务、二次开发模型都必须备案。以前API掉包是「骗钱」,现在还可能涉及「未备案服务违规对外提供」。
第三条在行业。金融领域的8号文明确要求,金融机构使用第三方AI模型必须进行供应链风险管控。模型身份可验证、输出可追溯,正在变成金融AI采购的硬性要求。
监管一出手,行为指纹和内容水印就都有了明确的应用场景。
内容水印解决的是「面向C端的内容合规」。平台要知道哪些内容是AI生成的,监管要能追溯到源头。
行为指纹解决的是「面向B端的模型合规」。企业采购API服务要知道自己买的是不是真货,金融机构要验证第三方模型的身份。
一个管内容,一个管模型。一内一外,形成了完整的AI身份验证体系。
2026年8月中旬国内那场「AI博主停更潮」,就是这套体系开始运转的一个信号。平台用隐形水印追溯技术抓搬运和套利账号,版权合规和内容溯源一起收紧,很多靠洗稿、搬运吃饭的账号直接断了生路。
这还只是开始。
尾声,AI不掷骰子,它掷出来的是自己回到开头那个问题,AI为什么藏不住自己的身份?
因为真正的随机,要求你是一张白纸。
但大模型恰恰是人类有史以来造出来的信息密度最高的非白纸。数十万亿Token的训练数据,几千年文明的总和,每一个权重参数都编码着某种规律、某种偏好、某种从语料里沉淀下来的肌肉记忆。
你让它随便说一个数,它根本没法真正随便。它只能从自己见过的所有文本里,找到一个最像随机数的答案。
42为什么被那么多模型偏爱?因为它是《银河系漫游指南》里「生命、宇宙以及一切问题的终极答案」。这个梗在互联网上被说了几千万次,模型早就记牢了。37、47、53为什么频繁出现?因为它们是奇数、是质数、不圆整、不对称,在人类的认知里,这些数字「看上去更像一个随手蹦出来的数字」。
大模型只不过把人类潜意识里的这种文化偏见,压缩、放大,然后写进了自己的概率分布里。
这才是行为指纹真正迷人的地方。
参数可以被量化,系统提示词可以被修改,名字可以被重新包装,外面甚至可以套上一层完全不同的壳。可它在亿万次训练中形成的概率习惯,依然会从一个小小的Token里漏出来。
就像一个人,不管怎么整容、怎么改名、怎么换身份,他的指纹不会变。
行为指纹是它天然的指纹,内容水印是它主动盖的戳。一内一外,一被动一主动,最终都指向同一件事。AI生成的每一个字、每一张图、每一段音频,都带着它的「出厂信息」。
爱因斯坦说,上帝不掷骰子。
而AI,也不掷骰子。
它每一次以为自己在随机选择的时候,掷出来的,都是它自己。(本文为作者观点,不代表本头条号立场)
本文刊载图片均搜集于互联网,仅作内容分享使用,不用于商业牟利。版权归原作者所有,若涉及侵权,请联系我方,将第一时间做下架处理。
