伪造与无意义文本
自我抄写:我们如何否定了最强的那个无意义文本版本
Torsten Timm提出的机制既不用镂空模板,也完全不用任何表格:抄写员照抄页面上已有的东西,并稍作改动。这样一个生成器确实能复制出伏尼契的很多数字。我们找到了六项它复制不出来的特征。

这是所有“没有含义”的版本里最强的一个。Torsten Timm与Andreas Schinner提出了一种机制,它既不需要 镂空模板,也不需要音节表,更不需要密钥。抄写员看一眼身旁或者上一行已经写好的词,把它再写一遍, 并稍作改动:换掉一个符号,加上一个前缀,去掉一个词尾。一行接一行,一页接一页。
这个想法的漂亮之处在于,它恰好解释了那些通常被拿出来当作有含义之证据的特征。
通常反对它的那些论证为什么不成立
自我抄写自行产生的东西如下:
- 低熵。照抄并稍作改动,按定义就是可预测的。
- Zipf定律。词的频率分布在抄写之下自动出现。
- 相似词构成的族。它们是这一机制的直接产物。
- 重复的聚集。词之所以彼此黏连,是因为它们是从近处抄来的。
由此得出一条我们视为重要方法教训的结论:单凭低熵并不能排除骗局。那些写着“熵太低,所以这不是 无意义文本”的综述,推理方式是错的:机械生成器的熵完全一样。
要否定这一类版本,需要的是生成器做得过头或者做得不够的那些特征,而不是它能够复制出来的 特征。
我们是怎么检验的:在一部分上调参,在另一部分上比较
我们搭了一个自我抄写生成器,并在手稿的一部分上给它调参,使它尽可能贴合那一部分的统计。随后我们把 它的输出与它从未见过的文本留出窗口作比较,同时考察六项区分性指标。检验方案是在取得结果之前就 写下来的。
逻辑是这样的:相似可以拟合,差异不能。如果这个生成器是对的,它就必须通过全部六个窗口。它在六个 里面失败了五个。
| 指标 | 伏尼契手稿 | 自我抄写生成器 |
|---|---|---|
| 写法不同的孪生词对数 | 42 | 0 |
| 覆盖80%文本需要多少个不同的词 | 51 | 115 |
| 词边界效应 | +0.197 | +0.014 |
| 重复的聚集 | 高于偶然水平1.75倍 | 5.38倍,大幅过头 |
| 共现比R | 1.87 | 3.47,过头 |
有两行特别说明问题。
写法不同的孪生词。伏尼契中有42对词,它们的行为完全一样,写法却不同,这正是同音替代密码留下的 痕迹:在这种密码里,同一个单位可以用几种方式写出来。自我抄写根本不制造这样的词对,它产生的是 相似词构成的族,而不是彼此不像却可以互换的词。零对四十二。
做得过头的地方。生成器不只是没有打中,它是往多的一边打偏:它的重复聚集程度比伏尼契的数字高出 三倍,共现也是如此。真实的手稿比机械抄写更有纪律,这意味着它内部有什么东西在与重复作对。
这意味着什么
这个版本被否定,不是因为我们不喜欢它,而是因为它在留出数据上、在事先指明的具体指标上失败了。
由此得出的不是“含义已被证明”,而是更克制的一句:机械的解释已经过检验,而且不成立。与 已被否定的卡尔达诺格栅合在一起,这把解释的负担推给了一个实质性的 模型,在我们这里就是一种作坊式的同音替代密码,其机制已经被重建。
还值得补充的是,关于无意义文本的争论在学术界同样活着:在马耳他的伏尼契会议上,同一个研究组提交了 两篇彼此相反的论文,“Gibberish after all?”和“A cipher after all?”。这就是这个问题的常态,而我们 在这里的贡献不是一种意见,而是一项带数字的区分性检验。
方法上的教训
我们从这项工作里带走了一条如今用于一切的规则:一个假说必须靠它必然做得过头或者做得不够的特征 来否定,而不是靠它反正都能复制出来的特征。后来我们自己在另一项检验里踩了旁边的耙子,并且公开 撤回了自己的结论:见关于东亚版本的说明。
伏尼契手稿的破译并不存在。巧合不等于释读。
常见问题
自我抄写假说说的是什么?
抄写员取一个身旁或者上一行已经写好的词,稍作改动再写一遍,如此一行接一行。这既不需要语言,也不需要密钥,而写出来的文本看上去像真的,有重复,也有相似词构成的族。
为什么用通常的论证否定不了这个版本?
因为自我抄写恰好复制出那些通常被拿来当作有含义之证据的特征:低熵、Zipf定律、相似词构成的族、重复的聚集。需要的是生成器会做得过头或者做得不够的特征。
“有区分力的检验”是什么意思?
就是在文本的一部分上给生成器调参,再在另一部分即留出的部分上作比较,而且看的不是总体的相似程度,而是具体的区分性指标。相似可以拟合,差异不能。
那么伏尼契手稿里究竟有没有含义?
我们的检验说明,机械的解释不成立:格栅和自我抄写都已被否定。这是支持文本背后有内容的一个论证。但内容本身并没有被读出来,我们也不提出任何释读。