Языковые сенсации
Восточноазиатская версия - и наша собственная ошибка, которую пришлось снять
Короткие слова Войнича похожи на слоговые языки Азии. Мы построили структурный фильтр, отсеяли им китайский и японский - а потом обнаружили, что фильтр ранжировал не языки, а размеры файлов.

Коротким и однообразным словам Войнича давно ищут объяснение в языках, а не в шифре. Логика простая: если слова короткие, может быть, за ними стоит язык, где короткие слова естественны. Отсюда две самые известные версии - лингвист Жак Ги предполагал моносиллабический восточный язык вроде китайского или вьетнамского, а Збигнев Банасик в 2003 году предложил праманьчжурский.
Мы построили инструмент, чтобы такие версии не обсуждать, а проверять. И честнее всего начать эту статью с того, чем она кончилась: инструмент оказался бракованным, и прежний наш вывод по восточным языкам мы сняли сами.
Как устроен структурный фильтр
Мы восстановили механизм шифра Войнича: слоговой многозначный шифр, где одна и та же единица открытого текста могла записываться несколькими взаимозаменяемыми способами, плюс несколько писцовых привычек. Механизм можно запустить в обратную сторону: взять настоящий текст на настоящем языке, пропустить через модель шифра и посмотреть, ложится ли результат на отпечаток Войнича по шести числам сразу.
Смысл фильтра не в том, чтобы «прочитать», а в том, чтобы отсеивать: если язык под нашим шифром даёт совсем не тот след, версия ослабевает. Одна из шести мерок считалась главной - доля слов-двойников, то есть пар разных слов, стоящих в одинаковых окружениях. У Войнича таких пар мало, 1.2 %.
Важное правило, которое мы соблюдали: корпуса нужной эпохи. Для гипотезы о рукописи 1400-х годов современный японский не годится - в нём заимствования и орфография другой эпохи. Мы специально доставали среднекитайский в реконструкции Бакстера, классический японский язык бунго, маньчжурский в транслитерации Мёлендорфа.
Что мы получили сначала
В июле по этой методике вышла красивая картина: моносиллабические языки давали лавину ложных двойников - среднекитайский 45 %, мандарин 18.6 %, классический японский 17-27 % при цели 1.2 %. Из восточных выживал только маньчжурский с 1.2 %. Вывод звучал так: обе главные восточноазиатские ветви структурно не проходят, версия сузилась до одной маньчжурской.
Тогда же мы отметили любопытную деталь: «современный японский проходит» оказалось артефактом современности, и на правильной эпохе японская ветвь тоже валилась. Это выглядело как урок про дисциплину источников.
Урок оказался не тот.
Где была ошибка
Через несколько дней мы прогоняли через тот же фильтр науатль - для проверки ацтекской гипотезы. Науатль дал 32 % двойников. Перед тем как записать вывод, мы сверили эту мерку по всем корпусам проекта - и увидели то, чего не должно быть.
| Корпус | Объём | Доля двойников |
|---|---|---|
| Маньчжурский | 58 тыс. букв | 1.2 % |
| Латынь (Катон) | 85 тыс. букв | 3.1 % |
| Окситанский | 176 тыс. букв | 12.6 % |
| Мандарин | 314 тыс. букв | 18.6 % |
| Классический японский | 507 тыс. букв | 27.3 % |
| Науатль | 833 тыс. букв | 32.0 % |
| Среднекитайский | 1.59 млн букв | 45.2 % |
Восемь корпусов из восьми выстроились строго по размеру файла. Маньчжурский «выжил» не потому, что он маньчжурский, а потому что его текст был самым коротким из всех, что мы нашли. Среднекитайский «провалился» с самым толстым.
Прямая проверка это подтвердила: один и тот же науатль, порезанный на куски разной длины, даёт 2.1 % двойников на 60 тысячах букв и 30.5 % на 833 тысячах. Язык не меняется - меняется толщина книги.
Почему так выходит. Чем больше исходный текст, тем разнообразнее набор единиц, из которых генератор собирает результат, и тем больше в результате редких слов, встречающихся два-три раза. Про слово, встреченное дважды, невозможно честно судить, в каком окружении оно живёт: пара случайных соседей совпадёт с чужой парой просто по случайности, и программа засчитает пару «близнецов». Мерка измеряла бедность данных, а не гомофонию шифра.
Честное сравнение при равном объёме
Мы обрезали все восемь корпусов до одинаковых 57 тысяч букв и прогнали заново.
| Язык, равный объём | Двойники | Соотношение R | Дистанция до Войнича |
|---|---|---|---|
| Среднекитайский (Бакстер) | 1.3 % | 1.89 | 0.37 |
| Маньчжурский (Банасик) | 1.4 % | 2.02 | 0.47 |
| Латынь (Катон) | 1.4 % | 1.94 | 0.58 |
| Классический японский (бунго) | 1.9 % | 1.78 | 0.84 |
| Окситанский (Фламенка) | 1.7 % | 1.68 | 1.01 |
| Мандарин (пиньинь) | 1.7 % | 1.88 | 1.04 |
| Науатль XVI века | 1.8 % | 1.88 | 1.13 |
Разброс схлопнулся с 0.43-37.2 до 0.37-1.24, все языки попали в цель Войнича или впритык к ней, а порядок перевернулся: среднекитайский, который был «хуже всех», оказался ближе всех.
Вывод: фильтр языки не различает вообще. Ни одна восточноазиатская ветвь им не отвергнута - как и никакая другая.
Что это значит и чего не значит
Не значит, что манускрипт Войнича написан по-китайски или по-маньчжурски. Значит ровно одно: этим методом вопрос не решается, и наш прежний вывод был необоснован.
Более того, полученный результат согласуется с другим нашим измерением, гораздо более важным. Мы пробовали восстановить ключ шифра изнутри, по статистике самого текста, - и атака провалилась: на уровне частей слова буквенная последовательность оригинала не выживает. Отсюда следует и слепота языкового фильтра: если след букв стёрт, то и язык под шифром не проступает. Подробнее - почему манускрипт Войнича нельзя прочитать.
Что действительно говорит против восточной версии
Языковые доводы мы теперь не используем ни за, ни против. Остаются вне-языковые - и они не затронуты нашей ошибкой:
- Пергамент и дата. Радиоуглерод даёт 1404-1438 годы, материал - европейский пергамент.
- Письмо. Начертания знаков - европейский курсив своей эпохи; отдельная проверка показала, что
это не персо-иранская и не восточная традиция письма. Форма знаков заимствована из обычной палеографии XV века.
- Окситанские месяцы. На зодиакальных страницах подписаны названия месяцев - они окситанские,
то есть юг Франции. Это наш якорь локализации. Формулировка «месяцы пьемонтские», гуляющая по обзорам, неверна.
- Структура зодиака. Кольца устроены как список градусов, по 30 на знак, - это общая
средиземноморская астрологическая рамка, а не китайская специфика: ни имён сезонных делений, ни восточных созвездий в тексте не обнаружено.
- Иконография. Восточных мотивов на рисунках не нашли и китайские специалисты, к которым
обращались с этим вопросом.
Почему мы публикуем собственную ошибку
Потому что иначе исследование превращается в набор удобных результатов. Мы опубликовали вывод 21-22 июля и сняли его 27 июля - через пять дней, как только увидели скрытую переменную. Все числа и скрипты в открытом доступе, старый файл с результатами оставлен на месте с шапкой-опровержением: это след ошибки, а не мусор.
Общий урок мы записали в правила работы, и он универсален: сравнение нужно задавать к контролю, который сохраняет артефакт процедуры. Прежде чем говорить «язык X не проходит», прогони тот же язык на двух-трёх объёмах и убедись, что мерка реагирует на язык, а не на толщину файла. Похожий урок мы уже получали, когда проверяли версию о писцовых сокращениях: там выигрыш давала сама процедура вставки, а не гипотеза.
Расшифровки манускрипта Войнича не существует. Мы не предлагаем чтений - ни восточных, ни каких бы то ни было ещё.
Частые вопросы
Почему манускрипт Войнича вообще связывают с языками Азии?
Из-за длины слов. Слова в рукописи короткие и однообразные по строению, что напоминает языки со слоговой структурой - китайский, вьетнамский. Отсюда предположение Жака Ги о моносиллабическом языке и версия Збигнева Банасика о праманьчжурском.
Значит, китайская версия подтвердилась?
Нет. Она не подтверждена и не отвергнута - у нас просто нет работающего инструмента, чтобы её проверить. Прежний вывод «восточные ветви отсеиваются» мы сняли сами, обнаружив в методике скрытую переменную.
Что за ошибка была в вашем тесте?
Ключевая мерка - доля слов-двойников - зависела от объёма исходного корпуса, а не от языка. Корпуса различались в 27 раз, и порядок результатов совпал с порядком размеров файлов - восемь из восьми. При равном объёме разница между языками исчезает.
Что тогда говорит против восточного происхождения манускрипта?
Доводы, не связанные с языком: радиоуглеродная дата европейского пергамента 1404-1438, европейский курсив как основа начертаний, окситанские названия месяцев на полях зодиака, структура зодиакальных колец по 30 градусов, отсутствие восточной иконографии.