Voynich StudiesБейнеке MS 408
RU EN IT

Языковые сенсации

Восточноазиатская версия - и наша собственная ошибка, которую пришлось снять

Короткие слова Войнича похожи на слоговые языки Азии. Мы построили структурный фильтр, отсеяли им китайский и японский - а потом обнаружили, что фильтр ранжировал не языки, а размеры файлов.

Вердикт СНЯТА 27.07.2026

Восточноазиатская версия - и наша собственная ошибка, которую пришлось снять
Лист f58r. Beinecke Library, Yale (public domain)

Коротким и однообразным словам Войнича давно ищут объяснение в языках, а не в шифре. Логика простая: если слова короткие, может быть, за ними стоит язык, где короткие слова естественны. Отсюда две самые известные версии - лингвист Жак Ги предполагал моносиллабический восточный язык вроде китайского или вьетнамского, а Збигнев Банасик в 2003 году предложил праманьчжурский.

Мы построили инструмент, чтобы такие версии не обсуждать, а проверять. И честнее всего начать эту статью с того, чем она кончилась: инструмент оказался бракованным, и прежний наш вывод по восточным языкам мы сняли сами.

Как устроен структурный фильтр

Мы восстановили механизм шифра Войнича: слоговой многозначный шифр, где одна и та же единица открытого текста могла записываться несколькими взаимозаменяемыми способами, плюс несколько писцовых привычек. Механизм можно запустить в обратную сторону: взять настоящий текст на настоящем языке, пропустить через модель шифра и посмотреть, ложится ли результат на отпечаток Войнича по шести числам сразу.

Смысл фильтра не в том, чтобы «прочитать», а в том, чтобы отсеивать: если язык под нашим шифром даёт совсем не тот след, версия ослабевает. Одна из шести мерок считалась главной - доля слов-двойников, то есть пар разных слов, стоящих в одинаковых окружениях. У Войнича таких пар мало, 1.2 %.

Важное правило, которое мы соблюдали: корпуса нужной эпохи. Для гипотезы о рукописи 1400-х годов современный японский не годится - в нём заимствования и орфография другой эпохи. Мы специально доставали среднекитайский в реконструкции Бакстера, классический японский язык бунго, маньчжурский в транслитерации Мёлендорфа.

Что мы получили сначала

В июле по этой методике вышла красивая картина: моносиллабические языки давали лавину ложных двойников - среднекитайский 45 %, мандарин 18.6 %, классический японский 17-27 % при цели 1.2 %. Из восточных выживал только маньчжурский с 1.2 %. Вывод звучал так: обе главные восточноазиатские ветви структурно не проходят, версия сузилась до одной маньчжурской.

Тогда же мы отметили любопытную деталь: «современный японский проходит» оказалось артефактом современности, и на правильной эпохе японская ветвь тоже валилась. Это выглядело как урок про дисциплину источников.

Урок оказался не тот.

Где была ошибка

Через несколько дней мы прогоняли через тот же фильтр науатль - для проверки ацтекской гипотезы. Науатль дал 32 % двойников. Перед тем как записать вывод, мы сверили эту мерку по всем корпусам проекта - и увидели то, чего не должно быть.

КорпусОбъёмДоля двойников
Маньчжурский58 тыс. букв1.2 %
Латынь (Катон)85 тыс. букв3.1 %
Окситанский176 тыс. букв12.6 %
Мандарин314 тыс. букв18.6 %
Классический японский507 тыс. букв27.3 %
Науатль833 тыс. букв32.0 %
Среднекитайский1.59 млн букв45.2 %

Восемь корпусов из восьми выстроились строго по размеру файла. Маньчжурский «выжил» не потому, что он маньчжурский, а потому что его текст был самым коротким из всех, что мы нашли. Среднекитайский «провалился» с самым толстым.

Прямая проверка это подтвердила: один и тот же науатль, порезанный на куски разной длины, даёт 2.1 % двойников на 60 тысячах букв и 30.5 % на 833 тысячах. Язык не меняется - меняется толщина книги.

Почему так выходит. Чем больше исходный текст, тем разнообразнее набор единиц, из которых генератор собирает результат, и тем больше в результате редких слов, встречающихся два-три раза. Про слово, встреченное дважды, невозможно честно судить, в каком окружении оно живёт: пара случайных соседей совпадёт с чужой парой просто по случайности, и программа засчитает пару «близнецов». Мерка измеряла бедность данных, а не гомофонию шифра.

Честное сравнение при равном объёме

Мы обрезали все восемь корпусов до одинаковых 57 тысяч букв и прогнали заново.

Язык, равный объёмДвойникиСоотношение RДистанция до Войнича
Среднекитайский (Бакстер)1.3 %1.890.37
Маньчжурский (Банасик)1.4 %2.020.47
Латынь (Катон)1.4 %1.940.58
Классический японский (бунго)1.9 %1.780.84
Окситанский (Фламенка)1.7 %1.681.01
Мандарин (пиньинь)1.7 %1.881.04
Науатль XVI века1.8 %1.881.13

Разброс схлопнулся с 0.43-37.2 до 0.37-1.24, все языки попали в цель Войнича или впритык к ней, а порядок перевернулся: среднекитайский, который был «хуже всех», оказался ближе всех.

Вывод: фильтр языки не различает вообще. Ни одна восточноазиатская ветвь им не отвергнута - как и никакая другая.

Что это значит и чего не значит

Не значит, что манускрипт Войнича написан по-китайски или по-маньчжурски. Значит ровно одно: этим методом вопрос не решается, и наш прежний вывод был необоснован.

Более того, полученный результат согласуется с другим нашим измерением, гораздо более важным. Мы пробовали восстановить ключ шифра изнутри, по статистике самого текста, - и атака провалилась: на уровне частей слова буквенная последовательность оригинала не выживает. Отсюда следует и слепота языкового фильтра: если след букв стёрт, то и язык под шифром не проступает. Подробнее - почему манускрипт Войнича нельзя прочитать.

Что действительно говорит против восточной версии

Языковые доводы мы теперь не используем ни за, ни против. Остаются вне-языковые - и они не затронуты нашей ошибкой:

  • Пергамент и дата. Радиоуглерод даёт 1404-1438 годы, материал - европейский пергамент.
  • Письмо. Начертания знаков - европейский курсив своей эпохи; отдельная проверка показала, что

это не персо-иранская и не восточная традиция письма. Форма знаков заимствована из обычной палеографии XV века.

  • Окситанские месяцы. На зодиакальных страницах подписаны названия месяцев - они окситанские,

то есть юг Франции. Это наш якорь локализации. Формулировка «месяцы пьемонтские», гуляющая по обзорам, неверна.

  • Структура зодиака. Кольца устроены как список градусов, по 30 на знак, - это общая

средиземноморская астрологическая рамка, а не китайская специфика: ни имён сезонных делений, ни восточных созвездий в тексте не обнаружено.

  • Иконография. Восточных мотивов на рисунках не нашли и китайские специалисты, к которым

обращались с этим вопросом.

Почему мы публикуем собственную ошибку

Потому что иначе исследование превращается в набор удобных результатов. Мы опубликовали вывод 21-22 июля и сняли его 27 июля - через пять дней, как только увидели скрытую переменную. Все числа и скрипты в открытом доступе, старый файл с результатами оставлен на месте с шапкой-опровержением: это след ошибки, а не мусор.

Общий урок мы записали в правила работы, и он универсален: сравнение нужно задавать к контролю, который сохраняет артефакт процедуры. Прежде чем говорить «язык X не проходит», прогони тот же язык на двух-трёх объёмах и убедись, что мерка реагирует на язык, а не на толщину файла. Похожий урок мы уже получали, когда проверяли версию о писцовых сокращениях: там выигрыш давала сама процедура вставки, а не гипотеза.

Расшифровки манускрипта Войнича не существует. Мы не предлагаем чтений - ни восточных, ни каких бы то ни было ещё.

Частые вопросы

Почему манускрипт Войнича вообще связывают с языками Азии?

Из-за длины слов. Слова в рукописи короткие и однообразные по строению, что напоминает языки со слоговой структурой - китайский, вьетнамский. Отсюда предположение Жака Ги о моносиллабическом языке и версия Збигнева Банасика о праманьчжурском.

Значит, китайская версия подтвердилась?

Нет. Она не подтверждена и не отвергнута - у нас просто нет работающего инструмента, чтобы её проверить. Прежний вывод «восточные ветви отсеиваются» мы сняли сами, обнаружив в методике скрытую переменную.

Что за ошибка была в вашем тесте?

Ключевая мерка - доля слов-двойников - зависела от объёма исходного корпуса, а не от языка. Корпуса различались в 27 раз, и порядок результатов совпал с порядком размеров файлов - восемь из восьми. При равном объёме разница между языками исчезает.

Что тогда говорит против восточного происхождения манускрипта?

Доводы, не связанные с языком: радиоуглеродная дата европейского пергамента 1404-1438, европейский курсив как основа начертаний, окситанские названия месяцев на полях зодиака, структура зодиакальных колец по 30 градусов, отсутствие восточной иконографии.

← Все гипотезы