Языковые сенсации
«Это архаичный цыганский». Что осталось от гипотезы после проверки по данным рукописи
Цыганские группы появились в Западной Европе ровно тогда, когда изготовили пергамент рукописи. На этом совпадении построена свежая гипотеза о языке манускрипта. Мы проверили её по транслитерации, по источниковедению и по статистике - и разобрали, что уцелело.

Идея выглядит красиво, и в ней есть настоящее зерно. Цыганские группы, называвшие себя выходцами из «Малого Египта», появляются в Западной Европе ровно в те годы, к которым радиоуглерод относит пергамент манускрипта Войнича. Закрытая община, свой язык, непонятный окружающим, ремесло гадания и врачевания, кочевье через всю Европу - и книга с непрочитанным письмом, женскими купальнями и травами. Совпадение слишком заманчивое, чтобы пройти мимо.
В августе 2026 года на Zenodo появился препринт, который делает из этого совпадения утверждение: язык рукописи - архаичный балканский диалект цыганского языка, а текст представляет собой травник с водными процедурами и разделом о женском здоровье. Мы проверили эту работу так же, как проверяем любую другую: по нашим собственным данным, без снисхождения и без предвзятости.
Что именно утверждает гипотеза
Автор берёт около десятка часто встречающихся слов рукописи и предлагает для каждого цыганскую этимологию: daiin читается как daj «мать» и толкуется как «вода», chey - как čhaj «дочь» и толкуется как «свежая трава», qokal - как kokalo «кость» и толкуется как «толчёный корень». Заявляется, что такие слова покрывают до восьмидесяти процентов токенов на отдельных страницах, что в тексте видны цыганский артикль и падежное окончание, и что тридцать семь страниц рукописи уже прочитаны на этом основании.
Проверка первая: страницы, которых нет
Первое, что мы сделали, - сверили список «проверенных страниц» с самой рукописью. Пять из тридцати семи в ней отсутствуют: листы f60r, f61v, f62r, f74r и f110r утрачены, и в транслитерации для них нет ни одной строки. Отдельное приложение работы содержит «построчный перевод страницы f74r» - то есть перевод листа, которого не существует уже несколько столетий.
Это не придирка к оформлению. Проверка чтения начинается с того, что читаемый текст существует.
Проверка вторая: строки не совпадают
Дальше мы сверили приведённые в работе «оригиналы» с транслитерацией. Для страницы f85r автор приводит начальную строку из пяти слов. В стандартной транслитерации ZL, которой пользуется всё сообщество, первая строка того же локуса состоит из совершенно других слов - совпадений нет ни одного. Читается, иначе говоря, не рукопись, а её пересказ.
Проверка третья: сколько на самом деле покрывают эти слова
Заявленное покрытие мы посчитали прямо. Одиннадцать предложенных лексем, которые реально встречаются в транслитерации, дают 2462 вхождения из 37712 токенов рукописи - это 6.53 процента корпуса. Максимум по отдельной странице среди страниц длиннее пятидесяти слов - 22.4 процента. Восемьдесят процентов не достигаются нигде.
Ещё две «лексемы» в словаре работы вообще не принадлежат алфавиту EVA: это записи другой системы транслитерации, v101. В одном списке смешаны два несовместимых способа записи одного и того же письма - и получившиеся «слова» невозможно найти в тексте ни в одной из систем.
Отдельная деталь, которая сама себя выдаёт: в «рецептах пятнадцатого века» стоят миллилитры и граммы. Метрическая система введена во Франции в 1795 году.
Что говорит источниковедение
Теперь о том, почему цыганская версия трудна не только в этом исполнении.
Цыганский язык оставался бесписьменным до двадцатого века. Древнейшая известная запись цыганской речи - тринадцать строк, около шестидесяти слов, в рукописном сборнике бенедиктинца Иоганна из Графинга, сделанная предположительно в Вене около 1515 года. Дальше идут словники Эндрю Борда 1542 года, Йохана ван Эусума до 1570 года, Бонавентуры Вулканиуса 1597 года. Ни одного текста на романи пятнадцатого века не существует - ни рукописи, ни глоссария, ни маргиналии.
При этом документов о цыганах пятнадцатого века много: Трансильвания 1416-1418, немецкие земли 1417-1424, Швейцария, Нижние земли 1420, Болонья и Форли летом 1422, Франция 1419 и 1427, Арагон 1425. Группы носили и предъявляли охранные грамоты - но грамоты писали не они. Формулировка арагонского архива прямая: это народ, не пользующийся письмом для сохранения своей памяти.
Отсюда простое следствие. Чтобы проверить утверждение «текст написан на языке X», нужен корпус языка X той же эпохи. Для латыни, итальянского, окситанского такой корпус есть. Для цыганского пятнадцатого века его нет и быть не может - ближайшая запись отстоит от верхней границы радиоуглеродной даты на восемьдесят лет, и это словник из шестидесяти слов, а не текст.
Что говорит статистика
Мы всё же измерили то, что можно измерить. Взяли переводы на три цыганских диалекта, усекли все корпуса до общего объёма 15667 токенов - равный объём обязателен, иначе метрики меряют размер файла, а не язык, - и посчитали условную энтропию символа.
| корпус | h2 |
|---|---|
| Манускрипт Войнича | 2.22 |
| Романи, балканский диалект | 3.14 |
| Романи, влашский диалект | 3.05 |
| Романи, центральный диалект | 3.19 |
| Латынь | 3.30 |
Цыганский попадает ровно в ту полосу, где лежат все естественные языки, и отстоит от рукописи почти на бит. Это не довод против цыганской линии - это тот же довод, который отсекает латынь, итальянский и все прочие языки в качестве открытого текста: между языком и рукописью обязательно стоит слой шифрования. А как только этот слой признан, языки перестают различаться: наши собственные проверки показали, что после такого преобразования буквенная статистика исходного языка не выживает вовсе.
Что остаётся
Остаётся ровно одно, и это не язык. Совпадение по времени и месту - настоящее: в отличие от ацтекской версии, где источник на век младше рукописи, здесь пересечение с радиоуглеродным окном документировано. Поэтому осмысленный вопрос звучит не «на каком языке написана книга», а «нет ли на рисунках следов этой среды»: шатров, повозок, характерных уборов, сцен гадания по руке. Это проверяется слепой кодировкой признаков, как мы проверяли химерность растений, - и проверяется честно только с заранее записанным критерием.
Приор у такой проверки низкий: костюм и архитектуру рукописи внешние исследователи описывают как центральноевропейские первой половины пятнадцатого века. Но это вопрос, на который можно ответить данными, а не красивым сюжетом.
Чему учит этот случай
Тем же, чему учил календарь Лериды и «ключ» из Института Макса Планка. Правдоподобие сюжета и проверяемость утверждения - разные вещи. Совпадение дат - это приглашение к проверке, а не её результат. А проверка расшифровки начинается не с этимологий, а с трёх скучных вопросов: существуют ли страницы, которые вы читаете; совпадают ли ваши строки с транслитерацией; и сколько текста ваш словарь покрывает на самом деле.
Расшифровки манускрипта Войнича по-прежнему нет. Совпадение - не чтение.
Частые вопросы
Мог ли манускрипт Войнича быть написан по-цыгански?
Как исторический сюжет - да, время и место совпадают: цыганские группы документированы в северной Италии и немецких землях в 1417-1422 годах, а пергамент рукописи датирован радиоуглеродом 1404-1438 годами. Как проверяемое утверждение о языке - нет: цыганский оставался бесписьменным до XX века, древнейшая запись цыганской речи относится к 1515 году, и сравнивать текст рукописи попросту не с чем.
Что не так с опубликованной цыганской расшифровкой?
Пять из тридцати семи «проверенных страниц» в ней физически не существуют - это утраченные листы рукописи, а одно из приложений переводит страницу, которой нет. Приведённые строки «оригинала» не совпадают с транслитерацией ни одним словом. Заявленное покрытие «до 80 процентов токенов» на деле составляет 6.53 процента корпуса.
Совпадение по времени - разве это не сильный довод?
Это лучшее, что есть у версии, и это правда: по датам и географии пересечение реальное, в отличие от ацтекской гипотезы, где источник на век младше рукописи. Но присутствие народа в нужном месте и в нужное время не делает утверждение о языке проверяемым - для проверки нужен текст, а текстов на романи XV века не существует.
А статистика что-нибудь говорит про цыганский?
Мы измерили условную энтропию трёх диалектов при равном объёме корпусов: 3.05-3.19 бита против 2.22 у Войнича. Цыганский попадает в обычную полосу естественных языков и отличается от рукописи ровно так же, как латынь. Это не довод против цыганской линии - это напоминание, что любая версия о языке обязана включать слой шифрования, а с ним языки становятся неразличимы.