Языковые сенсации
Славянская буквица и санскрит: почему «буква = слово» не работает
Две популярные версии - что каждый знак Войнича есть слово-буквица славянской азбуки и что письмо устроено как индийская абугида. Обе проверяются простым подсчётом, и обе на нём ломаются.

Идея «каждый знак - это целое слово» очень живуча, и у неё есть привлекательная опора: слова манускрипта Войнича короткие, а сам текст выглядит однообразно, будто собран из готовых блоков. Отсюда славянская версия - что перед нами древняя азбука-буквица, где каждая буква сама по себе несёт смысл, всего таких буквиц 49. Рядом стоит вторая версия - индийская: что письмо Войнича устроено как абугида, а язык - санскрит или родственный ему.
Обе версии удобны тем, что их можно проверить, не читая ни одного слова. Достаточно посчитать.
Проверка первая: сколько вообще знаков
Славянская версия называет точное число - 49 буквиц. Это её сильная сторона: числа проверяются.
В основной транслитерации Войнича устойчиво различимых знаков около 32. Число слегка плавает в зависимости от системы разбора - какие-то редкие лигатуры можно считать отдельными знаками или сочетаниями, - но ни в одном варианте разбора мы не получаем 49. Разрыв слишком велик, чтобы списать его на спорные случаи.
Проверка вторая: длина слова
Это главный аргумент, и он не требует никакой теории. Если знак равен слову, то слова из одного знака должны быть массовым явлением - как в любом письме, где значок несёт смысл целиком.
Считаем по всему тексту:
| Что меряем | Войнич |
|---|---|
| Средняя длина слова | 4.47 глифа |
| Доля слов из одного знака | 3.75 % |
| Энтропия на один глиф | 3.86 бита |
| Сколько разных слов покрывает 80 % текста | 1351 тип |
Средняя длина слова - четыре с половиной знака, а односимвольные слова составляют менее четырёх процентов. Это структура, где знак - часть слова, а не слово. Версия «буква равна слову» ломается на этом числе, и никакой перевод здесь уже не спасает: спорить можно о смысле, но не о длине.
Откуда взялось «совпадение с 49»
В нашей же работе есть число, которое иногда подставляют в эту дискуссию: 80 % текста Войнича обслуживают около 56 смысловых ядер. Похоже на 49, и соблазн велик.
Это иллюзия, и вот почему. Число 56 получено после снятия приставок и окончаний: мы разложили слова на префикс, корень и суффикс - так устроены три четверти всех слов рукописи - и посчитали корни. Корни это не буквы. Сравнивать 56 корней с 49 буквицами - то же самое, что сравнивать число корней русского языка с числом букв кириллицы: величины разной природы, а близость чисел ничего не означает.
Кстати, само по себе число корней у Войнича действительно аномально мало: для сравнения, в латыни на те же 80 % текста уходит около 640 ядер, в финском 1357, в английском 225. Но это довод в пользу закрытой таблицы кодов, а не азбуки со смыслом в каждой букве.
Проверка третья: абугида и санскрит
Индийская версия проверяется иначе. Абугида - письмо особого устройства: знак согласного несёт в себе присущую гласную, а другие гласные приписываются к нему значками сверху и снизу. Такое письмо оставляет специфический след в статистике: определённые классы знаков жёстко привязаны к позициям относительно друг друга.
Мы прогнали соответствующий тест. След не обнаружился: письмо Войнича не абугида. Тем самым версия «санскрит, записанный индийским по типу письмом» снимается вместе с ней - не потому, что санскрит плох, а потому, что письмо устроено иначе.
Заметим и обратное: гласные-подобные знаки у Войнича есть. Чередование «гласная - согласная» работает так же, как в латыни - по классической мерке Сухотина Войнич даёт 0.771 против 0.785 у латыни и 0.598 у случайного набора. То есть текст языкоподобен, но именно по-европейски, без индийской надстрочной механики.
Почему такие версии вообще возникают
Здесь стоит сказать о главной ловушке всей области. Слоги любого языка комбинируются небольшим числом способов, а в тексте Войнича около 37 тысяч слов. При таком объёме любой язык даст десятки «узнаваний»: похожих на слова сочетаний, красивых совпадений, «вот же оно». Так возникали персидские, арабские, ивритские и санскритские чтения - и все они, скорее всего, артефакты комбинаторики.
Спасает от этой ловушки одно правило: сначала структура, потом смысл. Если версия претендует на язык, она обязана предсказать что-то измеримое - число знаков, длину слова, устройство слога, статистику сочетаний - и это предсказание надо проверить до того, как приступать к переводу. Славянская и санскритская версии этой проверки не проходят, и заметьте: ни одного слова переводить для этого не понадобилось.
Что осталось живого
От славянской версии остаётся здравое наблюдение, которое мы разделяем: текст Войнича действительно собран из повторяющихся блоков, и блоки эти немногочисленны. Только объясняются они не азбукой со смыслом в каждой букве, а закрытой таблицей кодов: около 18 приставок, полсотни корней, 18 окончаний - и 74 % всех слов рукописи укладываются в схему «приставка + корень + окончание».
Это и есть наш основной результат о механизме: как устроен шифр манускрипта Войнича. Он объясняет короткие слова и однообразие, не требуя ни буквиц, ни санскрита - и, в отличие от них, воспроизводит числа рукописи.
Расшифровки манускрипта Войнича не существует, и мы её не заявляем: совпадение - не чтение.
Частые вопросы
Сколько знаков в алфавите манускрипта Войнича?
Около 32 устойчиво различимых глифов в основной транслитерации EVA. Точное число зависит от системы разбора, но ни в одной из них не получается 49 - числа славянской буквицы.
Может ли каждый знак Войнича означать целое слово?
Нет. Если бы знак был словом, короткие слова были бы обычным делом, а средняя длина слова - около одного-двух знаков. В действительности среднее слово Войнича - 4.47 глифа, а слов длиной в один знак всего 3.75 процента.
Что такое абугида и почему санскритская версия отвергнута?
Абугида - письмо, где знак согласного несёт присущую гласную, а другие гласные обозначаются надстрочными и подстрочными значками. Такое письмо оставляет характерный след в статистике сочетаний знаков. У Войнича этого следа нет: тест показал, что письмо не абугида.
А как же совпадение с 56 корнями, о котором пишут?
Это иллюзия. Число 56 получено после снятия приставок и окончаний - это корни, а не буквы. Сравнивать их с 49 буквицами всё равно что сравнивать число корней русского языка с числом букв кириллицы.