Языковые сенсации
Иврит по анаграммам: почему алгоритм назвал язык, а прочитать всё равно не вышло
В 2016 году алгоритм перебрал сотни языков и выбрал иврит, а затем выдал первую фразу рукописи. Разбираем два разных утверждения - определение языка и само чтение - и показываем, почему они держатся друг за друга по кругу.

Эта работа отличается от большинства «расшифровок» тем, что сделана аккуратными людьми и опубликована в рецензируемом издании по компьютерной лингвистике. Именно поэтому её стоит разобрать по существу: ошибка здесь не в небрежности, а в устройстве самого вывода.
Два разных утверждения
В работе на самом деле два независимых шага, и путать их нельзя.
Шаг первый: определение языка. Алгоритм сравнивает частотный профиль текста с профилями нескольких сотен языков и выбирает наиболее похожий. На тексте Войнича победил иврит.
Шаг второй: чтение. Авторы предположили, что буквы внутри слов переставлены в алфавитном порядке, восстановили исходный порядок, а получившееся прогнали через машинный перевод и слегка пригладили. Вышла фраза, похожую на осмысленную - про рекомендации священнику и людям дома.
Каждый шаг стоит разобрать отдельно.
Почему определение языка здесь не работает
Метод определения языка по частотам - рабочий инструмент, когда текст не зашифрован. Он сравнивает распределение знаков и находит ближайшее. Но шифр именно это распределение и переписывает.
У нас есть на это прямое измерение, и оно свежее. Мы прогоняли восемь языков - латынь, окситанский, маньчжурский, средневековый и современный китайский, классический японский, науатль XVI века - через модель шифра Войнича при равном объёме текста. Результат: все восемь дают практически одинаковый отпечаток, разница между языками исчезает. Подробности - в разборе восточноазиатской версии, где мы заодно сняли собственный прежний вывод.
Отсюда следствие: под шифром такого типа язык оригинала не проступает. Любой рейтинг языков, построенный по зашифрованному тексту, ранжирует не языки, а артефакты шифра. Победа иврита в таком рейтинге - не свидетельство об иврите.
Есть и второе, более общее наше измерение: попытка восстановить ключ по внутренней статистике провалилась так, что реальный текст оказался хуже случайного шума. След букв оригинала стёрт. Определять язык по стёртому следу невозможно.
Почему анаграммное чтение не проверяемо
Второй шаг страдает той же болезнью, что и большинство «прочтений»: слишком много свободы.
Если разрешено переставлять буквы внутри слова, то из набора знаков почти всегда собирается несколько осмысленных слов. Выбор между ними делает человек - по тому, что лучше вписывается в фразу. Дальше подключается машинный перевод, который сам по себе склонен выдавать связный текст даже из мусора, и финальная правка руками.
На каждом из трёх этапов система получает степень свободы. В сумме она прочитает почти любой набор знаков. А значит, удачно прочитанная фраза не является свидетельством: гипотеза, которая не запрещает никаких исходов, не проверяема.
Есть и внутренняя проблема: анаграммы восстанавливаются из шифротекста, то есть из того самого материала, устройство которого мы и пытаемся объяснить. Это круг: предположение о перестановке обосновывается тем, что после перестановки получается осмысленный текст, а осмысленность обеспечивается свободой выбора, которую даёт предположение.
Как выглядела бы проверяемая версия
Для сравнения - что нужно было бы предъявить:
- таблицу соответствий, зафиксированную до перевода и не меняющуюся от слова к слову;
- чтение куска текста, не участвовавшего в настройке;
- регулярную грамматику: одни и те же окончания в одних и тех же позициях;
- независимое предсказание - например, что на странице с определённым рисунком встретится конкретное
слово.
Ни один из этих пунктов ни в одной из известных «расшифровок» не выполнен - ни в ивритской, ни в протороманской, ни в ацтекской.
Что мы утверждаем и чего не утверждаем
Мы не говорим «иврит исключён». Мы говорим строже и скучнее: предъявленный метод не даёт основания ни за, ни против, потому что измеряет не то, что нужно.
Язык оригинала сегодня назвать нельзя - ни одним доступным способом, и это касается иврита ровно так же, как латыни, окситанского или науатля. Такова цена шифра, который стирает след букв.
Расшифровки манускрипта Войнича не существует. Совпадение - не чтение.
Частые вопросы
Что сделали Хауэр и Кондрак?
Построили алгоритм, который сравнивает частотный профиль текста с профилями сотен языков. На тексте Войнича алгоритм выбрал иврит. Затем авторы предположили, что буквы внутри слов переставлены, восстановили порядок и получили фразу, похожую на осмысленную.
Разве определение языка алгоритмом - не сильный довод?
Только если текст не зашифрован. Алгоритм сравнивает распределение знаков, а шифр это распределение переписывает. Наши измерения показывают, что под шифром такого типа язык оригинала вообще не проступает, поэтому победа любого языка в таком рейтинге ничего не означает.
Что не так с анаграммами?
Свобода перестановки слишком велика. Из набора букв почти всегда можно собрать несколько осмысленных слов, а выбор делается по тому, что кажется подходящим. Проверить такое чтение нечем: оно не запрещает никаких исходов.
Значит, иврит полностью исключён?
Нет. Мы говорим строже: этот метод не даёт основания ни за, ни против. Назвать язык оригинала сегодня нельзя ни одним доступным способом - и это касается иврита ровно так же, как латыни и науатля.