Перейти к содержанию
TextArray
100% локально

Калькулятор энтропии Шеннона

Измерьте, сколько бит информации несет в себе каждый символ или слово вашего текста.

Входные данные
Выходные данные

Калькулятор энтропии Шеннона

Энтропия Шеннона — это стандартная мера плотности информации: сколько бит в среднем несет каждый символ текста. Строка из одного повторяющегося символа содержит ноль битов на символ — что вполне предсказуемо. Равномерно случайные символы из алфавита из 8 содержат ровно 3. Английская проза перед сжатием обычно содержит около 4 битов на символ. Вставьте любой текст, и этот инструмент сообщит об энтропии, общем содержании информации в битах, количестве символов и алфавитов, едином максимуме для этого алфавита и избыточности — насколько ниже максимума находится текст.

Энтропия проявляется повсюду, как только вы посмотрите. Команды безопасности внимательно следят за ним, чтобы обнаружить жестко закодированные секреты: ключи API и случайные токены оцениваются близко к максимуму, тогда как обычные идентификаторы имеют низкие показатели — многие секретные сканеры немногим превышают порог энтропии. Сжатие ограничено этим: общее количество битов текста — это нижний предел, к которому может приблизиться любой компрессор без потерь. А при работе со списками слов или паролями сравнение строк-кандидатов по энтропии является быстрым первым фильтром, хотя для фактической надежности пароля специальная программа проверки паролей моделирует поведение злоумышленника, чего не делает чистая энтропия.

Опции меняют то, что считается символом. Режим символов измеряет распределение кодовых точек с переключателями для свертывания регистра и исключения пробелов. Вместо этого режим «Слова» измеряет распределение слов — полезный сигнал словарного разнообразия для прозы, где повторяющиеся слова снижают энтропию.

Все работает локально в вашем браузере — измеряемый вами текст никогда не покидает ваше устройство.

FAQ

Что на самом деле означает число бит/символов?
Это средняя информация на символ с учетом частоты букв самого текста: −Σ p·log₂(p). Ноль означает полностью предсказуемый (один повторяющийся символ); максимум равен log₂ размера алфавита и достигается только тогда, когда все символы встречаются одинаково часто.
Почему высокая энтропия является намеком на то, что строка является секретным ключом?
Случайные токены используют весь свой алфавит почти одинаково, поэтому они близки к теоретическому максимуму. Слова и идентификаторы часто повторно используют несколько символов и получают гораздо более низкую оценку. Сканеры секретов используют именно этот пробел — порог около 4,5 бит/символ для строк, выглядящих как base64, улавливает большинство ключей.
Что означает избыточность?
Процентный разрыв между измеренной энтропией и равномерным максимумом для одного и того же алфавита: 1 — H/log₂(алфавит). Это приблизительный показатель того, насколько сжимаем текст — высокая избыточность означает, что компрессору без потерь приходится многое сжимать.
Является ли энтропия текста тем же самым, что и надежность пароля?
Нет. Этот инструмент измеряет распределение символов в самой строке, а не то, насколько она угадывается — «Password123» имеет приличную энтропию символов, но попадает в словарь за миллисекунды. Для этого вопроса используйте средство проверки надежности пароля.
Мой текст где-нибудь загружен?
Нет. Измерение полностью выполняется в вашем браузере, и ваш текст никогда не покидает ваше устройство.