Перейти до вмісту
TextArray
100% локально

Калькулятор ентропії Шеннона

Виміряйте, скільки бітів інформації містить кожен символ або слово вашого тексту.

Введення
Вихід

Калькулятор ентропії Шеннона

Ентропія Шеннона є стандартною мірою щільності інформації: скільки бітів у середньому містить кожен символ тексту. Рядок з одного повторюваного символу містить нуль бітів на символ — цілком передбачувано. Равномірно випадкові символи з алфавіту з 8 містять рівно 3. Англійська проза зазвичай містить приблизно 4 біти на символ перед стисненням. Вставте будь-який текст, і цей інструмент повідомить про ентропію, загальний інформаційний вміст у бітах, кількість символів і алфавіту, уніфікований максимум для цього алфавіту та надлишковість — наскільки нижче максимуму розташований текст.

Ентропія виявляється скрізь, коли ви дивитеся. Команди безпеки придивляються до нього, щоб виявити жорстко закодовані секрети: ключі API та випадкові токени мають майже максимальні оцінки, тоді як звичайні ідентифікатори мають низькі оцінки — багато секретних сканерів трохи перевищують порогове значення ентропії. Стиснення обмежується цим: загальна кількість бітів тексту – це той рівень, до якого може підійти будь-який компресор без втрат. А в роботі зі списком слів або паролями порівняння рядків-кандидатів за ентропією є швидким першим фільтром, хоча для фактичної надійності пароля спеціальний засіб перевірки паролів моделює поведінку зловмисника, чого не робить необроблена ентропія.

Параметри змінюють те, що вважається символом. Режим символів вимірює розподіл кодових точок із перемиканням у регістр і без пропусків. Натомість режим слів вимірює розподіл слів — корисний сигнал різноманітності словника для прози, де повторювані слова зменшують ентропію.

Усе працює локально у вашому браузері — текст, який ви вимірюваєте, ніколи не покидає ваш пристрій.

FAQ

Що насправді означає число бітів/символів?
Це середня інформація на символ з урахуванням частоти власних літер тексту: −Σ p·log₂(p). Нуль означає повністю передбачуваний (один символ, що повторюється); максимум — це log₂ розміру алфавіту, який досягається лише тоді, коли всі символи однакові.
Чому висока ентропія є натяком на те, що рядок є секретним ключем?
Випадкові маркери використовують весь свій алфавіт майже однаково, тому вони знаходяться близько до теоретичного максимуму. Слова та ідентифікатори багаторазово використовують кілька символів і мають набагато нижчі оцінки. Секретні сканери використовують саме цю прогалину — поріг близько 4,5 біт/символ над рядками, які виглядають як base64, вловлює більшість ключів.
Що означає надмірність?
Розрив у відсотках між виміряною ентропією та єдиним максимумом для того самого алфавіту: 1 − H/log₂(алфавіт). Це приблизний показник того, наскільки текст можна стиснути — висока надмірність означає, що компресор без втрат має багато чого стиснути.
Ентропія тексту така ж, як надійність пароля?
Ні. Цей інструмент вимірює розподіл символів у самому рядку, а не те, наскільки його можна вгадати — «Password123» має пристойну ентропію символів, але потрапляє до словника за мілісекунди. Використовуйте перевірку надійності пароля для цього запитання.
Мій текст десь завантажено?
Ні. Вимірювання повністю виконується у вашому браузері, і ваш текст ніколи не залишає ваш пристрій.