Два подхода к измерению информации: через мощность алфавита и через вероятности символов. Формула Шеннона.
В информатике существуют два подхода к измерению информации: алфавитный (через мощность алфавита) и содержательный (через вероятности символов). Они дают разные результаты для неоднородных текстов.
Измерение информации через мощность алфавита
Каждый символ алфавита мощности N несёт одинаковое количество информации:
Объём текста: I = K × i, где K — количество символов. Общая формула: I = K × log2(N).
Алфавитный подход даёт точный результат, когда все символы алфавита равновероятны (встречаются с одинаковой частотой).
Пример: двоичный код, где 0 и 1 встречаются одинаково часто.
Измерение информации через вероятности символов
Каждый символ несёт разное количество информации в зависимости от его вероятности появления:
где p — вероятность появления символа в сообщении.
В русском тексте буквы встречаются с разной частотой:
| Буква | Частота p | Вес i = −log₂(p) |
|---|---|---|
| О (самая частая) | 0.10 | 3.32 бит |
| А | 0.08 | 3.64 бит |
| Е | 0.07 | 3.84 бит |
| И | 0.06 | 4.06 бит |
| Ъ (самая редкая) | 0.002 | 8.97 бит |
Редкие символы несут больше информации, чем частые!
Неопределённость, информация и среднее количество бит на символ
Представьте, что вам сообщают результат подбрасывания монеты. Если монета честная (50/50) — вы не знали, что выпадет, и получили 1 бит информации. Но если монета двухсторонняя (всегда орёл) — вы заранее знали результат, и информации = 0 бит.
Энтропия — это мера неопределённости (или, иначе, среднее количество информации), которое вы получаете, когда узнаёте результат случайного эксперимента.
Чем равномернее распределение — тем больше неопределённость — тем больше энтропия. Чем неравномернее — тем легче предсказать результат — тем меньше энтропия.
Пусть источник может выдавать N различных символов, и i-й символ имеет вероятность pi. Тогда информация одного символа:
Чем реже символ, тем больше информации он несёт. Буква «Ъ» (p=0.002) несёт ~9 бит, а буква «О» (p=0.10) — всего ~3.3 бита.
Энтропия — это среднее количество информации на символ, взвешенное по вероятностям:
Раскрывая формулу:
Каждое слагаемое — это вероятность символа, умноженная на его информационный вес. Сумма даёт среднее «количество сюрприза» на одно сообщение.
Формула Шеннона — это математическое ожидание информации. Вспомните:
Поэтому: H = E[i] = −Σ pi · log2(pi)
Это как средний балл: каждый «оценка» (информация символа) взвешивается «частотой» (вероятностью).
Один символ с p=1. Полная определённость. Нет информации.
Равномерное распределение. Максимальная неопределённость.
Потолок. Больше N — больше максимум.
Настройте цвета шариков в урне, вытягивайте их и наблюдайте, сколько информации вы получаете с каждым вытягиванием. Среднее количество информации на одно вытягивание — и есть энтропия.
| Критерий | Алфавитный | Содержательный |
|---|---|---|
| Формула | i = log₂(N) | i = −log₂(p) |
| Основа | Мощность алфавита N | Вероятность символа p |
| Предположение | Все символы равновероятны | Символы имеют разные вероятности |
| Применение | Компьютерное кодирование | Сжатие данных, энтропия |
| Точность | Точен при равномерном распределении | Точен всегда |
| Пример | ASCII: 256 символов → 8 бит | Русский текст: ~4.5 бит/символ |
Энтропия Шеннона напрямую связана с условием Фано — критерием оптимальности кодирования. Если код не удовлетворяет условию Фано, он не является оптимальным. Подробнее — в главе 23: Условие Фано.
Зная мощность алфавита и энтропию, вы готовы к кодированию информации. Как выбрать код, сколько бит нужно на символ, что такое равномерные и неравномерные коды — в главе 11: Кодирование и декодирование.
Интерактивный расчёт H = −Σ p·log₂(p) с пошаговым разбором
Задайте вероятности символов (сумма должна быть 1). Получите энтропию H с пошаговым расчётом.
Задачи на алфавитный и содержательный подходы
Решите задачу. Выберите ответ.
40 карточек · алфавитный и содержательный подходы, энтропия Шеннона