ASCII, Unicode, KOI-8, CP1251: кодовые таблицы, сравнение кодировок, интерактивный исследователь.
Кодовая таблица — это соответствие между символами и их числовыми кодами.
Каждому символу алфавита присваивается уникальный номер. Для хранения в памяти этот номер переводится в двоичный код. Разные кодировки используют разные таблицы соответствия.
Однобайтовые кодировки — 1 байт на символ → 256 символов. Многобайтовые — 2–4 байта → миллионы символов.
American Standard Code for Information Interchange (1963)
ASCII использует 7 бит → 128 символов (0–127). Расширенная ASCII (8 бит) — 256 символов. Первая половина (0–127) — управляющие коды и латиница — одинакова во всех кодировках.
Ключевые диапазоны ASCII:
| Диапазон | Символы | Пример |
|---|---|---|
| 0–31 | Управляющие | LF(10), CR(13), TAB(9) |
| 32–47 | Знаки препинания | пробел(32), !"#$%&'()*+,-./ |
| 48–57 | Цифры 0–9 | '0'=48, '9'=57 |
| 65–90 | Заглавные A–Z | 'A'=65, 'Z'=90 |
| 97–122 | Строчные a–z | 'a'=97, 'z'=122 |
Разные кодировки — разные коды для одних и тех же букв
Универсальная кодировка для всех языков мира
Unicode присваивает номер каждому символу всех письменностей мира. UTF-8 — способ записи Unicode в байты: латиница = 1 байт, кириллица = 2 байта, азиатские языки = 3–4 байта.
Размер символа в UTF-8:
| Диапазон Unicode | Байт в UTF-8 | Примеры |
|---|---|---|
| U+0000 – U+007F | 1 байт | Латиница, цифры, знаки |
| U+0080 – U+07FF | 2 байта | Кириллица, арабский, иврит |
| U+0800 – U+FFFF | 3 байта | Китайский, японский, корейский |
| U+10000 – U+10FFFF | 4 байта | Эмодзи, редкие иероглифы |
Полная таблица кодов 0–127: управляющие символы (0–31) + печатные (32–127)
Введите текст — увидите, сколько байт он займёт в каждой кодировке
Загружаются из JSON-файла