Unicode, UTF-8 и объём текста
Unicode задаёт кодовые позиции символов, а UTF-8 — способ записать их байтами.
В этом занятии
- Самостоятельно решить задачу по теме «Unicode, UTF-8 и объём текста» и объяснить проверку результата.
- Сравни объём коротких русских и английских подписей при явно заданной кодировке.
Пригодится: informatics10-real-memory
Разберёмся перед практикой+
Unicode, UTF-8 и объём текста
Unicode задаёт кодовые позиции символов, а UTF-8 — способ записать их байтами. ASCII-символы в UTF-8 занимают один байт; распространённые русские буквы — два. Другие символы могут занимать больше; видимый знак иногда состоит из нескольких кодовых позиций.
Не следует считать любой текст Unicode двухбайтовым. Информационный объём зависит от кодировки, конкретных символов, разделителей и служебных данных. При чтении файла неверная кодировка может дать искажённый текст без изменения самих байтов.
В UTF-8 строка «Кот!» без кавычек занимает 2+2+2+1 = 7 байт, если заголовков и перевода строки нет.
- Уточни кодировку и состав строки.
- Сложи длины кодирования символов.
- Учти пробелы и переводы строк, если они заданы.
Открываем цифровую мастерскую…
Попробуй самостоятельно
Запиши рассуждения в черновик или сделай построение на бумаге. Эти задания для самостоятельной работы: автоматической проверки и XP за них пока нет.
- Сравни объём коротких русских и английских подписей при явно заданной кодировке.
- Сначала предположи результат, затем проверь и объясни, что изменилось.
Источники и дальнейшее чтение
Материал изложен своими словами. Здесь можно проверить научные основания и подробнее изучить тему; часть источников — на английском.
Читай и разбирай пример в своём темпе. К практике можно перейти, когда будешь готов.