В основе алгоритма Хаффмана лежит идея кодирования битовыми группами. Сначала проводится частотный анализ входной последовательности данных, то есть устанавливается частота вхождения каждого символа, встречащегося в ней. После этого, символы сортируются по уменьшению частоты вхождения.
Основная идея состоит в следующем: чем чаще встречается символ, тем меньшим количеством бит он кодируется. Результат кодирования заносится в словарь, необходимый для декодирования. Рассмотрим простой пример, иллюстрирующий работу алгоритма Хаффмана.
Пусть задан текст, в котором бурва 'А' входит 10 раз, буква 'В' — 8 раз, 'С'— 6 раз , 'D' — 5 раз, 'Е' и 'F'
— по 4 раза. Тогда один из возможных вариантов кодирования по алгоритму Хаффмана приведен в таблицы
1.
Таблица 1.
Символ
Частота вхождения
Битовый код
A
10
00
B
8
01
C
6
100
D
5
101
E
4
110
F
4
111
Как видно из таблицы 1, размер входного текста до сжатия равен 37 байт, тогда как после сжатия —
93 бит, то есть около 12 байт (без учета длины словаря). Коэффициент сжатия равен 32%. Алгоритм Хаффмана универсальный, его можно применять для сжатия данных любых типов, но он малоэффективен для файлов маленьких размеров (за счет необходимости сохранение словаря).
На практике программные средства сжатия данных синтезируют эти три "чистых" алгоритмы, поскольку их эффективность зависит от типа и объема данных. В таблице 2 приведены распространенные форматы сжатия и соответствующие им программыи—архиваторы, использующиеся на практике.
Таблица 2.
Кроме того, современные архиваторы предоставляют пользователю полный спектр услуг для работы с архивами, основными из которых являются:
создание нового архива;