В основе алгоритма Хаффмана лежит идея кодирования битовыми группами. Сначала проводится частотный анализ входной последовательности данных, то есть устанавливается частота вхождения каждого символа, встречащегося в ней. После этого, символы сортируются по уменьшению частоты вхождения.
Основная идея состоит в следующем: чем чаще встречается символ, тем меньшим количеством бит он кодируется. Результат кодирования заносится в словарь, необходимый для декодирования. Рассмотрим простой пример, иллюстрирующий работу алгоритма Хаффмана.
Пусть задан текст, в котором бурва 'А' входит 10 раз, буква 'В' — 8 раз, 'С'— 6 раз , 'D' — 5 раз, 'Е' и 'F'
— по 4 раза. Тогда один из возможных вариантов кодирования по алгоритму Хаффмана приведен в таблицы
1.
Таблица 1.
Символ
Частота вхождения
Битовый код
A
10
00
B
8
01
C
6
100
D
5
101
E
4
110
F
4
111
Как видно из таблицы 1, размер входного текста до сжатия равен 37 байт, тогда как после сжатия —
93 бит, то есть около 12 байт (без учета длины словаря). Коэффициент сжатия равен 32%. Алгоритм Хаффмана универсальный, его можно применять для сжатия данных любых типов, но он малоэффективен для файлов маленьких размеров (за счет необходимости сохранение словаря).
На практике программные средства сжатия данных синтезируют эти три "чистых" алгоритмы, поскольку их эффективность зависит от типа и объема данных. В таблице 2 приведены распространенные форматы сжатия и соответствующие им программыи—архиваторы, использующиеся на практике.
Таблица 2.
Формат сжатия
Операционная система MS DOS
Операционная система Windows
Программа архивации
Программа разархивации
Программа архивации
Программа разархивации
ARJ
Arj.exe
Arj.exe
WinArj.exe
WinArj.exe
RAR
Rar.exe
Unrar.exe
WinRar.exe
WinRar.exe
ZIP
Pkzip.exe
Pkunzip.exe
WinZip.exe
WinZip.exe
Кроме того, современные архиваторы предоставляют пользователю полный спектр услуг для работы с архивами, основными из которых являются:
создание нового архива;
добавление файлов в существующий архив;
распаковывание файлов из архива;
создание самораспаковающихся архивов (self—extractor archive);
создание распределенных архивов фиксированного размера для носителей маленькой емкости;
защита архивов паролями от несанкционированного доступа;
просмотр содержимого файлов разных форматов без предварительного распаковывания;