Unicode экранирование и деэкранирование

Конвертируйте текст в Unicode-последовательности вида \u0041 или декодируйте экранированные последовательности обратно в символы. Полезно при работе с интернационализацией и отладке кодировок.

Возможности

Формат \uXXXX
Формат \UXXXXXXXX
Формат &#xHHHH;
Формат &#DDDD;

Как использовать

1. Выберите режим «Экранировать» или «Деэкранировать».

2. Вставьте текст в поле ввода.

3. Результат отображается справа — нажмите «Копировать».

Об этом инструменте

Escape-последовательности Unicode позволяют записать любой символ только средствами ASCII — это полезно в исходном коде, JSON, конфигурационных файлах и HTML, где важны точные байты. Этот инструмент переводит текст в четыре формата и обратно: \uXXXX, как в JavaScript, JSON и Java, где символы за пределами U+FFFF, например эмодзи, превращаются в суррогатные пары; \UXXXXXXXX с восемью шестнадцатеричными цифрами для полного кода символа, как в Python и C; и числовые HTML-ссылки &#xHHHH; и &#DDDD;. Экранируются только символы вне ASCII, поэтому обычные латинские буквы и цифры остаются читаемыми, а кириллица, наоборот, превращается в последовательности. При обратном преобразовании выбранный формат распознаётся и последовательности снова становятся символами; если в режиме экранирования вставить уже экранированный текст, инструмент сам сменит направление.

Часто задаваемые вопросы

Чем отличаются последовательности \u и \U?
За \u следуют четыре шестнадцатеричные цифры, обозначающие одну кодовую единицу UTF-16, поэтому символам выше U+FFFF нужны две последовательности (суррогатная пара). За \U следуют восемь шестнадцатеричных цифр, которые напрямую задают полный код символа, как поддерживается в Python и C.
Почему эмодзи превращается в две последовательности \u?
Эмодзи вроде 😀 (U+1F600) находятся за пределами базовой многоязычной плоскости. В UTF-16, который используют JavaScript и Java, они хранятся как старший и младший суррогаты, например \ud83d\ude00.
Когда в HTML использовать &#x; или &#;?
На страницах в UTF-8 символы обычно можно писать напрямую. Числовые ссылки полезны, когда система вырезает текст вне ASCII, когда нужен невидимый символ вроде неразрывного пробела или в XML-файлах с ограниченной кодировкой.
Экранирование Unicode — это то же самое, что URL-кодирование?
Нет. URL-кодирование превращает байты символа в UTF-8 в последовательности %XX, поэтому я становится %D1%8F. Экранирование Unicode записывает код символа, поэтому я становится \u044f или я.
Почему некоторые экранированные строки не преобразуются обратно?
Последовательности должны точно соответствовать выбранному формату. Одиночный суррогат, недостающие цифры или смешение форматов, например \u044f и я в одном тексте, оставят эти части без изменений.

Похожие инструменты

JWT-декодер
Вставьте JWT-токен для просмотра его заголовка, полезной нагрузки и подписи. Вре...
Base64 кодирование / декодирование
Введите текст для кодирования в Base64 или вставьте строку Base64 для декодирова...
URL кодирование / декодирование
Конвертируйте текст в процентно-кодированную форму для использования в URL-адрес...
HTML-сущности кодирование / декодирование
Конвертируйте специальные символы вроде &, <, > в HTML-сущности (&amp;, &lt;, &g...
Генератор случайных цветов
Генерируйте палитру случайных цветов со значениями HEX, RGB, HSL и OKLCH. Закреп...
Тестер регулярных выражений
Тестируйте регулярные выражения JavaScript с подсветкой совпадений в реальном вр...
Генератор cron-выражений
Создавайте расписания cron визуально или вставьте выражение, чтобы увидеть его о...
Генератор QR-кодов
Генерируйте QR-коды из текста, URL-адресов или любых данных. Настройте размер, ц...