Codificar ou recuperar os caracteres

O formato percentual com u aparece em representações antigas de texto, inclusive de caracteres chineses. Além dele, a decodificação aceita %XX e referências hexadecimais com ponto e vírgula. A operação ocorre no navegador e não envia o conteúdo em requisições de conversão.

  1. Codifique Aé你😀 para obter Aé%u4F60%uD83D%uDE00. A e é permanecem como texto; o emoji gera duas unidades UTF-16.
  2. Decodifique %u4F60 ou 你 para recuperar 你. Em left; A, o resultado left; A mantém a pontuação e o espaço entre as partes.
  3. Copie o resultado em texto simples. Ao editar a entrada, a saída anterior é apagada. Limpar esvazia ambos os campos, e uma falha de decodificação também elimina a saída antiga.

Como os valores são interpretados

O percentual não implica bytes UTF-8

%E4%F6%FC produz äöü porque cada par %XX corresponde a U+00XX. A sequência de URL %E4%BD%A0 não vira 你 neste conversor. Para texto percentual em UTF-8, use o decodificador de URL.

Na codificação, espaços, pontuação, o sinal % e os demais caracteres até U+00FF não mudam. O comportamento é seletivo: não equivale à função escape() completa nem cria escapes JavaScript com barra invertida.

Referências hexadecimais e sequências literais

A vira A e 😀 vira 😀. Essas referências com ponto e vírgula são convertidas diretamente para valores escalares Unicode. Valores substitutos ou acima de U+10FFFF causam erro; não há análise completa de HTML.

A forma antiga &#x4F60 sem ponto e vírgula também vira 你, como uma unidade UTF-16. Essa compatibilidade exige x minúsculo e exatamente quatro dígitos hexadecimais, sem outro dígito hexadecimal em seguida. As demais referências sem terminação continuam literais.

A decodificação ocorre uma vez: %25u0041 resulta no texto %u0041. Referências decimais e com nome, \u0041, %U0041 e escapes percentuais incompletos continuam literais. Tanto %u quanto a referência antiga de quatro dígitos mantêm unidades UTF-16, inclusive substitutos isolados; esta página não valida a integridade Unicode do texto.

Perguntas sobre essa notação

Codificar e decodificar sempre devolve o mesmo texto?

Não. Uma sequência literal como %41 permanece na codificação, mas vira A na decodificação. O campo de entrada também converte quebras de linha CR e CRLF reais para LF. Não é feita normalização Unicode.

Por que a ferramenta tinha UTF-8 para GBK no nome?

O rótulo anterior não correspondia à implementação. A função preservada trabalha com escapes no texto, não com bytes de arquivos ou conversão entre conjuntos de caracteres. Tags HTML na saída são exibidas como texto, sem execução.

Ferramentas recentes: