Outil gratuit

Réparer les accents brisés

« Café », « l’été », « 12 $ » : le texte a été enregistré dans un encodage et relu dans un autre. Collez-le ici : les caractères d'origine sont retrouvés, et chaque changement est surligné pour que vous puissiez le vérifier.

Texte réparé

réparé déduit, à relire perdu, à retaper · Survolez ou touchez un mot surligné pour voir ce qu'il y avait avant.

La réparation se fait dans votre navigateur : le texte ne quitte jamais votre ordinateur.

Pourquoi les accents se brisent

Aujourd'hui, presque tout s'écrit en UTF-8, où « é » occupe deux octets. Quand un logiciel lit ces deux octets en Windows-1252 (ou Latin-1), l'ancien encodage occidental, il affiche deux caractères : « Ã© ».

é è Ã

Lu dans le mauvais encodage

é, è, à… deviennent chacun deux caractères qui commencent par à; ’ “ ” — en deviennent trois qui commencent par â€.

Entièrement récupérable.

é

Double encodage

Le texte brisé a été réenregistré en UTF-8, puis mal relu une deuxième fois. Chaque tour ajoute une couche.

Récupérable : l'outil retire les couches une à une.

� ?

Caractères vraiment perdus

Quand un logiciel ne sait pas afficher un caractère, il le remplace parfois par « ? » ou « � » avant d'enregistrer. L'original a disparu.

Il faut le retaper : l'outil montre où.

Un « Â » égaré devant une espace ou un signe de dollar, c'est une espace insécable (celle de la typographie française) qui a subi le même accident.

D'où ça vient, en général

Une base de données en latin1

  • Vieux sites WordPress, ou sites déménagés d'un hébergeur à l'autre : tables en latin1 qui contiennent du texte UTF-8, ou export et import faits avec le mauvais jeu de caractères.
  • Symptôme : tout le site affiche des é, ou seulement les pages écrites avant le déménagement.

Un CSV ouvert dans Excel

  • Excel ouvre les CSV en Windows-1252 par défaut. Ouvrez-le plutôt par Données › À partir d'un fichier texte/CSV › Origine du fichier : 65001 : Unicode (UTF-8).
  • Pour exporter, choisissez CSV UTF-8 (délimité par des virgules).

Un courriel ou une page

  • Un courriel ou une page qui ne déclare pas son encodage : le logiciel devine, et devine mal.
  • Page Web : <meta charset="utf-8"> en haut du <head>. Courriel : l'en-tête Content-Type: text/plain; charset=UTF-8.

Corriger à la source dans WordPress

Cet outil répare le texte que vous collez. Si tout un site est touché, la correction se fait dans la base de données, et avec prudence.

  1. Faites d'abord une sauvegarde complèteBase de données et fichiers, avec l'outil de votre hébergeur ou mysqldump. Jamais de conversion sans sauvegarde.
  2. Regardez les réglagesDans wp-config.php, DB_CHARSET devrait valoir utf8mb4. Dans phpMyAdmin, vérifiez l'interclassement de chaque table (utf8mb4_unicode_ci ou semblable, pas latin1_swedish_ci).
  3. Quelques pages seulement ?Copiez chaque texte ici, réparez-le, recollez-le dans l'éditeur. Simple et sans risque.
  4. Tout le site ?Faites convertir les tables par un développeur sur une copie du site, comparez, et seulement ensuite basculez. La correction classique du texte UTF-8 rangé dans des colonnes latin1 est CONVERT(CAST(CONVERT(colonne USING latin1) AS BINARY) USING utf8mb4), à valider ligne par ligne : appliquée à un texte déjà correct, elle l'abîme.

Limites

La réparation ne touche qu'aux séquences qui forment un caractère valide une fois décodées : un texte accentué normal reste tel quel. Deux cas sont déduits plutôt que certains et apparaissent en orange : « Ã » suivi d'une espace (presque toujours « à ») et un « â€ » orphelin (presque toujours un guillemet fermant ”). Un texte abîmé par un autre encodage (Mac Roman, par exemple « √© ») n'est pas pris en charge.