Outil gratuit
Réparer les accents brisés
« Café », « l’été », « 12 $ » : le texte a été enregistré dans un encodage et relu dans un autre. Collez-le ici : les caractères d'origine sont retrouvés, et chaque changement est surligné pour que vous puissiez le vérifier.
Texte réparé
réparé déduit, à relire perdu, à retaper · Survolez ou touchez un mot surligné pour voir ce qu'il y avait avant.
La réparation se fait dans votre navigateur : le texte ne quitte jamais votre ordinateur.
Pourquoi les accents se brisent
Aujourd'hui, presque tout s'écrit en UTF-8, où « é » occupe deux octets. Quand un logiciel lit ces deux octets en Windows-1252 (ou Latin-1), l'ancien encodage occidental, il affiche deux caractères : « é ».
é è Ã
Lu dans le mauvais encodage
é, è, à… deviennent chacun deux caractères qui commencent par à ; ’ “ ” — en deviennent trois qui commencent par â€.
Entièrement récupérable.
é
Double encodage
Le texte brisé a été réenregistré en UTF-8, puis mal relu une deuxième fois. Chaque tour ajoute une couche.
Récupérable : l'outil retire les couches une à une.
� ?
Caractères vraiment perdus
Quand un logiciel ne sait pas afficher un caractère, il le remplace parfois par « ? » ou « � » avant d'enregistrer. L'original a disparu.
Il faut le retaper : l'outil montre où.
Un « Â » égaré devant une espace ou un signe de dollar, c'est une espace insécable (celle de la typographie française) qui a subi le même accident.
D'où ça vient, en général
Une base de données en latin1
- Vieux sites WordPress, ou sites déménagés d'un hébergeur à l'autre : tables en
latin1qui contiennent du texte UTF-8, ou export et import faits avec le mauvais jeu de caractères. - Symptôme : tout le site affiche des é, ou seulement les pages écrites avant le déménagement.
Un CSV ouvert dans Excel
- Excel ouvre les CSV en Windows-1252 par défaut. Ouvrez-le plutôt par Données › À partir d'un fichier texte/CSV › Origine du fichier : 65001 : Unicode (UTF-8).
- Pour exporter, choisissez CSV UTF-8 (délimité par des virgules).
Un courriel ou une page
- Un courriel ou une page qui ne déclare pas son encodage : le logiciel devine, et devine mal.
- Page Web :
<meta charset="utf-8">en haut du<head>. Courriel : l'en-têteContent-Type: text/plain; charset=UTF-8.
Corriger à la source dans WordPress
Cet outil répare le texte que vous collez. Si tout un site est touché, la correction se fait dans la base de données, et avec prudence.
- Faites d'abord une sauvegarde complèteBase de données et fichiers, avec l'outil de votre hébergeur ou
mysqldump. Jamais de conversion sans sauvegarde. - Regardez les réglagesDans
wp-config.php,DB_CHARSETdevrait valoirutf8mb4. Dans phpMyAdmin, vérifiez l'interclassement de chaque table (utf8mb4_unicode_ciou semblable, paslatin1_swedish_ci). - Quelques pages seulement ?Copiez chaque texte ici, réparez-le, recollez-le dans l'éditeur. Simple et sans risque.
- Tout le site ?Faites convertir les tables par un développeur sur une copie du site, comparez, et seulement ensuite basculez. La correction classique du texte UTF-8 rangé dans des colonnes latin1 est
CONVERT(CAST(CONVERT(colonne USING latin1) AS BINARY) USING utf8mb4), à valider ligne par ligne : appliquée à un texte déjà correct, elle l'abîme.
Limites
La réparation ne touche qu'aux séquences qui forment un caractère valide une fois décodées : un texte accentué normal reste tel quel. Deux cas sont déduits plutôt que certains et apparaissent en orange : « à » suivi d'une espace (presque toujours « à ») et un « †» orphelin (presque toujours un guillemet fermant ”). Un texte abîmé par un autre encodage (Mac Roman, par exemple « √© ») n'est pas pris en charge.