Taux d'erreur de caractère
Le score standard pour la précision de la reconnaissance de texte : la proportion de caractères individuels dans lesquels un système se trompe.
Le taux d’erreur de caractère, généralement abrégé en CER, mesure la capacité du logiciel à transformer une image de texte en texte réel. Il compte les caractères erronés, manquants ou inventés et divise par le nombre de caractères qui auraient dû être présents. Moins c’est mieux, donc un CER de 2,4 pour cent signifie qu’environ 24 caractères sur mille se sont révélés erronés, soit une précision de 97,6 pour cent.
C’est le nombre à comparer lors du choix d’un outil de reconnaissance de texte, et il est plus strict que son cousin le taux d’erreur de mot, car une seule mauvaise lettre compte plutôt que d’effacer le mot entier. Deux avertissements s’appliquent. Le CER est toujours mesuré sur un ensemble particulier de pages, de sorte que les résultats sur une impression moderne et propre en disent peu sur les numérisations ou l’écriture manuscrite délavées. Et il considère une modernisation inoffensive, comme transformer un ancien long s en un s normal, comme une erreur, c’est pourquoi le même modèle peut paraître mauvais pour l’érudition et bon pour la formation en IA.