CourionAI
FR
Newsletter
← Toutes les actus
open-source 3 min de lecture

L’« Unlimited OCR » de Baidu lit des documents de 40 pages d’un seul coup, en apprenant à oublier

Un nouveau modèle open source de Baidu traite des dizaines de pages en un seul passage avec une consommation de mémoire constante et arrive en tête du classement OmniDocBench, les poids et la démonstration sont accessibles gratuitement.

Un document plié en accordéon traverse une presse d’imprimerie qui transforme ses pages en rangées régulières de points

Transformer des documents numérisés en texte exploitable, l’OCR, ou reconnaissance optique de caractères, est l’une des tâches les plus pratiques de l’IA. Elle se heurtait pourtant à une limite tenace : les modèles actuels saturent après une dizaine de pages à la fois, car leur empreinte mémoire augmente avec chaque ligne produite. Des chercheurs de Baidu viennent de publier Unlimited OCR, un modèle open source qui lit des dizaines de pages en un seul passage tout en gardant une consommation de mémoire constante. Avec 93,92 %, il occupe actuellement la première place du test documentaire OmniDocBench pour les systèmes de bout en bout.

L’astuce est délicieusement humaine. Lorsque vous recopiez à la main un texte dans un livre, vous ne relisez pas tout ce que vous avez déjà écrit : vous gardez les yeux sur la source et sur vos derniers mots, tandis que les passages plus anciens s’effacent. Baidu a intégré ce principe au modèle : chaque nouveau fragment de sortie peut voir l’image complète du document, mais seulement les 128 derniers tokens, soit environ les dernières phrases, de son propre texte. L’équipe appelle cette méthode « Reference Sliding Window Attention ». Résultat : au-delà de 40 pages dans les tests, le taux d’erreur reste faible et le modèle génère le texte environ 13 % plus vite que le système OCR de DeepSeek sur lequel il repose. Plus le document s’allonge, plus l’écart se creuse.

Pourquoi ? L’OCR est discrètement devenu l’un des domaines les plus concurrentiels de l’IA, et pas seulement pour lire des contrats. Un texte enregistré sous forme d’image nécessite beaucoup moins de calcul que le même texte sous forme de tokens. Les laboratoires voient donc dans la lecture de documents un moyen de donner aux modèles de langage une mémoire plus longue et moins chère, la même idée que l’outil pxpipe présenté la semaine dernière, qui réduit le coût en tokens en transformant les prompts en PNG. Une réserve : « illimité » exagère quelque peu. Le contexte fixe de 32 000 tokens limite toujours le nombre de pages traitées en un passage, et les caractères très petits posent problème. Baidu annonce des versions à 128 000 tokens.

Ce que cela signifie pour vous : Vous pouvez réellement essayer cet outil dès aujourd’hui : le code et les poids du modèle sont disponibles gratuitement sur GitHub et Hugging Face, et une démonstration fonctionne dans le navigateur sur Hugging Face Spaces, sans installation. Si vous devez régulièrement extraire le texte de PDF numérisés, de factures ou d’anciennes archives papier, l’état de l’art vient de devenir plus rapide, plus endurant et gratuit. Pour les utilisateurs plus techniques : avec 3 milliards de paramètres, dont seulement environ 500 millions actifs, ce modèle est assez petit pour fonctionner sur du matériel modeste, un outil local véritablement utile, pas seulement un titre sur un classement.

Sources

Sources: https://github.com/baidu/Unlimited-OCR

Article suivant

Un classique PC de 2003 sur votre iPhone : l’IA a porté Command & Conquer sur iOS en un week-end

Un designer de Google DeepMind a utilisé Claude Code et Fable 5 pour porter nativement Command & Conquer: Generals Zero Hour sur iOS, première version jouable en environ 40 minutes, code source complet sur GitHub.

Un char rétro et une antenne radar sortent de l’écran d’un smartphone sous des nuages en pixel art