Le moteur de reconnaissance (OCR et IA)

L'intelligence qui lit vos documents repose sur deux composants, exécutés entièrement sur votre serveur :

  • Le module OCR — repère et découpe le texte présent sur le document (montants, dates, en-têtes, tableaux).
  • Le module IA — s'appuie sur le modèle de langage Qwen, un modèle open source, pour comprendre ce texte et en extraire les informations utiles (fournisseur, montant, date, type de document). Aucune donnée n'est envoyée à un service en ligne : le modèle tourne uniquement chez vous.

Le moteur peut fonctionner sur un processeur classique (CPU) ou, si votre serveur en dispose, sur une carte graphique (GPU) — le GPU accélère fortement le traitement mais n'est pas indispensable.

MinimumRecommandé
Mémoire (RAM)16 Go32 Go
Espace disque500 Go SSD2 To SSD
Carte graphique (GPU)Aucune (fonctionne sur CPU)8 Go de mémoire vidéo (VRAM) ou plus

À titre indicatif, sur un GPU avec 8 Go de mémoire vidéo, l'analyse d'un document prend environ 5 secondes. Sur un processeur seul (sans GPU), cela peut prendre jusqu'à 3 minutes — plus lent, mais tout à fait utilisable pour un usage quotidien.

Le moteur reconnaît le texte dans n'importe quelle langue utilisant l'alphabet latin (français, italien, allemand, anglais, etc.) et détecte automatiquement la langue du document — vous n'avez rien à préciser. Dans sa version actuelle, il reconnaît trois types de documents : facture, quittance, et autre (pour tout document qui ne correspond pas aux deux premiers types).

Vous pouvez à tout moment surveiller l'état du moteur — file d'attente, mode d'exécution (CPU ou GPU), disponibilité — depuis le tableau de bord de l'état du moteur (réservé aux administrateurs). Chaque document y suit son propre parcours technique, différent de son parcours de validation métier (voir la page Sécurité et conformité) :

  • En attente — le document est dans la file, pas encore pris en charge par le moteur.
  • En traitement — le moteur est en train de le lire et de l'analyser.
  • Terminé — l'analyse est finie, le résultat est prêt pour la vérification par votre équipe.
  • Échoué — l'analyse n'a pas abouti (document illisible, par exemple) ; nexdoc retente automatiquement avant de vous signaler un échec durable.