Vision:La dématérialisation de documents inclut plusieurs étapes qui relèvent du domaine de l' "Intelligence Artificielle".
L'une des premières opérations "intelligentes" à effectuer consiste à reconnaître les éléments constituant le document, en particulier le texte, mais aussi les images, les graphiques, les structures
de tableaux, etc. La reconnaissance de caractères (OCR) a effectué des progrès remarquables (dernièrement grâce aux Réseaux Neuronaux Récurrents) depuis le début des années 1990, à tel point que l'on peut pour certains types d'écriture (ex : typographiée),
considérer le problème comme résolu.
La reconnaissance du texte permet d'effectuer des requêtes par mots-clé (ce qui n'est pas possible sur le support papier ou encore, sur l'image issue du scanner).
Malgré une grande efficacité, démontrée, par exemple, par les moteurs de recherche, ce type de requête présente des limitations importantes (en particulier du fait de l'émergence du "Big Data", ou encore, de l'accroissement exponentiel de la quantité de données disponibles sur Internet)
et les recherches actuelles portent sur la compréhension du sens, qui semble
être le grand défi pour les systèmes dits "Intelligents". Récemment, des chercheurs de Google ont montré la possibilité de réaliser une représentation quantifiée des mots d'un vocabulaire (système "Word2Vec"),
dans laquelle la proximité géométrique correspond à une proximité sémantique. La simplicité du réseau neuronal permettant de construire cette représentation des mots dans un espace vectoriel
à partir d'un corpus de documents est tout à fait remarquable, et ouvre la voie à des requêtes "sémantiques". Maïtech a pour objectif de développer un système propre
d'analyse du langage naturel, à l'aide d'une représentation originale des concepts. La compréhension du sens constitue, à notre avis, de défi actuel en analyse de documents et gestion de l'information.