TALN (Traitement Automatique du Langage Naturel) : La reconnaissance du texte permet d'effectuer des requêtes par mots-clé
(ce qui n'est pas possible sur le support papier ou encore, sur l'image issue du scanner).
Malgré une grande efficacité, démontrée, par exemple, par les moteurs de recherche comme Google,
ce type de requête présente des limitations importantes. L'accroissement exponentiel des données sur Internet,
qui a reçu le nom de "Big Data", rend plus difficile l'accès aux données pertinentes pour une requête donnée (Leur performance étant mesurée à l'aide des critères "Précison / Rappel").
La question de la compréhension du sens des concepts abstraits (ou l'élaboration de solutions de contournement) constitue aujourd'hui le grand défi de l'IA.
Jusqu'à aujourd'hui, l'"IA forte" reste une chimère, ce qui n'est pas contradictoire avec le fait que l'"IA faible" ait accompli des prouesses.
Les systèmes dit d'"Intelligence Artificielle" utilisent des solutions de contournement utilisant massivement ce qui constitue la force des ordinateurs: leurs puissances de calcul et leurs capacités de mémorisation.
En réalité, ce qu'on appelle "Intelligence Artificielle" peut être vu comme une branche de la Statistique : l' "apprentissage automatique" permet d'établir
des corrélations complexes entre des données, mais la performance est liée à la taille des bases d'apprentissage (une différence notable avec l'intellect humain).
On trouve ci-dessous, deux solutions de contournement au problème de la compréhension du sens des phrases :
Représentation par vecteur sémantique, ou méthode du "plongement" : En 2013, des chercheurs de Google (sous la direction de Tomas Mikolov) ont démontré la possibilité de réaliser une représentation
quantifiée des mots d'un vocabulaire (système "Word2Vec"), dans laquelle la proximité topologique correspond à une proximité sémantique.
Autrement dit, une correspondance est établie entre le sens et la quantité. Cette approche constitue une solution de contournement tout-à-fait
remarquable au problème de la compréhension du sens. En effet, sans pour autant comprendre le sens d'un texte, l'ordinateur devient capable
d'établir une proximité entre le sens de deux expressions littérales, et ceci ouvre la voie à la possibilité de
requêtes "sémantiques".
Ce type de représentation a reçu le nom de "plongement" (embedding). Son efficacité provient du fait que le sens d'un mot est fortement corrélé à son contexte,
c'est-à-dire, à l'ensemble de mots qui constituent son voisinage dans une phrase. Il est ainsi possible de deviner le sens d'un mot inconnu,
en le "plongeant" dans quelques exemples de phrases.
C'est aussi souvent le contexte qui permet de résoudre le problème de la
polysémie des termes
Récemment, le système ChatGPT a donné une brillante démonstration de ce qu'il est possible de réaliser à partir de ces principes. L'article "Attention Is All You Need" décrit l'achitecture du Transformer, à la base de ChatGPT. Voir par exemple la vidéo : https://www.youtube.com/watch?v=eMlx5fFNoYc
Web Sémantique ou ontologies : Une autre approche permettant de résoudre ce problème de la compréhension du sens par une machine a
consisté à éliminer la polysémie des termes, par une redéfinition stricte et univoque des termes utilisés et de leur sens : appliquée au Web, cette tentative
a reçu le nom de "Web Sémantique".
La redéfinition du sens des termes passe par la définition d'une "Ontologie". Dans une ontologie, chaque terme est défini comme une spécification
d'un autre terme (arbre de Porphyre), ou comme une implémentation concrète d'un terme exprimant une abstraction. L'utilisation d'ontologies permet d'effectuer
des requêtes à la fois plus précises que des requêtes par mots-clé, et possédant un certain niveau d'abstraction. Par exemple, il est possible d'effectuer la requête suivante :
"rechercher toutes les sociétés travaillant dans la reconnaissance OCR et ayant passé des accords contractuels avec telle société".
Parmi les défis actuels de l'IA on peut considérer :
réduction de la taille des bases d'apprentissage (à performance égale)
augmentation de la rigueur des résultats obtenus en dehoirs de la base d'apprentissage (généralisation)
Ainsi, un problème limité, comme celui de la gestion de copropriétés, offre la possibilité de traiter ces deux problématiques.
MAITECH est en cours de développement un système propre d'analyse du langage naturel, à l'aide d'une représentation originale des concepts.
La gestion des informations contenues dans les documents numérisés est actuellement réalisé par un système d'ontologies
au format du Web Sémantique. Le résultat de l'analyse des documents consiste donc à mettre à jour la base d'ontologies. Dans le cas de l'Extranet des copropriétés, celle-ci comprend en
particulier les identités des copropriétaires, leur tantièmes, leurs adresses mail, etc...