Nous avons besoin d’outils d’analyse textuelle qui permettent d’identifier les mots, les relations entre les mots et le sens de ces mots dans les documents. De plus, les méthodes choisies doivent se prêter à l’étude de textes nombreux et volumineux. Enfin, cette analyse a pour but non seulement la collecte de l’information contenue dans les textes, mais aussi l’enrichissement de cette information. À ce titre, elle se doit d’établir des liens entre les lexèmes et un dictionnaire de référence, garant de la nature et du sens des mots. Par ailleurs, les résultats de l’analyse constituant la structure informationnelle initiale des documents analysés, il faut qu’ils se prêtent à la conservation et à la manipulation de l’information.
Les outils choisis pour effectuer cette analyse correspondent donc bien à ces critères. La chaîne NTM-XIP présente la robustesse voulue en même temps qu’une souplesse propre à faciliter l’identification, le stockage et la manipulation de l’information. De plus, la méthode de désambiguïsation sémantique permet d’identifier l’information lexicale liée à chaque sens sélectionné dans tout le dictionnaire choisi comme référence. Il s’agit à présent de déterminer le ou les dictionnaires dont l’information d’une part servira de base à l’analyse linguistique des textes et d’autre part permettra un enrichissement contextualisé et abondant de l’information détectée dans les documents.