|
actant :
| |
|
|
désigne celui qui fait l’action indiquée par le verbe ou le groupe verbal. |
|
actualisation :
| |
|
|
réalisation concrète sous la forme d’un mot ou de plusieurs mots d’un sens théorique. |
|
amorçage sémantique :
| |
|
|
théorie psycholinguistique selon laquelle l’introduction d’un concept dans un énoncé va influencer et faciliter la compréhension de concepts ultérieurs sémantiquement reliés (semantic priming). |
|
amorçage :
| |
|
|
technique utilisée pour fournir à un système d’analyse les données dont il a besoin pour fonctionner, et qui consiste à passer par une phase contrôlée d’apprentissage d’informations qui permettront ultérieurement une analyse automatique (bootstrapping). |
|
analyseur robuste :
| |
|
|
outil d’analyse linguistique automatique qui présente la particularité de tolérer que lui soit présenté un énoncé qui sort de sa compétence sans pour autant provoquer un arrêt du système : simplement, aucun résultat ne sera proposé par l’analyseur. |
|
anaphore :
| |
|
|
processus syntaxique consistant à reprendre par un segment (habituellement un pronom ou un adjectif) l’entité actualisée par un autre segment du discours ; nous utilisons couramment le terme anaphore dans le sens plus restreint de coréférence* anaphorique. |
|
ancrage :
| |
|
|
l’ancrage d’un trait est l’entité à laquelle un trait est rattaché – que ce soit un lexème*, un nœud lexical ou non lexical de l’arbre syntaxique partiel ou une dépendance syntaxique*. |
|
|
|
|
antonyme :
| |
|
|
lexème* qui possède un sens opposé à un autre par rapport auquel il est envisagé. |
|
baseline :
| |
|
|
voir plancher*. |
|
booléen :
| |
|
|
voir logique booléenne*. |
|
bootstrapping :
| |
|
|
voir amorçage*. |
|
catégorie grammaticale :
| |
|
|
classe d’une unité lexicale* définie sur la base de critères syntaxiques : nom, pronom, verbe, adjectif, déterminant, adverbe, préposition, conjonction, interjection (synonyme : partie du discours*). |
|
cause :
| |
|
|
relation d’implication* unissant deux verbes dont le premier est causatif et le second résultatif. |
|
chunk :
| |
|
|
voir syntagme minimal*. |
|
cible :
| |
|
|
le mot que le système de désambiguïsation sémantique* doit traiter à un instant donné (target). |
|
CIFRE :
| |
|
|
Convention Industrielle pour la Formation à la Recherche en Entreprise. |
|
CLEF :
| |
|
|
Cross Language Evaluation Forum. |
|
collocation :
| |
|
|
association habituelle d’une unité lexicale* avec une autre dans un énoncé. |
|
correct :
| |
|
|
se dit d’une réponse apportée en gestion de l’information* qui est conforme à la réponse de référence pour la même information demandée. |
|
coréférence :
| |
|
|
relation syntaxique unissant deux segments du discours qui dans le contexte désignent la même entité ou font référence à la même entité ; la coréférence anaphorique* relie un pronom ou un adjectif (qui ne fait référence par lui-même qu’à une entité indéterminée) à l’actualisation de cette entité placée avant dans l’énoncé. |
|
|
|
|
|
|
|
dégradation sur la correspondance :
| |
|
|
réduction volontaire des contraintes de correspondance entre l’information contenue dans la question posée au système de question-réponse* et les réponses proposées. |
|
dégradation sur la question :
| |
|
|
réduction volontaire de la quantité d’information extraite de la question par le système de question-réponse* qui aboutit à une diminution des contraintes informationnelles exigées dans les réponses proposées par le système. |
|
dépendance fonctionnelles :
| |
|
|
dépendances que XIP* extrait pour son fonctionnement interne (c’est-à-dire qui permettent de construire d’autres dépendances*) ou qui mettent en œuvre un ou plusieurs mots-outils*. |
|
dépendance syntaxique :
| |
|
|
propriété d’ordre syntaxique attribuée par un analyseur syntaxique automatique à un lexème* ou à la relation qui unit deux ou plusieurs lexèmes*. |
|
dépendances transitives :
| |
|
|
dépendances dont la définition par l’analyseur syntaxique est multiple, mais qui recouvrent une seule relation syntaxico-sémantique malgré une présentation syntaxique différente (par exemple une relation actant-action correspond à la syntaxe du sujet et du complément d’agent). |
|
désambiguïsation concurrente :
| |
|
|
cas où l’application de la désambiguïsation sémantique* permet à plus d’un sens de s’affirmer, c’est-à-dire pour la méthode choisie, lorsque plusieurs règles concurrentes s’appliquent à un même mot dans un même contexte (synonyme : désambiguïsation incomplète*). |
|
désambiguïsation incomplète :
| |
|
|
voir désambiguïsation concurrente*. |
|
désambiguïsation sémantique :
| |
|
|
association d’un unité lexicale* apparaissant dans un contexte avec sa signification ou sa définition – laquelle peut être distinguée des autres définitions qu’on peut attribuer à ce lexème* (word sense disambiguation). |
|
dictionnaire informatique :
| |
|
|
ressource lexicale se présentant sous un format numérique tel que seul un programme informatique (souvent dédié) peut l’exploiter, généralement une base de données optimisées. |
|
|
|
|
dictionnaire sémantique :
| |
|
|
ressource lexicale qui privilégie la description des relations sémantiques entre les unités lexicales* qu’il contient par rapport aux autres informations. |
|
|
|
|
dictionnaire électronique :
| |
|
|
version numérisée d’un dictionnaire papier. |
|
DTD :
| |
|
|
Document Type Definition, Définition de Type de Document. |
|
enrichissement :
| |
|
|
opération effectuée sur un texte ou un énoncé qui consiste à donner à ce texte une présentation différente de son aspect originel tout en lui conservant un sens égal ou similaire ; le résultat de cette opération (synonyme : expansion*). |
|
EWN :
| |
|
|
EuroWordNet. |
|
expansion :
| |
|
|
voir enrichissement*. |
|
expression synonymique :
| |
|
|
locution lexicalisée ou non dont la propriété est d’avoir le même sens qu’une unité lexicale*. |
|
expressions régulières :
| |
|
|
formalisme de traitement de chaînes de caractères sous forme de modèles ou patrons très généraux ou très spécifiques, et permettant d’identifier, d’extraire ou de modifier les chaînes de caractères sélectionnées par le patron. |
|
extraction d’information :
| |
|
|
domaine de la gestion de l’information* qui consiste à extraire automatiquement de l’information structurée à partir d’un texte en langage naturel non structuré (information extraction). |
|
F-measure :
| |
|
|
voir F-mesure*. |
|
F-mesure :
| |
|
|
résultat statistique qui découle de la combinaison de la précision* et du rappel*, pondéré par un paramètre β dont la variation à partir de 1.0 détermine si le rappel* ou la précision* est de plus de poids (F-measure). |
|
|
|
|
fenêtre de réponse :
| |
|
|
étendue prévue pour une réponse apportée par un système de gestion de l’information*, exprimé selon les cas en caractères, en unités lexicales ou en unité linguistiques ou typographiques plus étendues (phrase, paragraphe, texte). |
|
focus :
| |
|
|
concept présent dans une question qui englobe l’information attendue en réponse à cette question ; objet de la question. |
|
forme canonique :
| |
|
|
forme d’un lexème* considérée comme non fléchie, et utilisée arbitrairement comme intitulé pour cette unité lexicale* dans les dictionnaires. |
|
formulaire :
| |
|
|
structure hiérarchique d’attributs-valeurs permettant d’exprimer une information et couramment utilisée en extraction d’information* (template). |
|
gestion de l’information :
| |
|
|
l’ensemble du domaine du traitement automatique de données appliqué au contenu de textes, et principalement la recherche d’information, le filtrage de textes, l’extraction d’information* et la tâche de question-réponse* (knowledge management). |
|
groupe syntaxique minimal :
| |
|
|
voir syntagme minimal*. |
|
hidden Markov model (HMM)
| |
|
|
voir modèle de Markov caché*. |
|
HLRT :
| |
|
|
Head Left Right Tail : règle qui consiste à identifier les bornes gauche et droite de chaque élément d’information. |
|
HMM :
| |
|
|
Hidden Markov Model, voir Modèle de Markov Caché*. |
|
holonyme :
| |
|
|
lexème* dont le sens, désignant un tout, inclut le sens d’autres termes, considérés comme désignant des parties de ce tout, et appelés méronymes*. |
|
|
|
|
HTML :
| |
|
|
HyperText Markup Language. |
|
hypéronyme :
| |
|
|
lexème* dont le sens, considéré comme plus général, inclut le sens d’autres termes, considérés comme plus spécifiques, et appelés hyponymes*. |
|
hyponyme :
| |
|
|
lexème* dont le sens, considéré comme plus spécifique, est inclus dans le sens d’un autre terme, considéré comme plus général, et appelé hypéronyme*. |
|
|
|
|
héritage :
| |
|
|
relation sémantique hiérarchique selon laquelle les propriétés sémantiques d’une unité lexicale* sont héritées par les unités lexicales qui lui sont hiérarchiquement soumises dans une taxinomie*. Les relations d’héritage sont l’hyponymie* et l’hypéronymie*. |
|
IE :
| |
|
|
Information Extraction, voir extraction d’information*. |
|
IFSP :
| |
|
|
Incremental Finite-State Parser. |
|
ILI :
| |
|
|
Inter-Lingual Index, index inter-langue. |
|
ILPGA :
| |
|
|
Institut de Linguistique et de Phonétique Générales et Appliquées. |
|
implication :
| |
|
|
relation sémantique unissant un verbe à un autre lorsque la vérité du procès simple dans lequel apparaît le premier provoque obligatoirement la vérité du procès simple dans lequel apparaît le second (par exemple, il ronfle implique il dort). |
|
incorrect :
| |
|
|
se dit d’une réponse apportée en gestion de l’information* qui n’est pas conforme à la réponse de référence pour la même information demandée. |
|
|
|
|
information extraction :
| |
|
|
voir extraction d’information*. |
|
IR :
| |
|
|
Information Retrieval, recherche d’information. |
|
knowledge management :
| |
|
|
voir gestion de l’information*. |
|
LDOCE :
| |
|
|
Longman Dictionary of Contemporary English. |
|
lexical :
| |
|
|
voir lexème*. |
|
lexique génératif :
| |
|
|
ressource lexicale décrivant les sens du lexique considéré sous la forme de règles de signification relatives [Pustejovsky, 1991]. |
|
lexème :
| |
|
|
unité de base du lexique constitutive de sens ; le lexème peut être un mot simple, un mot composé ou une locution (synonyme : unité lexicale*). |
|
|
|
|
lissage :
| |
|
|
méthode s’appuyant sur des fréquences de co-occurrences utilisée pour éviter que la probabilité d’apparition d’un sens rare et non représenté dans le corpus soit égale à zéro (smoothing). |
|
logique booléenne :
| |
|
|
logique binaire s’appliquant à des propositions qui sont donc soit vraies (1) soit fausses (0), fondée sur des opérateurs d’inclusion (ET), de disjonction inclusive ou exclusive (OU) et de négation (NON). |
|
méronyme :
| |
|
|
lexème* dont le sens, désignant une partie d’un tout, est inclus dans le sens d’un autre terme, considérés comme désignant un tout, et appelés holonyme*. |
|
|
|
|
mesures traditionnelles :
| |
|
|
ces mesures sont celles de précision* et de rappel*, utilisées pour évaluer la qualité de la plupart des systèmes de gestion de l’information* depuis ses débuts, à l’exception de la tâche de question-réponse*. |
|
méthode globale :
| |
|
|
pour le système de construction de la structure informationnelle* et le système d’interrogation développé dans cette thèse, type d’interrogation consistant à interroger la structure informationnelle enrichie au maximum (y compris la coréférence* anaphorique* des sujets) en utilisant comme contraintes la présence du lexical* focus* et le rejet des réponses pour lesquelles aucune dépendance* n’est strictement exacte dans la question et la réponse candidate. |
|
Modèle de Markov caché :
| |
|
|
modèle statistique de distribution de traits « cachés », tels que des étiquettes de phonèmes ou de catégories grammaticales*, basé sur des traits observables, tels que des segments acoustiques ou des mots ; les modèles computationnels peuvent être entraînés automatiquement à partir d’un échantillon de données utilisée pour identifier la couche « cachée », basés sur le modèle statistique dérivé des données d’entraînement. |
|
mot-vedette :
| |
|
|
intitulé d’un article dans une ressource lexicale, correspondant à la forme canonique* de l’unité lexicale* décrite. |
|
mots grammaticaux :
| |
|
|
classe de mots fermée qui indiquent des relations grammaticales entre syntagme ou phrases, ou qui indiquent la frontière d’un syntagme ; elle regroupe les déterminants, les auxiliaires et copules, les conjonctions et les prépositions (synonymes : mots vides*, mots-outils*). |
|
mots vides :
| |
|
|
voir mots grammaticaux*. |
|
mots-outils :
| |
|
|
voir mots grammaticaux*. |
|
MUC :
| |
|
|
Message Understanding Conference. |
|
multi-slot structure :
| |
|
|
voir structure d’information combinée*. |
|
NLP :
| |
|
|
Natural Language Processing, voir TAL*. |
|
|
|
|
NTCIR :
| |
|
|
NII-NACSIS Test Collection for IR systems. |
|
OHFD :
| |
|
|
Oxford Hachette French Dictionary. |
|
overgeneration :
| |
|
|
voir surgénération*. |
|
parasynonyme :
| |
|
|
il s’agit dans le Dictionnaire des verbes et des mots de [Dubois et Dubois-Charlier, 1997], d’une unité ou expression lexicale* sémantiquement reliée au mot-vedette* soit comme synonyme*, soit comme holonyme* ou hypéronyme*, soit comme synonyme* d’un holonyme* ou d’un hypéronyme*. |
|
partie du discours :
| |
|
|
voir catégorie grammaticale* (part-of-speech). |
|
part-of-speech :
| |
|
|
voir catégorie grammaticale*. |
|
partonomie :
| |
|
|
structure hiérarchique sémantique qui met en œuvre les relations d’holonymie* et de méronymie* et classe les lexèmes* selon ces relations (voir taxinomie*). |
|
patient :
| |
|
|
désigne celui qui subit l’action indiquée par le verbe ou le groupe verbal. |
|
plancher :
| |
|
|
référence permettant de juger du niveau d’efficacité d’un système, et consistant ici à questionner la base documentaire sans enrichissement à l’aide des mots pleins des questions utilisés comme des mots-clefs (baseline). |
|
précision :
| |
|
|
rapport du nombre des réponses correctes* obtenues au nombre total des réponses (correctes* et incorrectes*) obtenues. |
|
|
|
|
présupposition :
| |
|
|
relation d’implication* entre deux verbes dont l’application du procès du premier implique la réalisation préalable du procès du second |
|
QA :
| |
|
|
Question Answering, voir question-réponse*. |
|
question answering :
| |
|
|
voir question-réponse*. |
|
question-réponse :
| |
|
|
ce domaine de la gestion de l’information* s’intéresse à l’interrogation en langage naturel d’une base documentaire. Son but est de permettre de poser des questions comme à un être humain au système qui s’efforce d’y apporter soit un court fragment de texte contenant la réponse à la question posée, soit cette réponse uniquement (question answering). |
|
racinisation :
| |
|
|
simplification automatique d’une unité lexicale* à sa racine ou à un noyau de cette unité* considéré comme sa racine pour permettre de trouver dans un texte toutes les unités lexicales* possédant une même racine, qui seront dès lors considérées comme appartenant au même champ sémantique (stemming). |
|
rappel :
| |
|
|
rapport des réponses correctes* obtenues au nombre des réponses correctes* réellement présentes dans le texte interrogé (recall). |
|
recall :
| |
|
|
voir rappel*. |
|
règle sémantique :
| |
|
|
règle créée pour la désambiguïsation sémantique*, et dans laquelle les contraintes sur le contexte lexical ne porte que sur des traits sémantiques de ce contexte (par opposition aux règles lexicales et aux règles de sous-catégorisation*). |
|
scalarité :
| |
|
|
relation sémantique unissant des adjectifs appartenant à une échelle de gradation de sens dont les extrémités ont des sens opposés. |
|
score :
| |
|
|
résultat évaluatif donné à la réponse à une requête apportée par un système de question-réponse*, et correspondant au rapport à 1 du rang de la première bonne réponse parmi les cinq premières fournies, ou 0 ; moyenne des scores pour chaque question lorsque l’évaluation est menée sur un ensemble de questions. |
|
|
|
|
segmentation :
| |
|
|
découpage d’un texte en unités lexicales* (tokenization). |
|
semantic priming :
| |
|
|
voir amorçage sémantique*. |
|
semi-auxiliaire :
| |
|
|
verbes qui, construits avec un infinitif, parfois avec un participe ou un gérondif, perdent plus ou moins leur signification propre et servent à exprimer diverses nuances de temps, d’aspect ou d’autres modalités de l’action. |
|
single-slot structure :
| |
|
|
voir structure d’extraction simple*. |
|
smoothing :
| |
|
|
voir lissage*. |
|
sous-catégorisation :
| |
|
|
indication limitative sur le schéma syntaxique (ou parfois syntaxico-sémantique) propre à une unité lexicale* (par exemple transitif pour un verbe donné) ; lorsque cette indication est propre à une acception de l’unité lexicale*, l’apparition de ce schéma syntaxique dans un énoncé permet de désigner le sens de l’unité lexicale* dans cet énoncé. |
|
stemming :
| |
|
|
voir racinisation*. |
|
structure d’extraction combinée :
| |
|
|
formulaire d’extraction d’une information complexe permettant de mettre en rapport différents éléments de même nature d’une même information (multi-slot structure). |
|
structure d’extraction simple :
| |
|
|
formulaire d’extraction d’une information complexe incapable de mettre en rapport différents éléments de même nature d’une même information, et de ce fait limité à un seul élément informationnel de même nature (single-slot structure). |
|
structure informationnelle :
| |
|
|
agencement constitué à partir d’une base documentaire textuelle par l’identification et le classement de chaque information qu’elle contient ainsi que par la détermination des liens qui unissent les différentes informations. Dans le cas présent, les enrichissements* font partie de cet agencement d’informations ; ils ont été effectués pour faciliter l’accès aux éléments informationnels. |
|
|
|
|
structure plate :
| |
|
|
structure dans laquelle les éléments ne sont pas classés les uns par rapport aux autres, ni hiérarchisés, mais constituent une simple liste. |
|
|
|
|
suffixation :
| |
|
|
constitution d’une unité lexicale* dérivée d’une autre par l’obtention automatique de sa racine et la concaténation de cette racine avec un suffixe. |
|
surgénération :
| |
|
|
se dit lorsque la réponse apportée par un système de gestion de l’information* contient une ou plusieurs données surnuméraires par rapport à la réponse de référence de la même information demandée (overgeneration). |
|
synonyme :
| |
|
|
nous considérons deux lexèmes* comme synonymes si un de leur sens au moins est commun de manière à permettre une interchangeabilité dans un énoncé sans modification du sens, même si un remaniement syntaxique est nécessaire. |
|
synonymie aveugle :
| |
|
|
enrichissement synonymique pratiqué sur la base documentaire après son analyse morpho-syntaxique, mais sans désambiguïsation sémantique*, et donc où les synonymes* ne sont pas distribués en fonction du sens des cibles* dans les énoncés. |
|
synonymie simple :
| |
|
|
relation sémantique de synonymie* unissant des unités lexicales* constituant l’entrée d’une ressource lexicale, à l’exclusion de locutions ou expressions à mots multiples. |
|
synset :
| |
|
|
ensemble d’unités lexicales* considérées par WordNet ou EuroWordNet comme synonymes* pour un de leurs sens au moins. |
|
syntagme minimal :
| |
|
|
correspond à un groupe de la grammaire traditionnelle (groupe nominal, verbal ou prépositionnel), à cette différence près qu’il est tronqué de sa partie droite au-delà de la tête du groupe (chunk). |
|
TAL :
| |
|
|
Traitement Automatique du Langage naturel (NLP). |
|
target
| |
|
|
voir cible*. |
|
|
|
|
taxinomie :
| |
|
|
classification hiérarchique sémantique des entrées d’une ressource lexicale qui met en œuvre les relations sémantiques d’héritage*, c’est-à-dire la méronymie* et l’holonymie*. |
|
template :
| |
|
|
voir formulaire*. |
|
|
|
|
texte libre :
| |
|
|
texte en langage écrit selon les règles grammaticales en vigueur dans la langue utilisée mais sans autre contrainte. |
|
texte semi-structuré :
| |
|
|
texte en langage écrit qui suit rarement la grammaire de la langue et se présente sous un style plus ou moins télégraphique, sans règle rigide ni sans forme prédéfinie ; il est en général porteur d’une information utilitaire. |
|
texte structuré :
| |
|
|
texte dans un langage écrit qui répond à des règles très strictes ; l’information dont il est porteur est régulière dans sa nature, sa présence, sa position. |
|
thesaurus :
| |
|
|
ressource lexicale monolingue traitant exclusivement et systématiquement la relation de synonymie* entre les unités lexicales*. |
|
tokenization :
| |
|
|
voir segmentation*. |
|
traitement homonymique :
| |
|
|
mode de présentation d’une ressource lexicale consistant à traiter chacun des sens des lemmes polysémiques sous autant d’entrées, c’est-à-dire à considérer les différents sens d’un même lexème* comme un ensemble d’homonymes. |
|
transducteur :
| |
|
|
dispositif algorithmique qui représente un ensemble de séquences en entrée et qui leur associe des séquences produites en sortie. |
|
TREC :
| |
|
|
Text REtrieval Conference. |
|
|
|
|
troponymie :
| |
|
|
relation d’implication* qui relie deux verbes dont l’un décrit une réalisation particulière du procès de l’autre. |
|
unité lexicale :
| |
|
|
voir lexème*. |
|
WN :
| |
|
|
WordNet. |
|
word sense disambiguation :
| |
|
|
voir désambiguïsation sémantique*. |
|
|
|
|
wrapper :
| |
|
|
procédure logicielle spécifique à un type de structure de ressource informationnelle, et qui traduit la réponse à une requête donnée en une nouvelle structure d’information simple* ou combinée* selon la structure de base du document et le sujet de l’information sélectionné. |
|
WSD :
| |
|
|
Word Sense Disambiguation, voir désambiguïsation sémantique*. |
|
XIP :
| |
|
|
Xerox Incremental Parser. |
|
XML :
| |
|
|
eXtensible Markup Language. |
|
XRCE :
| |
|
|
Xerox Research Centre Europe. |
|
|
|
|
|
|
|
|
|