JIE (1999) Nauer : Différence entre versions

De VSST
imported>Jacques Ducloy
imported>Jacques Ducloy
Ligne 14 : Ligne 14 :
 
{{clr}}
 
{{clr}}
 
{{JIE début corps}}
 
{{JIE début corps}}
 +
==Introduction==
 +
L’interrogation de plusieurs banques de données est une nécessité dans la constitution d’une
 +
bibliographie exhaustive sur un sujet pluridisciplinaire [Gehanno 1998]. Or, si la consultation de
 +
multiples sources d’information garantit une meilleure couverture du sujet, elle nécessite -en
 +
parallèle- de prendre en compte l’hétérogénéité des données. En effet, comme chaque producteur
 +
d’information possède son propre modèle de document, on obtient des représentations différentes
 +
d’une même information. Cette hétérogénéité occasionne deux problèmes majeurs pour la
 +
bibliométrie qui faussent statistiques et analyses. Ces difficultés concernent :
 +
*la présence de variations pour représenter une même information (auteurs, descripteurs, affiliation, etc.) ;
 +
*la présence de doublons (c’est-à-dire plusieurs représentations de la même référence bibliographique).
 
{{JIE fin corps}}
 
{{JIE fin corps}}

Version du 24 mars 2012 à 13:28

De l'importance de la normalisation en bibliométrie


 
 

 
Titre
De l'importance de la normalisation en bibliométrie
Auteur
Emmanuel Nauer
Affiliation
Loria, équipe Orpailleur – CNRS : UMR7503 – « [[A pour affiliation auteur » contient un caractère désigné « [ » dans un libellé de propriété, et a été classé conséquemment comme non valide. - Nancy I – Université Nancy II – Institut National Polytechnique de Lorraine (INPL) France ]]
Résumé
Si la consultation de multiples sources d'information garantit une meilleure couverture du sujet, elle nécessite -en parallèle- de prendre en compte l'hétérogénéité des données. En effet, comme chaque producteur d'information possède son propre modèle de document, on obtient des représentations différentes d'une même information. Cette hétérogénéité occasionne deux problèmes majeurs pour la bibliométrie qui faussent statistiques et analyses. Ces difficultés concernent : • la présence de variations pour représenter une même information (auteurs, descripteurs, affiliation, etc.) ; • la présence de doublons (c'est-à-dire plusieurs représentations de la même référence bibliographique). Dans cet article, nous proposons une approche visant à pallier ces problèmes. Nous discutons tout d'abord les choix retenus en terme de normalisation et de dédoublonnage.

Sommaire

Introduction

L’interrogation de plusieurs banques de données est une nécessité dans la constitution d’une bibliographie exhaustive sur un sujet pluridisciplinaire [Gehanno 1998]. Or, si la consultation de multiples sources d’information garantit une meilleure couverture du sujet, elle nécessite -en parallèle- de prendre en compte l’hétérogénéité des données. En effet, comme chaque producteur d’information possède son propre modèle de document, on obtient des représentations différentes d’une même information. Cette hétérogénéité occasionne deux problèmes majeurs pour la bibliométrie qui faussent statistiques et analyses. Ces difficultés concernent :

  • la présence de variations pour représenter une même information (auteurs, descripteurs, affiliation, etc.) ;
  • la présence de doublons (c’est-à-dire plusieurs représentations de la même référence bibliographique).