Contexte : Les systèmes de classification traditionnels, tels que la NACE et le NAICS, classifient principalement les entreprises par secteur, limitant leur capacité à identifier des entreprises liées. Objectifs : Cette recherche vise à améliorer l'identification des entreprises associées en analysant leurs descriptions, en utilisant une approche plus sémantique. Méthodes/Approche : Un modèle BERT pré-entraîné a été utilisé pour évaluer la similarité textuelle sémantique afin de suggérer des entreprises similaires. L'objectif était de créer un système qui aide les experts à comparer les entreprises en fonction de leurs descriptions, plutôt que de développer un outil de classification parfait. Résultats : Entraîné sur des données publiquement disponibles, le modèle a atteint une précision de 73,6 % dans l'identification des entreprises associées, avec une précision dépassant 90 % pour certaines combinaisons sectorielles sélectionnées. Conclusions : Bien que le système montre des promesses, ses résultats sont destinés à guider les professionnels qui doivent finalement valider les résultats. Les résultats soulignent les forces et les limites de l'utilisation des modèles IA à cette fin, fournissant une base pour de futures améliorations et applications concrètes. Cependant, la solution reste une idée conceptuelle, limitée à seulement 13 catégories industrielles, soulignant la nécessité de tests et de développements plus larges.
Jagrič et al. (Thu,) ont étudié cette question.