Key points are not available for this paper at this time.
Le clustering de texte est devenu une branche importante des méthodes d'apprentissage non supervisé et est largement utilisé dans les médias sociaux. Récemment, les grands modèles de langage (LLMs) ont constitué une avancée significative dans le domaine de l'IA. Par conséquent, certains travaux se sont consacrés à l'amélioration des performances de clustering des modèles d'embedding grâce aux retours des LLMs. Cependant, les approches actuelles prennent difficilement en considération les informations relatives aux étiquettes de clusters entre les instances de texte lors du fine-tuning des modèles d'embedding, ce qui entraîne un problème de collision de clusters. Pour résoudre ce problème, cet article propose TeC, une nouvelle méthode fonctionnant par le biais de phases d'enseignement et de correction. Au cours de ces phases, les LLMs jouent le rôle d'enseignants, guidant les modèles d'embedding en tant qu'étudiants pour améliorer leurs performances de clustering. La phase d'enseignement transmet des directives sur les informations d'étiquettes de clusters aux modèles d'embedding en interrogeant les LLMs par lots et utilise une perte d'apprentissage contrastif faiblement supervisé proposée pour affiner les modèles d'embedding sur la base des informations d'étiquettes de clusters fournies. Par la suite, la phase de correction affine les résultats de clustering obtenus lors de la phase d'enseignement en demandant aux LLMs de corriger les attributions de clusters des échantillons à faible niveau de confiance. L'évaluation expérimentale approfondie sur six ensembles de données textuelles à travers trois tâches de clustering distinctes démontre la performance supérieure de notre méthode proposée par rapport aux approches existantes de l'état de l'art.
Yang et al. (Tue,) ont étudié cette question.