본 논문에서는 다중 표현을 갖는 용어 검색에 임베딩 모델을 활용하고, 대조 학습을 통해 성능을 향상시키는 방법을 제안한다. 위키백과, 특허 문서 등에서는 하나의 개념이 영문 전체 표현, 약어 표현 등 여러 형태로 나타나 전통적인 키워드 기반 검색을 적용하기 어렵다. 이에 본 논문에서는 검색 증강 생성 등에서 널리 사용되는 dense 임베딩 모델을 활용하여, 용어와 용어의 설명문 간의 의미적 검색을 수행하며, 한글, 영어, 한자를 아우르기 위해 다국어 임베딩 모델을 채택하였다. 기본 모델뿐 아니라, 다중 표현 용어를 추가 학습한 모델과 정의문 포함 여부가 다른 학습 데이터 구성을 비교 실험하였으며, 한국어 위키백과에서 수집한 489개 용어(한글·영어·한자 표현 포함)를 대상으로 평가를 수행했다. 그 결과, 단어 일치 기반 검색 대비 정의문을 포함하여 학습한 dense 모델에서 정확률, 재현율, nDCG에서 평균적으로 각각 22%, 47%, 48%의 향상 결과를 보였다.
Min et al. (2026) studied this question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: