대규모 언어 모델(LLM)은 분류, 요약, 질의응답 등 다양한 자연어 처리 응용에서 널리 활용되고 있으나, 상업적 LLM은 대부분 블랙박스 API 형태로 제공되어 출력 결과의 근거를 해석하거나 신뢰성을 정량적으로 평가하기 어렵다. 특히 입력의 어떤 요소가 출력 변화에 영향을 미치는지, 그리고 이러한 변화가 얼마나 일관되게 발생하는지를 확률적으로 제시하지 못한다는 한계가 있다. 본 논문에서는 이러한 문제를 해결하기 위해, 블랙박스 LLM 환경에서 입력 변형에 따른 출력 변화 확률을 추정하고 이를 유한 표본 기반으로 인증하는 프레임워크인 ProbCert를 제안한다. ProbCert는 의미적으로 타당한 입력 변형을 반복적으로 생성하고, 각 변형에 대한 출력 변화 여부를 관측하여 변화 확률을 추정하며, 사용자 지정 신뢰수준과 허용 오차를 만족할 때까지 질의를 수행한다. 또한 Wilson score interval, Empirical Bernstein bound, Clopper–Pearson interval 등 다양한 신뢰구간 계산 방식을 통합하여, 동일한 절차 하에서 추정 정확도와 질의 효율을 비교할 수 있도록 한다. 분류 및 생성 작업을 대상으로 한 실험 결과, 제안 기법은 모든 설정에서 사용자 지정 신뢰수준과 허용 오차를 안정적으로 충족하였으며, 특히 Wilson score 기반 변형은 가장 적은 LLM 질의로 인증을 달성하여 실제 상업적 환경에서 효율적인 활용 가능성을 보였다.
Jongwook Kim (Fri,) studied this question.