Cet article présente le Protocole de Contexte Souverain (SCP), un protocole open-source pour un accès aux données conscient de l'attribution dans les systèmes de modèles de langage de grande taille (LLM). Les approches actuelles de l'attribution des données fonctionnent soit au niveau des internals du modèle, soit à travers des cadres juridiques et politiques, mais manquent d'un mécanisme d'exécution pour suivre comment le contenu généré par les humains est acces et utilisé. SCP définit une interface standardisée entre les LLMs et les données détenues par les créateurs, permettant l'enregistrement, la licence et l'attribution de chaque événement d'accès. Le protocole spécifie six méthodes fondamentales, prend en charge des interfaces compatibles avec REST et MCP, et inclut des mécanismes pour l'évaluation de la confiance, la vérification de l'authenticité et l'audit d'accès. Nous présentons une architecture de référence, un modèle de menace et des benchmarks de performance préliminaires, et positionnons SCP dans le cadre des nouveaux régulations comme le Règlement sur l'IA de l'UE. Ce travail plaide pour une approche de niveau protocole pour l'attribution, faisant de la provenance et de la responsabilité une propriété par défaut de l'accès aux données dans les pipelines LLM.
Panchigar et al. (Fri,) ont étudié cette question.