Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
Eine E-Mail an den Chatbot, ein umfangreiches Dokument zur Auswertung: Für viele Menschen ist künstliche Intelligenz längst ein Werkzeug zum Zeitsparen. Rund ein Drittel der Menschen in Deutschland nutzt KI mindestens einmal pro Woche. Pascal Tippe, Doktorand an der Fernuniversität Hagen, und Masterstudent Michael Maximilian Grötzner setzen genau an der riskanten Stelle an: Ihr Prototyp Privacy Gateway entfernt sensible Daten, bevor eine Anfrage ein KI-Sprachmodell erreicht.
Un e-mail adressé au chatbot, un document volumineux à analyser : pour beaucoup de gens, l’intelligence artificielle est depuis longtemps un outil qui fait gagner du temps. Environ un tiers des personnes en Allemagne utilisent l’IA au moins une fois par semaine. Pascal Tippe, doctorant à l’université à distance de Hagen, et l’étudiant en master Michael Maximilian Grötzner s’attaquent précisément au point sensible : leur prototype Privacy Gateway supprime les données sensibles avant qu’une requête n’atteigne un modèle de langage d’IA.
Der Filter arbeitet als Vermittler zwischen Nutzer und Chatbot. Er sucht nicht nur nach offensichtlichen Namen oder Zahlenfolgen, sondern bewertet den gesamten Zusammenhang einer Anfrage. Dafür übersetzten Tippe und Grötzner die rechtlichen Definitionen der Datenschutz-Grundverordnung aus Artikel 4 und Artikel 9 sowie das deutsche Geschäftsgeheimnis in ein Codebuch aus Anweisungen. Das System soll dadurch nicht nur erkennen, dass eine Information geschützt werden muss, sondern auch begründen können, warum.
Le filtre sert d’intermédiaire entre l’utilisateur et le chatbot. Il ne recherche pas seulement les noms évidents ou les suites de chiffres, mais évalue l’ensemble du contexte d’une requête. Pour cela, Tippe et Grötzner ont traduit les définitions juridiques du Règlement général sur la protection des données, aux articles 4 et 9, ainsi que le secret d’affaires allemand en un référentiel de consignes. Le système doit ainsi pouvoir non seulement reconnaître qu’une information doit être protégée, mais aussi expliquer pourquoi.
Der Bedarf entsteht nicht nur bei den Nutzern selbst. Eingaben können Angaben über Kollegen, Kunden oder Familienmitglieder enthalten, die einer Weitergabe nie zugestimmt haben. Aus vielen einzelnen Informationen können laut Tippe persönliche Profile über Interessen und Gewohnheiten entstehen. Gelangen solche Daten etwa durch einen Hackerangriff in falsche Hände, können sie missbraucht werden; zudem können Eingaben dem weiteren Training von KI-Modellen dienen.
Le besoin ne concerne pas uniquement les utilisateurs eux-mêmes. Les requêtes peuvent contenir des informations sur des collègues, des clients ou des membres de la famille qui n’ont jamais consenti à leur transmission. Selon Tippe, de nombreuses informations individuelles peuvent permettre de créer des profils personnels sur les intérêts et les habitudes. Si de telles données tombent entre de mauvaises mains, par exemple à la suite d’une attaque informatique, elles peuvent être détournées ; les requêtes peuvent en outre servir à l’entraînement ultérieur des modèles d’IA.
Und dann, konkret? Privacy Gateway könnte Menschen und Unternehmen ermöglichen, Chatbots weiter für E-Mails oder Dokumente einzusetzen, ohne jede sensible Angabe manuell suchen und löschen zu müssen. Der Prototyp ist jedoch noch keine risikofreie Lösung: In einer Studie mit einem umfangreichen Datensatz aus Alltagsszenarien zeigte sich, dass sensible Informationen nicht immer entfernt werden können, ohne die Antwort zu verschlechtern.
Et concrètement ? Privacy Gateway pourrait permettre aux particuliers et aux entreprises de continuer à utiliser des chatbots pour leurs e-mails ou leurs documents sans devoir rechercher et supprimer manuellement chaque donnée sensible. Le prototype n’est toutefois pas encore une solution sans risque : une étude menée sur un vaste jeu de données composé de situations du quotidien a montré qu’il n’est pas toujours possible de supprimer les informations sensibles sans dégrader la réponse.
Besonders deutlich wird die Grenze bei umfangreichen medizinischen Diagnosen. Je mehr personenbezogene Informationen ein Prompt enthält, desto mehr kann bei der Anonymisierung verloren gehen, was für die Antwort wichtig wäre, erklärte Tippe. Datenschutz und Nutzbarkeit sind damit nicht vollständig vereinbar. Die Messlatte für den Ansatz liegt deshalb nicht bei maximalem Entfernen, sondern bei einem brauchbaren Schutz, der die Funktion des Chatbots möglichst erhält.
La limite apparaît particulièrement nettement avec les diagnostics médicaux détaillés. Plus un prompt contient d’informations à caractère personnel, plus l’anonymisation risque de supprimer des éléments importants pour la réponse, a expliqué Tippe. La protection des données et l’utilisabilité ne sont donc pas totalement compatibles. Le critère de référence de cette approche ne réside donc pas dans la suppression maximale, mais dans une protection efficace qui préserve autant que possible les fonctionnalités du chatbot.