Google DeepMind führt erstmals eine doppelt-blinde Evaluierung eines proprietären, fortschrittlichen KI-Modells durch. In einem Pilotprojekt mit dem Singapore AI Safety Institute und weiteren Partnern wird ein Modell der Gemini Flash Lite-Reihe unter kryptografischem Schutz bewertet. Ziel ist es, die Vertrauenswürdigkeit von KI-Benchmarks zu erhöhen und einen neuen Standard für manipulationssichere Modelltests zu etablieren.
Herausforderung: Kontamination von KI-Benchmarks
Ein zentrales Problem bei der Bewertung von Künstlicher Intelligenz ist die sogenannte Benchmark-Kontamination. Dieses Phänomen tritt auf, wenn ein KI-Modell während seines Trainings bereits Zugriff auf die Fragen oder Daten des späteren Leistungstests hatte. Die Ergebnisse solcher Tests sind dann nur bedingt aussagekräftig, da das Modell nicht seine tatsächlichen Fähigkeiten unter Beweis stellt, sondern lediglich Gelerntes wiedergibt, das es zuvor gesehen hat.
Bisherige externe Evaluierungen erforderten oft einen Kompromiss: Entweder gaben die Evaluatoren ihre Testfragen preis, wodurch der Modellentwickler im Voraus Einblick in die Aufgaben erhielt. Oder der Entwickler übermittelte die internen Modellgewichte – die Kernkomponenten des KI-Modells – und riskierte damit den Verlust seines geistigen Eigentums. Ein Beispiel für dieses Dilemma war die verzögerte Evaluierung von Anthropic’s Fable 5 für den ARC-AGI-Benchmark, da das Unternehmen eine 30-tägige Datenaufbewahrungsrichtlinie für seine stärksten Modelle durchsetzt.
Technologie für doppelt-blinde Tests
Um diese Zielkonflikte zu beseitigen, setzt Google DeepMind auf eine doppelt-blinde Evaluierung, die durch Confidential Space aus dem Portfolio für vertrauliches Computing der Google Cloud ermöglicht wird. Dieses Setup nutzt kryptografische Verfahren, um sicherzustellen, dass sowohl die externen Testdaten als auch die Modellgewichte privat bleiben und nur ihren jeweiligen Eigentümern zugänglich sind. Das bedeutet, dass die Evaluatoren zu keinem Zeitpunkt die internen Daten des Gemini-Modells einsehen können und Google DeepMind umgekehrt keinen Zugriff auf die vertraulichen Testfragen erhält.
Während früher oft auf Zero-Logging-Protokolle und vertragliche Vereinbarungen gesetzt wurde, um die Vertraulichkeit externer Prompts zu gewährleisten, stellt der Einsatz technischer und kryptografischer Schutzmechanismen einen wesentlichen Fortschritt für die sichere Modellevaluierung dar.
Vorteile und zukünftige Standards
Die kryptografische Absicherung soll nicht nur die Kontamination verhindern, sondern auch sensible Daten schützen. Dies ist besonders wichtig für hochsensible Evaluierungen, beispielsweise im Bereich der Cybersicherheit oder bei Tests durch Regierungsbehörden. Unabhängige Organisationen können somit fortschrittliche KI-Modelle umfassend testen, ohne ihre Datenhoheit oder Sicherheit zu gefährden.
Google DeepMind erhofft sich, dass diese Bemühungen einen neuen Standard für die Modellaufsicht setzen und die Entwicklung zuverlässigerer und weithin vertrauenswürdiger KI-Systeme in der gesamten Branche fördern. Details zur Methodik und den Ergebnissen werden in einem technischen Bericht dargelegt.
Thema: Google DeepMind. Quelle/Inspiration: The Decoder.