KI

Studie: Künstliche Intelligenz besteht laut Forschern erstmals den Turing-Test

Während KI immer raffinierter wird, fällt es immer schwerer, Computermodelle von echten Menschen zu unterscheiden. Nun ist offenbar ein Meilenstein erreicht worden.

3 Min
Große KI-Sprachmodelle haben Wissenschaftlern zufolge erstmals den Turing-Test bestanden.

Große KI-Sprachmodelle haben Wissenschaftlern zufolge erstmals den Turing-Test bestanden.

© Matthias Bein/dpa

Zwei KI-Sprachmodelle haben erstmals den sogenannten Turing-Test bestanden. Der Test, benannt nach dem britischen Mathematiker Alan Turing, gilt seit Jahrzehnten als Maßstab für maschinelle Intelligenz. Demnach schafften es die Modelle GPT-4.5 von OpenAI und LLaMa, das hinter Metas AI steht, menschliches Verhalten so überzeugend zu imitieren, dass ein menschlicher Beobachter den Unterschied nicht erkennen kann.

Der 1950 von Turing entwickelte Test oder „Imitation Game“ ist ein Standardverfahren zur Prüfung der Intelligenz einer Maschine. Wenn die Befrager nicht in der Lage sind, verlässlich zwischen einem Menschen und einer Maschine zu unterscheiden, dann hat die Maschine bestanden. Dieser Punkt ist einer aktuellen Studie von Forschenden an der University of California San Diego (UCSD) zufolge nun erreicht.

Für die aktuelle Studie rekrutierten die Wissenschaftler 126 Studierende der University of California San Diego und 158 Personen aus dem Online-Datenpool Prolific. Die Teilnehmer führten dann fünfminütige Online-Gespräche sowohl mit einem anderen menschlichen Teilnehmer und einer der KIs – wussten jedoch nicht, wer welcher war, und mussten anschließend beurteilen, wen sie für den Menschen hielten.

KI-Modelle sollten menschliche Persona annehmen

Wenn die KI aufgefordert wurde, eine menschenähnliche Persona anzunehmen, wurde GPT-4.5 dabei in 73 Prozent der Fälle als Mensch eingestuft – häufiger als der echte menschliche Teilnehmer gewählt wurde. Ein so hoher Prozentsatz deutet darauf hin, dass die Menschen besser als der Zufall beurteilen konnten, ob GPT-4.5 ein Mensch oder eine Maschine ist oder nicht. Derweil wurde LLaMa-3.1 von Meta, das ebenfalls aufgefordert wurde, eine menschenähnliche Persona anzunehmen, in 56 Prozent der Fälle als Mensch eingestuft. Dies war „nicht signifikant häufiger oder seltener als die Menschen, mit denen sie verglichen wurden“, wie das Team betont – gelte aber dennoch als bestanden.

Dabei sei jedoch auffällig, dass die Modelle zunächst aufgefordert werden mussten, eine bestimmte Rolle oder Persona anzunehmen, bevor sie glaubhaft menschlich erschienen. Ohne einen solchen Prompt sei die KI weiter als solche zu erkennen. Dies wirft Fragen über die Art der Intelligenz auf, die solche Modelle tatsächlich besitzen. Zweifelhaft bleibt demnach, ob sie wirklich intelligent sind, oder einfach nur sehr gut darin geworden sind, menschliches Verhalten zu simulieren.

„Haben die LLM (die großen KI-Sprachmodelle, Anm. der Redaktion) wirklich bestanden, wenn sie einen Prompt brauchten?“, schrieb der Hauptautor der Studie, Cameron Jones, dazu in einem Thread auf der Onlineplattform X. „Ohne eine Aufforderung würden LLMs aus trivialen Gründen durchfallen (z. B. wenn sie zugeben, dass sie KI sind) … also denke ich, dass es fair ist zu sagen, dass die LLMs bestehen.“

Dennoch deuten die Ergebnisse der Studie einen größeren, anstehenden Wandel an. Wenn KI-Modelle nun in der Lage sind, Menschen in kurzen Interaktionen zu täuschen, könnten sie künftig noch umfassender als ohnehin schon in zahlreichen Bereichen, wie etwa dem Kundenservice eingesetzt werden, um menschliche Interaktionen zu simulieren. Die sozioökonomischen Folgen dieser Entwicklung sollten weiter erforscht werden, fordern die Forscher.

Send feedback

Ihre Meinung ist uns wichtig. Senden Sie uns Ihr Feedback zu diesem Artikel an: briefe@berliner-zeitung.de

Lesen Sie mehr zum Thema