Zum Hauptinhalt springen
Allgemein

KI-Detektoren: Der wahre Skandal ist nicht der, den man denkt

Ein Detektor erklärte eine preisgekrönte Kurzgeschichte für „zu 100 % KI-generiert“. Nur täuschen sich diese Werkzeuge in der Hälfte der Fälle. Der wahre Skandal ist nicht der, den man denkt.

vor 4 Monaten9 Min. Lesezeit

Am 12. Mai 2026 veröffentlicht die britische Literaturzeitschrift Granta — eine 1889 gegründete Institution, die die ersten Texte der Hälfte der lebenden großen englischsprachigen Namen abdruckte — die fünf regionalen Finalisten des Commonwealth Short Story Prize, des Preises für Kurzgeschichten, den die Commonwealth Foundation jedes Jahr für unveröffentlichte Fiktion aus den sechsundfünfzig Ländern des Commonwealth vergibt. Innerhalb weniger Tage löst eine dieser Geschichten einen Sturm aus.

„The Serpent in the Grove“ des Trinidaders Jamir Nazir, Gewinner für die Region Karibik, erzählt die Geschichte eines rumtrinkenden Amateurbauern, der auf einen verzauberten Hain stößt. Mehrere Leserinnen und Leser finden den Text zu glatt, zu sauber. Ethan Mollick, Professor an der Wharton School und einer der meistbeachteten KI-Kommentatoren weltweit, lässt die Geschichte durch Pangram laufen, ein amerikanisches Tool, das vorgibt, maschinell geschriebenen Text zu erkennen. Das Urteil fällt: „100 % KI-generiert“.

Hundert Prozent. Die Zahl ist klar, eckig, unwiderruflich. Sie sieht wie ein Beweis aus.

Sie ist keiner. Und hier beginnt die eigentliche Geschichte — die, über die niemand sprechen will, weil sie beide Lager gleichzeitig stört.

Was ein Detektor misst, und was nicht

Beginnen wir mit dem einzigen Punkt, auf den sich alle einigen sollten, weil er technisch und überprüfbar ist. Ein KI-Detektor liest nicht. Er rät. Er versteht weder die Geschichte, noch den Stil, noch die Absicht. Er misst eine Sache: die „Perplexität“ des Textes, also wie vorhersehbar die Wortfolge ist. Je erwartbarer, je statistisch banaler ein Satz ist, desto eher hält die Maschine ihn für ein Maschinenprodukt.

Der Fehler springt ins Auge, sobald man zwei Sekunden darüber nachdenkt. Eine Autorin, die in einem in der Schule gelernten Englisch schreibt, ohne die Ticks und Unregelmäßigkeiten einer Muttersprachlerin, erzeugt mechanisch einen vorhersehbareren Text. Eine karibische Kurzgeschichte, geschrieben im sorgfältigen, etwas schulmäßigen Englisch von jemandem, für den es nicht ganz die Muttersprache ist, erfüllt genau die Kriterien, die der Detektor mit der Maschine assoziiert.

Das ist keine Vermutung. Es ist eine Studie. Im Jahr 2023 hat ein Team der Stanford University TOEFL-Aufsätze — den Englischtest für nicht englischsprachige Studierende — durch sieben gängige KI-Detektoren laufen lassen. Ergebnis: 61,22 % Falschpositive. Mehr als ein menschlicher Aufsatz von zwei, geschrieben von einer ganz realen Studentin, wurde als „KI-generiert“ eingestuft. Alle Detektoren, einstimmig, haben einige dieser Studierenden zu Unrecht beschuldigt. Die Maschine erkennt nicht die KI. Sie erkennt diejenigen, die eine saubere, brave, zweite Sprache schreiben.

Pangram, das Tool, das bei „The Serpent in the Grove“ verwendet wurde, ist jünger als diese Studie und kommt darin nicht vor — man muss fairerweise sagen, dass seine Entwickler deutlich niedrigere Falschpositiv-Raten für sich beanspruchen. Aber das Prinzip bleibt dasselbe. Ein Detektor liefert eine Wahrscheinlichkeit. Sie als 100-Prozent-Urteil zu präsentieren, heißt, eine Statistik als Urteilsspruch zu verkleiden. Und zwischen einer Wahrscheinlichkeit und einem Beweis liegt die ganze Distanz, die einen Verdacht von einer Verurteilung trennt.

Grantas Verteidigung, oder der Algorithmus, der sich selbst anklagt

Was folgt, ist fast komisch, wenn man vergisst, dass am Ende ein menschlicher Autor steht. Zur Erklärung aufgefordert, erklärte Sigrid Rausing, die Herausgeberin von Granta, ihr Team habe die Geschichte Claude, dem Chatbot von Anthropic, vorgelegt und gefragt, ob der Text von einer KI geschrieben worden sei. Claudes Antwort: Der Text sei „fast sicher nicht ohne menschliche Hilfe entstanden“.

Lesen Sie den Satz noch einmal. Um herauszufinden, ob eine Kurzgeschichte von einer KI geschrieben wurde, hat eine große Literaturzeitschrift eine KI um ihre Meinung gebeten. Man hat die Anklage einem Algorithmus anvertraut, die Verteidigung einem anderen. Irgendwo in dieser Angelegenheit haben die Menschen den Raum verlassen — und niemand scheint es im Moment bemerkt zu haben.

Die Commonwealth Foundation ihrerseits kam schließlich zur einzig vertretbaren Position: Alle Finalisten hätten auf ihre Ehre erklärt, dass ihr Text von ihnen selbst und ohne Hilfe geschrieben worden sei, und in Ermangelung eines zuverlässigen Instruments zur Klärung „müsse man nach dem Prinzip des Vertrauens arbeiten“. Übersetzt: Wir wissen es nicht. Niemand weiß es. Und genau das ist der Kern des Problems.

Es gibt drei Fälle, nicht zwei

Hier verhakt sich die Debatte. Auf der einen Seite das Anti-KI-Lager: „Detektoren haben Betrüger entlarvt, Maschinentexte haben Preise gewonnen, verbieten wir sie.“ Auf der anderen das Pro-KI-Lager: „Detektoren sind Pseudowissenschaft, und überhaupt, was macht das schon.“ Beide Lager streiten über dieselbe Frage — „hat KI diesen Text geschrieben, ja oder nein?“ — als hätte diese Frage eine Antwort, und als wäre es die richtige.

Doch es gibt nicht zwei Fälle. Es gibt drei.

Der erste: eine Autorin, die KI als Werkzeug nutzt. Sie fragt nach einem Synonym, lässt einen Absatz gegenlesen, testet eine Formulierung, verwirft neun Zehntel davon. Genau das machen Entwicklerinnen und Entwickler seit zwei Jahren. Niemand behauptet, sie hätten aufgehört, Entwickler zu sein. Sie stehen mit dem Werkzeug im Dialog, lehnen den Großteil dessen ab, was es vorschlägt, entscheiden über jede Zeile. Die KI formuliert um, sortiert, schlägt vor — und manchmal, durch Zufall, löst sie eine Formulierung. Aber der Entwickler entscheidet, was in den Code kommt. Warum sollte eine Schriftstellerin anders sein? Wir sind auch die Bauleiter unserer eigenen Arbeit.

Der zweite Fall ist die wahre rote Linie, und er trägt inzwischen einen Namen, der aus der Tech-Welt geborgt ist: Vibe Writing. Das literarische Gegenstück zum „Vibe Coding“, jenem Entwickler, der der Maschine Anweisungen gibt, akzeptiert, was herauskommt, ohne es wirklich zu lesen, und veröffentlicht. Niemand nimmt das auf der Software-Seite ernst. Warum sollte es beim Roman anders sein? Der Vibe Writer generiert zweihundertachtzig Seiten aus einer Anweisung und unterschreibt den Umschlag. Da gibt es tatsächlich ein Problem — inhaltlich, in Sachen Ehrlichkeit, Urheberschaft.

Der dritte Fall ist der neueste, und der, den man nicht sehen will: der von einem Detektor beschuldigte Autor. Weder unterstützt noch Betrüger. Nur ein Mensch, dessen Prosa, zu sauber oder zu sehr Zweitsprache, einen statistischen Alarm ausgelöst hat. Ihn verurteilt man aufgrund einer Zahl.

Der wahre Skandal ist nicht der, den man denkt

Und hier werde ich es mir mit allen verscherzen.

Dem Anti-KI-Lager sage ich: Eine Detektorzahl ist kein Beweis. Sie bauen die Graphologie und den Lügendetektor wieder auf, jene Pseudowissenschaften, die man ein Jahrhundert lang aus den Gerichtssälen vertreiben musste, und nennen sie „Sorgfalt“, weil am Ende eine Prozentzahl steht. Man verurteilt keine Autorin wegen ihrer Textperplexität. Schon gar nicht, wenn diese Perplexität vor allem diejenigen belastet, die in einer erlernten Sprache schreiben — also, sehr oft, die Autorinnen und Autoren aus den ehemaligen Kolonien, die dieser Preis eigentlich sichtbar machen soll.

Dem Pro-KI-Lager sage ich: „Was macht das schon“ ist ein Achselzucken, das die Literatur den Vibe Writern ausliefert. Ein Preis, der unveröffentlichte, menschliche Fiktion auszeichnet, bedeutet etwas. Das Misstrauen der Autorinnen und Autoren ist keine Panik alter Reaktionäre: Es ist legitim, selbst wenn das Werkzeug, das es befriedigen soll, versagt. Man kann beide Enden festhalten: Der Detektor ist schlecht, und die Frage, die er aufwirft, ist real.

Der Skandal ist also nicht, dass eine KI vielleicht einen Preis gewonnen hat. Der Skandal ist, dass man jetzt einen Menschen aufgrund einer Zahl verurteilt, die niemand anfechten kann. Die Beweislast hat sich umgekehrt, ohne dass darüber abgestimmt wurde: Es ist nicht mehr Sache des Anklägers, den Betrug zu beweisen, sondern Sache der Autorin, ihre Unschuld zu beweisen. „Beweisen Sie, dass Sie keine KI benutzt haben“ — versuchen Sie es einmal. Es ist strikt unmöglich. Man beweist keine Abwesenheit.

Und der Detektor in all dem? Er kann den ersten Fall nicht vom zweiten unterscheiden. Er macht keinen Unterschied zwischen der Autorin, die um ein Synonym gebeten hat, und derjenigen, die ihr ganzes Buch generiert hat. Das Werkzeug, das die Linie überwachen soll, ist blind für die Linie, die es zu überwachen vorgibt. Es sieht weder Absicht, noch Arbeit, noch Hand — es sieht Vorhersehbarkeit, und es schießt.

Was übrig bliebe, wenn man die Detektoren wegräumte

Wenn die Erkennung nicht funktioniert — und sie funktioniert nicht —, bleibt eine einzige tragfähige Sache: die Herkunft. Nicht „sieht dieser Text menschlich aus?“, eine Frage, die niemals eine Maschine ehrlich beantworten wird, sondern „kann man zeigen, wie dieser Text geschrieben wurde?“. Der Verlauf, die Versionen, die Streichungen, der Entwurf, der zur Seite wird. Das ist weniger spektakulär als ein roter Prozentwert, aber überprüfbar.

Deshalb ist der Modus ohne KI, der bei mehreren Online-Schreibanwendungen — WriteControl, Extypis, Scribbook — inzwischen zur Option geworden ist, kein bloßes Kommunikationsargument. Für eine Studentin unter Integritätskontrolle, für eine Autorin, die eine vollständig menschliche Herkunft nachweisen möchte, ist es die einzige tragfähige Antwort auf einen Detektor, der sich in der Hälfte der Fälle irrt: nicht sich im Nachhinein verteidigen, sondern den Weg zeigen können. Die Tür, die das Werkzeug offen hält, ist nicht dasselbe wie die Schwelle, die die Autorin überschreitet.

Jamir Nazir seinerseits hat geschworen, keine KI benutzt zu haben. Vielleicht sagt er die Wahrheit. Vielleicht nicht. Das Unangenehme ist, dass wir es nie erfahren werden — und dass eine angesehene literarische Stiftung es vorgezogen hat, einen Roboter zu fragen, statt es zuzugeben. Solange man eine Wahrscheinlichkeit für einen Beweis hält, wird man weiterhin ein paar Unschuldige verbrennen, um sicherzugehen, einen Schuldigen zu erwischen. Das ist eine alte Methode. Sie ist nie gut gealtert.


Quellen: Granta („The Serpent in the Grove“, Mai 2026); Literary Hub; Futurism; Boing Boing; Scroll.in; Slashdot; Caribbean360; Liang et al., „GPT detectors are biased against non-native English writers“, Patterns (Cell), 2023; Stanford HAI; Commonwealth Foundation.

HU

Hubert Giorgi

Autor

Schreiben mit Extypis

Das Schreibstudio, das Romanautoren gefehlt hat

Aufriss, Figuren, Orte und Objekte, die Verknüpfungen zwischen ihnen, Mindmap, Szenentafel, Export: alles an einem Ort. Dazu eine KI, die Ihre Geschichte kennt, wann immer Sie es möchten.

Extypis entdecken

Kostenlos zum Schreiben und Exportieren. Keine Kreditkarte erforderlich.