01
Model Card

Ghost-2 auf einen Blick.

Die Zahlen hinter dem Modell. Was es ist, was es kann, wo es läuft.

Modellfamilie
Ghost
Version
2.0
Typ
Humanizer (Text-zu-Text)
Sprachen
EN primär · 100+ unterstützt
Abgedeckte Detektoren
10+ (GPTZero, Originality.ai, ZeroGPT, Turnitin, Quillbot, Grammarly und weitere)
Bestehensrate Ø
98.3%
Released
Live
Vorherige Version
Ghost-1 · verfügbar über API und Modell-Einstellungen
02
Leistung

Getestet, wo es drauf ankommt.

Jedes Ghost-Release durchläuft denselben Eval: Bestehensrate (<30% KI-Wertung) auf einem großen, festen Set einzigartiger englischer Texte, unabhängig von sechs Detektoren bewertet.

98.3%
durchschnittliche Bestehensrate über alle Detektoren
DetektorGhost-1
bei Launch (%)
Ghost-1
heute (%)
Ghost-2 (%)Δ
GPTZero
ML-Classifier
92.5
86.2
96.3
+10.1
ZeroGPT
Perplexity
94.3
94.3
96.9
+2.6
Originality.ai
ML-Classifier
95.4
90.8
98.4
+7.6
Turnitin*
Akademisch
97.0
95.8
98.8
+3.0
Quillbot
ML-Classifier
98.1
91.5
99.7
+8.2
Grammarly
ML-Classifier
99.8
99.8
99.9
+0.1

Getestet auf entdoppelten englischen Texten, jeder einzeln von sechs unabhängigen Detektoren bewertet. "Bestanden" heißt: Detektor gibt unter 30% KI-Wahrscheinlichkeit zurück. *Turnitin wurde wegen seines gesperrten Zugangs auf einer kleineren Stichprobe evaluiert. Die Launch-Werte von Ghost-1 stammen aus dem ursprünglichen Eval-Lauf; mehrere Detektoren wurden seitdem aktualisiert, was die heutigen Werte von Ghost-1 gesenkt hat. Δ vergleicht Ghost-2 mit Ghost-1 heute, auf demselben Testset.

Output-Qualität

Stealth ist nur die halbe Bewertung. Jedes Release wird auch daran gemessen, wie gut der Text selbst ist, und Ghost-2 hat sich an allen drei Fronten verbessert.

87.6Gesamt-Qualitätsscoregegenüber 73,2 bei Ghost-1
MetrikGhost-1 (%)Ghost-2 (%)Δ
Bedeutungstreue
87.8
88.2
+0.4
Lesbarkeit
76.1
87.3
+11.2
Konsistenz
82.2
91.5
+9.3

Die Qualität wird von General-Purpose-LLMs auf demselben Eval-Set bewertet: Jedes Umschreiben wird auf erhaltene Bedeutung, Flüssigkeit und Stabilität über Durchläufe hinweg geprüft.

AI Humanizer Benchmark
#1

von 11 Humanizern · September 2026

UndetectedGPT rank badge, AI Humanizer Benchmark
Getestete Detektoren7

GPTZero · Originality.ai · Winston AI · ZeroGPT · Grammarly · QuillBot · Copyleaks

Qualitätsmetriken3

Bedeutung · Lesbarkeit · Konsistenz

Unabhängiger Benchmark

Platz 1 von 11 Humanizern im AI Humanizer Benchmark (September 2026), getestet über 7 Detektoren mit fester, öffentlicher Methodik.

Zum Leaderboard

Warum liegen die Bestehensraten oben über den Benchmark-Werten?

Die Testsets sind unterschiedlich. Der Benchmark bewertet jedes Tool auf absichtlich schwer zu humanisierenden Eingaben, dort fallen die Werte für alle niedriger aus. Die Bestehensraten oben werden auf typischen Alltagstexten gemessen.

03
Changelog

Von Ghost-1 zu Ghost-2.

Detektoren ändern sich ständig, ein eingefrorenes Modell veraltet also langsam. Jedes Ghost-Release fährt denselben Benchmark erneut, und das nächste Modell ist schon in Arbeit, während das aktuelle live geht.

  1. nächsteIm Training

    Der nächste Ghost

    Das Training hört nie auf. Die nächste Generation ist schon in Arbeit, trainiert gegen die neuesten Detektor-Releases.

  2. v2.0Jetzt

    Ghost-2

    Modell der zweiten Generation, von Grund auf neu trainiert gegen die neuesten Detektor-Versionen. Bestehensrate Ø 98,3% über sechs Detektoren, gegenüber 96,2% bei Ghost-1. Auch die Schreibqualität hat zugelegt: weniger Bedeutungsdrift und stabilere Ergebnisse über alle Schreibstile hinweg.

  3. v1.0Vorherige Generation

    Ghost-1

    Erstes stabiles Release. Bestehensrate Ø 96,2% über sechs Detektoren. Weiterhin verfügbar über die API und die Modell-Einstellungen.

  4. v0.9Letzter Zyklus

    Tonfall halten

    Weniger Sinn-Drift bei langen akademischen und technischen Texten.

  5. v0.8Davor

    Turnitin-Push

    Turnitin ins Eval-Set aufgenommen, Bestehensrate von 91% auf 97% gehoben.

  6. v0.7Davor

    Zitat-Sperre

    Quellen, Fußnoten und Inline-Zitate werden nicht mehr umgeschrieben.

04
Methodik

So testen wir.

Bei jedem Release fährt derselbe Test. Kein Tuning für einzelne Detektoren, keine handverlesenen Beispiele.

  1. 01

    Quelle

    Eine große Stichprobe KI-generierter englischer Texte, von Essays über technische Doku und Blogposts bis zu Konversationsprosa.

  2. 02

    Humanisieren

    Jeder Text läuft mit Standardeinstellungen durch Ghost-2: kein Detektor-Tuning, keine Retries.

  3. 03

    Detektion

    Die Outputs werden einzeln von sechs Detektoren bewertet. Wir sehen die Scores während der Humanisierung nie.

  4. 04

    Qualität prüfen

    Die Outputs werden zusätzlich von allgemeinen LLMs bewertet, um zu checken, ob Sinn, Struktur und Lesefluss erhalten bleiben.

  5. 05

    Bestanden oder nicht

    Ein Text besteht bei einem Detektor, wenn dieser unter 30% KI-Wahrscheinlichkeit zurückgibt. Die durchschnittliche Bestehensrate mitteln wir über Detektoren, nicht über Texte.

05
Was es kann

Zwei Generationen später, immer noch genau ein Job:menschlich klingen.

Ghost-2 ist die zweite Generation von Ghost, unserem eigenen KI-Modell. Wie jedes Ghost-Modell schreibt es KI-Texte so um, dass sie wie von Hand geschrieben klingen. Es umgeht jeden großen KI-Detektor und behält dabei Sinn, Tonfall und Lesefluss bei.

Ghost-2 steckt jetzt standardmäßig hinter jeder Humanisierung auf UndetectedGPT: in der Web-App, in der API und im Ghost Writer. Ghost-1 bleibt verfügbar für alle, die bei ihrem bestehenden Setup bleiben wollen.

01

Gebaut, um Detektoren zu schlagen

Ghost-2 ist kein Allzweck-Paraphraser. Wir haben das Modell gezielt darauf trainiert, GPTZero, Originality.ai, ZeroGPT, Turnitin, Quillbot, Grammarly und Co. auszutricksen.

02

Sinn und Tonfall bleiben

Ghost-2 ändert nur, wie etwas gesagt wird, nicht was. Sinn, Struktur, Quellen und Zitate aus deinem Originaltext bleiben unangetastet.

03

Wird ständig besser

Detektoren entwickeln sich weiter und Ghost-2 macht das mit. Wir testen und tunen das Modell laufend, um vorne zu bleiben.

06
Verfügbarkeit

Überall live, wo wir sind.

Ghost-2 ist der Standard für jeden UndetectedGPT-Nutzer, überall. Ghost-1 bleibt verfügbar über die API und die Modell-Einstellungen im Humanizer.

07
FAQ

Häufige Fragen

Ghost-2 ist die zweite Generation des eigenen KI-Modells von UndetectedGPT. Es schreibt KI-Texte so um, dass sie an Detektoren wie GPTZero, Originality.ai, ZeroGPT, Turnitin, Quillbot und Grammarly vorbeikommen. Sinn, Quellen und Zitate aus deinem Originaltext bleiben dabei erhalten.

Ja. Ghost-2 ist jetzt überall der Standard, aber Ghost-1 bleibt verfügbar: API-Nutzer können es über den Modell-Parameter festlegen, Abonnenten wechseln das Modell in den Humanizer-Einstellungen. Ältere Generationen bleiben online, damit ein neues Release nie deinen Workflow kaputtmacht.

Ghost-2 wird gegen die härtesten KI-Detektoren am Markt getestet: GPTZero, Originality.ai, ZeroGPT, Turnitin, Quillbot und Grammarly. Es fährt exakt denselben Test wie Ghost-1 und besteht ihn mit einer durchschnittlichen Bestehensrate von 98,3%, gegenüber 96,2% zuvor. Andere Detektoren sind meist ähnlich streng oder einfacher zu umgehen.

Nein. Ghost-2 ändert nur, wie etwas gesagt wird, nicht was. Sinn, Struktur, Quellen und Zitate aus deinem Originaltext bleiben.

Die Testsets sind unterschiedlich. Der Benchmark bewertet jedes Tool auf absichtlich schwer zu humanisierenden Eingaben, dort fallen die Werte für alle niedriger aus. Die Bestehensraten auf dieser Seite werden auf typischen Alltagstexten gemessen.