01
模型卡

Ghost-2 速览。

模型背后的关键数据:是什么、做什么、在哪里跑。

模型家族
Ghost
版本
2.0
类型
人性化(文本到文本)
语言
英语为主 · 支持 100+ 语种
覆盖检测器
10+ 款(GPTZero、Originality.ai、ZeroGPT、Turnitin、Quillbot、Grammarly 等)
平均通过率
98.3%
发布状态
已上线
上一版本
Ghost-1 · 可通过 API 和模型设置使用
02
性能表现

在最关键的战场上接受考验。

每个 Ghost 版本都跑同一套评估:在一个大规模固定的独特英文文本集上测通过率(AI 判定 <30%),由六款检测器独立打分。

98.3%
全检测器平均通过率
检测器Ghost-1
发布时 (%)
Ghost-1
现在 (%)
Ghost-2 (%)Δ
GPTZero
ML 分类器
92.5
86.2
96.3
+10.1
ZeroGPT
困惑度
94.3
94.3
96.9
+2.6
Originality.ai
ML 分类器
95.4
90.8
98.4
+7.6
Turnitin*
学术
97.0
95.8
98.8
+3.0
Quillbot
ML 分类器
98.1
91.5
99.7
+8.2
Grammarly
ML 分类器
99.8
99.8
99.9
+0.1

评估样本为去重后的纯英文文本,每段由六款独立 AI 检测器分别打分。"通过"即检测器返回 AI 概率 <30%。*Turnitin 因访问受限,评估样本较小。Ghost-1 发布时的数据来自其最初的评估;此后多款检测器已更新,导致 Ghost-1 现在的通过率下降。Δ 为同一测试集上 Ghost-2 与现在的 Ghost-1 的对比。

输出质量

绕过检测只是评估的一半。每个版本还要看文字本身的质量,Ghost-2 在三个方面都有提升。

87.6综合质量得分高于 Ghost-1 的 73.2
指标Ghost-1 (%)Ghost-2 (%)Δ
意思保留
87.8
88.2
+0.4
可读性
76.1
87.3
+11.2
一致性
82.2
91.5
+9.3

质量由通用大模型在同一评估集上打分:每次改写都会就意思保留、流畅度和多次运行的稳定性进行评判。

AI Humanizer Benchmark
#1

11 款工具中 · 2026 年 9 月

UndetectedGPT rank badge, AI Humanizer Benchmark
使用的检测器7

GPTZero · Originality.ai · Winston AI · ZeroGPT · Grammarly · QuillBot · Copyleaks

质量指标3

意思保留 · 可读性 · 一致性

独立基准测试

在 2026 年 9 月的 AI Humanizer Benchmark 中,11 款人性化工具里排名 第一 。使用 7 款检测器,按固定公开方法评分。

查看排行榜

为什么上方的通过率比基准测试的分数高?

因为测试集不同。基准测试用刻意难以人性化的输入给所有工具打分,所以每家的分数都偏低。上方的通过率基于日常典型文本测得。

03
更新日志

Ghost-1Ghost-2

检测器一直在变,停在原地的模型会慢慢过时。每一代 Ghost 发布都会重跑同一套基准测试,当前版本上线的同时,下一个模型已经在路上。

  1. 下一代训练中

    下一个 Ghost

    训练从不停歇。面向最新的检测器版本,下一代已经在打造中。

  2. v2.0当前

    Ghost-2

    第二代模型,针对最新版检测器从头再训练。六款检测器上的平均通过率 98.3%,高于 Ghost-1 的 96.2%。写作质量同步提升:意思偏移更少,各类文体下的输出更稳定。

  3. v1.0上一代

    Ghost-1

    首个稳定版。六款检测器上的平均通过率 96.2%。仍可通过 API 和模型设置使用。

  4. v0.9上一周期

    语气稳态

    降低长篇学术和技术文本中的语义漂移。

  5. v0.8更早

    攻克 Turnitin

    把 Turnitin 加进评估集,通过率从 91% 拉到 97%。

  6. v0.7更早

    引用锁定

    参考文献、脚注和行内引用一律不动。

04
方法论

我们怎么评估。

每次发版都跑同一套评估。不针对单个检测器调参,不挑样本。

  1. 01

    取样

    大规模采样 AI 生成的英文文本,涵盖论文、技术文档、博客文章和对话式文本。

  2. 02

    人性化

    每段文本交给 Ghost-2,按默认设置改写,不针对单个检测器调参,也不重试。

  3. 03

    检测

    输出由六款检测器分别打分。改写过程中我们看不到任何分数。

  4. 04

    质量评分

    输出还会交给通用 LLM 打分,检查改写是否保住了原意、结构和流畅度。

  5. 05

    通过 / 不通过

    检测器返回 AI 概率 <30%,这段文本就算通过。平均通过率按检测器平均,不按文本平均。

05
能力

到了第二代,依然只做一件事:把话说得像人。

Ghost-2 是我们自研人性化模型 Ghost 的第二代。和每一代 Ghost 模型一样,它把 AI 生成文本改写得像真人写的,绕过各大 AI 检测器,同时完整保留原文的语义、语气和流畅度。

它现在是 UndetectedGPT 全线人性化能力的默认模型:网页端、API、Ghost Writer 全部接入。想沿用现有配置的用户,Ghost-1 依然可用。

01

为打败检测器而生

Ghost-2 不是普通的改写器。它从一开始就是为绕过 GPTZero、Originality.ai、ZeroGPT、Turnitin、Quillbot、Grammarly 等检测器而训练的。

02

语义、语气一字不差

Ghost-2 改的是怎么说,不改你说了什么。原意、结构、参考文献和引用全部保留。

03

持续进化

检测器在升级,Ghost-2 也在升级。我们不断评估、迭代模型,始终领先一步。

06
上线情况

我们上线到哪儿,它就跟到哪儿。

Ghost-2 已是每一位 UndetectedGPT 用户在所有入口的默认模型。Ghost-1 仍可通过 API 和人性化工具的模型设置使用。

07
常见问题

常见问题

Ghost-2 是 UndetectedGPT 自研人性化模型的第二代。它能改写 AI 生成文本,绕过 GPTZero、Originality.ai、ZeroGPT、Turnitin、Quillbot、Grammarly 等 AI 检测器,同时完整保留你的原意、参考文献和引用。

可以。Ghost-2 现在是所有入口的默认模型,但 Ghost-1 依然可用:API 用户可以用 model 参数锁定它,订阅用户可以在人性化工具设置里切换模型。旧版本会一直在线,新版本发布不会打断你的工作流。

Ghost-2 在市面上最严苛的 AI 检测器上跑基准测试:GPTZero、Originality.ai、ZeroGPT、Turnitin、Quillbot、Grammarly。它跑的正是 Ghost-1 通过的同一套评估,平均通过率 98.3%,高于此前的 96.2%。其他检测器一般也差不多,甚至更好绕。

不会。Ghost-2 改的是怎么说,不改你说了什么。原意、结构、参考文献和引用都会原样保留。

因为测试集不同。基准测试用刻意难以人性化的输入给所有工具打分,所以每家的分数都偏低。本页的通过率基于日常典型文本测得。