在最关键的战场上接受考验。
每个 Ghost 版本都跑同一套评估:在一个大规模固定的独特英文文本集上测通过率(AI 判定 <30%),由六款检测器独立打分。
发布时 (%)Ghost-1
现在 (%)Ghost-2 (%)Δ
评估样本为去重后的纯英文文本,每段由六款独立 AI 检测器分别打分。"通过"即检测器返回 AI 概率 <30%。*Turnitin 因访问受限,评估样本较小。Ghost-1 发布时的数据来自其最初的评估;此后多款检测器已更新,导致 Ghost-1 现在的通过率下降。Δ 为同一测试集上 Ghost-2 与现在的 Ghost-1 的对比。
输出质量
绕过检测只是评估的一半。每个版本还要看文字本身的质量,Ghost-2 在三个方面都有提升。
质量由通用大模型在同一评估集上打分:每次改写都会就意思保留、流畅度和多次运行的稳定性进行评判。
GPTZero · Originality.ai · Winston AI · ZeroGPT · Grammarly · QuillBot · Copyleaks
意思保留 · 可读性 · 一致性
为什么上方的通过率比基准测试的分数高?
因为测试集不同。基准测试用刻意难以人性化的输入给所有工具打分,所以每家的分数都偏低。上方的通过率基于日常典型文本测得。
从 Ghost-1 到 Ghost-2。
检测器一直在变,停在原地的模型会慢慢过时。每一代 Ghost 发布都会重跑同一套基准测试,当前版本上线的同时,下一个模型已经在路上。
- 下一代训练中
下一个 Ghost
训练从不停歇。面向最新的检测器版本,下一代已经在打造中。
- v2.0当前
Ghost-2
第二代模型,针对最新版检测器从头再训练。六款检测器上的平均通过率 98.3%,高于 Ghost-1 的 96.2%。写作质量同步提升:意思偏移更少,各类文体下的输出更稳定。
- v1.0上一代
Ghost-1
首个稳定版。六款检测器上的平均通过率 96.2%。仍可通过 API 和模型设置使用。
- v0.9上一周期
语气稳态
降低长篇学术和技术文本中的语义漂移。
- v0.8更早
攻克 Turnitin
把 Turnitin 加进评估集,通过率从 91% 拉到 97%。
- v0.7更早
引用锁定
参考文献、脚注和行内引用一律不动。
我们怎么评估。
每次发版都跑同一套评估。不针对单个检测器调参,不挑样本。
- 01
取样
大规模采样 AI 生成的英文文本,涵盖论文、技术文档、博客文章和对话式文本。
- 02
人性化
每段文本交给 Ghost-2,按默认设置改写,不针对单个检测器调参,也不重试。
- 03
检测
输出由六款检测器分别打分。改写过程中我们看不到任何分数。
- 04
质量评分
输出还会交给通用 LLM 打分,检查改写是否保住了原意、结构和流畅度。
- 05
通过 / 不通过
检测器返回 AI 概率 <30%,这段文本就算通过。平均通过率按检测器平均,不按文本平均。
到了第二代,依然只做一件事:把话说得像人。
Ghost-2 是我们自研人性化模型 Ghost 的第二代。和每一代 Ghost 模型一样,它把 AI 生成文本改写得像真人写的,绕过各大 AI 检测器,同时完整保留原文的语义、语气和流畅度。
它现在是 UndetectedGPT 全线人性化能力的默认模型:网页端、API、Ghost Writer 全部接入。想沿用现有配置的用户,Ghost-1 依然可用。
为打败检测器而生
Ghost-2 不是普通的改写器。它从一开始就是为绕过 GPTZero、Originality.ai、ZeroGPT、Turnitin、Quillbot、Grammarly 等检测器而训练的。
语义、语气一字不差
Ghost-2 改的是怎么说,不改你说了什么。原意、结构、参考文献和引用全部保留。
持续进化
检测器在升级,Ghost-2 也在升级。我们不断评估、迭代模型,始终领先一步。
常见问题
Ghost-2 是 UndetectedGPT 自研人性化模型的第二代。它能改写 AI 生成文本,绕过 GPTZero、Originality.ai、ZeroGPT、Turnitin、Quillbot、Grammarly 等 AI 检测器,同时完整保留你的原意、参考文献和引用。
可以。Ghost-2 现在是所有入口的默认模型,但 Ghost-1 依然可用:API 用户可以用 model 参数锁定它,订阅用户可以在人性化工具设置里切换模型。旧版本会一直在线,新版本发布不会打断你的工作流。
Ghost-2 在市面上最严苛的 AI 检测器上跑基准测试:GPTZero、Originality.ai、ZeroGPT、Turnitin、Quillbot、Grammarly。它跑的正是 Ghost-1 通过的同一套评估,平均通过率 98.3%,高于此前的 96.2%。其他检测器一般也差不多,甚至更好绕。
不会。Ghost-2 改的是怎么说,不改你说了什么。原意、结构、参考文献和引用都会原样保留。
因为测试集不同。基准测试用刻意难以人性化的输入给所有工具打分,所以每家的分数都偏低。本页的通过率基于日常典型文本测得。
