← 返回信息流

The Decoder观点

大语言模型本可像人类一样写作,但后训练护栏使其文本可被检测

the-decoder.com作者:Matthias Bastian观点模型AI评分:50/100

Pangram CTO Bradley Emi 认为,LLM 并非不能写出多样化的文本,而是后训练和安全护栏大幅压缩了其表达范围,导致“模式坍缩”,使其文本可被检测。基础模型或专门微调模型则更具多样性,不易被检测。

理论上,大语言模型(LLM)的写作风格可以像人类一样多样,但实际上并非如此。AI文本检测工具Pangram的首席技术官布拉德利·埃米在一篇博客文章中表示,后训练和安全护栏使得AI生成的文本仍然可以被识别出来。像ChatGPT、Claude或Gemini这样的系统会学习行为规则,以避免产生危险输出或审查某些政治言论。这极大地限制了它们的表达范围,这种现象被称为“模式坍缩”。

In "mode collapse," a language model fixates on one preferred phrasing (orange curve) instead of covering the full range
In "mode collapse," a language model fixates on one preferred phrasing (orange curve) instead of covering the full range

埃米指出,所谓的基础模型,即经过后训练之前的原始模型,其写作风格更加多样,因此Pangram的检测系统不会将其标记为AI生成。同样,仅针对海明威或特定Reddit子版块文本进行训练的窄领域微调模型,以及诸如语无伦次之类的异常输出,也不会被标记。不过,这仅适用于没有水印的AI文本。对于带有水印的文本,即使基础模型风格多样,水印检测也几乎总能奏效。

阅读原文