Claudeが採用する「テキストをコピペしても人間には識別できないウォーターマークが残る」ってどういうこと?と思って調べてみたらこういう論文がヒットした。面白いのでぜひ読んでみて下さい。
↓以下解説
Claudeがこの方式を採用するかは不明ですが、文章を構成する単語・トークンの選び方そのものに統計的な偏りを埋め込む方式です。
たとえば、LLMが次の文章を生成するとします。
「この研究結果は臨床的に重要である。」
この場合では、
- 重要である
- 意義がある
- 注目に値する
- 重要と考えられる
など、意味的にはほぼ同じ候補があります。
通常なら確率に従って選びますが、ウォーターマーク方式では、秘密鍵などから各時点の候補トークンを仮に
パターン1: 重要である、注目に値する……
パターン2: 意義がある、重要と考えられる……
のように擬似ランダムに分類し、パターン1側のトークンを選びやすくすることができます。人間には普通の文章にしか見えません。しかし数百トークン集めて解析すると、
「偶然にしてはパターン1が多すぎる」という統計的シグナルが出ます。
これはLLMウォーターマーク研究ですでに実証されている基本的なアイデアのようです。生成時に特定のトークン群をわずかに優遇し、後から統計検定でウォーターマークを検出します。このため、
Claude → メモ帳にコピペ → Wordにコピペ
としても、文字列が同じである限り統計的パターンもそのままなため、ウォーターマークが残ります。
さらに、人間が編集で一部を書き換えても残り得ます。例えばClaudeが1,000トークン生成し、そのうち100トークンを人間が修正したとしても、残り900トークンには元の統計的偏りが残っています。したがって検出器には、パターン1の比率が依然として偶然では説明しにくい、というシグナルが残る可能性があります。
当然ながら大幅な編集、短文、翻訳、他の文章との混合、短い抜粋などでは検出不能になる場合があり、これはAnthropic社も限界として明記していることから、この方式を採用するのではないかと予想されます。
顯示更多