Register and share your invite link to earn from video plays and referrals.

EARLの医学&AIノート
@EARL_med_tw
中の人は臨床医/AIコンサルタント等のポートフォリオワーカーです。医学論文AI総合サイトMVidEraの公式アンバサダー。専門は感染症(メイン)、呼吸器内科、敗血症、PICSなど。論文ポストが多いです。ブログもやってます。新型コロナワクチン10回接種済み(最終コスタイベ)
Joined June 2012
314 Following    151.9K Followers
Claudeが採用する「テキストをコピペしても人間には識別できないウォーターマークが残る」ってどういうこと?と思って調べてみたらこういう論文がヒットした。面白いのでぜひ読んでみて下さい。 ↓以下解説 Claudeがこの方式を採用するかは不明ですが、文章を構成する単語・トークンの選び方そのものに統計的な偏りを埋め込む方式です。 たとえば、LLMが次の文章を生成するとします。 「この研究結果は臨床的に重要である。」 この場合では、 - 重要である - 意義がある - 注目に値する - 重要と考えられる など、意味的にはほぼ同じ候補があります。 通常なら確率に従って選びますが、ウォーターマーク方式では、秘密鍵などから各時点の候補トークンを仮に パターン1: 重要である、注目に値する…… パターン2: 意義がある、重要と考えられる…… のように擬似ランダムに分類し、パターン1側のトークンを選びやすくすることができます。人間には普通の文章にしか見えません。しかし数百トークン集めて解析すると、 「偶然にしてはパターン1が多すぎる」という統計的シグナルが出ます。 これはLLMウォーターマーク研究ですでに実証されている基本的なアイデアのようです。生成時に特定のトークン群をわずかに優遇し、後から統計検定でウォーターマークを検出します。このため、 Claude → メモ帳にコピペ → Wordにコピペ としても、文字列が同じである限り統計的パターンもそのままなため、ウォーターマークが残ります。 さらに、人間が編集で一部を書き換えても残り得ます。例えばClaudeが1,000トークン生成し、そのうち100トークンを人間が修正したとしても、残り900トークンには元の統計的偏りが残っています。したがって検出器には、パターン1の比率が依然として偶然では説明しにくい、というシグナルが残る可能性があります。 当然ながら大幅な編集、短文、翻訳、他の文章との混合、短い抜粋などでは検出不能になる場合があり、これはAnthropic社も限界として明記していることから、この方式を採用するのではないかと予想されます。
Show more
0
17
1.4K
461
Forward to community