Register and share your invite link to earn from video plays and referrals.

iwashi / Yoshimasa Iwase
@iwashi86
NTTドコモビジネスでEM(育休中)。その他に、早稲田大で非常勤講師、#fukabori#.fmの中の人、書籍翻訳者。 AI、マネジメント、Dev、PdM、Agile、HRに関する学びをポストしています。 発言は個人の見解であり、所属する組織の公式見解ではありません。 Amazonアソシエイト・プログラム参加者。
Joined May 2009
682 Following    20.1K Followers
このプロンプトインジェクションはかなり面白いな。 ・まず前提として、人は目で見える情報と自分の考えを感覚器官の違いで区別できる ・だが、LLMにはそれができない ・だから、情報を区別し、構造を与えるための目印として導入されたのがuserやtool、thinkといった役割(Role)タグ ・本来、役割タグは、ここから先は外部データである、ここはユーザーの指示である、といった境界線として機能するはずだった ・だが、モデルは、テキストがどのタグで囲まれているかよりも、どのように書かれているかという文体を基準にして情報の出所を判断していることがわかった ・この欠陥を突く攻撃が CoT Forgery ・最近の推論モデルは、回答を生成する前に内部で思考(think)する ・モデルにとって自分自身の思考は、再度検証する必要のない絶対的に信頼できる結論だったはず ・そこで、ユーザーのプロンプト内に、いかにもそのモデルが思考したかのような文体で、悪意のある行動を正当化する偽の推論プロセスを紛れ込ませる ・するとモデルは、自分がすでに考え落ちした結論だ、と錯覚して、ガードレールから逸脱する
Show more