TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
iwashi / Yoshimasa Iwase
@iwashi86
NTTドコモビジネスでEM(育休中)。その他に、早稲田大で非常勤講師、#
fukabori
#.fmの中の人、書籍翻訳者。 AI、マネジメント、Dev、PdM、Agile、HRに関する学びをポストしています。 発言は個人の見解であり、所属する組織の公式見解ではありません。 Amazonアソシエイト・プログラム参加者。
参加 May 2009
682
フォロー中
20.1K
ファン
iwashi / Yoshimasa Iwase
@iwashi86
2026.06.25 03:00
このプロンプトインジェクションはかなり面白いな。 ・まず前提として、人は目で見える情報と自分の考えを感覚器官の違いで区別できる ・だが、LLMにはそれができない ・だから、情報を区別し、構造を与えるための目印として導入されたのがuserやtool、thinkといった役割(Role)タグ ・本来、役割タグは、ここから先は外部データである、ここはユーザーの指示である、といった境界線として機能するはずだった ・だが、モデルは、テキストがどのタグで囲まれているかよりも、どのように書かれているかという文体を基準にして情報の出所を判断していることがわかった ・この欠陥を突く攻撃が CoT Forgery ・最近の推論モデルは、回答を生成する前に内部で思考(think)する ・モデルにとって自分自身の思考は、再度検証する必要のない絶対的に信頼できる結論だったはず ・そこで、ユーザーのプロンプト内に、いかにもそのモデルが思考したかのような文体で、悪意のある行動を正当化する偽の推論プロセスを紛れ込ませる ・するとモデルは、自分がすでに考え落ちした結論だ、と錯覚して、ガードレールから逸脱する
もっと見る
0
0
0
54
11
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
100K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
New York Post
@nypost
4.1M ファン
一劍浣春秋
@chee828
230.9K ファン
モデルプレス
@modelpress
2M ファン
AKB48公式
@AKB48_staff
289.4K ファン
ファミ通.com
@famitsu
1.4M ファン
NMB48 Official
@nmb48_official
133.7K ファン
フレッシュ撮影会【公式】
@fresh_akiba
94.3K ファン
HKT48
@hkt48_official_
150.8K ファン
空空道人
@Kongkongda5882
30.6K ファン
乃木坂46
@nogizaka46
2M ファン
STU48
@STU48_official_
103.9K ファン
中國新聞社
@CNS1952
547.1K ファン