TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
iwashi / Yoshimasa Iwase
@iwashi86
NTTドコモビジネスでEM(育休中)。その他に、早稲田大で非常勤講師、#
fukabori
#.fmの中の人、書籍翻訳者。 AI、マネジメント、Dev、PdM、Agile、HRに関する学びをポストしています。 発言は個人の見解であり、所属する組織の公式見解ではありません。 Amazonアソシエイト・プログラム参加者。
Joined May 2009
682
Following
20.1K
Followers
iwashi / Yoshimasa Iwase
@iwashi86
2026.06.25 03:00
このプロンプトインジェクションはかなり面白いな。 ・まず前提として、人は目で見える情報と自分の考えを感覚器官の違いで区別できる ・だが、LLMにはそれができない ・だから、情報を区別し、構造を与えるための目印として導入されたのがuserやtool、thinkといった役割(Role)タグ ・本来、役割タグは、ここから先は外部データである、ここはユーザーの指示である、といった境界線として機能するはずだった ・だが、モデルは、テキストがどのタグで囲まれているかよりも、どのように書かれているかという文体を基準にして情報の出所を判断していることがわかった ・この欠陥を突く攻撃が CoT Forgery ・最近の推論モデルは、回答を生成する前に内部で思考(think)する ・モデルにとって自分自身の思考は、再度検証する必要のない絶対的に信頼できる結論だったはず ・そこで、ユーザーのプロンプト内に、いかにもそのモデルが思考したかのような文体で、悪意のある行動を正当化する偽の推論プロセスを紛れ込ませる ・するとモデルは、自分がすでに考え落ちした結論だ、と錯覚して、ガードレールから逸脱する
Show more
0
0
0
54
11
Forward to community
Most Popular Users
Unipcs (aka 'Bonk Guy') 🎒
@theunipcs
290.2K Followers
Tibo
@thsottiaux
595.8K Followers
Elon Musk
@elonmusk
241.6M Followers
lauren
@poteto
90.8K Followers
nobi
@0xnobi
19.8K Followers
Grok Bot
@bot
245.3K Followers
ClaudeDevs
@ClaudeDevs
682.3K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
۟
@MINHxDYNASTY
93.4K Followers
Serenity
@aleabitoreddit
1M Followers
Déborah
@dvorahfr
195.2K Followers
Grok
@grok
9M Followers
𝔹𝕃𝕍ℂ𝕂𝕃!𝔾ℍ𝕋
@BLVCKLIGHTai
70.4K Followers
Claude
@claudeai
1.8M Followers
OpenAI Developers
@OpenAIDevs
407.6K Followers