TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
iwashi / Yoshimasa Iwase
@iwashi86
NTTドコモビジネスでEM(育休中)。その他に、早稲田大で非常勤講師、#
fukabori
#.fmの中の人、書籍翻訳者。 AI、マネジメント、Dev、PdM、Agile、HRに関する学びをポストしています。 発言は個人の見解であり、所属する組織の公式見解ではありません。 Amazonアソシエイト・プログラム参加者。
加入 May 2009
682
正在关注
20.1K
粉丝
iwashi / Yoshimasa Iwase
@iwashi86
2026.06.25 03:00
このプロンプトインジェクションはかなり面白いな。 ・まず前提として、人は目で見える情報と自分の考えを感覚器官の違いで区別できる ・だが、LLMにはそれができない ・だから、情報を区別し、構造を与えるための目印として導入されたのがuserやtool、thinkといった役割(Role)タグ ・本来、役割タグは、ここから先は外部データである、ここはユーザーの指示である、といった境界線として機能するはずだった ・だが、モデルは、テキストがどのタグで囲まれているかよりも、どのように書かれているかという文体を基準にして情報の出所を判断していることがわかった ・この欠陥を突く攻撃が CoT Forgery ・最近の推論モデルは、回答を生成する前に内部で思考(think)する ・モデルにとって自分自身の思考は、再度検証する必要のない絶対的に信頼できる結論だったはず ・そこで、ユーザーのプロンプト内に、いかにもそのモデルが思考したかのような文体で、悪意のある行動を正当化する偽の推論プロセスを紛れ込ませる ・するとモデルは、自分がすでに考え落ちした結論だ、と錯覚して、ガードレールから逸脱する
显示更多
0
0
0
54
11
转发到社区
热门用户
狱
@Wx1n11124
191.4K 粉丝
オリコンニュース
@oricon
1.9M 粉丝
空空道人
@Kongkongda5882
30.6K 粉丝
吴说区块链
@wublockchain12
180.5K 粉丝
New York Post
@nypost
4.1M 粉丝
乐老爺 #JAV
@HappyLok1157
206.9K 粉丝
中國新聞社
@CNS1952
547.1K 粉丝
一劍浣春秋
@chee828
230.9K 粉丝
华尔街观察 Xtrader
@cnfinancewatch
126.6K 粉丝
TVer新着
@TVer_info
100K 粉丝
彭博商業周刊 / 中文版
@BloombergBWCN
41.6K 粉丝
Gxtimer 原创
@GxtimerTv
194.2K 粉丝
看中國
@kanzhongguo
348.3K 粉丝
TPE48
@official_TPE48
11K 粉丝
小牛
@Xiaoniu6161
188.4K 粉丝