A/Bテストって実施するだけで数週間かかりますよね。それ、実データ由来の「AIペルソナ」に事前予測させられるかもしれません。
タイトル: Data-Driven Persona-Conditioned Agents for A/B Test Simulation
URL:
❓ どんな質問の仕方がAIペルソナに一番効くの?
💡 バリアントを比較させる「ペアワイズ評価」が最も精度が高く、CTRで精度0.75、サブスクリプションで0.80を記録しました。単独評価だと0.40程度に落ちます。
❓ 実データがなくても代用できる?
💡 公開のe-コマースデータでもプロプライエタリデータに匹敵する精度が出ました。ただしドメインが違う映画レビューデータでは精度が下がり、ドメインの近さが重要だとわかりました。
❓ ペルソナは行動データが濃い方がいい?人口の多様性がある方がいい?
💡 CTR予測では行動データが濃い「深いプール」が有利でしたが、サブスクリプション予測では差が出ませんでした。目的次第で使い分けが必要そうです。
❓ ペルソナ数を減らすとコストは下がる?精度は落ちる?
💡 935人から500人へサブサンプリングしても精度はほぼ変わらず、約2倍のコスト削減に成功しています。
#
A#/Bテスト #
LLMエージェント#