AIエージェント時代のテスト駆動開発(TDD)の話
一年前のセッションなので、今聴くとせやな
従来のTDDは決定的な出力を前提にするが、AIは同じ入力でも出力がばらつくのでこの前提が崩れる
ゆえに評価はpass/fail の二値をやめ、スコア・レーティング・満足度・挙動(推論・ツール選択・判断)で測る。
AI版SDLCは5段階
①企画/spec(AIが本当に効く箇所を見極める)
②実験(小データで小さく検証)
③大規模eval(数百〜数千のテストで評価)
④リリース管理(AIとアプリのデプロイを分離)
⑤可観測性(本番のエッジケースをトレース)
肝はループ、テスト作成→eval→プロンプト/ロジック修正→リグレッション確認
1つ直すと別が壊れるのを検知する
魔法のように自己改善するエージェントは幻想。複雑なほど地道な可観測性が必要
顯示更多