註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Tianzhu Ye
@ytz2024
Foundation AI models and self-improving AI. Researcher @MSFTResearch Asia.
加入 October 2024
411 正在關注    684 粉絲
(1/n) Introduce LLM-as-a-Coach for non-verifiable tasks. Scalar rewards discard rich feedback. LLM-as-a-Coach guides policy with context, leveraging high bandwidth to provide rich experiential knowledge that preserves fine-grained preference on non-verifiable tasks.
顯示更多
0
12
70
10
轉發到社區