登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

Dongxi 东锡 NLP
@dongxi_nlp
Prev. PhD @Stockholm_Uni | Alumni @KTHuniversity @uppsalauni Sharing insights on AI
参加 January 2022
983 フォロー中    41.4K ファン
Encoder 的卷土重来 BERT 本来是一条极有潜力的路线:高效地把输入压成 representation。但它停留在了 task-specific 时代,每个任务都需要微调。 GPT 早期同样如此,后来却沿着 scaling、in-context learning 和 instruction tuning 走向了 泛化,把自然语言变成 universal task interface。分类、判断、推理、工具调用,统统变成 generation。 于是 decoder-only 赢下了整个 paradigm,encoder 也失去了继续探索 general classifier 和 general representation model 的历史机会。 但 Agent 改变了 workload。模型开始面对越来越大的输入、越来越重的 KV cache、越来越频繁的循环调用,此时,用一个巨大的 decoder 完整 prefill,再 autoregressive decode 几个 token 来完成一次判断,开始显得昂贵。 Jev 恰好等到了这个窗口。它试图补上 BERT 当年没有走完的路线,保留 GPT 的 task generalization,同时重新获得 encoder 和 classifier 式的 decision efficiency,成为面向 service、面向 Agent 的 泛化 decision model。
もっと見る