註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 DeelSpeed⚡️
DeelSpeed⚡️ 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 DeelSpeed⚡️ 的搜尋結果
🎓 兄弟们,想把开源大模型微调成自己想要的样子,Hugging Face 官方维护的 TRL 把整套后训练都备好了。 GitHub 上 1.9 万 star,DeepSeek R1 训练用的 GRPO 算法,在 TRL 里就是一个现成的训练器。今天刚发 1.13 版,上一版是 8 月 26 号。 以前想照着论文给模型做一遍偏好对齐或者强化学习,得自己写训练循环、算奖励、处理多卡,光把代码跑通就要耗掉不少时间。 在 TRL 里,从监督微调 SFT,到用偏好数据做 DPO,再到 GRPO 强化学习,每一步都有对应的 Trainer 直接调,不想写代码还能用命令行起训练。 显卡不够也有办法:接上 PEFT 用 LoRA、QLoRA 加量化,有限的硬件也能训大模型;卡多了就通过 Accelerate 和 DeepSpeed 扩到多节点。连标注都能省,KTO 只要“好 / 不好”这种二元反馈,不用两两比较。 想自己动手做后训练的,先把 TRL 摸熟准没错。 GitHub:
顯示更多
最近我有个手握十篇AI顶会的博士朋友正在找工作,分享一下他找工作的经验吧: 整理了 50 多篇青云、Seed、Kimi 等大模型人才计划面经,发现一个挺反常识的现象: 论文多的人,不一定更容易通过。 面试官真正关心的通常不是论文数量,而是几个更具体的问题: 你的研究方向和团队是否匹配?工作里哪些部分是自己完成的?为什么这样设计?方法在哪些场景会失败?换到真实业务里,成本和收益是否仍然成立? 研究型团队会重点考察问题定义、方法创新、实验设计和未来研究方向。但对于后训练、Agent 和推理系统岗位,工程闭环同样重要: 能不能搭建数据、训练、rollout 和评测流程?是否真正用过 verl、vLLM、Ray、DeepSpeed?遇到 reward 异常、熵崩溃、显存不足或吞吐下降时,能不能定位原因? 所以常见的四类候选人,大致是: 1. 论文强、工程弱:Research Talk 有优势,但容易挂在 Coding、系统实现和工程追问。 2. 工程强、论文弱:业务组适配度不错,但需要证明自己不只是调用框架,也能定义和分析问题。 3. 论文和工程都强:竞争力最高,但面试官会重点确认工作是否真正由自己主导。 4. 两边都不突出:与其继续堆零散经历,不如完成一个方向匹配、指标完整、能讲清失败案例的闭环项目。 人才计划不一定选择履历最豪华的人,更可能选择: 1. 方向匹配,并且能够独立把问题推进下去的人。 2. 一篇能讲透、能复现、能落地的工作,可能比几篇说不清个人贡献的论文更有说服力
顯示更多
0
40
439
57
轉發到社區