註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 RLツアー
RLツアー 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 RLツアー 的搜尋結果
RL训练模拟环境市场地图
这篇讲 forecasting RL 预测强化学习的文章挺有意思。 它做的事情可以这样理解: 拿一批已经有结果的历史预测题,让 AI 回到当时的时间点。 但不能让它直接上今天的互联网,否则会偷看到答案。 所以作者搭了一个「时间遮罩」环境: 搜索只能搜当时以前的资料; 网页通过历史快照读取; 金融和趋势数据也只给当时可见的部分。 然后让模型自己查资料、判断证据、输出概率。 等真实结果揭晓后,用 proper scoring rule 给它打分,再用 RL 去强化更好的预测过程。 这点最有意思: 训练的不是一句答案,而是整套预测动作: 查什么、读什么、什么时候停、怎么处理冲突证据、最后给多少概率。 放到预测市场里,我觉得第一步还不是让 AI 自动交易。 更应该先让它保留 forecast diary: 1. 当时概率 2. 使用证据 3. 市场价格 4. 是否会交易 5. 后续结果 6. 错因归类 如果一个系统说 60% 的时候,长期并不像 60%,那它还不是策略,只是会写理由。 如果你也想练习“记录预测 → 等结果 → 校准自己”,可以从小额/模拟开始,把它当预测日记,而不是交易建议。 我自己用的链接: 原文在这里: 我觉得最值得看的不是结论本身,而是它把“预测”拆成了一个可以训练和复盘的过程。
顯示更多
在这张 RL 环境公司市场地图中,Benchflow AI 是唯一一家: > 仅获得天使轮融资 > 没有 YC 或 a16z accelerator 背景 > 创始团队没有 PhD、实验室经历或传统学术光环 并且还是 solo founder 模式。 却发出了两篇顶级研究,还收到独角兽的八位数收购报价!
顯示更多
🎉 #WEEX# 正式上線 $RL @RARERIAL2035 推特專屬福利來咯,完成任務贏 15 USDT 獎勵 1️⃣ 追蹤 @weexglobal_ch + @RARERIAL2035,轉發按讚本推文 2️⃣ 點擊報名 👉 3️⃣ 交易滿 100 U 的 $RL(現貨) 4️⃣ 完成上述步驟後,填寫表單 👉 📅 活動截止時間:5月22日 🎁 隨機抽取 10位 滿足條件的用戶,每人 15 USDT 獎勵 #RL# #現貨#
顯示更多
🎉 #WEEX# 正式上线 $RL @RARERIAL2035 推特专属福利来咯,完成任务赢 15 USDT 奖励 1⃣ 关注 @WeexCn + @RARERIAL2035 ,点赞 & 转发本推文 2⃣ 点击报名 👉 3⃣ 交易满 100 U 的 $RL (现货) 4⃣ 完成上述步骤后,填写表单 👉 📅 活动截止时间:5月22日 🎁 随机抽取 10位 满足条件的用户,每人 15 USDT 奖励
顯示更多
0
15
27
11
轉發到社區
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。 它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。 我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。 尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。 现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。 不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。 项目链接:
顯示更多
0
58
542
93
轉發到社區
WEEX活动密集上线! $RL 新币福利太香了,顺手就能冲👀 最近WEEX的活动真的一波接一波,刚看完 $RL 新币活动,门槛低、奖励香,日常交易就能参与,太适合咱们顺手薅一波~ 新币上线初期市场情绪最旺,行情活跃、机会多,现在入场刚刚好! 这次福利直接拉满,空投+交易冲榜+邀请奖励三重活动同步开启🚀 完成首充+首笔RL现货交易,就能先领奖励;后续继续交易还能冲榜,一起瓜分30,000 $USDT 总奖池,这个力度在当下真的很良心。 懂行情的朋友已经在悄悄布局了,这波不卷不费力,轻松拿奖励,错过真的亏!😏 🔗 RL新币活动直达: 🔥 热门同步蹲:WEEX TradFi现货交易赛 #WEEX# #RL# #空投# #Crypto# #加密货币# #现货交易#
顯示更多
0
144
119
0
轉發到社區
⚡ 真香!智谱 GLM 大模型背后的那套开源 RL 训练框架开源了——slime GitHub 揽获 7000+ stars。 做大模型强化学习后训练,最头疼的是一堆 trainer、rollout 服务、agent 框架拼在一起,数据流绕来绕去,出了 bug 还经常是悄无声息的那种。 slime 的思路是把训练、数据生成、奖励计算这些全压到同一条数据流上,用 Megatron 做训练、SGLang 做推理,中间不再叠一层又一层的抽象。 GLM-5.2、GLM-5、GLM-4.6 这一整串智谱旗舰模型的 RL 后训练,背后跑的都是它,等于被前沿模型的完整训练流程反复验证过。 它还支持 Qwen、DeepSeek V3、Llama 3 这些主流模型系列。 GitHub:
顯示更多