註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Qwen3_9
Qwen3_9 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Qwen3_9 的搜尋結果
一个 9B 模型,专门学习怎么给 Agent 修 harness,最后比更大的前沿模型改得更稳。 这篇论文提出 Harness-R1,把「改进 Agent 的运行外壳」本身训练成了一项能力。 它会读取 Agent 的失败轨迹,找出工具误用、状态丢失、重复尝试和恢复失败等问题,再生成可以直接运行的 harness 补丁。 补丁可以介入任务开始、决策前、执行前和环境反馈后,调整上下文、动作验证和错误恢复。 关键在于,系统不会根据补丁写得是否合理来打分。 修改后的 Agent 必须重新执行任务,真实成功率有没有提升,才决定这次修改值不值得学习。 在 WebShop、ALFWorld 和 DBBench 上,Harness-R1 将 Qwen3.5-9B 的平均成功率从 44.3% 提升到 53.6%。当目标 Agent 自身经过微调后,它还能继续把成功率从 59.2% 推到 64.2%。 训练出的编辑能力也迁移到了 20 个未见过的目标模型,平均提升约 7 个百分 现在模型可以从经验中更新参数,Harness Engineer 则学习如何调整上下文、工具、验证和恢复机制。 看起来合理的修改,放进真实系统后可能反而降低成功率。未来 Agent 改进 Agent,真正重要的标准还是能不能跑通、能不能验证,以及出问题后能不能回滚。 📎 arxiv:
顯示更多
0
45
149
39
轉發到社區
在无人在意的角落,科大讯飞开源了他们的小模型Spark-X2.5-4B 全面超越Qwen3.5-9B Spark-X2.5-4B 的定位是本地私人助手、轻量代码与 Agent、企业私有化部署 官方宣称支持 1M 上下文、200 多种语言 真能超越Qwen的小模型吗🤔
顯示更多
Qwen3.5-35B-A3B-FP8 在NV DGX Spark GB10上输出测试
0
14
45
2
轉發到社區
Avarok Cybersecurity 开源了 Atlas,一个用 Rust + CUDA 从零写的大模型推理引擎。它不依赖 Python 和 PyTorch,项目方称 Docker 镜像约 2.5GB,冷启动不到 2 分钟,目前主要面向 NVIDIA DGX Spark 的 GB10 平台优化。 官网模型矩阵显示,Atlas 在单台 DGX Spark 上跑 Qwen3.5-35B-A3B 可到约 130 tok/s,跑 Qwen3.6-35B-A3B 约 71 tok/s。Atlas 官网和 Hugging Face 页面称,在同硬件下,Qwen3.5-35B 平均约 111 tok/s、峰值 130 tok/s,vLLM 约 37 至 38 tok/s。 这组「3 倍 vLLM」数据来自项目方公开基准。GitHub README 写明,测试使用的是「法国首都是哪」这类短 prompt,生成上限不超过 30 个 token,temperature 为 0.1。这个口径更接近短请求、低并发、快速响应场景,也正好对应 Atlas 想打的卖点:用更小镜像、更少依赖和更快冷启动,把本地大模型服务变得更轻。 Atlas 现在仍是早期项目,真实生产场景还要看后续长文本、高并发和复杂工具调用测试。GitHub 上已有用户反馈输出质量和工具调用稳定性问题,相关 Issue 截至 2026 年 5 月 11 日仍处于 Open 状态。对开发者来说,它更像一个值得关注的新推理底座,而不是已经能全面替代 vLLM 的成熟方案。
顯示更多
⚡ 震惊,有人为了让 Qwen3.8-27B 在单张 RTX 5090 上跑得更快,硬是把 vLLM 改了七轮,成果就是 Qwen3.8-Inference-MetaZenith 这个分支。 效果是拿数据说话的:基线版和优化后的 R107 版跑了 18 组对比,生成吞吐的几何平均从 51.9 提到 84.9,涨了 63.5%;上下文拉到 65536、并发为 1 的那一档,涨幅直接到 310%。 自己编译 vLLM 折腾过 Blackwell 卡的应该有体会:装 CUDA Toolkit、对着编译目标一个个试,编出来还不一定比官方版快多少。 Qwen3.8-Inference-MetaZenith 把调好的结果整个端出来了。它基于 vLLM v0.27.1,动了 24 个上游文件,加了三千三百多行,七个阶段挨个啃——解码调度、输出投影、精确解码内核、批量预填充调度、预填充融合,重点都压在 TurboQuant 和 Gated Delta Network 这两条执行路径上。预编译好的 wheel 也放出来了,装 wheel 这条路不需要 CUDA Toolkit 和 nvcc,驱动对得上就行。 说清楚适用范围:它是给 sm_120 的 RTX 5090 加特定模型做的专用分支,换卡换模型就不是这个故事了。 这么窄的一个场景居然有人认真调了七轮,属实硬核。 GitHub:
顯示更多
🔥 突破 10.9T 算力大关! 前沿大模型免费狂欢进行中! 免费活动上线至今, 平台累计 Token 吞吐量突破 10.9 万亿!在 8,956 万+ 次 API 调用的严苛考验下, 成功赋能超 23.9 万 新注册用户(含 23.5 万+ 新增 API 用户)。底座承载力全线升级,轻松应对海量高并发与重度 Agent 工作流。 顶尖国产模型组合拳,兼顾零门槛与极致性价比: 🔸 全量免费体验:GLM-5.3-Flash (Ox Alpha)、 Qwen3.8-Flash、Tencent Hy3、Xiaomi MiMo-V2.5 🔸 重磅折扣加码:DeepSeek-V4-Flash、DeepSeek-V4-Flash-Vision-Exp 享 50% OFF 半价优惠! 赋能每一位开发者与企业团队,打造更高效、更稳定、更实惠的 AI 应用体验。 👉 立即部署高效 AI 工作流:
顯示更多
0
16
46
5
轉發到社區
刚看到 Qwen 发布 Qwen3.8-Max,它开始挑战几小时、几天甚至跨周的复杂任务:从空目录搭项目、连续跑科研实验,到处理数百份文档和操作视觉界面,边做边检查,发现问题再自己修正 模型总参数 2.4T、激活参数 95B。API 已经上线;权重将在下周开放,这是 Qwen 首次开放 Max 级模型权重 1、连续十几天写一个项目 官方让它从零开发 oh-my-cli,截至 7 月 30 日自主运行了约 16 天,完成 265 次提交、127 个 PR 和 151 个 Issue。它还给自己搭了任务分发、状态监控、CI、E2E 测试和故障恢复流程 2、自己跑完一轮科研 它连续工作约 125 小时,阅读并复现一篇大模型数据筛选论文,写下约 7600 行代码,执行超过 1100 次操作和 33 轮 GPU 训练 复现完成后又继续探索 18 个想法,找到的方法比论文方案再高 2.7 个百分点 3、会根据真实反馈改方案 在一场有 526 支人类队伍参加的比赛中,它在 24 小时内提交 45 次,把准确率从 0.60 提到 0.853,超过 458 支队伍 这个案例更能体现 Agent 的用法:提交、看结果、调整,再提交 4、办公任务开始接近成品交付 官方展示了数百份文档审查、带公式和图表的表格、8 页交互式数字银行原型、餐厅菜单成本分析等任务 交付物覆盖文档、表格、网页和可视化,适合资料多、步骤长、需要统一格式的工作 5、视觉信息也进入执行循环 它能处理 200 多页报告、长视频、截图和设计图,也能根据截图写前端、把平面图转成 3D 场景 生成后会观察页面布局、方向和交互是否出错,再重新规划和修改 6、可以接进现有 Agent 工具 官方已经给出 Claude Code、Codex、Qoder CLI、Qwen Code 和 OpenClaw 的接入方式,兼容 OpenAI 与 Anthropic API reasoning_effort 可选 xhigh、medium、low;Codex 示例配置给出 100 万上下文,并支持文本、图片和并行工具调用 7、目前怎么用 现在可以通过千问 AI 平台调用 API,Hugging Face 和 ModelScope 的模型权重还要等到下周 上面的长程案例与成绩来自 Qwen 官方测试,准备接入生产前,建议拿自己的代码库、文档和成本预算再跑一轮 我觉得日常问答未必能体现它的优势;自动编程、深度研究、多文件交付和长视频理解,才是这次更值得尝试的方向
顯示更多
我跑通了: Qwen3.8-Flash-Next 模型 111GB , 单显卡4090 48GB 125B 级的 MoE, 以前想本地跑,那是机房里好几张 A100 的事。 现在 : 一张 48GB 改装版 4090, 加 123GiB 普通内存,不光跑起来了,250K 长文读完一道没错, 还和 27B 打了场 300 题正面对测。 模型是阿里前天才放的 Qwen3.8-Flash-Next,Unsloth UD-Q4_K_XL 量化 , 四个分片 111.3GB。 它能塞进单卡, 秘密就一条 : MoE 每个 token 只激活约 6B。 我把 33GiB 权重放进显卡, 70.7GiB 扔给内存——其中 26.8GiB 是那张 51B 的 n-gram 表, 它每个 token 只查几行,放内存几乎白嫖。 速度: 短请求 28.5–30.3 tok/s 读了 32K 内容 : 24.1 tok/s 读满 250K : 14.04 tok/s 长任务是这么虐它的 : 一份 250K token 的合成长文 , 里面埋 17 个要检索、要计算的字段,读完全文、找出来、算对。它半小时读完,17/17 一道没错,整轮 34.8 分钟。 质量这关更有意思 : 300 道冻结同题(代码+困难推理) , 这个 111GB 的大家伙 247/300, 16.5GB 的 27B Q4 245/300 统计上打平(p=0.86)。但单题耗时, 只是Flash 平均慢 48%。 所以我的判断 : 日常任务留 27B, 快; Flash-Next 的更强的是长任务。 网上那个"24G 4090 跑出 21 tok/s"很多人在转。 我看了测法:他把上下文窗口设到了 250K——窗口只是个上限, 意思是"最多允许模型读这么多" ; 但他每轮真正让模型读的内容, 只有 28K 左右。 模型读得越多越慢,他的速度 21 tok/s 是"读了 28K"的速度, 我的 14.04tok/s 是读满 250,002 token 的速度。 窗口设很大不关键、真正往上下文放了多少, 是完全不一样的,短测试可以很快,长文测试才是速度关键!!! 对了, 这轮 MTP 没开——模型目录里没有 draft 文件; 社区 sidecar 试过一版, decode 反而掉八九成。也就是说,这个 14.04 tok/s 还有的涨。 惊喜的发现!我本来想自己动手写的思路,发现 GitHub 上已经有人做出来了(01554 的 llama.cpp fork,expert-tier 分支): 上游 llama.cpp 显存不够时,把 MoE 权重整层搬去内存。 但专家冷热天差地别——512 个专家, 常被路由命中的就那几百个。这个分支改成按专家放:热门专家住显存,按命中热度限速换入换出,冷门的睡内存。路由越偏科,赚得越多。 作者的卡是 96GB 的 RTX PRO 6000,他测小卡的办法挺取巧 : 跑个进程占死一块显存,把可用显存压到 32GB、48GB, 模拟不同预算: 32GB 可用 : 整层切 25 tok/s,热缓存 35-36,快 42% 48GB 可用 : 整层切 29,热缓存约 39,快 34% 48GB 这档, 显存预算和我这张 4090 刚好一样。 但他的卡是 Blackwell,带宽算力都不同 热缓存只加速 decode, prefill 绕开走老路; 分支还是 experimental, 早期有个读错权重的 bug, 8/27 已修,复现要用修完的 commit。 下一轮,就在这张 4090 上测试这个。
顯示更多
0
54
58
4
轉發到社區
【8月4日| 生态洞察】 Qwen3.8-Max 接入 后迅速成为热门模型,单日算力吞吐突破 143.5 亿 Tokens,创近期新高! 🔹 算力吞吐刷近期峰值 单日 Tokens 吞吐达 14.35B,API 调用占比 99.7%。面对高负载需求, 基础设施持续稳定运行 🔹 用户增长持续加速 单日新增注册用户 1,747 人,DAU 快速提升,更多开发者正在 探索 AI Agent 与自动化工作流 🔹 链上支付生态持续增长 链上支付占比达 77.9%,以多链资产结算为基础的 Web3 原生支付体系持续发挥优势 🔹 Qwen3.8-Max 成为热门选择 新模型上线后迅速获得开发者关注,进一步验证了 快速接入前沿模型并推动实际应用落地的能力 💡 核心洞察 从前沿模型快速接入到百亿级 Token 吞吐, 正打造连接 AI 模型、开发者与 Web3 用户的高性能基础设施,让 AI 能力更快转化为生产力。 👉 一键部署您的 AI 工作流:
顯示更多
0
20
28
15
轉發到社區
阿里云发布Token Plan个人版,可抢先体验Qwen3.8-Max-Preview 个人版:Lite 39元/月(6.5折),Standard 139元/月(7.7折),Pro 499元/月(8.3折); 团队版:标准席位 150元/席位/月(7.6折),高级席位 550元/席位/月(7.9折),尊享席位 1398元/席位/月。 另外,Qoder和QoderWork也已支持Qwen3.8-Max-Preview。
顯示更多
0
38
60
6
轉發到社區