刚看到 Qwen 发布 Qwen3.8-Max,它开始挑战几小时、几天甚至跨周的复杂任务:从空目录搭项目、连续跑科研实验,到处理数百份文档和操作视觉界面,边做边检查,发现问题再自己修正
模型总参数 2.4T、激活参数 95B。API 已经上线;权重将在下周开放,这是 Qwen 首次开放 Max 级模型权重
1、连续十几天写一个项目
官方让它从零开发 oh-my-cli,截至 7 月 30 日自主运行了约 16 天,完成 265 次提交、127 个 PR 和 151 个 Issue。它还给自己搭了任务分发、状态监控、CI、E2E 测试和故障恢复流程
2、自己跑完一轮科研
它连续工作约 125 小时,阅读并复现一篇大模型数据筛选论文,写下约 7600 行代码,执行超过 1100 次操作和 33 轮 GPU 训练
复现完成后又继续探索 18 个想法,找到的方法比论文方案再高 2.7 个百分点
3、会根据真实反馈改方案
在一场有 526 支人类队伍参加的比赛中,它在 24 小时内提交 45 次,把准确率从 0.60 提到 0.853,超过 458 支队伍
这个案例更能体现 Agent 的用法:提交、看结果、调整,再提交
4、办公任务开始接近成品交付
官方展示了数百份文档审查、带公式和图表的表格、8 页交互式数字银行原型、餐厅菜单成本分析等任务
交付物覆盖文档、表格、网页和可视化,适合资料多、步骤长、需要统一格式的工作
5、视觉信息也进入执行循环
它能处理 200 多页报告、长视频、截图和设计图,也能根据截图写前端、把平面图转成 3D 场景
生成后会观察页面布局、方向和交互是否出错,再重新规划和修改
6、可以接进现有 Agent 工具
官方已经给出 Claude Code、Codex、Qoder CLI、Qwen Code 和 OpenClaw 的接入方式,兼容 OpenAI 与 Anthropic API
reasoning_effort 可选 xhigh、medium、low;Codex 示例配置给出 100 万上下文,并支持文本、图片和并行工具调用
7、目前怎么用
现在可以通过千问 AI 平台调用 API,Hugging Face 和 ModelScope 的模型权重还要等到下周
上面的长程案例与成绩来自 Qwen 官方测试,准备接入生产前,建议拿自己的代码库、文档和成本预算再跑一轮
我觉得日常问答未必能体现它的优势;自动编程、深度研究、多文件交付和长视频理解,才是这次更值得尝试的方向
顯示更多