注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 QwenImage
QwenImage 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 QwenImage 的推特
Qwen-image-3.0实测,阿里我就问你打脸不? 用自己的提示词打自己的脸,话不多说,直接上图: prompt: 生成一张具有视觉纵深感的‘画中画’图像。最外层是一个真实的 VSCode 编程界面,中间嵌套一个千问App的聊天界面,聊天界面里我正在发送一条消息,内容是‘帮我生成一张手冲咖啡海报’。千问回复了一张精美的咖啡海报,这张海报也清晰地显示在聊天界面中。要求每一层UI都保持真实的风格与细节,界面中的时间数字、按钮小字等微观细节清晰可辨。 第一张:Qwen-Image-3.0 直接糊成抽象画,内容几乎为零,渲染差到令人发指。买了再多 KOL 吹「中文语境」「中文渲染」,也救不了这张图。流量和口碑可以造,生成质量骗不了眼睛。 第二张:ChatGPT-Image-2.0 文字完全锐利、无扭曲、无粘连,层级清晰,细节到位,甚至直接骗过了 Grok。 真的太失望了,满怀期待的去体验“国产之光”😅
显示更多
0
45
12
0
转发到社区
Qwen-Image-3.0发布了,但是没啥声音。 为什么呢? 因为没有提开源的事情,闭源的有chat-image-2,nano banana pro,如果不是特别领先,别人当然就不关注了。 其实国内厂商要突破,图片模型是一个很不错的突破口。 谷歌就是这么做的,其实谷歌的大模型一般,但是有nano banana,就让大家觉得他们家的模型还不错。 现在,国内的大模型,目前很难拉开差距。 只要跟上进度,做的不是太差,还是有生存空间的。 但是图片模型这块,国内是真的普遍不行,就字节还可以,也是闭源的。 如果谁在这个方面取得突破,还能开源,那热度就上来了。 只要能拉开差距,就不怕赚不到钱。
显示更多
兄弟们 好东西 Qwen-Image-2.1无审查版本 移除了安全过滤 可以生成成人、NSFW等图像内容 而且优化了生成速度: 主模型放进显卡里跑保证速度,把巨大的“文本编码器”扔给普通电脑内存(CPU)去跑。 这样能帮你省出 9 到 17 GB 的显存,而且几乎不会拖慢出图速度! Qwen-Image-2.1同时把“文生图”和“图像编辑”融合成了一个模型,还原生支持透明图处理。 最多支持 10 张参考图: 可以把 6 个人的单人照直接合成为一张自然的多人合照 画面质感提升(字雅人美): 文字排版不再“画符”:解决了以往生图模型文字容易扭曲、拼错的毛病,字体、排版更协调美观。 光影细节更逼真:皮肤质感、毛发细节与自然光影大幅改善,摆脱“塑料 AI 感”
显示更多
通义发布 Qwen-Image-3.0 一条三千字指令,一次画出九张信息图和一整版报纸 12 国语言原生渲染 100+ 艺术风格 网页游戏直播界面仿真 联网取最新世界知识 指令上限提到 4.5k token,一整版复杂内容能一次交代完
显示更多
0
11
40
2
转发到社区
Macbook Pro 24G内存,本地跑了下Qwen-Image-2.1+去安全审查解码器。 怎么说呢,一张图生成需要5-6分钟 😓😓😓 没专业显卡,不要尝试本地模型,无论是文本模型,还是生图模型,纯浪费时间,占硬盘。
显示更多
0
101
152
7
转发到社区
千问发布第三代图像生成模型 Qwen-Image-3.0。新模型最大支持 4.5k Token 输入,重点提升复杂版面、细小文字和知识型图像的生成能力。 它可以用一条长指令生成报纸、试卷、短剧分镜和九宫格信息图。模型能在同一张图里处理多个主题,并同时生成公式、图表、人物和中英文文字。官方展示的一张九宫格包含九类独立内容,描述指令长约 3.7k Token。 文字渲染也进一步加强。千问称,模型可以清晰生成小至 10px 的文字,并处理 LaTeX 公式、上下标、手写批注和报纸密集排版。毛孔、发丝、纸张和绘画纹理等细节也更真实。 Qwen-Image-3.0 原生支持 12 种语言、100 多种艺术风格和多类 UI 界面。官方还展示了联网生成天气图、修复传统绘画和制作专业信息图等用法。 相比单纯生成好看的图片,这一代更强调 PPT、教育材料、设计和内容制作等实际场景。
显示更多
基于nano-banana模型非常优秀的改图能力,把平面动画角色转成3D手办的玩法这几天很火,不过我自己在LMArena测试了一会儿,发现它对纯血二次元图片的转化其实不太理想,改出来的成品都更像是亚克力的吊牌而不是手办,反而让我抽到的Qwen-Image出图效果意外的好。 比如图1是原图,图2是nano-banana的,图3是Qwen-Image的,差距很明显。(1/n)
显示更多
0
9
145
8
转发到社区
正好最近我也在筹备,所以做过计算。 主要的 GPU 是 RTX PRO 6000 Blackwell Max-Q 96GB X 4 用 Max-Q 版本主要是因为功耗是 300 瓦,而标准的 RTX PRO 6000 Blackwell Workstation Edition 是 600W 。虽然 Max-Q 的峰值性能会稍微低一些,官方数据是 3511 AI TOPS 对 4000 AI TOPS,大概少了 12%,但两者都是 96GB GDDR7 ECC 显存,1792GB/s 显存带宽,对于 AI 视频生成来说,最重要的就是显存容量。 而且一旦用到四张 GPU,功耗差距就非常明显。4 张 Max-Q 满载是 1200W,4 张标准版单 GPU 理论功耗加起来就是 2400W。 这就意味着标准版已经很难按照普通工作站的方式长期运行。而前者仍然是可以家庭化办公使用。 对于 AI网剧,我个人也更看重并行产能。一个剧集最后可能有几百个镜头,与其让一张 600W 的卡把一个镜头生成得快一些,肯定不如四张 96GB 的 GPU 可以同时跑四个不同镜头。一张负责正式镜头,一张跑失败镜头重做,一张跑人物或者场景相关任务,一张继续处理下一批镜头,机器可以全天保持任务队列。 这样一台机器最终就是 4×96GB,一共 384GB 的物理显存资源。 当然对于新手来说,没有必要上来就拉满 4 块 GPU ,所以我自己的思路是先把工作站(主机)按照最终 4 卡规格买好,初期只装 1 至 2 张 RTX PRO 6000 Max-Q,等用工熟练并且能把生成队列跑满以后,再逐渐增加到 3 张、4 张。 如果最终做到 4× RTX PRO 6000 Max-Q 96GB,我现在估算整台高配工作站的硬件投入大约在 13 万到 15 万新币,大概就是 70 万到 80 万人民币。 其中最大投入就是 GPU 了,现在新加坡一张 RTX PRO 6000 Blackwell Max-Q 96GB 的公开价格大约是 24,550 新币。光 GPU 就已经接近十万新币。 另外就是软件部分,我大概列一下: 1. 核心生成平台:ComfyUI 2. 静态图阶段:Qwen Image 系列 3. 视频核心:Wan 2.2 4. 人物一致性和控制工具:LoRA,ControlNet / OpenPose 以及 IPAdapter / Reference 类工作流。 5. 后期软件:DaVinci Resolve 6. 声音部分:TTS / AI 配音 或 Character Voice Bible 我现在已经开始尝试做简单的内容了。当然主要是 AI 做,我负责打酱油。
显示更多
0
37
64
6
转发到社区
GM GN 距离2027年 仅剩165天 腾讯设计Agent平台Miora全面开放了,腾讯系这个AI的打法,和以前好像,全方面进攻啊,Miora你去试试不? 一起看看消息 polo的AI日报 7月23日,14条精选 ⬇️ 1. Alphabet Q2财报亮眼,营收涨24%,Google Cloud暴涨82%。Gemini月活冲到9.5亿,模型API处理量飙到220亿token每分钟,已被90%财富100强企业使用。 💡AI业务正在成为Alphabet的第二增长引擎 2. Anthropic给图书作者赔了15亿美元,联邦法院批准,涉及48万多部作品每部约3000美元。法官认为合法获取的书上训练AI算变革性合理使用,但大规模抓网内容合法性未定。 💡每本书赔3000美元,48万部作品合计15亿,产权问题是大问题,但是ai就像人脑一样,我记住了理解了你还要收我的版权费吗? 3. GigaToken发布全新语言模型分词器,在AMD 144核CPU上对GPT-2分词速度达24.53 GB/s,是HuggingFace Tokenizers的989倍。 4. 微软把MagenticLite全家桶全面开源,MagenticBrain和Fara 1.5权重上架Hugging Face,应用测试工具全栈模型一个不落。 💡微软把全套Agent工具链扔进开源社区 5. DAIR的Elvis Saravia提出用任务替代提示词作为交互单元,把语音、屏幕、文本、标注等多模态信息一次性喂给智能体。 6. Anthropic给Claude加了经济指数连接器,用户可直接问哪些职业用AI最多,答案基于真实数据,数据集免费开放。 💡Claude变身经济分析师 7. OpenAI准备在佐治亚州砸200亿美元建超大规模数据中心,配套3.2吉瓦电力,2028年起投用,满负荷总成本或超300亿。同时将2030年算力支出预期从6000亿上调至近7500亿。 💡OpenAI在赌未来五年的算力需求根本停不下来 8. AMD宣布向Anthropic投资50亿美元,换取Anthropic采购2GW的AMD MI455及未来GPU。 💡GPU军备竞赛进入交叉持股阶段,好熟悉的感觉 9. Qwen-Image-3.0实测出炉,19个场景挑战GPT Image2,中文长文本不崩、多语言混排稳、多图融合和图片编辑能力在线,国内速度快价格不贵。 💡中文场景下Qwen-Image-3.0比GPT Image2更稳 10. 小红书技术团队开源BigMac,多模态大模型训练新范式,以LLM流水线为主干嵌套编码器和生成器,比基线快1.08到1.9倍,已是dots多模态模型核心组件。 💡小红书开源了自家训练多模态模型的底层框架,你开源我开源,你不开源,我还是开源,这是什么打法 11. 腾讯设计Agent平台Miora全面开放免邀请码,覆盖品牌设计、影视创意等五大场景,支持自定义多模态模型和Agent推理深度,内置Skill市场和记忆系统。 💡腾讯把设计Agent从邀请制直接推到全民开放 12. Cursor发布智能模型路由系统Cursor Router,自动把每个编码请求分给最合适的模型。Auto模式满意度接近Fable同时成本降60%,Balance模式满意度超Opus 4.8成本降36%。 💡Cursor Router自动帮你分任务 13. OpenRouter新增音频转写API,支持Whisper等STT模型,一个API key搞定,base64音频丢过去返回JSON文本。 14. OpenAI自曝AI模型在安全测试中突破沙盒越狱,利用零日漏洞入侵HuggingFace基础设施偷凭证。HuggingFace在7月16日披露,称入侵由自主AI智能体系统实施。 💡这件事的严重程度比HuggingFace被黑本身大得多 #AI# #开源# #人工智能#
显示更多
0
27
27
1
转发到社区