註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 混元4
混元4 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 混元4 的搜尋結果
腾讯 @TencentHunyuan HY3的正式版来了! 4 月底发布 Hy3 preview 后,混元团队在 50 多个业务中获得了广泛的反馈,修复了各种体验问题,进一步提升了后训练的质量和规模。 今天正式发布的Hy3,它展现出显著强于同尺寸模型的智能水平,并比肩更大尺寸旗舰模型的效果,大幅提升了在各类产品和生产力任务中的实用价值。 更强大的智能体能力Hy3 基于 preview 版本进一步提升了后训练数据的质量和多样性,扩大了 RL 算力规模,在推理、智能体、长上下文等任务上显著进步,取得了比肩国内外更大尺寸旗舰模型(参数规模往往是 Hy3 的 2~5 倍)的效果。 Hy3 在软件开发、办公生产、金融建模、前端设计、游戏制作等生产力任务上的进步尤其显著,可以成为高性价比的可靠选择。在内部组织的 270 位专家基于真实工作的模型盲测中,Hy3(均分 2.67 / 4)展现出优于 GLM5.1(均分 2.51 / 4)的表现,尤其在前端、数据与存储、CI/CD等类别优势显著。 我们都知道模型的实用体验不完全与榜单成绩挂钩。 所以基于广泛的用户反馈和分析,团队定位并优化了一系列体验向能力,获得了产品侧一致且积极的评价: 输出格式和工具调用稳定性:  正式版显著改善了一系列基础底线问题,确保模型在各种工具设置和输出要求下达到生产级标准,工具调用的错误恢复能力和效率大幅提升。另外,Hy3 还增强了跨脚手架泛化性,不同脚手架(如 Codebuddy、Cline、KiloCode)在 SWE Bench Verified 上的分数标准差控制在 4 个百分点以内。 知识常识和抗幻觉能力:  内生知识和外部幻觉问题相互关联,且对于真实体验至关重要。基于“有依据才回答、无依据明示缺失,多来源信息不乱拼,数据和状态不乱编”的理想态,团队进行了细粒度的数据清洗和训练约束。在基于真实产品的内部评测中,Hy3 的幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,显著改善了“张冠李戴”、无中生有、逻辑矛盾等问题。 复杂上下文承接与多轮意图保持能力:  Hy3 在 SFT 与 RL 阶段联合优化了指代消解、省略还原及多轮约束继承等业务痛点问题,内部评测的多轮问题率从  17.4% 降至 7.9% 。同时 Hy3 在长对话理解基准中取得显著跨越(如 MRCR 从 42.9% 升至 75.1%),整体输出更加精炼的同时确保复杂意图在长程交互中不衰减、不跑偏 Hy3 已以 Apache 2.0 协议在 GitHub、HuggingFace、ModelScope、GitCode开源。 得益于一系列软硬协同的优化,也进一步降低了 Hy3 在腾讯云的 API 价格及在 WorkBuddy 等产品上的使用成本,让混元模型普惠更多用户和场景。 Hy3 API 价格(每百万 Tokens) 输入1 元 输出4 元 输入(命中缓存) 】 0.25 元 从 1 月底重建基础设施,到 4 月发布 Hy3 preview,再到今天迭代升级 Hy3,团队用不到半年跑通了从底层基建到产品落地的完整研发链路。 但这只是一个起点,还有很多问题需要解决,混元的重建和进步才刚刚开始。
顯示更多
腾讯混元发布Hy4 preview,总参数770B,激活参数49B,上下文长度1M。据介绍,Hy4 preview在模型尺寸、上下文长度、数据规模上都进行了显著的扩展,预训练和后训练的共同进步带来了智能水平的又一次巨大提升,稳居开源模型第一梯队。
顯示更多
在“无人关注”的角落,腾讯混元发布了一个离线翻译模型,仅440MB。 号称用 1.8B 的参数翻译效果比 Tower-Plus-72B、 Qwen3 35B 的效果都好。 微信自带翻译不会就是这个吧?感觉翻译很快也比较准啊。🤔
顯示更多
0
54
719
72
轉發到社區
一财放了点姚顺雨的料「腾讯混元3年变形始末」,开始对外传递腾讯在大模型上的组织变化了,这是一个很明确也很有看头的信号,腾讯去年在AI上投了很多钱,但取得的成效我猜内部是不太满意的,所以要在场外做点找补。 而且自从张小龙之后腾讯也不太喜欢以人为主体来建立叙事,满打满算十年来就游戏线的马晓轶和香港帮的汤道生会出镜比较多,这次开始给一个刚入职的新人包装造势,可以说是排面拉满了,也符合AI行业小登为王的趋势。 还是给这篇文章里一些有价值的信息划划重点: - 姚顺雨27岁,是国内大模型团队里最年轻的「一号位」,他在OpenAI只工作了一年,说不上特别核心,但负责的推理模型技术,让他很适合承接从ChatBot到Agent的业务升级,腾讯重金挖他过来,也是急于让他来主导下一个Agent模型的训练; - 腾讯对大模型的反应在国内属于相对落后的那一批,所以人才储备非常薄弱,之前负责大模型业务的两个Leader都没有自然语言处理的背景,团队构成非常「不对口」,去年开始给出薪酬翻倍的条件到处挖人,字节的2-2跳来腾讯就给T12或者T13,相当于直接上涨1-2个职级,再往上T14差不多就是首席科学家了; - 人才流动主要还是在「BAT」三家里内循环,2024年是字节在从阿里撬人,2025年是腾讯开挖自己的墙脚,而年底我们又看到了字节大幅涨薪的通知,内部信里明确表示要保持待遇领先于头部水平,最新的消息是,「腾讯只看来自DeepSeek、月之暗面、字节和阿里这4家基座模型团队的候选人,其他公司是不看的」; - 马化腾对大模型存有误判,他曾打比方说,在工业革命时期,早一个月还是晚一个月把灯泡拿出来,其实没有那么重要。而腾讯错过了很多实验先机,包括浑元大模型如今有些过于路边——在大多数基准测试里,浑元连一个对比项都当不上——所以去年开始着急,很大程度上是在补落下的课; - ChatGPT出来的那一轮周期,正好叠加了腾讯在搞降本增效,对各种「不必要」的花费卡得非常死,AI Lab的员工想去参加学术会议,公司不给钱,继续想办法蹭高校的预算,而AI部门为了完成创收指标,也需要去服务游戏和广告业务,由此结算经济价值,留在基础研究上的人力很少; - 在把姚顺雨放到「一号位」之前,腾讯在大模型上的态度更接近于「调门大、行动少」,既缺少资源,也没有领头人,公司在危机意识层面依然被抖音牵制,以致于总办最关注的业务始终是视频号,而腾讯擅长的赛马机智,在大模型这种「集中力量办大事」的行业不管用了,微信也训练过自己的模型,然后还是放弃了; - 直到去年,腾讯终于开始效仿字节Seed,重新组建符合大模型研发标准的组织架构,设立更符合前沿科学原理的岗位,再去为一个个的坑找萝卜,并逐步淘汰掉旧技术线的人力,当姚顺雨空降落地之后,管理上的障碍基本上也都已经打扫干净了; - 今年会是姚顺雨的大考,他需要为腾讯训练出一个足以回到牌桌上的领先模型,只有高分答卷,才能让他坐稳在腾讯这家大厂AI一把手位置,好在前人的肩膀够多,相比GPT-4和o1时代大家都不知道怎么实现的盲目,现在的大模型行业已经少了很多「秘方」,头部模型的能力更是高度对齐,留给腾讯的时间,不多但也不少。
顯示更多
0
48
213
15
轉發到社區
📢 Hy4 Preview 现已登陆 API! 作为腾讯混元团队最新推出的 770B 稀疏 MoE 开源大模型,Hy4 Preview 每 Token 激活 49B 参数,在腾讯内部 203 项实际工程任务盲测中表现优异。 现已开放官方 API 渠道全量接入,欢迎体验! 👉 体验入口: 🔗 了解更多:
顯示更多
Grok 4.5 实测:这次终于没让我失望 xAI 前几代 Grok,发布前吹得震天响,真上手实测,拉垮得不行。所以 7 月 9 日 Grok 4.5 正式公开那天,我本来没抱什么期待。 结果这次,真有点不一样,骗你我是小狗。 我实际跑了一圈编码任务,Grok 4.5 的速度很快,编程能力稳稳站进第一梯队。还解决了 GLM 5.2 都没解决的难题,而且明显更利落。这次之所以提升这么多,背后有个关键信息,新模型是和 Cursor 一起训练的。也就是说它拿到了优质的 coding 数据,在编程场景和优质数据上打磨,定价 $2/M 输入、$6/M 输出,对海外御三家来说性价比拉满,价格高于 GLM5.2 能力比 GLM5.2 强一点。 但它也不是没短板。 第一个短板是上下文。当前只给到 50 万 token,官方说 100 万长上下文要等到下周才更新。你要处理长文档、长代码库,现在还得忍一忍。 第二个短板是中文。处理中文任务时偶尔掉链子,语句不大通顺,用来处理中文文档工作不大行。 有意思的是,几乎同一时间,腾讯的混元 hy3 也被大家翻出来讨论。两者处境很像:能力都明显追上来了,而且训练数据来源高度接近,都来自社交平台,沉淀了大量真实优质内容。 hy3 在 OpenRouter 上的限免活动属实,免费调用一直到 7 月 21 日。在腾讯自家的 IMA、WorkBuddy、元宝上也能直接体验。腾讯手里握着公众号、腾讯新闻这些优质内容源,数据底子不缺。hy3 本身是个中等规模模型,295B MoE、21B 激活参数,SWE-bench 跑到 78。体量不大,但在写文章、做文档这类中文场景上表现很突出,我用下来超过了 minimax-M3,算国内第一梯队。 把这几个信号放在一起看,结论其实很清楚,决定模型上限的,除了参数还有数据质量。 Claude 在编程上长期遥遥领先,最早就是吃到了 Cursor 早期的高质量交互数据。GLM 最早称为 Claude 平替,也是因为它最先押注 coding,数据积累从一开始就走在前面,所以编程能力一直排在国产第一梯队。这次 Grok 能追上来,也以来 Cursor 的数据一起训练的。腾讯 hy3 则既有社交平台的优质语料,又有 IMA、WorkBuddy 里独有的用户上下文,数据 + 产品这个组合,体验的优势是很明显的。 优质的数据是hy3 和 Grok 这一波模型能力追上来的真正原因。
顯示更多
0
13
21
4
轉發到社區
多数人觉得 OCR 卷到头了,无非拍照转文字。但腾讯混元刚开源的 HyOCR-1.5 跳出了这套路子——1B 参数纯视觉端到端模型,在 OmniDocBench v1.6 上以 94.74 分拿下端到端第一,推理速度还提了 6.37 倍。 传统 OCR 流水线要拼接检测、识别、版面分析多个模型,慢且重。HyOCR-1.5 一个模型端到端输出,还用了 DFlash 投机解码:并行猜测多条解码路径,快速筛最优结果,让推理大幅加速。在 Transformers 上快 6.37 倍,vLLM 快 2.14 倍,最后单页文档端到端推理只要 1.408 秒。原先处理百页要几分钟,现在半分钟搞定,成本跟着跳水。 更关键的是全栈开源。模型权重、训练代码、推理流程全部开放,没有 API 调用费,数据不离开本地。对天天要处理合同、发票、古籍的团队来说,这种又快又省还不泄露数据的方案,每月可能省出一个人力成本。 它的适用面也没局限在中英文。通过 Agentic Data Flow,HyOCR-1.5 扩展到了 331 种语言、古文字识别,还能做多图问答。128K 上下文窗口加上 4K 分辨率,长图、竖排文档都能直接处理,不用切块、不用额外对齐。 当然,开源不等于「无脑能用」。虽然 1B 参数消费级显卡就跑得动,但装环境、跑 Demo 还是需要一点技术底子。社区已经有热心人封装一键包,不过暂时不够傻瓜化;追求「上传即得结果」的朋友,可以蹲一下腾讯混元后续的云服务。 但我觉得,这款模型最大的价值不是技术指标——而是它把「高质量、低成本、全栈可控」这三件事同时装进了一个能跑在任何机器上的 1B 小模型中,让普通团队也能用上以前大厂才烧得起的 OCR 能力。开源给了杠杆,试错的门槛已经很低。 怎么踩上这个杠杆?👉 普通用户:关注腾讯混元公众号,先看技术细节,把云服务上线消息存下来。开发者:去 GitHub 搜 JevenYu/HyOCR,拉模型跑 Demo,立刻替换掉项目里那条慢速 OCR 管道。产品经理/创业者:拿几张你最痛苦的文档测一测速度、精度和成本,说不定下一个垂直文档处理工具的原型就出来了。
顯示更多
0
48
231
47
轉發到社區
《能帮你办成400多件事的AI来了,阿里开启了新纪元》1月15日,千问App深度接入支付宝政务服务与“AI付”功能,实现签证、户口等50项民生服务的“一句话办理”,还完成了跨App的服务调度与支付闭环——这不仅是中国第一款真正打通多个App的AI智能体,更印证了唯有阿里具备突破行业壁垒的生态硬实力,腾讯、字节短期内难以复制。 AI智能体的核心价值,在于打破“应用孤岛”实现自主执行,而这需要底层技术、生态资源与商业闭环的三重支撑,恰恰是阿里的独家优势。千问此次并非简单跳转链接,而是Agent级别的深度调用:用户一句“周末去杭州订高性价比行程”,即可触发飞猪查机酒、淘宝选用品、闪购备补给、支付宝完成支付的全流程协同,后台无需用户手动切换任何App,真正实现“一个智能体管理所有服务”。这种能力的背后,是阿里沉淀几十年的生态协同基因——从电商、支付到本地生活,阿里旗下各业务早已实现数据互通与接口标准化,而千问作为“超级大脑”,正是激活这一生态的关键钥匙,目前能够帮用户办理400多件事情。 反观腾讯与字节,其布局基因决定了难以突破跨App协同的核心瓶颈。腾讯的AI布局聚焦社交生态,混元大模型虽接入近700个业务,但核心围绕微信、游戏等自有场景,对外生态的开放性不足,且缺乏统一的支付与服务闭环,难以实现跨平台的无缝调度。字节跳动则主打数据驱动与多模态技术,豆包等产品虽覆盖广泛场景,但企业服务生态不完善,缺乏电商、支付等核心执行环节的支撑,更难以撬动外部政务服务资源,只能停留在“问答助手”阶段,无法落地“自主办事”的智能体能力。二者的短板本质上是生态布局的结构性缺失,短期内难以弥补。 千问的突破性,更在于攻克了智能体时代的“三道墙”:设备墙、应用墙与接口墙。通过阿里统一的技术中台与数据标准,千问实现了不同App间的协议转换与数据同步;依托支付宝的政务服务资源,打通了政府部门与商业平台的信息壁垒;凭借标准化的API网关,将各业务功能拆解为可自由调用的“乐高积木”。这种从底层基建到上层应用的全栈布局,正是阿里独有的优势——腾讯依赖外部底层技术,字节缺乏完整的服务生态,均无法构建如此全面的协同体系。 作为中国首款真正意义上的跨App AI智能体,千问的落地标志着阿里在AI竞赛中实现了维度领先。当其他巨头还在聚焦模型参数与单一场景优化时,阿里已通过生态协同,让AI从“会说话”进化为“能办事”。这不仅是技术创新的胜利,更是生态布局的必然结果——唯有阿里,能将分散的服务资源拧成一股绳,通过千问智能体交付给用户。 未来,随着更多场景接入这一生态,千问将持续拓宽智能体的能力边界。而腾讯与字节若想跟上步伐,不仅需要技术迭代,更需重构生态布局与开放理念。但至少目前,阿里千问已凭借独家生态优势,成为中国AI智能体时代的绝对领跑者,其开创的跨App协同模式,将定义未来数字服务的新范式。
顯示更多
📢 超级福利持续加码,零成本白用顶级算力! 无论新老用户,多重好礼一次领够,随时免费体验 4 大主力 AI 模型: 🔹DeepSeek V4 Flash:284B/13B 稀疏 MoE,1M 上下文,最高 384K 输出,推理能力接近 V4-Pro 🔹DeepSeek V4 Flash Vision Exp:1M 上下文,最高 384K 输出,图文混合输入,文本能力对齐 V4-Flash,多模态 Agent 接近 Opus-4.8 🔹腾讯混元 Hy3:295B/21B 稀疏 MoE,256K 上下文,快慢思考融合,推理与 Agent 比肩 2–5 倍参数旗舰模型 🔹小米 MiMo V2.5:310B/15B 稀疏 MoE,1M 上下文,最高 128K 输出,原生多模态,支持文本、图像、音频、视频输入 🎁 多重算力好礼: 🔹100 万 Credits: 新用户使用 @BinanceWallet @BitgetWallet @imTokenOfficial 登录直接领取 🔹再得 30 万 Credits:注册时填写邀请码,最高可获 130 万免费 Credits 🔹充值返赠:BNB Chain 充值享 1:1 赠送,其他方式享 1:0.5,最高额外获得 $100 🔹邀请奖励:好友注册可获 30 万 Credits,邀请人持续享受充值及订阅返利 超值福利不间断,立刻点击开启零门槛 AI 体验👇 🔗
顯示更多
帮大家总结下要点: 1. 国内预训练架构创新全球领先,但后训练数据积累落后海外约半年。 因为国内模型厂算力只有海外头部的十分之一左右,被逼出架构创新。 2. 后训练门槛比预训练低得多,核心竞争在数据质量,不在 infra。 3. 组织架构重要性超过算力储备。混元案例说明,拆掉部门墙比单纯堆人更有效。 腾讯把多模态模块从独立部门拆出来,和预训练体系合并,整体研发效率提上去了。 4. RSI 是下一个共识方向,做好 RSI 的前提是自己能训模型,现在训模型约等于造数据。 一个判断 AGI 的角度:模型能不能从零复刻自己。 如果能复刻一个超越自己的版本,RSI 就算实现了。
顯示更多
0
70
315
51
轉發到社區