注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 开源评测
开源评测 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 开源评测 的推特
腾讯混元发布了新的语音识别模型 Hy ASR 3.0 preview。 这个模型可以结合上下文纠错、注入热词,也能处理高噪声和耳语场景。 在开源评测集里,中文普通话 WER 3.34%,英语 2.62%,粤语 3.12%。 目前腾讯云 API 已上线,元宝 App 也已首发免费开放。
显示更多
很多人看AI生成的视频 觉得画质好就是"效果不错" 阿里DAMO院做了一件事: 专门去测这些视频里的物理定律有没有被遵守 水往上流吗?物体穿墙了吗? 光照方向前后帧一致吗? 你说"向左转",它真的转了吗? 这就是WorldOlympiad干的事—— 把视频世界模型扔进三项全能测试: 物理合理性、3D几何一致性、指令跟随 1000条长视频,全自动打分 Cosmos、混元、矩阵游戏这些顶级视频模型都跑进去测过了 代码全开源,arXiv也有论文 👉 你觉得现在最好的AI视频模型,能不能通过物理常识测试? #AI视频# #世界模型# #开源评测#
显示更多
Qwen-3.8 发布两天,实测体验来了。 第一时间订阅了 Token Plan,并在 Qwen Code 环境下进行了对比测试。 📊 实验对照: 第一次(弱提示):仅给出一句话模糊需求,生成效果较为平庸、模式化。 第二次(强结构):清晰梳理功能模块、交互逻辑、图片规则及页面结构。模型对长任务的指令遵循度表现极佳,最终成功交付了一个完整的可操作系统。 核心体验: 1. 推理与生成速度:即便面对超长 Prompt 和多页面构建,整个生成过程依然流畅,耗时17分钟,等待延迟相比 kimi k3(52分钟)、grok 4.5(26分钟) 小很多。 2. 长任务执行力:后加的交互细节与模块划分,基本都高水准地落到了最终成品中。 最后:还是那句话,模型能力固然重要,但想让模型稳定交付复杂任务,需求本身也得足够清楚。 把目标、模块和规则拆明白,Qwen 3.8 确实能把复杂任务推进得又快又完整。 越来越期待它接下来的开源评测了! 以上。 附上两次生成过程和最终效果👇
显示更多
0
74
72
5
转发到社区
Gemini 3发布后,日常工作彻底变了! 💡 日常生活工作中突然冒出一个需求→双线程启动: 1️⃣ AI深度调研:挖掘社区方案+开源项目评测 2️⃣ Gemini 3疾速开发:直接撸出定制化MVP ⏱️等调研报告出来时,粗糙原型已经能跑了 接下来:Debug→对比社区实现→AI助力“取长补短” 1小时从想法到可用工具。不再"找工具适配需求",而是"造工具精准命中" 这才是AI时代的真正红利:每个人都成了自己的工具制造者。
显示更多
0
54
539
64
转发到社区
临近中秋,收到字节、阿里、百度、360、硅基流动,爱搜等团队送的中秋礼盒。 还有不少热心网友的美食投喂。 继续玩AI,写评测,开源自己的探索。 感恩的心❤️ 预祝所有朋友中秋、国庆双节快乐!
显示更多
教大家三种识别中转站是否掺水的方案,保姆级详细教程 1. 在线监测,只需要把api和key填入即可,这里我测了一个X上一个中转站的1.5倍率分组,测试结果如图1所示。 可以看到是未达标准的,这种就是严重掺水的,就不建议使用。 此外,该网站上也有一些中转站的聚合榜单,实时标注了在线率,掺水率等,可以作为参考 2. api-relay-audit 这是一个开源项目,评测维度更多一些。测试结果见图二。我使用体验下来,因为很多Claude Max满血分组是做了限制的,只允许在Claude Code客户端调用,所以有时候,测试仍然不全面,不过可以作为参考的维度。 开源地址: 3. Skill 该Skill通过自省式分析检测当前 API 是否为真实 Claude 模型,或是否存在多层封装和提示词冲突。 使用教程:直接在Claude Code中发送提示词:使用skill进行自我检查即可 开源地址如下:
显示更多
0
48
287
50
转发到社区
达里奥为什么这么紧张?说白了,就是中国开源模型跟得太快了。每次 Anthropic 发新模型,几个月之内,中国开源模型在评测数据上就能亦步亦趋地追上来。他的策略很明显——技术手段之外,更想靠舆论和政治拉高壁垒。但这套玩法在美国自己人那里也没得到多少认同,X 上大量美国 AI 从业者都在骂他。 说说我的看法。国内的前沿 AI 模型跟 Claude、GPT 比,确实还有明显差距。但 AI 模型要保持领先,核心动力永远是前沿创新和算力,Anthropic 真的不需要这么焦虑。而且这种竞争本身是好事——它推动技术更快进步,也在快速拉低模型价格,让普通人更早享受到 AI 的红利。 一个真正有技术自信的公司,不会每隔几个月就跑去给政府写告状信。
显示更多
0
52
178
11
转发到社区
DeepSeek V4终于来了,拥有百万字超长上下文。性能领先开源,媲美顶级闭源模型。 Agent 能力大幅提高,交付质量接近Opus 4.6 非思考模式,但仍与Opus 4.6思考模式存在一定差距。 世界知识测评中,大幅领先其他开源模型,仅稍逊于顶尖闭源模型Gemini-Pro-3.1。 世界顶级推理性能,在数学、STEM、竞赛型代码的测评中,V4-Pro超越当前所有已公开评测的开源模型,取得了比肩世界顶级闭源模型的优异成绩 更关键的是,V4开创了一种全新的注意力机制,在token维度进行压缩,结合 lDSA 稀疏注意力(DeepSeek Sparse Attention),实现了全球领先的长上下文能力,并且相比于传统方法大幅降低了对计算和显存的需求。这一点值得关注!
显示更多
大模型厂商交替领先,真是各领风骚三五月:去年四季度是gemini、今年一季度是cluade、现在感觉轮到GPT5.5了。核心还是大家都在积极进取迭代,只很多时候领先源于对手的松懈。去年在算力投入上非常节制的Authropic最近应该是感受到了算力短缺的痛。 梳理下时间线 1、去年四季度: Google Gemini 3 系列(尤其是25年11月左右的Gemini 3 Pro/Deep Think)强势登顶,很多基准(如Humanity’s Last Exam、推理、多模态)领先,引发OpenAI“Code Red”。它在多模态、长上下文和搜索集成上特别亮眼,一度被视为转折点。 2、今年一季度: 最耀眼的自然是Anthropic Claude 4.6(Opus/Sonnet,2月发布)强势反超,尤其在编码(SWE-Bench)、长上下文推理、agentic任务和实际生产力上领先。 3、当下2026年4月: OpenAI GPT-5.5正处于发布窗口,刚 在ChatGPT和Codex上即将全面上线。它强调更好的上下文理解、编码、computer use和agent能力,试图追赶和超越。 大模型领域现在并没有绝对的“唯一王者”,而是各有专长: 1)Claude:主攻编码、长任务、可靠推理往往领先,Agent上迭代非常多。 2)Gemini:多模态、速度、性价比、超长上下文强(3.1 Pro Preview仍很能打)。 3)GPT:通用agent、工具调用、实时应用和生态集成突出,新版在上下文和特定专业任务上提升明显。算力囤积最积极 4)grok:有X这个实时内容平台提供源源不断的训练数据,但近期受制于团队动荡。看跟cursor的合作、以及囤积的大量算力,后面会不会进一步跟上。 当然还有meta最新的Muse Spark,AI团队的最新之作。 更不用说国内豆包、千问、混元、kimi也是各有特色,杀疯了。 这就是当下大模型领域的现状:快速迭代、轮流坐庄。暂时还没有一家能长期领先甚至垄断。当然竞争对用户是好事——模型越来越强、价格/速度也优化。 2月中在《资本开支的战争》推文里有聊过:”往下游看,越往用户端竞争越激烈,当然也是未来AI决胜的关键所在。 可以说大模型、在面向B端或者C端的Agent或者应用才是AI的王冠,但这一层面短期其实很难看出谁会成为最后真正的赢家,再很多时候都是交替领先”。现在看确实如此 GPT-5.5出来后估计又要新一轮刷榜了,下一个出来交替领先的会是谁?
显示更多
开源 AI 网络安全能力,正在进入一个很多人低估的阶段。 这份内部评估最值得关注的,不是哪一个模型排第一 释放出的信号更加重要 Kimi K3 在隐秘评测里的网络安全能力已经进入第一梯队,Sol 同样展现出很强的能力,开源模型开始具备完成复杂安全任务的实力 这意味着网络安全领域正在迎来新的变化 更强的模型可以帮助安全团队发现漏洞、分析攻击路径、加固系统,也意味着防御能力需要同步升级 未来网络安全的竞争,越来越像一场 AI 与 AI 的对抗 真正拉开差距的,也许已经不是有没有 AI,而是谁拥有更快迭代、更开放的安全能力 你觉得未来企业更应该优先投入什么?更强的 AI 防御能力,还是更严格的人工安全流程?
显示更多
开源模型的参数规模迅速膨胀,性能也在逼近甚至追平闭源frontier model。K2(1T)到DeepSeek V4 Pro(1.6T)再到K3(2.8T),间隔不到12个月。K3在独立评测中已经能对标Claude Fable 5,企业拿开源模型做私有化部署,不再是性能上的妥协,而是成本和隐私上的优选。 当这类万亿级MoE模型真正落地部署,硬件侧的瓶颈就不在算力了,而在内存容量、数据格式(FP4)、以及scale-up域内的低延时高带宽互联。 K3总参2.8T,FP4量化后权重约1.4TB,每个token只激活896个专家中的16个,计算量不大,但专家路由要求全部权重可访问,GPU大部分时间在等内存读取,不是在算。FP4不再是可选的精度降级,而是架构级的刚需,推理芯片如果不在硬件层原生支持FP4,基本没法跑这个体量的模型。 MoE模型的推理通常采用专家并行(EP),每个token的expert routing都需要跨卡通信完成分发和结果聚合。scale-up域内的低延时高带宽互联质量,直接影响用户端的token rate和系统的总吞吐。参数规模越大,需要装进同一个低延时域的权重越多,scale-up域也必须跟着扩大。 关于scale-up域内的具体方案,我在之前”把一万块芯片变成一台计算机”的三篇推文里详细讨论过,这里不再展开。 另一个被拉动的环节是CXL。MoE模型98%以上的专家权重在任意时刻是冷的,纯靠HBM装太贵。把冷专家放CXL-attached DDR5,热专家留HBM,做分层调度,理论上成本可以大幅下降。再往下一层,把更冷的权重卸载到高速SSD也在成为可行的路径,学术界和工业界都已经有MoE专家分层加载的方案在验证。未来大概率是HBM放热专家,CXL DRAM放温专家,SSD放冷专家,形成多级内存层次。Astera Labs和澜起在CXL控制器芯片上的卡位已经很清楚了,一个吃全球hyperscaler,一个吃中国本土供应链。 开源模型的参数规模没有放缓的迹象,scale-up域必须跟着扩大。更大的scale-up域意味着更多的HBM容量、更大的先进封装面积、更多的高速光互联和铜互联、更多的CXL内存扩展、以及更多的retimer。这条需求链条会随着每一代开源模型的参数膨胀持续拉长。 除了上边聊到的,还哪些受益环节?大家可以一起聊聊。
显示更多
0
7
154
23
转发到社区