註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 全模态模型
全模态模型 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 全模态模型 的搜尋結果
【腾讯合并混元多模态和大语言模型部门 姚顺雨带队】7月23日下午,腾讯宣布合并两个模型团队:整合混元多模态模型部门与大语言模型部门,成立基础模型部,统一由腾讯首席AI科学家姚顺雨管理。腾讯称,这是为了进一步提升模型研发和协同效率,探索全模态模型的智能上限。
顯示更多
0
20
17
3
轉發到社區
上个月,那个把文本、图像、视频全模态模型 API 无限期免费开放的 Agnes AI。 一度爆火,至今都还有很多人在白嫖。 今天在 Artificial Analysis 榜单上,看到了它家有个新模型 Agnes 2.5 Pro Alpha 在打榜。 了解了下这次 2.5 Pro Alpha 模型,在复杂推理、专业开发和 Agent 任务等方面,都有不少提升。 同时也支持到 1M 超长上下文窗口,对于开发大型项目、处理长文档等场景来说超有用。 另外我发现它的基础模型已迭代到 Agnes-2.5-Flash,依然还是不限期免费。 开发者可以通过API直接调用,文本之外,Agnes的图像和视频模型也依然免费开放。 拿Agnes-2.5-Flash处理一些日常开发任务已经够用了,感兴趣的朋友可以通过新官网查看模型和调用方式。 官网:
顯示更多
Kimi K3终于把国产大模型塞进世界第一梯队。 Kimi K3的实力区间:第一次插进国外模型腹地。真实水平在Claude 4.8到5.0之间,比GPT和Claude略弱但强过Gemini 3.5 Flash和Grok 4.5。关键是它是全模态模型——能读图、能读文字、能读代码。这是中国模型首次在"御三家"的腹地里抢到一个位置,之前智谱GLM 5.2虽然也不错,但是纯文本模型,不能computer use。而Kimi K3可以直接绑定Codex控制电脑,并且便宜还不封号——这瞬间就让被Claude封号的用户狂欢了。 预训练已死?Kimi K3打脸了所有人。 李开复说过"预训练已死",但Kimi K3是从头做的预训练,而非常规的后训练微调。更恐怖的是,据传40%的训练用的是国产显卡——虽然6成还是外国的,但已经是里程碑式的跨越。这意味着预训练浪潮可能会重来,国内AI训练师、数据标注的需求缺口会重新被打开,之前转到产品经理的同学可以考虑"杀回来"。 #KIMI# #AI大模型# #人工智能# #水球泡# #国产大模型#
顯示更多
究极"拼好模"出现了! 字节跳动 Lance! 字节跳动刚发布了一个开源模型 Lance, 激活参数量只有 3B. 但是这个模型可以接受文本, 图片, 视频输入, 然后同时可以输出文本, 图片, 视频! 所以这一个模型就能完成像图片理解, 视频理解, 文生图, 图生图, 图片编辑, 文生视频, 图生视频, 视频编辑等任务. 而训练团队在技术报告中透露, 训练成本仅仅是 128 涨 A100 显卡 (按照大厂算力来说纯纯是把冗余算力拿来用了). 那为啥说是"拼好模"呢? 原因是团队并没有完全从0造轮子. 模型的视觉输入模块直接用了 Qwen2.5-VL-ViT (用来看图和视频), 而视觉输出模块是 Wan2.2_VAE (用来画画). 而模型本体是两个: Lance_3B (用来做图片的理解、生成或编辑任务) Lance_3B_Video (用来做视频相关的任务, 比如文生视频、图生视频) 所以, 这完全是一个研究性项目了, 而项目本身的亮点其实恰好是"拼得好". 这个模型不像之前许多自称为全能模型那样直接把大语言模型 (LLM) 和扩散模型 (Diffusion) 硬拼接在一起 (即所谓的 Pipeline 方案) . 而是在一个共享的交错序列 (Interleaved sequence) 中同时处理文本、图像和视频的上下文. 这样做最大的好处是统一了语义空间, 让模型的理解能力和性能更好. (从评测来看3B就接近了许多10B甚至20B模型的水平) 另外还引入了多任务协同. 简单来讲, 理解任务 (图片转向量) 和生成任务 (向量转图片) 在模型内部本身是互斥的. Lance 创新性地在同一个框架内加入了专用专家模块, 成功缓解了这种冲突, 让模型既能做 VQA (视觉问答) , 又能做图像/视频生成和编辑. 期待一波实际应用落地, 这个模型对于端侧和多模态 Agent 来讲意义是重大的, 有很多之前需要多个模型协作的场景都能用单个模型做了. #lance# #全模态模型#
顯示更多
0
11
181
18
轉發到社區
MiniMax新模型 MiniMax-H3 开源后,在 的 Video 排行榜上,成为「开放模型」第一名 MiniMax 把一个接近SOTA(最强水平)的全模态视频模型直接开源了,并且在真实用户投票的Arena榜单上立刻证明了实力,很多人已经在本地跑它、做各种创意视频了。 MiniMax 在7月31日先发布了 MiniMax-H3(也叫 Hailuo 系列最新版)。这是一款全模态视频生成模型,能同时理解文字、图片、视频、音频,然后一次性生成最长15秒、最高2K分辨率、带原生立体声音的视频。 8月3日,他们把模型权重正式公开到了 Hugging Face,任何人都可以下载本地运行。 结果出来后:图像到视频(Image-to-Video):MiniMax-H3 得了 1476分,只比第一名 Dreamina Seedance-2.0(字节跳动)的1478分低2分,并列整体第一。 文本到视频(Text-to-Video):得了 1455分,只比第三名 Muse Video 低3分,并列整体第三。 在所有开放模型里,它是稳稳的第一,比第二名开源模型 hunyuan-video-1.5 高出约280分。 它比 MiniMax 自己以前的老模型(Hailuo-2.3 和 Hailuo-02-pro)进步巨大——那些老模型当时还排在20多名,分数只有1190多分。 这意味着开源视频生成领域突然出现了一个能接近甚至追平顶尖闭源模型的选手。
顯示更多
我们的自建AI模型API聚合平台终于上线了!!! 1. 1 key调用全模态AI模型,覆盖文本,图像,音频,视频 2. 原厂直连,非中转 3. 全球加速,海外模型访问稳定,不用自建代理 4. 统一管理,账单/用量/权限 一站式控制台 5. 同时支持多key管理 ,可按团队/项目拆分 具体折扣信息,请联系 Telegram:@dianmircloud #token# #词元# #claude# #openai# #chatgpt# #模型调用# #大模型#
顯示更多
小米今天正式发布了MiMo-V2系列旗舰模型,包括 1.MiMo-V2-Pro:总参数超1T(激活42B),专为Agent场景优化,支持1M超长上下文,全球Artificial Analysis排行榜第8、国内第2。 2.MiMo-V2-Omni:全模态基座模型(文本+图像+视频+音频理解),音频理解能力超Gemini 3 Pro。 3.MiMo-V2-TTS:端到端语音合成模型,支持高保真、多语种、自然情感表达。 (ai语音说话) 相关链接 官方API开放平台(接入、定价、文档): (MiMo-V2-Pro API定价:256K内输入$1/百万tokens、输出$3;1M内输入$2、输出$6。注册后可立即获取Key。) 在线体验平台(MiMo Studio,含MiMo Claw Agent演示,直接免费试用MiMo-V2-Pro的Agent能力): (推荐从这里开始玩,网页端就能体验“养龙虾”式的复杂任务,比如自动生成网站、操控工具等。) 初步评测: Artificial Analysis排行榜:MiMo-V2-Pro全球第8(综合智能指数),国内第二 (强调性价比最高之一,尤其在< $0.15/百万tokens价位段霸榜。) OpenClaw标准评测(PinchBench & ClawEval):MiMo-V2-Pro排名全球顶尖(第三,仅次Claude Sonnet 4.6和Opus 4.6)。在无人工干预下,能完成复杂工作流编排、长程规划、精准工具调用。 1M上下文下支撑真实高强度龙虾应用;早期匿名版“Hunter Alpha”在OpenRouter调用量超1T tokens,多日登顶日榜。 作如何和OpenClaw结合? MiMo-V2-Pro就是专为OpenClaw这类Agent框架深度优化的! 小米官方已宣布联合OpenClaw、OpenCode、KiloCode、Blackbox、Cline五大框架团队,提供一周限时免费接口支持(全球开发者都能白嫖)。结合方式:直接用MiMo API替换Claude/OpenAI Key(兼容OpenAI SDK格式),在OpenClaw的Scaffold(脚手架)里接入即可。 模型针对OpenClaw等框架做了深度SFT + RL强化,工具调用、多步推理、长程规划特别稳。 实际表现:在OpenClaw里能一步生成完整网页、自主处理报错/多标签切换、完成选品比价下单、制作短视频等复杂链路,像真人操作浏览器。 小米自己的扩展:他们还出了Xiaomi miclaw(手机端类OpenClaw系统级Agent),基于MiMo系列,能直接“动手操作手机”。 快速上手建议:去 Claw(内置OpenClaw式演示); 或直接在OpenClaw项目里换API Base为
顯示更多
Deepseek 的多模态模型全量了。 目前可以在网页版的识图模式尝试,看起来是一个单独的多模态模型
0
30
55
0
轉發到社區
昨天收到 DeepSeek涨价 今天看到GPT-5.6 Luna免费调用了 真搞不懂DeepSeek为什么涨价 大家期待的7月中旬出新模型 都期待你能吊打所有模型 出全模态 这都8月了也没有什么炸裂的模型出来 反而开始涨价了
顯示更多
阿里前几天刚发季报,破天荒的第一次披露了模型与应用服务——其实就是MaaS——的经常性年化收入: 截至今年3月超过80亿人民币,预计6月达到100亿,年底突破300亿。 相当于半年3.75x的增长速度,大概也是基于如此乐观的势头,阿里才会难得的公布这个数字,向资本市场构建叙事。 所以你以为我要开始吹阿里了?错了。 阿里的AI收入,建立在阿里云这个中国最大的云计算平台上,阿里云拥有现成的客户群体、销售网络和算力资源,用配套升级的方式去叠一层AI服务收入,是很容易的。 所以真正要吹的,不是阿里的AI业绩凭什么增长这么快,而是如果连主要靠存量用户增加预算就能做到半年3.75x的增速,那么原生AI公司今年在同样的市场环境下,增速会飙到什么地步? 要知道,原生AI公司赚的每一块钱都是从零开始、靠着模型能力兑现而来的,除了更加纯粹的增长之外,因为不必承担其他业务的成本转移,ROI的负担也更小。 比如摩根士丹利测算发现MiniMax平均每分钟进账1美金,同时成本低于0.3美金,而行业平均收入只有约0.5美元/分钟,相当于MiniMax仅凭利润就跑赢了大盘。 这就是Pure-play的价值,算清楚这笔账,对于理解走向拐点时刻的AI行业,非常重要。 在研报里,摩根大通认为中国在2026年的企业端需求,很大概率会复制美国2025年至今的来路,也就是从试点到规模化投入再到AI成为固定支出的三级跳。 简而言之,就是Anthropic的那条离谱曲线。 Anthropic创造了AI行业还是商业史上的创收奇迹,300亿美金的经常性年化收入,让它成为了全球瞩目的新王,甚至让OpenAI的股份交易在一级市场失去了吸引力。 毫无疑问,Coding是一个回报路径极其明确的赛道,根据The Information的报道,在企业级市场,Anthropic展现了空前强势的定价权,从它用按量计费替换订阅套餐,到上线导致Token费用上涨的分词器,都让企业找不到商量余地,只能拿着超标的账单去找老板加大预算。 没办法,品质和稀缺绑在一起,就是硬通货。 摩根大通也是这么判断的,在AI行业,拥有强大模型的公司某种程度上可以豁免于成本战争,而且它想进入「下沉市场」的难度,要远低于低价模型打入「高端市场」。 但Coding是一个已经实现预期的赛道,下一个大的是什么? 目前来看,几天之后的Google I/O大会非常重要,从已经被剧透的Gemini Omni来看,「All In One」的全栈模型要给多模态打翻身仗了。 那个教授在黑板上写公式讲课的片段,之所以艳惊四座,是因为它并非简单的视频生成,这个新的Gemini Omni模型同时搞对了三件事: 手持粉笔的空间关系、板书撰写的画面关系、推导过程的逻辑关系。 更直白的说,这绝对不是三个模型合在一起的结果,而是基座模型已经就在全模态信息上完成了训练,也就是,世界模型的雏形。 像是杨立昆、李飞飞这些不属于Transform派别的行业大佬,都对语言模型颇有微词,认为这条路线跑不出真正的世界模型,所以都选择了另辟蹊径,但Google、OpenAI甚至字节跳动都在证明,即使语言模型确实有局限之处,只要坚持Sc­a­l­i­ng La­ws、在同一个基座模型上训练全模态能力,同样能够渐进式的通向世界模型。 如果只看Coding的叙事,中国的原生AI公司都在扮演「一个更便宜的Anthropic」,杀成一片红海。 但在找出「一个更本土的Google」这件事情上,就会发现阿里、字节和MiniMax都在这么干,只有它们的模型迭代方向与Google完全一致:在一个系统内完成文本理解、图片生成、视频生成和音频输出。 王慧文在即刻上说,一家新兴公司的估值,是由相信它的资本定价的,不是不相信它的人定价的,「好吧,这是句废话。」 多模态的生成是语言模型理解世界的硬验证信号,且大部分底层能力与核心模型复用,多个模态并不等同于多份研发投入,有限的成本提升,能够极具经济性的帮助AI构建世界,并让每一代模型的更新不断放大效率差,并打开更高的智能上限。 我想吹的和期待看到的,其实就是这个。
顯示更多
0
8
115
18
轉發到社區