注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 全模态模型
全模态模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 全模态模型 的推特
【腾讯合并混元多模态和大语言模型部门 姚顺雨带队】7月23日下午,腾讯宣布合并两个模型团队:整合混元多模态模型部门与大语言模型部门,成立基础模型部,统一由腾讯首席AI科学家姚顺雨管理。腾讯称,这是为了进一步提升模型研发和协同效率,探索全模态模型的智能上限。
显示更多
0
20
17
3
转发到社区
📢 小米 MiMo 系列模型现已登陆 API! 🔸 MiMo-V2.5:310B 稀疏 MoE 原生全模态模型,支持图文音视频全模态输入与 1M 上下文,专为多模态 Agent 与通用编程打造。 🔸 MiMo-V2.5-Pro:1.02T 稀疏 MoE 旗舰文本模型,专攻复杂推理与长周期软件工程,SWE-Bench Verified 达 78.9。 现已开放两款模型的 API 调用,提供官方组接入和 自选服务商 4 折 优惠。 立即接入体验:
显示更多
0
19
27
9
转发到社区
📢 模型权益更新 自 2026 年 9 月 3 日 17:00(SGT)起,DeepSeek V4 Flash 与 DeepSeek V4 Flash Vision Exp 将结束免费体验,开启 5 折优惠计费。在此之前,两款模型仍可免费使用,抓住最后的免费窗口 🔥 同时, 将在同步 DeepSeek 官方峰谷定价机制的基础上实施折扣优惠: 🔹高峰时段(工作日 09:00–12:00、14:00–18:00 SGT):官方原价 5 折 🔹空闲时段(工作日其余时段及周末全天):高峰价格再 5 折,即官方原价 2.5 折 💡 想继续免费?首推 GLM 5.3 Flash 此前爆火的神秘模型 Ox Alpha 正式揭晓为 GLM 5.3 Flash!作为 GLM 5 系列首款原生全模态模型,拥有 320B 总参数 / 18B 激活参数,支持 1M 上下文,兼具强大推理与极速响应,是高频调用的优选免费模型。 此外,Qwen3.8 Flash、Hy3、MiMo V2.5 也将继续免费开放。 将持续优化模型供给与价格结构,为您提供更多高性能、高性价比的 AI 模型选择。感谢大家的支持和关注!
显示更多
上个月,那个把文本、图像、视频全模态模型 API 无限期免费开放的 Agnes AI。 一度爆火,至今都还有很多人在白嫖。 今天在 Artificial Analysis 榜单上,看到了它家有个新模型 Agnes 2.5 Pro Alpha 在打榜。 了解了下这次 2.5 Pro Alpha 模型,在复杂推理、专业开发和 Agent 任务等方面,都有不少提升。 同时也支持到 1M 超长上下文窗口,对于开发大型项目、处理长文档等场景来说超有用。 另外我发现它的基础模型已迭代到 Agnes-2.5-Flash,依然还是不限期免费。 开发者可以通过API直接调用,文本之外,Agnes的图像和视频模型也依然免费开放。 拿Agnes-2.5-Flash处理一些日常开发任务已经够用了,感兴趣的朋友可以通过新官网查看模型和调用方式。 官网:
显示更多
Kimi K3终于把国产大模型塞进世界第一梯队。 Kimi K3的实力区间:第一次插进国外模型腹地。真实水平在Claude 4.8到5.0之间,比GPT和Claude略弱但强过Gemini 3.5 Flash和Grok 4.5。关键是它是全模态模型——能读图、能读文字、能读代码。这是中国模型首次在"御三家"的腹地里抢到一个位置,之前智谱GLM 5.2虽然也不错,但是纯文本模型,不能computer use。而Kimi K3可以直接绑定Codex控制电脑,并且便宜还不封号——这瞬间就让被Claude封号的用户狂欢了。 预训练已死?Kimi K3打脸了所有人。 李开复说过"预训练已死",但Kimi K3是从头做的预训练,而非常规的后训练微调。更恐怖的是,据传40%的训练用的是国产显卡——虽然6成还是外国的,但已经是里程碑式的跨越。这意味着预训练浪潮可能会重来,国内AI训练师、数据标注的需求缺口会重新被打开,之前转到产品经理的同学可以考虑"杀回来"。 #KIMI# #AI大模型# #人工智能# #水球泡# #国产大模型#
显示更多
究极"拼好模"出现了! 字节跳动 Lance! 字节跳动刚发布了一个开源模型 Lance, 激活参数量只有 3B. 但是这个模型可以接受文本, 图片, 视频输入, 然后同时可以输出文本, 图片, 视频! 所以这一个模型就能完成像图片理解, 视频理解, 文生图, 图生图, 图片编辑, 文生视频, 图生视频, 视频编辑等任务. 而训练团队在技术报告中透露, 训练成本仅仅是 128 涨 A100 显卡 (按照大厂算力来说纯纯是把冗余算力拿来用了). 那为啥说是"拼好模"呢? 原因是团队并没有完全从0造轮子. 模型的视觉输入模块直接用了 Qwen2.5-VL-ViT (用来看图和视频), 而视觉输出模块是 Wan2.2_VAE (用来画画). 而模型本体是两个: Lance_3B (用来做图片的理解、生成或编辑任务) Lance_3B_Video (用来做视频相关的任务, 比如文生视频、图生视频) 所以, 这完全是一个研究性项目了, 而项目本身的亮点其实恰好是"拼得好". 这个模型不像之前许多自称为全能模型那样直接把大语言模型 (LLM) 和扩散模型 (Diffusion) 硬拼接在一起 (即所谓的 Pipeline 方案) . 而是在一个共享的交错序列 (Interleaved sequence) 中同时处理文本、图像和视频的上下文. 这样做最大的好处是统一了语义空间, 让模型的理解能力和性能更好. (从评测来看3B就接近了许多10B甚至20B模型的水平) 另外还引入了多任务协同. 简单来讲, 理解任务 (图片转向量) 和生成任务 (向量转图片) 在模型内部本身是互斥的. Lance 创新性地在同一个框架内加入了专用专家模块, 成功缓解了这种冲突, 让模型既能做 VQA (视觉问答) , 又能做图像/视频生成和编辑. 期待一波实际应用落地, 这个模型对于端侧和多模态 Agent 来讲意义是重大的, 有很多之前需要多个模型协作的场景都能用单个模型做了. #lance# #全模态模型#
显示更多
0
11
181
18
转发到社区
MiniMax新模型 MiniMax-H3 开源后,在 的 Video 排行榜上,成为「开放模型」第一名 MiniMax 把一个接近SOTA(最强水平)的全模态视频模型直接开源了,并且在真实用户投票的Arena榜单上立刻证明了实力,很多人已经在本地跑它、做各种创意视频了。 MiniMax 在7月31日先发布了 MiniMax-H3(也叫 Hailuo 系列最新版)。这是一款全模态视频生成模型,能同时理解文字、图片、视频、音频,然后一次性生成最长15秒、最高2K分辨率、带原生立体声音的视频。 8月3日,他们把模型权重正式公开到了 Hugging Face,任何人都可以下载本地运行。 结果出来后:图像到视频(Image-to-Video):MiniMax-H3 得了 1476分,只比第一名 Dreamina Seedance-2.0(字节跳动)的1478分低2分,并列整体第一。 文本到视频(Text-to-Video):得了 1455分,只比第三名 Muse Video 低3分,并列整体第三。 在所有开放模型里,它是稳稳的第一,比第二名开源模型 hunyuan-video-1.5 高出约280分。 它比 MiniMax 自己以前的老模型(Hailuo-2.3 和 Hailuo-02-pro)进步巨大——那些老模型当时还排在20多名,分数只有1190多分。 这意味着开源视频生成领域突然出现了一个能接近甚至追平顶尖闭源模型的选手。
显示更多
我们的自建AI模型API聚合平台终于上线了!!! 1. 1 key调用全模态AI模型,覆盖文本,图像,音频,视频 2. 原厂直连,非中转 3. 全球加速,海外模型访问稳定,不用自建代理 4. 统一管理,账单/用量/权限 一站式控制台 5. 同时支持多key管理 ,可按团队/项目拆分 具体折扣信息,请联系 Telegram:@dianmircloud #token# #词元# #claude# #openai# #chatgpt# #模型调用# #大模型#
显示更多
小米今天正式发布了MiMo-V2系列旗舰模型,包括 1.MiMo-V2-Pro:总参数超1T(激活42B),专为Agent场景优化,支持1M超长上下文,全球Artificial Analysis排行榜第8、国内第2。 2.MiMo-V2-Omni:全模态基座模型(文本+图像+视频+音频理解),音频理解能力超Gemini 3 Pro。 3.MiMo-V2-TTS:端到端语音合成模型,支持高保真、多语种、自然情感表达。 (ai语音说话) 相关链接 官方API开放平台(接入、定价、文档): (MiMo-V2-Pro API定价:256K内输入$1/百万tokens、输出$3;1M内输入$2、输出$6。注册后可立即获取Key。) 在线体验平台(MiMo Studio,含MiMo Claw Agent演示,直接免费试用MiMo-V2-Pro的Agent能力): (推荐从这里开始玩,网页端就能体验“养龙虾”式的复杂任务,比如自动生成网站、操控工具等。) 初步评测: Artificial Analysis排行榜:MiMo-V2-Pro全球第8(综合智能指数),国内第二 (强调性价比最高之一,尤其在< $0.15/百万tokens价位段霸榜。) OpenClaw标准评测(PinchBench & ClawEval):MiMo-V2-Pro排名全球顶尖(第三,仅次Claude Sonnet 4.6和Opus 4.6)。在无人工干预下,能完成复杂工作流编排、长程规划、精准工具调用。 1M上下文下支撑真实高强度龙虾应用;早期匿名版“Hunter Alpha”在OpenRouter调用量超1T tokens,多日登顶日榜。 作如何和OpenClaw结合? MiMo-V2-Pro就是专为OpenClaw这类Agent框架深度优化的! 小米官方已宣布联合OpenClaw、OpenCode、KiloCode、Blackbox、Cline五大框架团队,提供一周限时免费接口支持(全球开发者都能白嫖)。结合方式:直接用MiMo API替换Claude/OpenAI Key(兼容OpenAI SDK格式),在OpenClaw的Scaffold(脚手架)里接入即可。 模型针对OpenClaw等框架做了深度SFT + RL强化,工具调用、多步推理、长程规划特别稳。 实际表现:在OpenClaw里能一步生成完整网页、自主处理报错/多标签切换、完成选品比价下单、制作短视频等复杂链路,像真人操作浏览器。 小米自己的扩展:他们还出了Xiaomi miclaw(手机端类OpenClaw系统级Agent),基于MiMo系列,能直接“动手操作手机”。 快速上手建议:去 Claw(内置OpenClaw式演示); 或直接在OpenClaw项目里换API Base为
显示更多
🎁 免费福利再加码!小米 MiMo-V2.5 现已开启全量免费! 作为小米开源的原生全模态旗舰模型,MiMo-V2.5 采用 310B 稀疏 MoE 架构,支持文本、图像、视频与音频全模态输入,具备 1M 超长上下文与极速响应能力,专为多模态 Agent、音视频分析及通用编程等实战场景打造。 现已在 API 官方组开启全量免费调用,0 成本即可解锁小米前沿全模态大模型的硬核实力! 👉 立即免费体验:
显示更多
0
11
52
7
转发到社区