註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 TogetherAI
TogetherAI 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 TogetherAI 的搜尋結果
推荐这篇公告,一个重量级的开源模型托管合作。 首个 3T 级开源模型通过美国推理基础设施向开发者开放——后续模型同步首发。 Together AI 在 7 月 29 日宣布与 Moonshot AI 达成战略合作:Together AI 成为 Kimi K3 及未来所有 Moonshot 开源模型的美国托管平台。 合作内容 • Kimi K3 已在 Together AI 上线,通过 moonshotai/Kimi-K3 端点访问 • 未来所有 Moonshot 开源模型都将在发布当天同步上线 Together • 支持微调:开发者可以用自己的数据对 Kimi 模型做后训练,同时可选择移除 MIT 许可证中的 attribution 要求 • 三层部署选项:Serverless(按量)、Provisioned Throughput(预留容量 + 99% SLA)、Dedicated Inference(专有实例) 定价 • 输入 $3.00 / 1M token(缓存 $0.30) • 输出 $15.00 / 1M token • FP4 量化推理 战略意义 Together AI 的推理栈已经为 Cursor、Y Combinator 和 Decagon 等公司的 agentic 和编程负载提供生产服务。这次合作意味着开发者可以通过一套 API 同时访问 Kimi K3、LLaMA、GLM 等所有主流开源模型,不需要为每个新模型配置新的 SDK 或账户。 Moonshot 端——Kimi K3 作为首个开源 3T 级模型,在国内已经通过 API 服务广泛部署,但美国开发者此前缺乏一个可靠的托管方案。Together AI 填补了这个空白。 原文: #KimiK3# #TogetherAI# #OpenSource#
顯示更多
推荐这篇文章,Together AI 的 ThunderAgent(ICML 2026 Spotlight)。 把 agent 工作流当成一个"程序"来调度,而非一系列无关的请求——单节点吞吐翻倍,8 节点近线性扩展。 Together AI 在 7 月 29 日发布了 ThunderAgent——一个面向 agentic 推理的高吞吐调度系统。ICML 2026 Spotlight 论文。核心贡献:把 agent workflow 抽象为"程序"而非"一系列不相关的请求"。 问题:KV Cache Thrashing Agent 工作流在两个阶段之间交替:GPU 密集的推理阶段和 GPU 空闲的等待工具返回阶段。当数百个 agent 并发运行时,各自的 KV cache 在每轮不断增长,竞争有限的 GPU 内存。 传统推理引擎(vLLM、SGLang、TensorRT-LLM)按请求级别调度——agent A 暂停等待工具调用时,它的 KV cache 被 LRU 淘汰腾出空间给 agent B 的 prefill。当 A 的工具返回,引擎必须从头重算 A 的整段对话历史,这又淘汰了 C 的 cache。高并发下,这种淘汰和重算的级联反应导致严重的吞吐量和延迟退化——论文称之为 KV cache thrashing。 能通过加 GPU 节点解决吗?不完全。现有多节点路由器(如 SGLang Gateway)把每个 agent 钉在固定节点上以保留 cache 局部性——但 agent 的上下文长度不可预测增长,某些节点被赋予长上下文 agent 导致内存耗尽,其他节点闲置。 能通过 KV cache offloading 解决吗?也解决不了。LMCache 和 HiCache 把 KV cache 卸载到 CPU 内存或磁盘,扩大了总容量但只是延迟 thrasthing。当并发 agent 的工作集超过所有存储层级时,淘汰恢复,同一个恶性循环重现。 ThunderAgent 的解法 ThunderAgent 在 agentic 客户端和推理后端之间插入一个轻量调度层。它将每个 agent 工作流抽象为一个可调度程序(program),追踪其执行阶段、KV cache 占用和节点位置。 Program-level admission control:监控每个节点的内存压力,选择性暂停低优先级工作流,减少竞争 cache 的程序数量。当被暂停的工作流准备恢复时,通过全局等待队列路由到容量最充足的节点。 多节点部署:用全局等待队列替代了基于 session 的静态节点绑定。暂停的工作流恢复时被路由到可用容量最多的节点,在 KV cache 局部性和多节点负载均衡之间取得平衡。 评测 集成在 Together AI 自己的合成数据生成管道里——就是产生 CoderForge 等数据集的那套基础设施。对比 SGLang 默认调度器: 单节点 8×H100(HiCache offloading),batch size 192: • SGLang:吞吐 390 token/s,平均延迟 65s • ThunderAgent:吞吐 803 token/s,平均延迟 10.6s 多节点(2→8 节点): • 近线性扩展,16 GPU 到 64 GPU 吞吐从 671 增长到 2248 steps/min • 加速比随集群规模增大:2 节点 1.79× → 8 节点 2.39× 使用 一个 program_id 字段,OpenAI 兼容 API,直接适配现成的 offloading 和 speculative decoding。已被 SkyRL 和 NVIDIA Dynamo 集成。 GitHub: 论文: #AgentInference# #KVcache# #ThunderAgent#
顯示更多
Claude Fable 5 是 DeepSWE 记分板上最贵的模型。Together AI 拿它跟全场最便宜的模型各跑了 452 次,给出的用法建议是反过来:贵的当后手。 《DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码与路由》 DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码和路由 要点 • 先跑 DeepSeek V4 Pro 0813,只有它失败时才升级到 Claude Fable 5。这条级联链解决 82.7% 的 DeepSWE 任务,每个任务 8.28 美元。单用 Fable 是 69.7%、每个任务 21.63 美元。高 13 个百分点,便宜 62%。 • Fable 赢第一发。pass@1 69.7% 对 62.8%,领先 7 个点。 • Pro 赢之后每一发。pass@2 打平(78.5% 对 77.1%),pass@4 领先(88.5% 对 84.1%)。 • 价格差 90 倍。每次 rollout 0.24 美元对 21.63 美元。每花 100 美元,Pro 解决 260 个任务,Fable 解决 3 个。 • 它们栽在不同的任务上。逐任务相关性只有 0.39,是我们测过的分歧最大的一对。两者合计覆盖 113 个任务中的 107 个。分歧正是路由能成立的全部理由。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 在我们对 DeepSeek V4 Pro 0813 与 Claude Fable 5 的 DeepSWE 对比中——DeepSWE 是一个跨多种任务类型和编程语言测试模型软件工程能力的基准——这两个模型坐在价格表的两端。Claude Fable 5 的每次 rollout 是 DeepSWE 全榜最贵。DeepSeek V4 Pro 0813 是最便宜的之一。Fable 首发的准确率高 7 个百分点,单次 rollout 却贵 90 倍,所以真正的问题不是哪个模型更好,而是这 90 倍的溢价到底买到了什么、什么时候值得付。 DeepSWE · 正面对决 DeepSeek V4 Pro 0813 vs Claude Fable 5 一览 • claude-fable-5 [max]:pass@1 69.7% ± 2.3%,平均成本 21.63 美元,每 100 美元解决 3 个任务,输出 token 115k,79 步 • deepseek-v4-pro-0813 [max]:pass@1 62.8% ± 3.1%,平均成本 0.24 美元,每 100 美元解决 260 个任务,输出 token 101k,146 步 我们在全部 113 个 DeepSWE 任务上,用 DeepSeek V4 Pro 0813(max)对 Claude Fable 5(max)各跑四次 trial,取自已发布的逐 trial 记录:总计 904 次 rollout(各 452 次)。Fable 是贵价的手艺人;Pro 是性价比上的异类。这两个模型的分歧也大于这套数据里的任何其他组合——结果这成了它们最有趣的地方。下文的每个数字都来自本次运行,所以可能与其他公开的 DeepSeek V4 Pro 0813 vs Claude Fable 5 记分卡有出入。 DeepSWE 记分板:pass@1 与 pass@k 单发,Fable 领先:pass@1 69.7% 对 Pro 的 62.8%(官方计分)。但这个领先很脆弱。两次尝试时 Pro 追平(78.5 对 77.1),四次尝试时 Pro 的 pass@4 88.5% 比 Fable 的 84.1% 高出 4 个多百分点。对一个贵 90 倍的模型来说,Fable 既没有守住天花板,也没有在重试下保住首发优势。更便宜的模型覆盖更广,best-of-k 也更高。 成本对比:DeepSeek V4 Pro 0813 vs Claude Fable 5 的价格 每次 rollout 0.24 美元,DeepSeek V4 Pro 0813 比 Fable(21.63 美元)便宜 90 倍:每 100 美元解决 260 个任务,Fable 只有 3 个。这是我们测过的所有组合里最宽的成本差距,Fable 也是榜单上最贵的单个配置。而且与直觉相反,低价格没有带来速度惩罚:Fable 的中位 rollout 31 分钟,Pro 35 分钟,基本持平——因为 Fable 是榜单上话最多的模型(115k 输出 token),尽管它的步数更少(79 对 146)。Pro 走的步数多;Fable 每步写得多。两个模型谁也没有明显更快。 失败模式:两个模型分别怎么错 两者在「不破坏东西」上都算自律:DeepSeek V4 Pro 0813 和 Fable 各自只在 11% 的失败里回归了现有测试套件,远低于 GPT 家族的 20%。差别在另一个方向:Fable 的大偏差失误占比是这里最高的(18% 对 Pro 的 10%),也就是说 Fable 一旦错,更常是错得离谱——给出离题很远的方案,而不是差一个边界用例。Pro 更多时候倒在离正确答案不远的地方(66% 的近似失手,对 Fable 的 57%)。所以两者都可以不加重度回归门禁就放心接入,但 Fable 的失手是调试成本更高的那种。 按任务类型,各自赢在哪 Fable 的手艺体现在推理重、契约精确的领域:8 个领域里它赢 6 个,领头的是数据建模与序列化(88%,比 Pro 高 24 个点)和语言内部机制(78)。但 DeepSeek V4 Pro 0813 拿下两个,两个都分量不轻:有状态响应式(66 对 64),以及——更有说服力的——并发与持久化(58 对 45):在恰恰是 Fable 最弱的领域里领先 13 个点。Fable 在并发上的 45% 是它最弱的格子,也是唯一一个便宜模型不只是更便宜、而是工程师水平更高的领域。 按编程语言 Fable 赢下五种语言里的四种,但真正对得起它价格的是 Rust:85% 对 Pro 的 65%,20 个点的差距,也是这场对决里最大的一处差距。Fable 显然是序列化和 Rust 专家。其他语言都比价格暗示的接近(Python 70 对 60,Go 71 对 67,JavaScript 75 对 65),DeepSeek V4 Pro 0813 则实际拿下 TypeScript(61 对 57)。Rust 和序列化之外,付 90 倍价格的理由很难成立。 这两个模型到底有多不一样? 亮点在这里。逐任务相关性只有 0.39,是我们测过的 DeepSeek-Pro 组合里最低的——这两个模型是真心意见不合。它们各自解决了 88 个任务;Pro 单独拿下 12 个,Fable 单独拿下 7 个,只有 6 个任务两边都栽。两者的并集覆盖 113 个任务中的 107 个(94.7%),而且分歧是双向的:DeepSeek V4 Pro 0813 在 awilix-async-container-initialization 上四发四中,Fable 一次没成;Fable 在四个 Pro 全挂的任务上四发四中(包括 koota-query-predicates 和 testem-bail-on-test-failure)。这是真正的互补,不是冗余。 在两者之间路由:组合打法 多样性加上价格差,让级联变得很划算。先跑 DeepSeek V4 Pro 0813,只有测试套件否决答案时才升级到 Fable:82.7% 的解决率,每个任务 8.28 美元。比单用 Fable(69.7%)高 13 个百分点,价格不到 Fable 单任务价格(21.63 美元)的一半。廉价的第一阶段清掉大部分队列,Fable 的溢价只花在难啃的剩余任务上,而且那些任务在上面还多获得一次独立的尝试。级联甚至赢过完美的一次性 oracle 路由(78.8%)。顺序不是可选项:Pro 先行每个任务 8.28 美元,Fable 先行 21.71 美元,准确率一样。 这意味着什么 Fable 5 是这张榜单上最难被当作默认模型的:最贵的一次 rollout 遥遥领先,首发优势被重试抹平,四发也没有天花板优势。只为两件事买它:Rust(85%)和序列化密集的工作(88%)——只有在这里它的质量才真正对得起价格。 DeepSeek V4 Pro 0813 是相反的画像:首发准确率接近 Fable,天花板更高,失败画像持平或更好,便宜 90 倍——尽管它在 Rust 和契约精确的领域让位。而因为两者是我们测过最多样的一对,Fable 最好的用法不是当默认,而是躲在低成本的 Pro 第一阶段后面做选择性升级,只在那少数真需要 Rust 或序列化专家的任务上付费。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 数据表:DeepSeek V4 Pro 0813 vs Claude Fable 5 完整结果 DeepSWE · 完整结果 • Pass@1(官方计分):Pro 62.8%,Fable 69.7% • Pass@1(错误计为失败):62.8%,67.3% • Pass@2 / pass@4:78.5 / 88.5%,77.1 / 84.1% • 覆盖率 / 可靠性:88.5 / 71.0%,84.1 / 82.0% • 四发四中 / 全挂:35 / 13,56 / 18 • 每次 rollout 成本 / 总成本:0.24 美元 / 109 美元,21.63 美元 / 9,346 美元 • 每 100 美元解决数:261,3 • 中位分钟 / 步数:35 / 146,31 / 79 • 中位峰值上下文 / 输出 token:232k / 101k,202k / 115k • 失败构成(近似 / 大偏差 / 回归):66% / 10% / 11%,57% / 18% / 11% • 赢下的领域(共 8 个):2(有状态、并发),6 • 赢下的语言:1(TypeScript),4(Rust 大胜) • 逐任务相关性 / 并集(两模型合计):0.39 / 113 中的 107(94.7%) • Pro → Fable 级联(准确率 / 成本):82.7% / 8.28 美元(单用 Fable 69.7% / 21.63 美元) • 单发 oracle 路由:78.8% • 基础设施错误:0,16 FAQ DeepSeek V4 Pro 0813 比 Claude Fable 5 更好吗? 看指标。Claude Fable 5 赢 DeepSWE 上的单次尝试质量(pass@1 69.7% 对 62.8%),四发四中的任务也更多(56 对 35)。DeepSeek V4 Pro 0813 在 pass@2 追平、pass@4 反超(88.5% 对 84.1%),且每次 rollout 便宜 90 倍,所以在大批量或容忍重试的 agent 工作里,它是更强的性价比之选。 DeepSeek V4 Pro 0813 比 Claude Fable 5 便宜多少? 在我们的运行里,DeepSeek V4 Pro 0813 每次 rollout 0.24 美元,Claude Fable 5 满血档 21.63 美元,约便宜 90 倍。按解决的任务算,Pro 每 100 美元解决 260 个,Fable 是 3 个——每美元的产出大约差 80 倍。 编码该用 DeepSeek V4 Pro 0813 还是 Claude Fable 5? 大多数编码工作,两者的差距比价格暗示的小。Claude Fable 5 领先 Rust(85 对 65)、Python、Go 和 JavaScript,赢下 8 个领域中的 6 个,领头的是数据建模与序列化。DeepSeek V4 Pro 0813 拿下 TypeScript(61 对 57)、有状态响应式,以及并发与持久化(58 对 45)——那正是 Fable 最弱的领域。 要不要在 DeepSeek V4 Pro 0813 和 Claude Fable 5 之间做路由? 要,前提是你能验证结果。两者是我们测过的所有组合里逐任务相关性最低的(0.39),合计覆盖 113 个任务中的 107 个。先跑 DeepSeek V4 Pro 0813,当测试套件否决输出时升级到 Claude Fable 5,能达到 82.7%、每个任务 8.28 美元——赢过单用 Fable,也赢过完美的一次性 oracle 路由。 DeepSWE 的 pass@k 是什么? pass@k 衡量一个任务在 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励一次做对;更高的 k 奖励能在多次尝试后最终到达方案的模型。DeepSeek V4 Pro 0813 的优势随 k 增大而扩大。 原文: #DeepSWE# #AI编程# #LLM评测#
顯示更多
外面的设计公司要收你几千块的 Logo 设计费,Vercel 大牛直接给开源刷爆了。 GitHub 爆火的开源 AI Logo 生成器 Logocreator,由知名开发者 Nutlope 打造。基于 Together AI 的 FLUX 模型驱动,目前在 GitHub 已斩获 7.6k+ Star(MIT 开源协议)。你只需要输入品牌名和简单描述,几秒钟就能生成媲美专业设计师的高清 Logo。 秒级出图:输入 Prompt,一键吐出高质感品牌标识 FLUX 加持:基于顶级 FLUX 图像大模型,文字不崩、线条贼稳 完全免费:无需复杂注册,支持填自己的 API Key 无限刷 二次修改:集成 FLUX.1 Kontext,生成的 Logo 能随时局部微调 开箱即用:基于 Next.js + Tailwind 构建,几分钟就能自己部署一套 🔗 体验网址: 📦 GitHub 开源:
顯示更多
现在包括 Cursor、Droid、Opencode 等等几乎所有流行的产品,提供的 Kimi 模型都是从 Fireworks、Together AI、Baseten 进货的。很多人觉得那我直接从源头买不让中间商赚差价不就完了吗?但个人买完全没有价格优势,还是按量付费,还不如官方的 coding plan 呢。当然如果你追求极致的速度多花钱还是值得的。
顯示更多
0
52
56
2
轉發到社區
把一千篇真实论文丢给三个模型做摘要,同一份语料、同一份 prompt:DeepSeek 的 Flash 跑完全部只花 $3.99,Claude 的 Haiku 花了 $35.76。 《年度 AI 论文:2025–2026 年的关键研究》 一年 1,000 篇论文的图鉴,外加一个成本实验。 是 Hassan El Mghari(GitHub 上的 Nutlope,Together AI 生态的知名开源开发者,做过 roomGPT、SmartPDFs 等热门项目)做的「年度 AI 论文」站点:2025 年 8 月 4 日到 2026 年 8 月 4 日这一年的 1,000 篇论文,每篇都有摘要,可按实验室、主题、月份浏览。整个项目的起点其实是个成本实验:把这一年的论文全部摘要完,要花多少钱? 基准结论:同一份输入,三个模型差了 8.95 倍。 语料合计 30,681 页、1.027 亿字符。三个模型拿到完全相同的提取文本、prompt、分块方式和输出合同,关闭 reasoning,各跑一遍: • DeepSeek V4 Flash:合计 $3.99,每篇约 $0.004 • GPT-5.6 Luna:合计 $6.00,每篇约 $0.006 • Claude Haiku 4.5:合计 $35.76,每篇约 $0.036(8.95×) 费用按官方报价的 token 用量计算,价格冻结在 2026 年 8 月 5 日;只统计成功完成的摘要,失败重跑不计入。 方法论可复现。 语料从 8,262 个候选(Hugging Face Daily Papers + OpenAI、Anthropic、DeepSeek、MiniMax、Moonshot AI 的官方论文)按 arXiv ID 去重,冻结成恰好 1,000 篇;放得进上下文预算的整篇一次读完,超长的走 50,000 字符的 map-reduce,不静默截断。作者明确说这是成本对比,不是质量排名——没有引入 LLM judge 打分。 图鉴本身也好看。 按实验室(OpenAI、Anthropic、Moonshot AI、DeepSeek、MiniMax、 275 篇、Reasoning 177 篇、Video 164 篇、Multimodal 144 篇、Systems 143 篇、Robotics 59 篇)、月份浏览;trending 和 most cited 两个榜单(Qwen3-VL 1,802 次引用、DINOv3 1,216 次、InternVL3.5 1,212 次)。再叠上 18 篇 Together AI 官方论文,共 1,018 篇。 适合想快速补完这一年 AI 研究的人,以及要批量处理 PDF 摘要、想先估成本的工程团队。全流程开源在 GitHub(Nutlope/1kpapers),语料清单、抽取画像、逐篇费用都能自己复现。 原文: #AI论文# #成本基准# #LLM#
顯示更多
🎨 炸裂,一句话就能改图,不用会 PS 也不用调参数 刚开源没多久,背后用的是 BFL 刚出的 Flux 2 图像模型 想给产品图换个背景,或者把照片里多余的路人去掉,以前要么自己抠图抠半小时,要么找设计师排队等两天。就算用 AI 绘图工具,还得学一堆提示词语法和参数。 EasyEdit 把这事压缩成一句话:上传图片,用大白话说你要改成什么样,剩下的交给模型。它用的是 BFL 的 Flux 2 图像模型,通过 Together AI 跑推理。 整个项目是 Next.js 加 Tailwind 写的,代码全开源,想自己部署一份换成自己的 API key 也行。 改图这件事,门槛已经被抹平了。 GitHub:
顯示更多
前天,IREN宣布签署总价值 28亿美元 的多年代理AI云合同,并将2026年底AI云年化运行收入(ARR)目标从37亿美元上调至 超过40亿美元(其中85%已签约)。这一消息不仅推动股价大涨,更传递出一个清晰的市场趋势:AI算力需求正从顶级frontier labs向更广泛客户群外溢。 IREN的新合同主要来自 Perplexity(AI搜索)、Figure AI(物理AI与机器人)、Together AI、Fireworks AI、Fal AI、Hume AI 等专注领域AI公司,以及一个未具名的领先AI开发商。加上此前已有的 Microsoft 和 NVIDIA,IREN的客户画像已覆盖: Hyperscalers(超大规模云厂商) 专业AI开发商 企业级用户 公司明确表示,正在“broadening our customer base across hyperscalers, enterprises and AI developers”,并优先选择多样化分配容量,避免过度依赖少数巨头。 IREN在公告中指出,“hyperscalers、enterprises、AI developers and frontier labs”的需求持续超过其可用和计划容量。过去一年,其自建AI云容量从约3MW激增至2026年交付480MW,2027年目标1.2GW,仍供不应求。 这说明前沿实验室(frontier labs)仍是重要驱动力,但其需求已无法独占新增容量。 大量中层和应用层AI公司(推理、专用模型、机器人、生成媒体等)开始大规模锁定长期GPU资源。 许多合同包含客户预付款(约占GPU资本支出45%),显示买家意愿强烈且愿意承担前期成本。 IREN的案例是AI基础设施热潮的缩影:算力短缺正从“顶级玩家军备竞赛”扩散至整个AI生态。这对数据中心运营商、GPU供应链和新能源行业都是长期利好,也意味着AI商业化落地正在加速。 随着更多公司加入“算力抢夺战”,2026-2027年将成为AI基础设施大规模部署的关键窗口。IREN的故事,或许只是行业多元化浪潮的开始。 免责声明:本人持有推文题及资产,观点充满偏见,非投资建议dyor
顯示更多
IREN 宣布与多家 AI 开发商签署新的多年期云服务合约,总合同价值达 28 亿美元,并将 2026 年底 AI Cloud 年化经常性收入(ARR)目标从 37 亿美元上调至超过 40 亿美元。目前约 85% 目标 ARR 已签约。IREN 客户包括 Microsoft、NVIDIA、Perplexity、Figure AI、Together AI 等。截至 2026 年 6 月 30 日,其现金及现金等价物约为 76 亿美元。
顯示更多
重新审视 Token (词元)的属性 TLDR: 之前我也一度觉得是大宗商品/资产 甚至还设想过相关的交易和定价逻辑 也看到不少人提过Token期货,交易所之类 但现在我倾向它只是一种服务,没必要过度金融化 毕竟它没有办法脱离AI推理单独存在,无法被提前生产出来或预先被囤积。但换个角度看,是服务,就天然是分层的、多元的,不同的人有不同的需求,这其实也恰恰奠定了AI 经济必将是百花齐放而非赢家通吃的基础。 在这浪潮中,红利属于能把廉价 Token 加工成更有价值的 Token 卖出去的人。 -------------------------------- 我的一些个人思绪和逻辑: 1、Token (词元)经济从何而来? 首先它是AI训练转向AI推理的产物, 这是理解 Token 商业模式的基础。 过去模型训练时代,主要是卖算力时间。为什么?因为训练是持续性的大工程,需要大量算力协同工作。这种规模的投入,有资本的大厂基本都会选择自购,毕竟可控性最强,但对于没有能力一次性投入大量资金的团队来说,出于对稳定性的要求,也会倾向选择租赁模式,包下一整段时间的独占使用权,榨干这段时间内算力的所有价值,是一种占用的逻辑。 但随着主流大模型开始进入商用阶段,AI 算力的需求重心也从模型训练转向了推理。你用 GPT聊天、用 Claude写代码、问豆包问题,这些本质上都是在跑推理,每一次调用,都在为你做一次推理和计算。 而推理是相对碎片化的、一次性的、用完即走的。虽然也有不少企业,仍然会采用租赁或自购的模式来跑推理,但对于广大中小开发者和应用方来说,他们对算力独占性的要求并不高,因而额外衍生出了按消耗计费的模式,这样算力服务商就可以把算力资源同时卖给成千上万个客户。 Token (词元) 就是在这种背景下而产生的,衡量每次计算消耗了多少资源的那个单位,你付的钱,就是对这次计算的补偿,本质是消耗逻辑。 所以训练和推理是完全不同的生意形态: 训练时代,商业模式是卖 GPU 时间。 推理时代,商业模式是卖 Token (词元)。 --------------------------------- 2、为何Token (词元) 是服务属性而非商品/金融属性? 卖Token (词元),就是卖服务! Token (词元) 经济,本质是服务经济! 为什么? 一个比较直接的原因是 Token (词元)不能被预先生产出来,而是产出后就被消耗掉了,并作为衡量你这次推理服务所消耗资源的参考,来给你计费。 且Token (词元) 的一些特性,也和大宗商品的逻辑不像: - 价格长期下降趋势 - Pay-As-You-Go - 难以标准化 你在Claude的100万Token额度,和你在Minimax的100万Token额度,两者本身是没有可比性的,模型不同,性能不同,定价完全可以不一样。 而大家愿意接受价格差异的原因,也是因为 Token (词元) 本质上计量了一种非标准化的服务,而不同用户对服务的诉求是不同的,有的人看重性能,所以愿意支付溢价,有的人看重成本控制,所以觉得国产开源模型也够用了。 而整个模型市场占有率,并没有出现几家独大,本身也是其服务属性的体现。如果 Token (词元) 是资产,那资产的流动性、网络效应,一定会引发所有资源最终向一个市场集中,形成赢家通吃的局面。但恰巧 Token (词元) 其实是服务,而服务市场天然是分层的、多元的,不同的服务商满足不同的需求,所以才构成了 AI 经济百花齐放的基础。 我想通这点后,就不再纠结模型厂商只有哪家笑到最后了。 因为未来必将是多模型共存、多层级并行的格局,Token(词元)也将会被计入到企业的会计成本之中,并反映到企业的产品和服务之中。 比较值得关注的一点是,AI时代Token所代表的服务经济和传统的人力服务经济,成本曲线可能是完全反过来的。由人所提供的服务,长期要求的是报酬上升,这也是为什么服务业占比高的经济体,服务更贵。但 Token 服务恰恰相反,价格长期只会下降,当 Token 逐步替代掉一部分原本需要人力智力才能完成的工作,这部分成本不但不会随时间上升,反而会持续走低。 这可能也是这一波AI的红利之一。 ------------------------- 3、这个Token (词元) 服务都有谁在卖? - 闭源模型厂商 - 开源模型厂商 - 开源模型托管商 - 大模型聚合器、中转站 1)闭源模型厂商:直营为主,分销为辅 最直接的模式。OpenAI 卖 GPT 的 Token,Anthropic 卖 Claude 的 Token。模型自己训的、API 自己提供、定价权在自己手里,产品和渠道都是自己的,跟品牌直营店一个逻辑。当然作为最顶级的模型,难免会被接入像一些API中转站,或者Open Router这样的大模型聚合平台被动分销。 2)开源模型厂商:开源也挺赚钱的 开源模型谁都可以拿去用,很多人不想自己本地跑,因此催生出了一批开源模型托管商,他们可以帮你跑模型,并按 Token 收费。但这就引出一个问题:Token 的钱都让模型托管商这些中间商赚了,开源模型的开发者自己怎么赚钱?这一点,至少中国的开源模型厂商,走的很灵活。 像Minimax,Kimi,Zhipu,它们都有自有的 API 直售,更多面向开发者群体,并且也都有自己的 Coding Plan 订阅包,把按 token 计费玩出了订阅制,完全是中国移动卖流量的玩法。而OpenClaw 这波更是让它们赚得盆满钵满,各自推出了品牌化的 Claw 产品,帮用户把 OpenClaw 部署好,底层跑自家模型,Token 消耗从自家 API 走。 3)开源模型托管商:帮别人跑模型,赚差价 对于那些没有能力或意愿自己卖 Token 的开源模型来说,托管商就是它们触达用户的渠道。它们帮开发者跑模型、按 Token 收费: - Together AI / Fireworks:自有 GPU 集群 + 极致推理优化,核心竞争力是翻台率,同样的卡单位时间能吐出更多 Token。 - Groq:自研 LPU 推理专用芯片,不用传统 GPU,核心竞争力是极致速度,跑 Llama、Qwen 等开源模型比 GPU 快。 - Cloudflare Workers AI:全球 300+ 边缘节点,跑 Llama、Mistral、Qwen,最近还加了智谱 GLM 和 Kimi,核心竞争力是低延迟 + 开发者生态 - AWS Bedrock / Google Vertex AI — 企业级云平台,跑 Llama、Mistral 等主流开源模型,核心竞争力是客户的数据和基础设施已经在这些云上了,迁移成本低 4)大模型聚合器:一个入口管所有模型 闭源和开源的大模型越来越多,而不同场景适合不同模型,不同模型的优劣势不同,对开发者来说,一个个去接不同厂商和托管商的 API,管理起来很痛苦。于是催生了 OpenRouter 这类聚合器,可以接几十个模型,开发者在一个地方统一管理、按需切换即可。 OpenRouter按照批发转零售的模式盈利,各家模型厂商把自己的Token分销出去。而 OpenClaw 这波直接让 OpenRouter 上中国模型的消耗量暴增,前十名 Token 消耗量中,中国模型占了 61%,前五有四个是中国的。 而围绕这条 Token (词元) 产业链,也衍生出了一些其他的参与者和新需求: 第一是一些推理优化引擎,vLLM、SGLang 这些开源项目,在大家对效率极致追求的当下,通过对硬件算子层面(更高效地利用 GPU 计算单元,减少内存碎片和带宽瓶颈)以及 LLM 算法层面(让多个请求共享已经算过的内容,更聪明地管理显存)的优化,提升同一张卡在同一时间内的 Token 吞吐量。 它们自己不面向终端用户收费,但 Together AI、Fireworks 这些托管商底层用的就是这些技术。也有不少自己本地跑开源模型的开发者,会直接使用 vLLM 或 SGLang 来搭建自己的推理服务。 第二是对Token消耗的优化需求,当 Token 消耗逐渐常态化,自然就会有人开始琢磨怎么省钱,也有不少人早就抱怨OpenClaw高昂的Token消耗,那么,帮你预览一次 Prompt 会消耗多少 Token、建议怎么优化 Prompt 来降本、甚至自动帮你选性价比最高的模型和服务商的产品,就很有市场了。 ---------------------------- 4、AI经济时代,真正的机会在哪? 我觉得 Token 经济的红利,属于把廉价的 Token 加工成更有价值的 Token 卖出去的人。 1)如果你有能力,就做一个模型,哪怕是微调的 你不需要从头训一个 GPT,在开源模型基础上针对某个垂直场景做微调,只要在某个细分领域效果够好,就有人愿意按 Token 付费调用你的模型。前面说了,Token 是服务,服务市场天然分层,通用大模型吃不掉所有场景,垂直微调的模型在自己的领地里反而更有定价权。 2)做一个新时代的产品,开放 API 你的产品底层消耗 Token,但你的产品本身也可以对外输出能力,你开放 API,让别的开发者和 Agent 来调用。你买入底层模型的 Token,加上你的产品逻辑和数据,产出更高价值的 Token 服务卖出去。这跟传统行业买原材料、加工、卖成品的逻辑是一样的。 3)写 Skill,做 Agent 每一个被广泛使用的 Skill 和 Agent,背后都是源源不断的 Token 消耗。你写的 Skill 越好用、越多人用,你帮模型厂商卖出去的 Token 就越多。这不是你直接卖 Token,但你是这条产业链上的分销渠道。 而不管你选哪条路, 你的护城河在我看来最终都会归结为三样东西: 算力、算法、数据。 算力影响你的吞吐量 算法影响你的效率和成本 数据决定你是不是不可替代
顯示更多