注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 TogetherAI
TogetherAI 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 TogetherAI 的推特
推荐这篇公告,一个重量级的开源模型托管合作。 首个 3T 级开源模型通过美国推理基础设施向开发者开放——后续模型同步首发。 Together AI 在 7 月 29 日宣布与 Moonshot AI 达成战略合作:Together AI 成为 Kimi K3 及未来所有 Moonshot 开源模型的美国托管平台。 合作内容 • Kimi K3 已在 Together AI 上线,通过 moonshotai/Kimi-K3 端点访问 • 未来所有 Moonshot 开源模型都将在发布当天同步上线 Together • 支持微调:开发者可以用自己的数据对 Kimi 模型做后训练,同时可选择移除 MIT 许可证中的 attribution 要求 • 三层部署选项:Serverless(按量)、Provisioned Throughput(预留容量 + 99% SLA)、Dedicated Inference(专有实例) 定价 • 输入 $3.00 / 1M token(缓存 $0.30) • 输出 $15.00 / 1M token • FP4 量化推理 战略意义 Together AI 的推理栈已经为 Cursor、Y Combinator 和 Decagon 等公司的 agentic 和编程负载提供生产服务。这次合作意味着开发者可以通过一套 API 同时访问 Kimi K3、LLaMA、GLM 等所有主流开源模型,不需要为每个新模型配置新的 SDK 或账户。 Moonshot 端——Kimi K3 作为首个开源 3T 级模型,在国内已经通过 API 服务广泛部署,但美国开发者此前缺乏一个可靠的托管方案。Together AI 填补了这个空白。 原文: #KimiK3# #TogetherAI# #OpenSource#
显示更多
推荐这篇文章,Together AI 的 ThunderAgent(ICML 2026 Spotlight)。 把 agent 工作流当成一个"程序"来调度,而非一系列无关的请求——单节点吞吐翻倍,8 节点近线性扩展。 Together AI 在 7 月 29 日发布了 ThunderAgent——一个面向 agentic 推理的高吞吐调度系统。ICML 2026 Spotlight 论文。核心贡献:把 agent workflow 抽象为"程序"而非"一系列不相关的请求"。 问题:KV Cache Thrashing Agent 工作流在两个阶段之间交替:GPU 密集的推理阶段和 GPU 空闲的等待工具返回阶段。当数百个 agent 并发运行时,各自的 KV cache 在每轮不断增长,竞争有限的 GPU 内存。 传统推理引擎(vLLM、SGLang、TensorRT-LLM)按请求级别调度——agent A 暂停等待工具调用时,它的 KV cache 被 LRU 淘汰腾出空间给 agent B 的 prefill。当 A 的工具返回,引擎必须从头重算 A 的整段对话历史,这又淘汰了 C 的 cache。高并发下,这种淘汰和重算的级联反应导致严重的吞吐量和延迟退化——论文称之为 KV cache thrashing。 能通过加 GPU 节点解决吗?不完全。现有多节点路由器(如 SGLang Gateway)把每个 agent 钉在固定节点上以保留 cache 局部性——但 agent 的上下文长度不可预测增长,某些节点被赋予长上下文 agent 导致内存耗尽,其他节点闲置。 能通过 KV cache offloading 解决吗?也解决不了。LMCache 和 HiCache 把 KV cache 卸载到 CPU 内存或磁盘,扩大了总容量但只是延迟 thrasthing。当并发 agent 的工作集超过所有存储层级时,淘汰恢复,同一个恶性循环重现。 ThunderAgent 的解法 ThunderAgent 在 agentic 客户端和推理后端之间插入一个轻量调度层。它将每个 agent 工作流抽象为一个可调度程序(program),追踪其执行阶段、KV cache 占用和节点位置。 Program-level admission control:监控每个节点的内存压力,选择性暂停低优先级工作流,减少竞争 cache 的程序数量。当被暂停的工作流准备恢复时,通过全局等待队列路由到容量最充足的节点。 多节点部署:用全局等待队列替代了基于 session 的静态节点绑定。暂停的工作流恢复时被路由到可用容量最多的节点,在 KV cache 局部性和多节点负载均衡之间取得平衡。 评测 集成在 Together AI 自己的合成数据生成管道里——就是产生 CoderForge 等数据集的那套基础设施。对比 SGLang 默认调度器: 单节点 8×H100(HiCache offloading),batch size 192: • SGLang:吞吐 390 token/s,平均延迟 65s • ThunderAgent:吞吐 803 token/s,平均延迟 10.6s 多节点(2→8 节点): • 近线性扩展,16 GPU 到 64 GPU 吞吐从 671 增长到 2248 steps/min • 加速比随集群规模增大:2 节点 1.79× → 8 节点 2.39× 使用 一个 program_id 字段,OpenAI 兼容 API,直接适配现成的 offloading 和 speculative decoding。已被 SkyRL 和 NVIDIA Dynamo 集成。 GitHub: 论文: #AgentInference# #KVcache# #ThunderAgent#
显示更多
外面的设计公司要收你几千块的 Logo 设计费,Vercel 大牛直接给开源刷爆了。 GitHub 爆火的开源 AI Logo 生成器 Logocreator,由知名开发者 Nutlope 打造。基于 Together AI 的 FLUX 模型驱动,目前在 GitHub 已斩获 7.6k+ Star(MIT 开源协议)。你只需要输入品牌名和简单描述,几秒钟就能生成媲美专业设计师的高清 Logo。 秒级出图:输入 Prompt,一键吐出高质感品牌标识 FLUX 加持:基于顶级 FLUX 图像大模型,文字不崩、线条贼稳 完全免费:无需复杂注册,支持填自己的 API Key 无限刷 二次修改:集成 FLUX.1 Kontext,生成的 Logo 能随时局部微调 开箱即用:基于 Next.js + Tailwind 构建,几分钟就能自己部署一套 🔗 体验网址: 📦 GitHub 开源:
显示更多
现在包括 Cursor、Droid、Opencode 等等几乎所有流行的产品,提供的 Kimi 模型都是从 Fireworks、Together AI、Baseten 进货的。很多人觉得那我直接从源头买不让中间商赚差价不就完了吗?但个人买完全没有价格优势,还是按量付费,还不如官方的 coding plan 呢。当然如果你追求极致的速度多花钱还是值得的。
显示更多
0
52
56
2
转发到社区
🎨 炸裂,一句话就能改图,不用会 PS 也不用调参数 刚开源没多久,背后用的是 BFL 刚出的 Flux 2 图像模型 想给产品图换个背景,或者把照片里多余的路人去掉,以前要么自己抠图抠半小时,要么找设计师排队等两天。就算用 AI 绘图工具,还得学一堆提示词语法和参数。 EasyEdit 把这事压缩成一句话:上传图片,用大白话说你要改成什么样,剩下的交给模型。它用的是 BFL 的 Flux 2 图像模型,通过 Together AI 跑推理。 整个项目是 Next.js 加 Tailwind 写的,代码全开源,想自己部署一份换成自己的 API key 也行。 改图这件事,门槛已经被抹平了。 GitHub:
显示更多
前天,IREN宣布签署总价值 28亿美元 的多年代理AI云合同,并将2026年底AI云年化运行收入(ARR)目标从37亿美元上调至 超过40亿美元(其中85%已签约)。这一消息不仅推动股价大涨,更传递出一个清晰的市场趋势:AI算力需求正从顶级frontier labs向更广泛客户群外溢。 IREN的新合同主要来自 Perplexity(AI搜索)、Figure AI(物理AI与机器人)、Together AI、Fireworks AI、Fal AI、Hume AI 等专注领域AI公司,以及一个未具名的领先AI开发商。加上此前已有的 Microsoft 和 NVIDIA,IREN的客户画像已覆盖: Hyperscalers(超大规模云厂商) 专业AI开发商 企业级用户 公司明确表示,正在“broadening our customer base across hyperscalers, enterprises and AI developers”,并优先选择多样化分配容量,避免过度依赖少数巨头。 IREN在公告中指出,“hyperscalers、enterprises、AI developers and frontier labs”的需求持续超过其可用和计划容量。过去一年,其自建AI云容量从约3MW激增至2026年交付480MW,2027年目标1.2GW,仍供不应求。 这说明前沿实验室(frontier labs)仍是重要驱动力,但其需求已无法独占新增容量。 大量中层和应用层AI公司(推理、专用模型、机器人、生成媒体等)开始大规模锁定长期GPU资源。 许多合同包含客户预付款(约占GPU资本支出45%),显示买家意愿强烈且愿意承担前期成本。 IREN的案例是AI基础设施热潮的缩影:算力短缺正从“顶级玩家军备竞赛”扩散至整个AI生态。这对数据中心运营商、GPU供应链和新能源行业都是长期利好,也意味着AI商业化落地正在加速。 随着更多公司加入“算力抢夺战”,2026-2027年将成为AI基础设施大规模部署的关键窗口。IREN的故事,或许只是行业多元化浪潮的开始。 免责声明:本人持有推文题及资产,观点充满偏见,非投资建议dyor
显示更多
IREN 宣布与多家 AI 开发商签署新的多年期云服务合约,总合同价值达 28 亿美元,并将 2026 年底 AI Cloud 年化经常性收入(ARR)目标从 37 亿美元上调至超过 40 亿美元。目前约 85% 目标 ARR 已签约。IREN 客户包括 Microsoft、NVIDIA、Perplexity、Figure AI、Together AI 等。截至 2026 年 6 月 30 日,其现金及现金等价物约为 76 亿美元。
显示更多
重新审视 Token (词元)的属性 TLDR: 之前我也一度觉得是大宗商品/资产 甚至还设想过相关的交易和定价逻辑 也看到不少人提过Token期货,交易所之类 但现在我倾向它只是一种服务,没必要过度金融化 毕竟它没有办法脱离AI推理单独存在,无法被提前生产出来或预先被囤积。但换个角度看,是服务,就天然是分层的、多元的,不同的人有不同的需求,这其实也恰恰奠定了AI 经济必将是百花齐放而非赢家通吃的基础。 在这浪潮中,红利属于能把廉价 Token 加工成更有价值的 Token 卖出去的人。 -------------------------------- 我的一些个人思绪和逻辑: 1、Token (词元)经济从何而来? 首先它是AI训练转向AI推理的产物, 这是理解 Token 商业模式的基础。 过去模型训练时代,主要是卖算力时间。为什么?因为训练是持续性的大工程,需要大量算力协同工作。这种规模的投入,有资本的大厂基本都会选择自购,毕竟可控性最强,但对于没有能力一次性投入大量资金的团队来说,出于对稳定性的要求,也会倾向选择租赁模式,包下一整段时间的独占使用权,榨干这段时间内算力的所有价值,是一种占用的逻辑。 但随着主流大模型开始进入商用阶段,AI 算力的需求重心也从模型训练转向了推理。你用 GPT聊天、用 Claude写代码、问豆包问题,这些本质上都是在跑推理,每一次调用,都在为你做一次推理和计算。 而推理是相对碎片化的、一次性的、用完即走的。虽然也有不少企业,仍然会采用租赁或自购的模式来跑推理,但对于广大中小开发者和应用方来说,他们对算力独占性的要求并不高,因而额外衍生出了按消耗计费的模式,这样算力服务商就可以把算力资源同时卖给成千上万个客户。 Token (词元) 就是在这种背景下而产生的,衡量每次计算消耗了多少资源的那个单位,你付的钱,就是对这次计算的补偿,本质是消耗逻辑。 所以训练和推理是完全不同的生意形态: 训练时代,商业模式是卖 GPU 时间。 推理时代,商业模式是卖 Token (词元)。 --------------------------------- 2、为何Token (词元) 是服务属性而非商品/金融属性? 卖Token (词元),就是卖服务! Token (词元) 经济,本质是服务经济! 为什么? 一个比较直接的原因是 Token (词元)不能被预先生产出来,而是产出后就被消耗掉了,并作为衡量你这次推理服务所消耗资源的参考,来给你计费。 且Token (词元) 的一些特性,也和大宗商品的逻辑不像: - 价格长期下降趋势 - Pay-As-You-Go - 难以标准化 你在Claude的100万Token额度,和你在Minimax的100万Token额度,两者本身是没有可比性的,模型不同,性能不同,定价完全可以不一样。 而大家愿意接受价格差异的原因,也是因为 Token (词元) 本质上计量了一种非标准化的服务,而不同用户对服务的诉求是不同的,有的人看重性能,所以愿意支付溢价,有的人看重成本控制,所以觉得国产开源模型也够用了。 而整个模型市场占有率,并没有出现几家独大,本身也是其服务属性的体现。如果 Token (词元) 是资产,那资产的流动性、网络效应,一定会引发所有资源最终向一个市场集中,形成赢家通吃的局面。但恰巧 Token (词元) 其实是服务,而服务市场天然是分层的、多元的,不同的服务商满足不同的需求,所以才构成了 AI 经济百花齐放的基础。 我想通这点后,就不再纠结模型厂商只有哪家笑到最后了。 因为未来必将是多模型共存、多层级并行的格局,Token(词元)也将会被计入到企业的会计成本之中,并反映到企业的产品和服务之中。 比较值得关注的一点是,AI时代Token所代表的服务经济和传统的人力服务经济,成本曲线可能是完全反过来的。由人所提供的服务,长期要求的是报酬上升,这也是为什么服务业占比高的经济体,服务更贵。但 Token 服务恰恰相反,价格长期只会下降,当 Token 逐步替代掉一部分原本需要人力智力才能完成的工作,这部分成本不但不会随时间上升,反而会持续走低。 这可能也是这一波AI的红利之一。 ------------------------- 3、这个Token (词元) 服务都有谁在卖? - 闭源模型厂商 - 开源模型厂商 - 开源模型托管商 - 大模型聚合器、中转站 1)闭源模型厂商:直营为主,分销为辅 最直接的模式。OpenAI 卖 GPT 的 Token,Anthropic 卖 Claude 的 Token。模型自己训的、API 自己提供、定价权在自己手里,产品和渠道都是自己的,跟品牌直营店一个逻辑。当然作为最顶级的模型,难免会被接入像一些API中转站,或者Open Router这样的大模型聚合平台被动分销。 2)开源模型厂商:开源也挺赚钱的 开源模型谁都可以拿去用,很多人不想自己本地跑,因此催生出了一批开源模型托管商,他们可以帮你跑模型,并按 Token 收费。但这就引出一个问题:Token 的钱都让模型托管商这些中间商赚了,开源模型的开发者自己怎么赚钱?这一点,至少中国的开源模型厂商,走的很灵活。 像Minimax,Kimi,Zhipu,它们都有自有的 API 直售,更多面向开发者群体,并且也都有自己的 Coding Plan 订阅包,把按 token 计费玩出了订阅制,完全是中国移动卖流量的玩法。而OpenClaw 这波更是让它们赚得盆满钵满,各自推出了品牌化的 Claw 产品,帮用户把 OpenClaw 部署好,底层跑自家模型,Token 消耗从自家 API 走。 3)开源模型托管商:帮别人跑模型,赚差价 对于那些没有能力或意愿自己卖 Token 的开源模型来说,托管商就是它们触达用户的渠道。它们帮开发者跑模型、按 Token 收费: - Together AI / Fireworks:自有 GPU 集群 + 极致推理优化,核心竞争力是翻台率,同样的卡单位时间能吐出更多 Token。 - Groq:自研 LPU 推理专用芯片,不用传统 GPU,核心竞争力是极致速度,跑 Llama、Qwen 等开源模型比 GPU 快。 - Cloudflare Workers AI:全球 300+ 边缘节点,跑 Llama、Mistral、Qwen,最近还加了智谱 GLM 和 Kimi,核心竞争力是低延迟 + 开发者生态 - AWS Bedrock / Google Vertex AI — 企业级云平台,跑 Llama、Mistral 等主流开源模型,核心竞争力是客户的数据和基础设施已经在这些云上了,迁移成本低 4)大模型聚合器:一个入口管所有模型 闭源和开源的大模型越来越多,而不同场景适合不同模型,不同模型的优劣势不同,对开发者来说,一个个去接不同厂商和托管商的 API,管理起来很痛苦。于是催生了 OpenRouter 这类聚合器,可以接几十个模型,开发者在一个地方统一管理、按需切换即可。 OpenRouter按照批发转零售的模式盈利,各家模型厂商把自己的Token分销出去。而 OpenClaw 这波直接让 OpenRouter 上中国模型的消耗量暴增,前十名 Token 消耗量中,中国模型占了 61%,前五有四个是中国的。 而围绕这条 Token (词元) 产业链,也衍生出了一些其他的参与者和新需求: 第一是一些推理优化引擎,vLLM、SGLang 这些开源项目,在大家对效率极致追求的当下,通过对硬件算子层面(更高效地利用 GPU 计算单元,减少内存碎片和带宽瓶颈)以及 LLM 算法层面(让多个请求共享已经算过的内容,更聪明地管理显存)的优化,提升同一张卡在同一时间内的 Token 吞吐量。 它们自己不面向终端用户收费,但 Together AI、Fireworks 这些托管商底层用的就是这些技术。也有不少自己本地跑开源模型的开发者,会直接使用 vLLM 或 SGLang 来搭建自己的推理服务。 第二是对Token消耗的优化需求,当 Token 消耗逐渐常态化,自然就会有人开始琢磨怎么省钱,也有不少人早就抱怨OpenClaw高昂的Token消耗,那么,帮你预览一次 Prompt 会消耗多少 Token、建议怎么优化 Prompt 来降本、甚至自动帮你选性价比最高的模型和服务商的产品,就很有市场了。 ---------------------------- 4、AI经济时代,真正的机会在哪? 我觉得 Token 经济的红利,属于把廉价的 Token 加工成更有价值的 Token 卖出去的人。 1)如果你有能力,就做一个模型,哪怕是微调的 你不需要从头训一个 GPT,在开源模型基础上针对某个垂直场景做微调,只要在某个细分领域效果够好,就有人愿意按 Token 付费调用你的模型。前面说了,Token 是服务,服务市场天然分层,通用大模型吃不掉所有场景,垂直微调的模型在自己的领地里反而更有定价权。 2)做一个新时代的产品,开放 API 你的产品底层消耗 Token,但你的产品本身也可以对外输出能力,你开放 API,让别的开发者和 Agent 来调用。你买入底层模型的 Token,加上你的产品逻辑和数据,产出更高价值的 Token 服务卖出去。这跟传统行业买原材料、加工、卖成品的逻辑是一样的。 3)写 Skill,做 Agent 每一个被广泛使用的 Skill 和 Agent,背后都是源源不断的 Token 消耗。你写的 Skill 越好用、越多人用,你帮模型厂商卖出去的 Token 就越多。这不是你直接卖 Token,但你是这条产业链上的分销渠道。 而不管你选哪条路, 你的护城河在我看来最终都会归结为三样东西: 算力、算法、数据。 算力影响你的吞吐量 算法影响你的效率和成本 数据决定你是不是不可替代
显示更多
Happy Mid-Autumn Festival together with Kisaki 🦋💙 What kind of mooncake 🥮 do you like btw? 中秋节记得吃🥮月饼! 可以和妃咲会长一起吃💙🦋 Full set Kisaki has been added to my Gank page, do check it now: Photos: Raychel #kisakicosplay# #bluearchive#
显示更多
0
2
1.6K
152
转发到社区
Have a drink together?💋 歡迎來預定工業風酒吧棚景哦!(ฅ´ω`ฅ)
0
1
442
33
转发到社区