註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 vLLM
vLLM 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 vLLM 的搜尋結果
本地用vLLM部署GLM-5.2的速度终于上来了! 好消息终于轮到本地部署 GLM-5.2 了! 大家都知道 GLM-5.2 这次是自带了MTP头的, 可以进行推测性解码. 但是, 这个只适用于bf16原始精度的GLM-5.2, 而这玩意原始精度要到1.5TB, 本地跑的很少有富到这个程度的, 所以大家都用各种量化版本, 毕竟4bit量化就只要430GB了. 问题这就来了, 由于 GLM-5.2 的 MTP 采用了非常特殊的 DSA (动态稀疏注意力), 导致目前几个推理引擎 (llama.cpp, vLLM, mlx) 都无法支持. 其中 llama.cpp, mlx 是完全没办法开 MTP, vLLM 只支持FP8精度的. 而SGLang 没事哈, SGLang 架构比较屌上来就支持同一个计算流使用混合精度. 所以直接用 GLM-5.2-W4AFP8 就行. 所以回到这几个不支持的推理引擎, 大部分的量化版本 GLM-5.2 开了 MTP 反而会掉速度. 甚至有的量化版本直接把MTP部分给砍了(mlx). 而社区作者dnhkng搞了个缝合方法, 最终搞出了 GLM-5.2-AWQ-INT4-FP8-MTP-delta, 即 底座用 INT4(走 Marlin 算子)+ MTP 用 FP8(保持精度)同时还能让vLLM 支持. 速度从原来的 2 token/s 直接飙升到了 43.39 token/s (绑定NUMA+MTP-3) 所以目前位置 SGLang 和 vLLM (魔改版)都能直接火力全开跑带MTP的 GLM-5.2了. 而 llama.cpp和mlx用户还需要再等等. 社区还在弄. 这个作者的blog (过程极其精彩, 有不少优化技巧): #glm52# #mtp# #dsa#
顯示更多
0
66
208
30
轉發到社區
在 LinkedIn 点赞了一篇 vLLM Semantic Router 的帖子,结果算法开始接二连三给我推荐 Model Router。我只能说继续学习,虽然感觉已经快看不懂了🫤 简单理解,vLLM 就像一家高并发餐厅: 应用层是顾客,API Gateway 是服务员,Foundation Model 是厨师,GPU 是炉子,Semantic Router 负责判断每道菜应该交给哪个厨师。 Continuous Batching:把不断进来的多个请求动态拼在一起处理,尽量别让 GPU 闲着。 PagedAttention:把 KV Cache 分页管理。KV Cache 就是模型推理时用来“记住前面已经算过的信息”的缓存,这样请求可以随时加入和退出,也不会因为连续内存分配浪费大量显存。 Semantic Router:根据请求的内容、难度、成本和延迟要求,把任务分配给最合适的模型。 以前是所有问题都找同一个大模型,现在是简单问题给便宜模型,复杂问题再找顶级模型。AI 基础设施已经开始进入精细化运营阶段了。
顯示更多
在最近的开源热潮中,SGLang和vLLM等开源推理引擎成为算力优化的核心技术。DeepSeek、Kimi等模型一上线就实现Day-0支持,昨天Google Cloud TPU也官宣引入SGLang。 这背后是AI Infra的千亿级市场和需求:当推理成为AI的主战场,GPU看似满载,却仍把大量时间耗在重复计算、缓存搬运和任务等待上。AI Infra深处,一场围绕调度与系统优化的效率革命已经开始。为什么最昂贵的GPU仍会“又忙又闲”?AI Infra还能榨出多少藏在“硅”里的性能?当算力增长不再只靠堆卡,AI竞争的尺度会被怎样改写?这期视频,我们与推理引擎开源社区SGLang孵化出的RadixArk团队一起,深入探讨这场算力效率变革。
顯示更多
0
60
72
7
轉發到社區
感觉我也可以魔改 sglang 、 vllm ,用于调试 DSpark 这类新能力, 看看效果是不是和吹的一样好。 现在租用一个 GPU又不贵。 大模型预训练需要烧很多钱,烧很多数据才能验证, 大模型推理看起来门槛并没那么高,小成本也可以验证/验收能力。
顯示更多
Multi-agent 不再是玩具 demo 100+ agents 协作一周,把 Gemma 4 在 vLLM 上加速到原来的 5× 自发的沟通规范、配额池化、算力分工、跨 agent kernel debug、显著性标准…… 更像是在观察一个新型“AI 研究社区”从零开始长出来。
顯示更多
0
29
151
34
轉發到社區
本地跑大模型的工具越来越多,光推理引擎就有 Ollama、llama.cpp、vLLM,还没算模型和界面。 LLMs-local 把本地跑大模型相关的资源整理到了一起,推理引擎、模型、硬件、教程都有。 推理引擎收录了 Ollama、llama.cpp、vLLM 这些,界面有 Open WebUI、Lobe Chat,模型按用途分好了类。 GitHub: 还收录了微调工具、Agent 框架、训练教程和硬件选购建议,一份清单基本能摸清整个生态。 打算在自己机器上跑模型的朋友,可以先翻翻这份合集找找方向。
顯示更多
0
51
49
16
轉發到社區
默认组合大致是: Silero:判断用户有没有说话 Parakeet TDT:语音转文字 OpenAI-compatible API:生成回答 Qwen3-TTS:把回答读出来 STT 和 TTS 可以在本地运行。 LLM 也能换成 llama.cpp、vLLM 或其他兼容接口。
顯示更多
懒猫算力舱 X5 终于上线了,2070T 最强推理算力,128GB 超大显存,英伟达芯片,还配备 100GB 光口 和万兆网口,所有配置拉满 超帅超强,比 GB10 性能还强一倍,可以通过光口和 vllm 无限组网跑本地大模型,可以当独立电脑用 详细配置参数如下,预售 200 台已卖光,想要进一步了解软件性能的评论区打 1 懒猫 AI 算力舱(LazyCat AI Pod)详细硬件参数 1. 产品概述 紧凑型 AI 计算设备,面向硬核开发者 搭载 NVIDIA Jetson GPU,支持 CUDA 生态 统一内存架构,可本地部署大规模 AI 模型(如 DeepSeek-V4-Flash 284B) 预装 Ubuntu,支持本地 AI 部署,可作为私有 AI 超算替代云服务 从开箱到运行 AI 模型约 5 分钟 支持多机联网扩展算力 2. CPU 架构:Arm® Neoverse®-V3AE 64-bit X5-T4000**:12 核心,最高频率 2.6 GHz,每核心 1 MB L2 缓存,16 MB 共享系统 L3 缓存 X5-T5000**:14 核心,最高频率 2.6 GHz,每核心 1 MB L2 缓存,16 MB 共享系统 L3 缓存 3. GPU / AI 算力 架构:NVIDIA Blackwell X5-T4000(NVIDIA Jetson T4000)**: 1536 核心 第 5 代 Tensor Core MIG:6 TPC 最高频率 1.53 GHz AI 性能:1200T X5-T5000(NVIDIA Jetson T5000)**: 2560 核心 第 5 代 Tensor Core MIG:10 TPC 最高频率 1.57 GHz AI 性能:2070T 完整支持 CUDA 生态;非 CUDA 芯片实际 AI 性能约降低 50% 4. 内存 类型:LPDDR5X,256-bit 带宽:273 GB/s X5-T4000**:64 GB X5-T5000**:128 GB(可支持 DeepSeek-V4-Flash 284B 大模型:总参数 284B / 激活参数 13B,适合文生图、文生视频等任务;支持 vLLM 及多机联网扩展) 5. 存储 系统存储(嵌入式):64 GB eMMC 5.1(主要针对 X5-T5000 提及) 模型存储:最高 32 TB(通过最多 2 个 M.2 接口) 支持 PCIe NVMe 和 USB 3.2 SSD 6. 网络与接口 有线网络 X5-T4000**:1 × QSFP28 光口(最高 75 Gbps,3 × 25GbE)+ 1 × 10GbE RJ45 口(支持网络唤醒) X5-T5000**:1 × QSFP28 光口(最高 100 Gbps,4 × 25GbE)+ 1 × 10GbE RJ45 口(支持网络唤醒) 无线 Wi-Fi:海华 WIFI6 XB560NF 无线网卡,双贴片天线 蓝牙:5.4 其他端口 1 × Type-C 3.2 Gen2(10 Gbps) 2 × USB 3.2 Gen1(5 Gbps) 1 × HDMI 2.1(支持 8K 输出) 1 × DC 电源口(5.5×2.5 mm) 7. 电源与功耗 模块功耗: X5-T4000:40W ~ 70W X5-T5000:40W 130W(针对 AI 推理优化,远低于消费级 GPU 的 350W 450W) 电源适配器:氮化镓宽电压适配器,输入 100V ~ 240V,输出 12V/8A,频率 50/60 Hz,支持 UPS 不间断供电 8. 外观与物理规格 尺寸:144 × 130 × 61 mm(长 × 宽 × 高) 重量:2.3 kg 外壳:金属机身 颜色版本: 太空白(喷砂烤漆工艺) 星辰灰(阳极氧化工艺) 9. 散热 直吹液压静音风扇 10 mm 大风量风扇 静音 FDB 轴承 转速 3500 ± 10% RPM 配备定制静音转速算法,12V 供电 10. 软件与系统支持 操作系统:预装 Ubuntu(含 CUDA 加速驱动和 AI 开发环境) 支持框架:Ollama、vLLM、Shimmy 等 常见应用:Jupyter Notebook(一键安装 CUDA 支持)、ComfyUI(文生图)、AI 语音识别/合成、DeepSeek OCR、文档/PDF 翻译等 支持内网穿透,手机远程访问 100% 本地部署,数据物理隔离,无需上传云端 可独立作为 Ubuntu AI 电脑使用(接键鼠显示器),也可多机联网扩展
顯示更多
0
30
11
0
轉發到社區
阿里平头哥把真武AI芯片的整套软件栈开源了。 开发者可以直接获取底层驱动,编译器,算子库和调试工具,不用只靠芯片厂商内部适配。 这套软件栈叫T-Head SAIL,已经适配PyTorch,TensorFlow,vLLM和SGLang等260多个训练与推理框架。平头哥称,主流推理框架的平均适配时间可以压到7天以内。 公司同时披露,真武AI芯片截至今年4月累计出货超过56万片,覆盖400多家客户。
顯示更多
有意思,这也许是昨晚DeepSeek-V4-Pro发布失败的原因。 近三小时前有中国网友发现, @deepseek_ai 官方 API 的模型指纹发生了变化。 也许这意味着一些事情。 此前 DeepSeek V4 Pro 和 Flash 返回的 fingerprint 都是非常可读的 vLLM 描述格式: Pro: fp_v4pro_20260812_prod0820_fp8_kvcache_20260402 Flash: fp_a18b46594c_prod0820_fp8_kvcache_20260402 里面甚至可以直接读出版本、生产环境、FP8、KV Cache 等部署信息。 但大约半小时后,两边的 fingerprint 都突然变成了纯 32 位哈希: Pro: a307abda487cd1b463329ccb945ce396 Flash: a26a7955944dc5c60445bff77fac9c8e 而且不是单个模型变化,是 Pro 和 Flash 同时切换。 模型指纹变化,也可能来自推理后端、部署版本、量化配置、缓存策略,甚至只是 fingerprint 的生成规则被改了。 所以我倾向于认为,这至少说明 DeepSeek 的线上推理栈刚刚发生了一次比较明确的切换。 可能是新部署,也可能是新的 serving/harness,也可能单纯是不想再让外界通过 fingerprint 猜他们后台到底在跑什么🤔
顯示更多
0
13
50
1
轉發到社區