註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 NVIDIADGX-1
NVIDIADGX-1 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 NVIDIADGX-1 的搜尋結果
1/ 🧠 為什麼未來的 personal AI computer(像 NVIDIA DGX Spark)真的能跟 data center 一較高下? 不是因為桌面變強到取代雲端,而是因為 AI 的「需求結構」正在分裂 —— 訓練留在雲端,推論回到本地。 2/ 關鍵突破一:FP4 改寫遊戲規則 70B 參數的模型,用 FP16 要 140GB 記憶體; 換成 FP4 → 只要 35GB。 一台配 128GB unified memory 的桌面機,就能跑得動以前要 8 張 H100 才能裝下的模型。 精度損失?用 QAT(量化感知訓練)幾乎可以忽略。 3/ 關鍵突破二:Memory Wall 正在被打破 LPDDR5X 頻寬不夠? •Apple M4 Ultra 用超寬位元寬度做到 ~800 GB/s •LPDDR6(2027)頻寬再翻倍 •NVIDIA DGX Spark 用 GB10 + 連貫記憶體架構 桌面端不再是「閹割版 GPU」,而是「為推論優化的新物種」。 4/ 關鍵突破三:你根本不需要 data center Data center 解決的是: ✅ 訓練 frontier model(兆級參數) ✅ 服務全球數十億用戶並發 個人需要的是: ✅ 一個跑得動 70B–200B 模型的本地大腦 ✅ 隱私、低延遲、不用月費 這兩件事根本是不同問題。 5/ 投資啟示 💡 •HBM 仍是訓練端王者(SK Hynix、Micron) •但邊緣推論晶片 + 高頻寬 LPDDR/統一記憶體會是下一個十年的新戰場 •NVIDIA DGX Spark、Apple Silicon、AMD Strix Halo、高通 X Elite —— 都在卡位 未來不是雲端 vs 桌面,是雲端做訓練,桌面做你的 AI。
顯示更多
Avarok Cybersecurity 开源了 Atlas,一个用 Rust + CUDA 从零写的大模型推理引擎。它不依赖 Python 和 PyTorch,项目方称 Docker 镜像约 2.5GB,冷启动不到 2 分钟,目前主要面向 NVIDIA DGX Spark 的 GB10 平台优化。 官网模型矩阵显示,Atlas 在单台 DGX Spark 上跑 Qwen3.5-35B-A3B 可到约 130 tok/s,跑 Qwen3.6-35B-A3B 约 71 tok/s。Atlas 官网和 Hugging Face 页面称,在同硬件下,Qwen3.5-35B 平均约 111 tok/s、峰值 130 tok/s,vLLM 约 37 至 38 tok/s。 这组「3 倍 vLLM」数据来自项目方公开基准。GitHub README 写明,测试使用的是「法国首都是哪」这类短 prompt,生成上限不超过 30 个 token,temperature 为 0.1。这个口径更接近短请求、低并发、快速响应场景,也正好对应 Atlas 想打的卖点:用更小镜像、更少依赖和更快冷启动,把本地大模型服务变得更轻。 Atlas 现在仍是早期项目,真实生产场景还要看后续长文本、高并发和复杂工具调用测试。GitHub 上已有用户反馈输出质量和工具调用稳定性问题,相关 Issue 截至 2026 年 5 月 11 日仍处于 Open 状态。对开发者来说,它更像一个值得关注的新推理底座,而不是已经能全面替代 vLLM 的成熟方案。
顯示更多
推荐这个测试,Unsloth 对 Kimi K3 的极端量化。 一个 2.8T 参数的模型,压到几百 GB 仍保留大部分准确率。 Unsloth 团队在 7 月 29 日发布了 Kimi K3 的 GGUF 量化版本,并给出了 1-bit 和 2-bit 量化的实测数据。这是目前第一个对 2.8T 参数模型做极端量化的公开结果。 量化效果 | 精度 | 大小 | 准确率 | 对比全精度 | |------|------|--------|-----------| | 全精度 (MXFP4) | 1.56 TB | 100% | — | | Q8 | ~1.6 TB | lossless | — | | Q4 | ~1.1 TB | — | — | | Dynamic 2-bit | 861 GB | ~90% | 45% 更小 | | Dynamic 1-bit | 594 GB | ~78.9% | 62% 更小 | 关键数字:Dynamic 2-bit 在 861 GB 下达到约 90% 准确率,比全精度小了 45%。 即使压到 1-bit(594 GB),仍保留约 78.9% top-1 准确率。 实际意义 594 GB 意味着什么?NVIDIA DGX Station 或多台 Mac Studio 串联 128GB RAM 设备可以运行。Unsloth 团队还在尝试把 1-bit 版本压到 512 GB 以下。 通过 Unsloth Studio 或 llama.cpp 直接加载。 Benchmark 对比 Unsloth 同时给出了官方 benchmark 数据作为参考系:Kimi K3 的 Terminal-Bench 2.1 (88.3) 与 GPT-5.6 Sol (88.8) 几乎持平,BrowseComp (91.2) 超过 Fable 5 (88.0) 和 Sol (90.4)。GPQA Diamond (93.5) 仅次于 Sol (94.1)。 模型: 文档: #KimiK3# #Quantization# #GGUF#
顯示更多