注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 CUDA
CUDA 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 CUDA 的推特
CUDA 的核心理念,是把原本给电子游戏用的并行计算电路,转手交给科学家 不用再靠处理三角形去榨那每秒 10 亿次的浮点运算,整个架构被打开,供更广泛的用途使用 有个说法很传神:你手里是一张游戏显卡,但它带一个开关,轻轻一拨,它就变成了一台超级计算机
显示更多
Avarok Cybersecurity 开源了 Atlas,一个用 Rust + CUDA 从零写的大模型推理引擎。它不依赖 Python 和 PyTorch,项目方称 Docker 镜像约 2.5GB,冷启动不到 2 分钟,目前主要面向 NVIDIA DGX Spark 的 GB10 平台优化。 官网模型矩阵显示,Atlas 在单台 DGX Spark 上跑 Qwen3.5-35B-A3B 可到约 130 tok/s,跑 Qwen3.6-35B-A3B 约 71 tok/s。Atlas 官网和 Hugging Face 页面称,在同硬件下,Qwen3.5-35B 平均约 111 tok/s、峰值 130 tok/s,vLLM 约 37 至 38 tok/s。 这组「3 倍 vLLM」数据来自项目方公开基准。GitHub README 写明,测试使用的是「法国首都是哪」这类短 prompt,生成上限不超过 30 个 token,temperature 为 0.1。这个口径更接近短请求、低并发、快速响应场景,也正好对应 Atlas 想打的卖点:用更小镜像、更少依赖和更快冷启动,把本地大模型服务变得更轻。 Atlas 现在仍是早期项目,真实生产场景还要看后续长文本、高并发和复杂工具调用测试。GitHub 上已有用户反馈输出质量和工具调用稳定性问题,相关 Issue 截至 2026 年 5 月 11 日仍处于 Open 状态。对开发者来说,它更像一个值得关注的新推理底座,而不是已经能全面替代 vLLM 的成熟方案。
显示更多
DGX Spark vs Mac M5 Max 128GB 统一内存 4TB SSD Cuda vs MLX NVIDIA DGX OS vs Mac OS MacBook 多了Nano-texture display 但 MacBook 也贵了 6000 NZD 谁是本地 AI 更优解? 我现在 Claude & Codex 都是最贵的 Max 订阅,Claude 感觉不够用。如果能帮我省点订阅费,也算值了
显示更多
当你要用本地大模型做视频的时候 现在摆在你面前的选择,只有CUDA生态 要么买DGX Spark,要么买N卡
苏妈这次,可能把本地AI的门槛打下来了,但我还是优先选择cuda生态!
AMD的股东们,开始兑现投资的乐趣。在英伟达(NVDA)凭借CUDA生态,统治AI市场的背景下,苏姿丰为AMD塑造了独特的AI叙事:提出AI不仅是GPU的事,而是CPU、GPU、FPGA以及自适应计算的集合。这种“全栈算力”的布局,使AMD成为唯一能在大规模数据中心,提供完整解决方案的公司。作为MIT的电机工程博士,苏姿丰能直接进入实验室检查晶片样片,这种“懂行”的领导风格,让工程师文化重新回归AMD。
显示更多
DeepSeek 内蒙的数据中心,计划使用华为GPU 集群 16 万 950DT 梁文锋之前的确说过,“英伟达没有护城河”,华为能完全替代英伟达。 华为的整体性能应该不如 H200,更不用提 Blackwell、Rubin 平台,CUDA 生态做训练依然是首选 这批芯片应该是做推理用的 另外侧面印证中国国内 CXMT、YMTC 产能对国内需求都供不应求,两年内应该不会影响到全球价格
显示更多
0
13
16
0
转发到社区
今天继续跟一下 CMP 170HX。 这次没有80G神迹,反而抓到一个挺有价值的软件坑。 8G版解锁64G以后,有人在 CUDA 13.3 + vllm.cpp 下第一次 CUDA Graph capture 就直接炸,报 CUBLAS_STATUS_INTERNAL_ERROR。第一反应很容易怀疑显存、地址映射,甚至怀疑170HX又抽风了。 结果现在基本查清楚了,不是卡坏了,是 CUDA 13.3 的 cuBLASLt 在 graph capture 里查 heuristic 的兼容性问题。 修复也已经出来了,提前把 GEMM heuristic cache 好,再进 CUDA Graph,同一张64G 170HX 连续测试正常,而且 token 输出一致。把 cache 关掉,又能100%复现原来的报错。 更有意思的是,后来 GB10 上也复现了同样的问题。 所以这个结论很重要。 以后170HX报 CUDA error,别第一时间就说显存坏了。现在这个生态已经进入一个新阶段了,很多问题不是硬件解锁本身,而是驱动、CUDA、vLLM、graph capture这些软件层一层一层互相打架。 8G版64G继续往生产卡方向走。 10G版40G正常推进。 10G版80G,还是老规矩,没看到多人独立复现,全显存唯一pattern,多CUDA context,再加24到72小时0 Xid 0 error之前,我还是当彩票。
显示更多
英伟达 $NVDA 黄仁勋,不仅是顶级工程天才,更是顶级金融架构师。他用CUDA锁定软件,用NVLink锁定集群,用极速迭代锁定二手残值,把高风险的半导体周期股,包装成了全球科技基础设施的“基建债券”。老黄既夸中国有100万人在搞模型,又说“美国拥有无比的优势,那就是川普总统”。
显示更多
⚡ 一个二进制文件跑本地大模型,还给你 OpenAI 风格的接口 GitHub 上 5.7K stars,Rust 写的 本地跑模型最劝退的是环境:装 Python、配 CUDA、编译推理后端,一套下来两小时,换台机器再来一遍。 Shimmy 把这些压成一个单二进制:直接加载 GGUF 模型文件,起来就是 OpenAI 风格的 API 端点,原本调云端的代码改个地址就能用。2.0 版本把 llama.cpp 后端移除了,改用自研的 Airframe WebGPU 推理引擎,Rust 加 WGSL 实现。 模型覆盖上,项目列了 11 个模型家族和 25 种已认证的模型与量化组合,Q4_0、Q4_K_M、Q5_K_M、Q6_K 这些常见量化格式都在。还支持 YaRN RoPE 扩展上下文和 INT4 KV 缓存量化,显存紧张的机器能多撑一会儿。 本地推理这件事,越简单的方案活得越久。 GitHub:
显示更多