🚀 韩国端侧芯片独角兽估值翻四倍
DeepX D 轮估值冲 22 亿美元
端侧 NPU 已签八国 30 余量产合同
AI 从云端向终端扩散加速
A股技术创新公告:技术创新公告(近1-2周)
【炬芯科技】第二代存内计算NPU技术取得重大突破,搭载新NPU的SoC芯片将于今年正式流片,预计明年实现多品类规模化导入。上半年端侧AI芯片营收占比已超25%,标志公司AI化转型进入新阶段。
【隆华科技】旗下丰联科光电实现G8.7 AMOLED银合金管靶100%全链条自主量产出货,彻底打破国外垄断,成为国内唯一具备该规格成熟量产及稳定供货能力的企业,填补国产高端核心显示材料空白。
【川恒股份】获2项国家专利,"切割天井爆破成型布孔结构"已在矿山建设应用,另一专利解决磷矿井下水仓淤泥中有价资源回收问题,正在中试试验。
【上海阿为特】获"金属导轨与塑料导轨槽控制推力制造方法"发明专利,该工艺已应用于科学仪器精密零部件生产,后续将拓展至半导体设备领域精密零部件制造。
显示更多
好多开发板都是Rockchip方案,我看飞牛OS已经对RK3568做了NPU支持,瑞芯微果然性价比高
DeepSeek v4 的白皮书里有个彩蛋。
英伟达的 GPU 和华为的 NPU,均验证出相同范围的加速效果,加上今晚还要开 DeepSeek v4 华为昇腾的首发直播,不知道会不会影响到英伟达。
显示更多
历史性的时刻!时隔一年,中国 AI 大模型 DeepSeek 再次发布新版,最强开源大模型 DeepSeek v4。
API 定价比 GPT 5.4 和 Claude Opus 4.6 便宜 10 - 50 倍,支持 1M 百万字超长上下文,且统统开源!
本次分为 V4 Pro 与 V4 Flash 两个版本。
其中,V4 Pro 在推理能力、世界知识、数学、STEM、竞赛代码等推理评测中表现领先,官方称其性能,已比肩美国顶级 AI 闭源模型。
V4 Flash 则主打更快、更经济的 API 服务,适用于小公司或资金有限的个人开发者,并在简单 Agent 任务中接近 V4 Pro。
官方表示,V4 采用全新注意力机制与 DSA 稀疏注意力,大幅降低长上下文计算和显存需求。
即日起,1M 上下文将成为 DeepSeek 官方服务标配。
便宜、好用、开源,属于中国的 AI 时刻再次到来。如果你不知道这有多恐怖,可以看下图的 API 定价,人民币单位!
显示更多
想要一起洗澡吗?
软乎乎的大奶子可以帮到你什么?玩自己奶头好爽啊,要拉丝了
♻️ 真香!DeepSeek 公开的 DeepJIT,让 GPU 算子编译一次就能在多用户、多进程、多台机器之间共享复用,英伟达显卡和华为昇腾 NPU 走的是同一套接口。
仓库 9 月 8 号才建,挂在 DeepSeek 官方 GitHub 账号下,只有头文件,引进 C++20 项目就能用。
跑大模型时不少自定义算子是运行时现编译的,一个进程编一遍、一台机器又编一遍,卡一多,光等编译就把启动拖慢了。
DeepJIT 的做法是给每份编译产物算一个缓存键,源码、引用的头文件、编译器版本、编译选项都算进去,结果放进本地或分布式文件系统上的共享目录,别的进程、别的节点命中了就直接加载,不用再编。
用 PyTorch 的也不用额外折腾,默认跟着当前的 CUDA 流或 torch_npu 流走,通过 pybind11 就能接进来。目前只支持 Linux,按历史记录预热缓存、直接从 Python 传源码编译这两项还在开发中,暂时用不了。
编一次到处用,集群越大,省下的等待时间越多。
GitHub:
显示更多