🧊 又挖到一份 PyTorch 入门笔记,专治「张量这块一直没搞明白」
GitHub 上 1K stars
学深度学习卡在第一关的人比想象中多。教程一上来就是搭网络训模型,但真到自己写的时候,形状对不上、广播规则不清楚、矩阵乘法维度顺序搞反,报错信息看半天不知道错在哪。问题不在模型,在张量这层基本功没打牢。
这份材料就只干这一件事,把张量从头讲透:张量怎么初始化、类型怎么转、数学运算和比较运算怎么用、矩阵乘法和批处理怎么对齐维度、广播规则到底怎么生效、索引和形状变换有哪些写法。
形式是一个 Jupyter Notebook,`pytorch_fundamentals.ipynb`,边看边改边跑,比读文档快得多。MIT 协议。
地基没打好,上面盖多高都会晃。
GitHub:
顯示更多
简单了解了下,lightning(即 PyTorch Lightning / Lightning AI 框架)在深度学习和 PyTorch 生态里非常流行…
所以,最近的投毒喜欢干玩 AI 工程的技术人员?🤦🏻♂️顺便干掉依赖这些的各大服务。
顯示更多
🐳 DeepSeek 刚开源了 DeepSelect,大模型里“从海量候选中挑出前 K 个”这一步,比 PyTorch 自带的 torch.topk 快 2 到 20 倍。
它是给 DeepSeek 稀疏注意力 DSA 和采样器用的 TopK 内核,而 DSA 就用在 DeepSeek V3.2、V4 和 V4.1 上。仓库昨天才建,今天就发了 1.0.0。
稀疏注意力的思路是每一步只看最要紧的那部分 token,挑哪几千个就靠 TopK;生成时从约 12.8 万的词表里采样,也要先挑出前 K 个候选。
DeepSelect 把这两个场景分别做了优化:批大小、词表大小随便设,K 最多到 4096,每一行还能单独设长度上限,接口同样返回 values 和 indices 两个张量。默认开着 NaN 检查,发现坏数值直接终止程序。
如果你在做推理框架、抠每一步的开销,可以拿仓库自带的基准测试跑一遍对比。
GitHub:
顯示更多
学深度学习一上来就 import torch,模型能跑起来,面试官问一句反向传播里梯度怎么传的,支支吾吾答不上来。
TrenTorch 的路子是不用 PyTorch,只靠 NumPy 从零写一个自己的深度学习框架,它照着哈佛 CS249r 课程的 TinyTorch 重做了一遍,还往前推了一段。
一共 20 个模块分四部分,先是张量、激活函数、层、损失、自动求导、优化器、训练循环这 8 块基础,接着卷积做图像分类。
GitHub:
第三部分是分词、词嵌入、多头注意力和 Transformer,最后写出 GPT 式的语言模型。第四部分讲推理,性能分析、量化、KV 缓存加速,优化器一路做到 AdamW、Lion、Muon。
每过一段会解锁一个历史里程碑复现,拿自己写的框架跑经典模型。装好自带一个 tren 命令行,进度和测试都在里面管。
20 个模块作者说小到能一口气读完,我觉得比刷文档踏实,想真正搞明白框架底下在干什么的可以照着敲一遍。
顯示更多
想在自己产品里加文字识别功能,装完 Tesseract 调半天参数,中英混排还是识别得七零八落。
docTR 是个 PyTorch 写的文字识别库,几行代码就能把 PDF 或者图片里的文字整页取出来。
它分两步走,先定位每个词在页面上的位置,再识别里面的字符,两步各自的模型都能单独换。
GitHub:
打开版面识别之后,标题、正文、表格、页眉页脚会被分别标出来,取完就知道哪段是哪段。
扫描件常见的歪页、旋转页有专门的处理选项,输出正框还是斜框自己选。
Hugging Face 上挂了在线演示,也有 Colab 笔记本,不想装环境的话先在网页上丢张图试试效果。
项目最早由 Mindee 做出来,现在交给 t2k 团队接手维护,前两天还在提交代码。
要给自己的项目接一层文字识别,比从零训个模型省事不少。
顯示更多
想学强化学习,看论文太硬核,看博客又太碎片,找一份系统又不劝退的入门资料不容易。
《The Little Book of Reinforcement Learning》这本开源书籍,篇幅不长,从基础概念讲到常用算法。
附带全套 PyTorch 代码,书里讲到的每个算法都有可运行的实现,边读边练。
GitHub:
还有一份动态规划的详细推导作为补充,想深入数学细节的可以对照看。
对强化学习感兴趣、想从零入门的朋友,这本小书适合当起点。
顯示更多
找回被开发工具缓存和 ML 模型占用的磁盘空间
一个免费开源桌面工具,帮开发者和 ML 工程师清理各种工具缓存——Hugging Face、Ollama、PyTorch、npm、pip、Cargo、Docker 等 25+ 类来源。
能识别"下载过但从未使用"的 ML 模型,量化不同 Python 环境间的重复包,每个项目都给出安全评分。所有清理都走回收站,不删文件,不收集数据,支持 macOS 和 Windows。
顯示更多
阿里平头哥把真武AI芯片的整套软件栈开源了。
开发者可以直接获取底层驱动,编译器,算子库和调试工具,不用只靠芯片厂商内部适配。
这套软件栈叫T-Head SAIL,已经适配PyTorch,TensorFlow,vLLM和SGLang等260多个训练与推理框架。平头哥称,主流推理框架的平均适配时间可以压到7天以内。
公司同时披露,真武AI芯片截至今年4月累计出货超过56万片,覆盖400多家客户。
顯示更多
如果现在重新学深度学习,我反而会更重视这种「能把经典论文拆开跑一遍」的资源。
有人把 Ilya Sutskever 推荐过的 30 篇经典论文,全部做成了可运行的教学实现,而且尽量只用 NumPy,不依赖 PyTorch / TensorFlow 这类框架。
这点很重要,因为框架太强以后,很多细节会被封装掉。你知道怎么调用 attention、怎么 import 一个 ResNet,但未必真的理解梯度怎么流、信息怎么传、记忆怎么写入、模型为什么会稳定训练。
这个仓库覆盖的范围也很完整:RNN、LSTM、AlexNet、ResNet、Attention、GNN、VAE、Neural Turing Machine、Scaling Laws、RAG、Lost in the Middle,基本是一条从早期深度学习到现代大模型的技术脉络。
它的价值在于,把「经典论文阅读清单」变成了「可以动手拆开的学习路径」。
读论文容易停在概念层面,跑一遍实现,才会真正知道每个模块在系统里承担什么角色。
AI 时代很多人直接从调用大模型开始学,但底层直觉依然很值钱。
知道模型为什么能工作,可能比只会用模型更抗周期。
顯示更多
极其良心:开箱即用
单个数据集 6.9GB 到 5.1TB 不等,全统一 HDF5 格式,支持 Hugging Face 流式读取。官方还给了一键安装的 PyTorch 接口:
```python
from the_well.data import WellDataset
# 一行代码加载数据
trainset = WellDataset("base_path", "active_matter")
顯示更多