註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 HuggingFace
HuggingFace 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 HuggingFace 的搜尋結果
HuggingFace 独立研究者 AuroraAI-Research 把语言模型压到了 8 万参数——训练是在一台小米手机的 CPU 上完成的。 《Aurora-80K:一个现代微型语言模型》 Aurora-80K 是 AuroraAI-Research 发布在 HuggingFace 上的微型语言模型:正好 8 万参数,Apache 2.0 许可,整个权重文件只有约 0.3MB。作者称这是 Aurora 系列的新起点,用来取代之前那些"低效的旧模型",更大尺寸的版本已在路上。 最有意思的是词表设计。8 万参数的模型通常只能用几百词的词表,它却塞进了 4096 词表——靠分解表示:嵌入层拆成 64 个 cluster 向量和 64 个 sub-token 向量,相加组合出全部 4096 个词。128 个向量就顶起一张 4096 宽的嵌入表。 输出层同样分解。推理时先预测 cluster(64 选 1),再在 cluster 条件下预测 sub-token(64 选 1),两级合起来就是完整的 4096 词表概率。输入输出两头都省。 架构是现代配置的极简版:2 层 Transformer、hidden 64、SwiGLU 前馈、RMSNorm、ALiBi 位置编码配 256 的注意力窗口、4 头注意力。评测数字:Wikitext-2 BPB 3.2902,BLiMP 52.31%,Arc-Easy 26.05%。 训练数据是 fineweb-edu 按教育分 4 分以上过滤出的约 4000 万 token,跑 2 个 epoch。训练设备是小米 14T Pro,钉在 4 个 Cortex-X4 CPU 大核上,算上预处理和 tokenizer 训练,全程约 6 小时。 适合玩极限压缩、或者想研究"现代架构缩到最小长什么样"的人。仓库里权重、tokenizer、 齐全,装个 torch 就能在 CPU 上跑。AuroraAI-Research 主页还会更新更大的尺寸。 原文: #Aurora80K# #TinyLM# #开源模型#
顯示更多
#OpenAI# 发布 #HuggingFace# 攻击事件的详细技术报告,认为攻击的根本原因不只是沙箱环境存在漏洞。 OpenAI 称此次失控由多种因素叠加引起,包括奖励作弊、面对无解任务时过度坚持、绕过限制建立非授权通信、不同智能体相互接受目标。 OpenAI 强调若部署 ChatGPT 正式环境中的系统提示和生产安全机制,可以大幅度降低模型攻击基础设施的概率。 查看全文:
顯示更多
本着透明原则,HuggingFace CEO 对OpenAI提了两个要求: -把失控agent的行为记录公开,让研究社区研究清楚; -再拿出1亿美元算力,帮HuggingFace社区搭建更强的网络防御。 这是首次由自主 Agent 发起的网络攻击,是前所未有的事件,也需要前所未有的应对!
顯示更多
#人工智能# #HuggingFace# 首席执行官要求 OpenAI 赔偿 1 亿美元算力和公开 AI 智能体攻击的完整细节,不过目前 OpenAI 尚未发布回应。 此前 HF 遭到未知智能体攻击,事后 OpenAI 承认这个智能体是从内部环境中逃逸的。 不过 OpenAI 到现在也没有公布细节,HF 认为这是业界首次出现 AI 智能体自主发起的攻击,本身这就是史无前例的事件,所以也应该采用史无前例的应对措施。 查看全文: PS: HF也联系FBI报警了。
顯示更多
0
62
123
6
轉發到社區
🎉我又发现小米在HuggingFace上开源了新东西,4B参数的具身机器人小模型 开源权重是BF16, 如果能优化到4bit权重,能直接运行到2G显存的机器人上,大大降低了成本 但是还有个大问题,这个小模型主要解决是图像和场景生成,还不能直接当作机器人的决策大脑
顯示更多
#NVIDIA# 以 129.303 亿美元收购🤗#HuggingFace,为什么收购金额有零有整?因为这里暗藏小彩蛋。# 129303 是 U+1F917 的十进制表示,转为十六进制就是 1F917,对应🤗这个表情。 若使用十六进制颜色即 #129303# 则是绿色,与英伟达的品牌色比较接近。 查看全文:
顯示更多
0
11
121
7
轉發到社區
#人工智能# 抱抱脸🤗HuggingFace 被爆准备以 130 亿美元出售自己,目前正在寻求潜在的买家。 抱抱脸并非 AI 模型训练公司,而是面向 AI 公司和开发者的服务平台,专注于构建开放 AI 生态系统。 日前商业内幕网站爆料称,该平台计划以 130 亿美元的估值寻求出售,不过暂时还没有明确买家。 查看全文:
顯示更多
0
21
45
0
轉發到社區
有兴趣的朋友可以上 huggingface 看看业务需要的数据格式,然后自己创造新的,高质量的数据集,然后就能训练出自己的了不起的垂直大模型(或者蒸馏出高质量模型)
顯示更多
炸场了兄弟们🔥 HuggingFace 全球模型榜前排,直接被中国开源模型包了。 ✅ 月之暗面 Kimi K3:开源权重冲上全球模型趋势榜 ✅ 百度 Unlimited OCR:从 GitHub 到 HuggingFace 一路霸榜,发布一个多月热度还在往上冲 这俩现在基本可以叫:中国开源模型「双子星」。 更有意思的是,Unlimited OCR 不是单纯刷榜好看,它真打到行业痛点了:长文档 OCR。 过去解析书籍、论文、报告,都得一页页拆、再拼起来。页数一多,上下文丢、表格断、显存涨、速度慢,全是老毛病。 百度这次搞了个 R-SWA 机制,让模型像人读长文档一样:一直盯着原文,只留最近一段内容当工作记忆。结果就是几十页文档一次连续解析,KV Cache 还能保持恒定。 所以你会看到它被杨立昆转发,被海外 AI 博主刷屏,GitHub Star 冲到 1.97 万,HF 下载量 265 万。 另一边 Kimi K3 也很猛:2.8 万亿参数 MoE,原生多模态,百万 token 上下文。马斯克一句 "Impressive",Vercel CEO 说它网页工程评测综合第一。 ✅ 一个长上下文多模态,一个长文档解析 ✅ 一个冲模型能力,一个打真实场景 这波不是"国产替代"的老叙事了。 是中国 AI 开源,真的开始在全球开发者社区拿话语权了。 中国开源模型,已经不是追赶者了。
顯示更多
昨天发布的GLM-5.3-Flash在HuggingFace开源的同时 GLM-5.3本体也要在明天开源了 不过我期待社区魔改小内存的GLM-5.3-Flash