註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI   🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
433 正在關注    10.9K 粉絲
万万没想到奥特曼昨夜放了大招,有一种王者归来的气势。原来我一直以为 OpenAI 的 Whisper 已经到了语音识别的天花板了。看来是我认知太浅薄了。 由于老婆就是川渝那边的,方言的味道绝对十足。如果走在街上,加上外界环境的嘈杂声,我之前用的 Whisper 测试过简直就是个瞎子,识别出来叽里呱啦的一大串乱七八糟的字符真的有点神奇。 这两天无意间看到了这个开源的模型,Hojo-ASR-Multi-V1,据说是语音识别领域的新星。 🔥 Hugging Face Open ASR Leaderboard 多语言榜全球第 7,开源多语言 ASR 第 1。 🎉五语种平均 WER 3.54%,模型权重开放、评测公开、结果可复现。 😄同时支持普通话、英语、粤语和四川话等多语言、多方言识别。 特意找来测试了一下,发现真的有意思。 更有意思的是 Hojo 的处理过程:声音 → Qwen3-Omni 音频编码器听懂声音 → Adapter 转换特征 → Qwen3-4B 生成文字。 通俗一点的讲就是:声音进来 → 音频编码器先“听懂”声音 → Adapter 把声音信息翻译成大模型能理解的格式 → Qwen3-4B 再把它变成文字。 而 Whisper:声音进来 → 转成频谱图 → Whisper 编码器提取声音信息 → Whisper 解码器直接生成文字 两者对比就是Whisper 的重点是 听声音 → 写文字,而 Hojo 则更偏向 听声音 → 理解声音 → 再根据理解生成文字。 所以最后我在本机做了一个测试结果还是非常不错的。 先解释一个百分比,CER = Character Error Rate,字符错误率,百分比越小越好。 然后可以看看我的视频 hojo 和 whisper的对比,做了三个例子,川渝话、广东话、普通话。 川渝话:hojo CER= 0%, whisper CER=42.9% 广东话:hojo CER=18.8%, whisper CER=43.8% 普通话:hojo CER=16.7%, whisper CER=25.0% 应该说 hojo这一套效果还是非常不错的。 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:
顯示更多
0
38
90
17
轉發到社區
「千问办公」给自己留了后手,随时能接入第三方大模型。 问题来了。「豆包工作」是不是也早就开了后门,随时能接入第三方呢? 豆包+飞书生态,真的有点吊打workbuddy+千问办公,就看能不能抓住用户使用习惯了。 一篇长文让你入门豆包,让你从此使用豆姐不再迷路。
顯示更多
HuggingFace被曝卖身英伟达:129亿美元! 一边是 OpenAI、Google、Anthropic、小米、阿里等等都在自研芯片,就是想减少对英伟达的依赖。 另一边是英伟达的老黄,要收购 Hugging Face,也就是收购AI界的Github。 核心就是一边闭源大厂都想摆脱对英伟达的芯片依赖,另一边是英伟达想在开源领域掌握更多的话语权。 Hugging Face作为开源AI的交通枢纽,一旦被英伟达收购,就能继续在开源社区为大家提供源源不断的算力供应,继续大卖GPU。 Github上开源的都是代码,那么HuggingFace 上开源的模型大致都包含了哪些东西呢? 最重要的莫过于模型权重,当然只有模型权重是远远不够的,还需要很多其他的配件。 下面暂时就主要来学一下模型权重到底是什么? 模型权重,可以理解成大模型训练之后真正学到的东西。 传统各种我们用到的软件或者手机里的APP能力都是写在代码里的,是程序员提前规划好的; 但大模型不是这样,大模型的代码更多的只是搭建好的一个“大脑结构”,真正决定它会不会写代码、懂不懂知识、能不能推理的,是训练之后得到的权重。 这些权重,本质上就是模型内部海量的数字参数。 比如你输入“苹果”,如果前面提到“甜、营养、水果”,模型会更倾向理解成水果;如果前面提到“iPhone、芯片、手机”,它就会理解成 Apple 公司。 这种判断并不是程序员一条条写进去的,而是模型在训练过程中,看了大量数据,不断预测、犯错、纠正,再一点点的调整内部参数形成的。 所以可以简单的理解成: 代码 = 大脑结构 训练数据 = 学习材料 训练过程 = 不断学习和纠错 权重 = 最终学出来的能力 比如实践哥测评的 Apodex-1.1-mini-GPTQ-Int4 35B 的大模型,意味着它大约有 350 亿个参数。这些参数组合在一起,最终决定了模型的语言、知识、推理和编程能力。 Hugging Face 上仓库总大小约 24.7 GB,而原始未量化版本仓库大约 71.9 GB。 所以所谓开放权重,其实就是把模型训练完成后的这套核心参数开放出来,让别人可以自己下载、运行、量化、微调和部署。
顯示更多
Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。 现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。 那问题来了: 后训练到底训练进去了什么? 是知识更多了?推理更强了?还是模型“干活的方式”变了? 我正好部署了两个特别适合做 A/B Test 的模型: 🔥Apodex-1.1-mini-GPTQ-Int4 vs 它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4 但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了: 在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。 同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。 一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。 这个我偏不信。 我正好有机器。我有两张 4090。 一张跑 Apodex,一张跑原版 Qwen。 同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。 所以这个实验非常干净: 底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。 结果越来越有意思。 甚至测出来一层能力,已经开始往 Fable 那个方向靠了。 🔥我给这两个模型和 Fable 出了一道预测题。 2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。 我提前几个小时,让它们预测: 总营收 GAAP 毛利率 Data Center 营收 下一季度指引 要求自己上网调研,最后给判断。 本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。 🔥结果这道题出了个非常离谱的乌龙。 底座其实非常努力。它搜了 40 次。 而且最离谱的是:它中间已经把正确答案全部查出来了。 然后到了最终答案——它自己把这些正确数据全扔了。 我一开始都看懵了。 后来翻完整 Agent 日志,才发现真正有意思的事情: 当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。 🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。 它看起来会更聪明、更机灵。 它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。 以后每个企业,都会有一个自己的模型。 不一定是从零预训练。 但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。 🔥小模型不一定非得和 Frontier Model 拼所有能力。 把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。 最后夸一下 Apodex。 这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。 一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。
顯示更多
最近发现上万 star 团队 MemOS,又新开源的了一个项目 Memmy。 最近体验了一番。它把我眼前最难搞的一个问题解决了: 换一个 AI 工具,我就得重新给这个AI Agent 搭建一套完整的harness 。 每天在 Claude Code、Codex、Grok、甚至国产Agent 之间来回切的人应该特别有感。 刚刚还在 Codex 里聊了半天项目架构、技术选型、踩过的坑,结果额度一用完,切到 Claude Code,又得从头解释一遍。 项目是干嘛的、为什么这么设计、哪些方案已经试过、哪些坑千万别再踩…… 真的很烦。 Memmy 干的事情其实特别直接: 把记忆从某一个 Agent 里抽出来,变成一份属于你自己的共享记忆。 也就是:Agent 随便换,记忆别清零。 更关键的是,它不是只从今天开始帮你记。 授权之后,它可以直接扫描你本地已经存在的 Agent 历史,比如 Claude Code、Codex、OpenCode、OpenClaw、Hermes、DeepSeek Harness 等,把过去几个月散落在不同工具里的对话重新挖出来。 然后从里面整理出真正值得长期保留的东西: 项目背景、技术选型、用户偏好、重要决策、踩过的坑、失败方案。 以前那些躺在 session 里的聊天废墟,现在终于可以重新变成资产。 这一点我觉得特别重要。 因为很多 Memory 产品解决的是: “从今天开始我帮你记。” 但 Memmy 想解决的是: “你过去已经积累的那些历史,我也帮你接回来。” 而且它自己还不只是一个记忆插件。 它本身就是一个比较完整的本地 Agent: 日常用有桌面端 GUI 极客可以走 CLI / TUI 支持 OpenAI 兼容 API 支持 Skills、MCP 等接入方式 最新版 Linux 也已经支持 所以你既可以直接把 Memmy 当 Agent 用,也可以只把它放在后台,当成统一的 Memory Hub。 然后 Claude Code、Codex、Cursor、OpenClaw、DeepSeek Harness 都来读同一份记忆。 上面的 Agent 随便换, 下面的 Memory 不动。 这个架构我觉得才是它真正有价值的地方。 举几个特别现实的例子。 你在 Codex 里确认了一个架构选型,切到 Claude Code,它已经知道。 你在 Cursor 里踩过一个坑,新开 DeepSeek Harness,不会再踩第二遍。 Claude Code 额度没了,直接切 Codex,上下文不会重新归零。 Agent 可以换,但项目的大脑不应该跟着失忆。 所以我现在越来越觉得: 代码靠 Git 同步,AI 的记忆以后也需要一个类似 Git 的东西。 Git 保存的是代码现在是什么状态。 Memory 保存的是: 为什么变成这个状态。 为什么选这个架构。 为什么放弃那个方案。 哪些事情已经验证过。 你真正想做什么。 这些东西以前全被锁死在各个 Agent 的 session 里,现在终于有机会跟着用户自己走。 它背后的技术底座就是同团队的 MemOS,GitHub 已经一万多 Star。 MemOS 想做的也不只是“向量库 + 摘要”,而是更完整的 Memory OS。 所以 Memmy 可以理解成: 把 MemOS 这类记忆基础设施,真正包装成普通用户可以直接使用的产品。 当然,这个项目现在还比较早期。 各家 Agent 的本地格式升级后,适配可能会出问题;记忆蒸馏、旧信息失效、跨项目隔离,也都是很难的问题。 另外它虽然强调 Local-first,但更准确的说法应该是: Memory storage 是本地优先,模型推理是否完全本地,取决于你自己的模型配置。 但即便如此,我还是觉得这个方向非常对。 因为进入多 Agent 时代之后,记忆本来就应该属于用户自己。 代码不会因为你从 VS Code 换到 Cursor 就消失。 那为什么从 Claude Code 换到 Codex,AI 就得重新认识你一次? 未来真正重要的资产,可能不是你在哪个 Agent 里有多少条聊天记录。 而是你长期积累下来的: 项目背景 + 决策 + 偏好 + 经验 + 踩坑 + Skills。 这份东西应该属于你。 所以别看一句话,就把游戏做出来,背后的Agent 团队和 Harness 各种工具链付出了汗马功劳。 最后附上开源项目链接:
顯示更多
以前玩贪吃蛇,玩的都是别人做好的。 今天我试着让 AI 给我做了一款。 我只说了一句: “做一个经典贪吃蛇小游戏,用方向键控制小蛇吃苹果,撞墙或撞到自己就结束。” 然后 Gear Zero 就开始自己规划、写代码、搭画面。 我在旁边等着,它在认真给小蛇铺果园、放苹果。 最神奇的是,做完不是给你一张效果图,而是真的生成一个能玩的小游戏。打开浏览器就能玩;觉得不够好玩,还能接着跟它说:“加几个障碍物”“吃到金苹果多加分”“速度再快一点”,它会继续往下改。 不用学游戏引擎,不用写代码,也不用找美工。 你只要把脑子里的游戏说出来,它就能一步步给你做成能在浏览器里直接玩的版本。 以前我们玩别人创造的游戏, 现在,终于可以玩自己脑洞里的游戏了。 想做贪吃蛇、赛车、塔防,还是“打工人下班逃生”? 去 Gear Zero,说一句试试。 想自己做一个的话,方法很简单: 打开 比如“做一个贪吃蛇”“做一个双人赛车”“做一个奶茶店经营游戏”。 剩下的,交给 Gear Zero。 @gearzero_alaya
顯示更多
看完实践哥的这个帖子,也验证了自己的想法,属于本地部署小模型的时代正式到来了。 整个八月可以说是阿里 Qwen 系列的天下,没人给他打广告,但是奈何产品自带广告属性,疯狂在大众面前刷屏。 尤其是开源大模型 Qwen3.8-27B,成功的把开源模型生态带到了前所未有的高度。 而实践哥实验的这个 Apodex-1.1-mini-GPTQ-Int4 就是 一个 35B 的开源模型后训练一下,就号称专业 Agent 能力已经能摸到甚至超过 Fable。 详情可以看看视频,那我相信很多人会跟我一样,有必要搞懂几个词 什么是后训练呢? 什么是预训练? 什么是微调? 什么是预训练? 预训练:相当于给模型打基础、学通识。 模型通过海量的网页、书籍、代码、论文等数据,不断做「预测下一个 Token」的训练,逐渐学会语言、知识、代码和基本的推理能力。 可以理解为: 让模型先“读万卷书”,变得见多识广。 预训练结束后,通常得到的是 Base Model(基座模型)。 什么是微调? 微调:就相当于在现有模型基础上做专项训练。 不用从头训练,而是拿一个已经训练好的模型,再用特定领域或任务的数据继续训练。 比如把通用模型训练成: 医疗模型 法律模型 编程模型 客服模型 SQL 模型 可以理解为: 模型已经大学毕业了,现在再去接受岗位专项培训。 LoRA 就是一种常见的低成本微调方式,只训练少量额外参数,而不是修改整个模型。 什么是后训练? 后训练:就相当于预训练完成以后,对模型进行的一整套“调教和实战训练”。 它不是一种具体算法,而是一个大的训练阶段。 包括: SFT 指令微调 DPO 偏好优化 RLHF RLVR 推理训练 安全训练 工具调用训练 Agent 训练 目的就是让模型从: “有能力” 变成:“知道怎么正确地把能力用出来”。 也就是让模型学会听指令、推理、拒绝不合适请求、调用工具、检查错误、完成复杂任务。 最后总结一下: 预训练决定模型的底子,微调让模型学会了专项,后训练则决定了模型怎么把能力真正的发挥出来。
顯示更多
0
30
17
1
轉發到社區
牛来(Ox-Alpha)以来,新的斩杀线已成。 智谱 GLM 上线并开源 GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型。 1、320B 总参数,仅激活 18B:MoE 架构,单次推理计算量明显降低。 2、能力进入前沿区间:官方称整体能力超过 GLM-5.2,AA Intelligence Index 为 57 分,与 Claude Opus 4.8 持平。 3、价格极低:正式价格约为 GLM-5.3 的 1/10,限时约 1/20,官方称约为 Opus 4.8 的 1/40。 4、GLM-5 首个原生多模态模型:可以同时处理文本、图像、GUI 和视觉环境。 5、特别适合 Coding Agent:能“写代码 → 看运行效果 → 自我检查 → 再修改”,尤其适合前端、游戏、3D、Browser Use 和 Computer Use。 6、长上下文成本大幅降低:采用线性注意力 + 稀疏注意力混合架构,相比 GLM-5.3,注意力计算量降低约 3 倍,KV Cache 降低约 4.4 倍。 7、已开源且经过真实流量验证:此前匿名模型 Ox-Alpha / 牛来就是 GLM-5.3-Flash,并已在 OpenRouter、OpenCode 上进行大规模测试。 8、配合DeepSeek Harness 和 Alloomi,不仅速度快,价格还便宜,效果实打实的在线。 模型开源地址,本地部署欢迎实测:
顯示更多
还在把 md 当记忆补丁、把窗口加大当「有记忆」的,这篇值得认真拜读一下。 窗口再大也只是缓存。Harness 调的再顺,也只是外壳在进化,模型没进化。RAG 再全,也只是把查询相关的信息塞回到 prompt。官方这篇写得很硬核:这些做法给了 AI 更多的信息,但却不能让 agent 变的更强。 从初级助理变成熟手搭档的,是需要带着判断和反馈的工作经验——而这种东西网上是没有的。 两派人现在走的不是一条路。一边继续往外加检索、加会话摘要、加更长的上下文;而另一边则是把真实工作流里的判断、改稿、交付结果,经过筛选写回权重,再用质量门和回滚把进化锁住。前者每次接活都有点重来的味道,后者每干完一次,下一次再干就又有了很大的进步。 Alloomi 把应用层和模型层焊在一起,四层是一个飞轮,不是四个功能。OpenContext 开源的是第一层:时间上下文、记忆检索、上下文校正、多平台接入、主动调度。产品侧是 OKR 驱动的自进化数字员工,已经在法律、保险、投顾这些高专业度场景里共创。 下一阶段比的不是模型有多聪明,是它在真实世界里每干完一件活,学走了什么。 现在智能只是起跑线,而经验和判断力才是分叉口。你站哪边?👇
顯示更多
赶在牛来(Ox Alpha)未来之前,Qwen3.8-Flash-Next 重磅提前发布。 看截图,仅三项跑分没有超过 Deepseek v4-flash 或 Claude-Opus 4.6(max)! 1、Qwen3.8-Flash-Next 作为 Qwen4 架构预览版。 2、原生多模态 MoE 3、参数 125B 的主模型,每 Token 仅激活约 6B 4、额外挂载 51B N-gram Embedding,大内存 Mac和DGX Spark 适配度很高。 5、另外首次引入 QSA:稀疏选择长上下文 6、GDN + QSA 混合 Attention 7、4 路 Gated Residual + Muon Optimizer 8、相比 Qwen3.7-Plus,官方称训练成本降至约 1/9 所以我觉得这次最值得关注的并不是 又开放了一个 125B 模型,而是: Qwen 正在把大模型的容量和实际推理计算量彻底拆开。 125B 用来提供容量,6B 负责实际计算,51B N-gram 负责低成本存储局部模式,GDN 负责记,QSA 负责找。
顯示更多
怕了吗? 代号叫 Paloma,多方爆料指向 Qwen-3.9。 这是对国外大模宣战了吗? 另外 Qwen3.8-Flash-Next 即将开源
0
45
11
0
轉發到社區
分享一个最近一直在用的开源项目 LoopX:让超长程 Agent 自主运行 200+ hours,任务跑久了也不容易跑偏。 相信很多用过 Codex Goal 的朋友都会遇到一个问题:Goal 的质量太依赖上下文。任务跑久以后,上下文不断压缩,关键信息可能丢失,旧信息又可能重新混进来;更麻烦的是,Goal 和 Todo 本身也会过期,任务执行到一半,真实目标可能已经变了。 LoopX 解决这个问题的思路很直接:不要让 Agent 靠上下文记住状态,而是把状态本身持久化。 它会把 Vision、Goal、Todo、Gate、Evidence、Identity、Quota、Handoff 等信息外置成一个结构化控制面。之后每一次执行,Agent 认的是这套统一事实源,而不是某一次会话里的上下文。换模型、换 Session、换 Host,甚至经历多次等待、人工决策、writeback 和 resume,都可以重新找到“现在目标是什么、已经做到哪、下一步应该干什么”。 我比较喜欢它对 Vision 和 Goal 的拆分:Vision 表示最终想达到什么结果,Goal 表示当前准备怎么实现。执行过程中如果发现 acceptance gap、外部状态变化或者现有计划已经不合适,Agent 会重新 replan,而不是机械地沿着旧 Todo 一直跑下去。 所以我更愿意把 LoopX 理解成一块专门给 Agent 设计的可执行 Kanban:普通看板只是展示状态,LoopX 的状态会直接决定下一次 Agent 应该做什么。 这也让长程 Agent 不只是“连续干活”,还可以在任务过程中自我升级:发现能力不够,就开发 feature、验证、发布新版本,再用新能力继续原来的任务。完成工作和升级完成工作的系统,可以发生在同一条 trajectory 里。 最终要解决的其实就是一个问题:LLM 的上下文注定有限,但 Agent 的任务可以持续几天、几周甚至更久。想让 Agent 真正长期工作,就不能把“记忆”和“状态”都押在上下文窗口里,而需要一套独立、持久、可恢复、可执行的状态系统。 LoopX 做的就是这件事。所以我觉得LoopX跟Alloomi之间有很多的思路上的可取之处。有空继续研究他们。 github地址:
顯示更多
还在把 md 当记忆补丁、把窗口加大当「有记忆」的,这篇值得认真拜读一下。 窗口再大也只是缓存。Harness 调的再顺,也只是外壳在进化,模型没进化。RAG 再全,也只是把查询相关的信息塞回到 prompt。官方这篇写得很硬核:这些做法给了 AI 更多的信息,但却不能让 agent 变的更强。 从初级助理变成熟手搭档的,是需要带着判断和反馈的工作经验——而这种东西网上是没有的。 两派人现在走的不是一条路。一边继续往外加检索、加会话摘要、加更长的上下文;而另一边则是把真实工作流里的判断、改稿、交付结果,经过筛选写回权重,再用质量门和回滚把进化锁住。前者每次接活都有点重来的味道,后者每干完一次,下一次再干就又有了很大的进步。 Alloomi 把应用层和模型层焊在一起,四层是一个飞轮,不是四个功能。OpenContext 开源的是第一层:时间上下文、记忆检索、上下文校正、多平台接入、主动调度。产品侧是 OKR 驱动的自进化数字员工,已经在法律、保险、投顾这些高专业度场景里共创。 下一阶段比的不是模型有多聪明,是它在真实世界里每干完一件活,学走了什么。 现在智能只是起跑线,而经验和判断力才是分叉口。你站哪边?👇
顯示更多
Unsloth 团队真的是太牛逼了,现在普通人甚至不用买高端显卡,就能用 Unsloth 对 Qwen3.8-27B 做微调。 以前玩开源模型,普通人能干的事很简单:把模型下载下来,跑起来,聊两句。现在不一样了, 你可以自己做数据、微调、测试、部署,真正做出一个属于自己的模型。 现在主流玩法叫 LoRA / QLoRA。 LoRA 的意思是:27B 这么大的底模先冻住,不改它本身,只在旁边训练一小块低秩参数。 QLoRA 更狠:先把底模压成 4-bit,再训练这块小参数。再加上 Unsloth,把 Attention、Activation、Gradient Checkpointing 这些训练时最吃显存的环节再压一遍。结果就是:微调 27B,以前要很贵的卡,现在一张消费级显卡就能干,甚至免费云 GPU 也能试。 基础模型已经会中文、数学、代码了。大厂负责把底模造出来。开源社区负责把模型真正送到每个人手里。企业接下来真正该关心的,不是从头预训练一个 GPT,而是拿 Qwen 这种强开源底模,把自己的数据、Know-how、业务规则和工作流炼进去。 未来不是每家公司都自己造一个大模型,而是每家公司都会有一个自己的模型。现在连没有 GPU 的人,都可以开始炼一个 27B。这才是开源真正牛逼的地方。 使用Qwen3.8-27B在本地部署真正属于自己的大模型,企业数据可以无需考虑隐私安全问题,再使用上完全开源的Agent 产品比如DeepSeek Harness,最后如果在本地加上 alloomi 这一套「记得住、学得会、做得成」新的思考范式,如果真的能实现他们的落地,那么AI的很多自动化问题也就迎刃而解,对企业的提效将继续被放大。
顯示更多
0
21
140
23
轉發到社區
还在把 md 当记忆补丁、把窗口加大当「有记忆」的,这篇值得认真拜读一下。 窗口再大也只是缓存。Harness 调的再顺,也只是外壳在进化,模型没进化。RAG 再全,也只是把查询相关的信息塞回到 prompt。官方这篇写得很硬核:这些做法给了 AI 更多的信息,但却不能让 agent 变的更强。 从初级助理变成熟手搭档的,是需要带着判断和反馈的工作经验——而这种东西网上是没有的。 两派人现在走的不是一条路。一边继续往外加检索、加会话摘要、加更长的上下文;而另一边则是把真实工作流里的判断、改稿、交付结果,经过筛选写回权重,再用质量门和回滚把进化锁住。前者每次接活都有点重来的味道,后者每干完一次,下一次再干就又有了很大的进步。 Alloomi 把应用层和模型层焊在一起,四层是一个飞轮,不是四个功能。OpenContext 开源的是第一层:时间上下文、记忆检索、上下文校正、多平台接入、主动调度。产品侧是 OKR 驱动的自进化数字员工,已经在法律、保险、投顾这些高专业度场景里共创。 下一阶段比的不是模型有多聪明,是它在真实世界里每干完一件活,学走了什么。 现在智能只是起跑线,而经验和判断力才是分叉口。你站哪边?👇
顯示更多
0
58
32
14
轉發到社區
我突然想到一个很骚的本地 AI 方案: 去闲鱼淘一台 “无头骑士” Mac。 不要屏幕,不追新款,只盯两个东西: Apple Silicon Max 芯片 + 大内存。 比如: M1 Max 64GB。 然后在里面塞一套: Qwen3.8-27B + MLX/MTPLX + 社区 Uncensored 版本。 直接把它改造成一台 24 小时在线的本地 AI 服务器。 为什么我觉得这事可能很香? 因为本地大模型现在的购买逻辑,已经和买普通电脑完全不一样了。 你不需要好屏幕。 不需要最新 CPU。 甚至不需要完整的 MacBook。 你真正买的是: 统一内存 + 内存带宽。 M1 Max 虽然老,但有 400GB/s 内存带宽,64GB 统一内存跑 27B 量化模型正好进入舒适区。 于是一个很有意思的组合出现了: 闲鱼残血 Mac + Qwen3.8-27B + 本地 API + Coding Agent / OpenCode / Qwen Code / 各种 Agent 以后很多任务不需要再一刀一刀地烧 API Token。 代码阅读、资料整理、Sub-agent、长文本分析、自动化任务…… 全扔给本地模型。 真正困难的任务,再调用 Claude / GPT 这类顶级云模型。 等于自己搭了一个: “廉价 Token 发电厂”。 更有意思的是,你甚至可以同时部署两个 Qwen: 一个官方版,负责 Coding、Agent 和日常工作。 一个社区 Uncensored / Abliterated 版本,负责一些限制更少的实验和创作(你懂的) 按任务自动路由。 这才是我觉得本地模型真正有价值的地方: 以前大家问: “我的 Mac 能不能跑大模型?” 现在应该换一个问题: “我能不能花几千块收一台别人不要的残血 Mac,给自己造一台每天随便烧几十万、几百万 Token 的私人 AI 服务器?” 如果答案是可以, 那“无头骑士 Mac”这种原本很小众的二手设备, 可能突然变成了一种非常奇怪的—— AI 矿机。 我准备真去闲鱼研究一下。 如果能淘到价格合适的 M1 Max 64G / M2 Max 96G / M1 Ultra 128G, 这事可能比买一台新 Mac 有意思多了。
顯示更多
0
51
153
14
轉發到社區
手机+ UU 远程 + Mac + 终端 + herdr + 多Agent 。
远程控制AI一定是大趋势,但是试过 Codex 远程、WorkBuddy 远程和豆包远程后,感觉用起来还是有不少问题,不能覆盖我的全部需求。 因为一旦你还想查看电脑上的产出的文件、验证 Vibe Coding 的效果,又想参考电脑上其他工具里的数据等等,这些个 Codex 远程、WorkBuddy 远程、豆包远程通通都很难办到,所以试了一圈我还是选择用 UU 远程。 手机连接到电脑后可以随意放大缩小,十几个终端面板指哪打哪,文件、网页和其他AI软件也能随时切过去看,操作起来意外地顺手。 而且目前免费、没广告,画质和延迟表现也比我预想中好不少。 我把实际使用过程录进视频了。如果你也经常让 Codex 或其他 AI 工具在电脑上长时间跑任务,可以看看这种用法。
顯示更多
怕了吗? 代号叫 Paloma,多方爆料指向 Qwen-3.9。 这是对国外大模宣战了吗? 另外 Qwen3.8-Flash-Next 即将开源
🚨重磅泄露!Qwen最新模型“Paloma”已上Arena,被确认是Qwen-3.9! 关键要点:
🔹代号Paloma,前端编码能力体感对标Claude Opus 5
🔹同步测试中还有另一个未发布模型Korrine(大概率也是Qwen)
🔹Paloma表现更强,Image+Text→Web能力突出
🔹社区直呼:九月要起飞了! 中国开源模型又要掀桌子了?本周AI大战正式开打🔥 #Qwen3_9# #Paloma# #AI大模型​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​# #阿里巴巴#
顯示更多
0
53
15
0
轉發到社區
「千问办公」发布一个月后,「豆包工作」终于迎来了正式版的发布 唯一的遗憾就是,「千问办公」和「豆包工作」这哥俩目前都不像 WorkBuddy 那样,支持自定义模型接入。
顯示更多
千问办公单独网站和客户端。新用户注册赠送2000积分,现在每日登录可领100积分。 常用功能真的基本一模一样。 网站分享:
顯示更多
0
47
14
2
轉發到社區
很多人经常听到一个词:自回归模型(Autoregressive Model)。 其实很好理解: 一个字一个字往后猜,每次生成新的内容,都要参考前面已经生成的内容。 比如: 「今天天气很」 ↓ 预测下一个 Token:「好」 ↓ 变成「今天天气很好」 ↓ 再继续预测下一个 Token 整个过程就是: 已有 Token → 预测下一个 Token → 把新 Token 加回输入 → 再预测 GPT、Claude、Gemini、Llama、Qwen、DeepSeek 等大多数文本生成模型,本质上都是自回归模型。 它的优点是生成质量高、上下文连续性好。 但缺点也很明显: 传统自回归解码通常是串行的。 Token 1 → Token 2 → Token 3 → …… → Token 1000 后面的 Token 要依赖前面的 Token,所以生成速度会受到限制。 这也是为什么现在会出现 MTP、Speculative Decoding、DFlash、FreeToken 这类技术。 它们很多都在尝试解决同一个问题: 一次只生成一个 Token 太慢,能不能一次多预测几个? 一句话总结: 自回归模型 = 一边看前文,一边逐 Token 往后写。
顯示更多
在 24GB M5 MacBook 上运行了 Qwen3.8-27B,使用 llama.cpp 的 MTP 推测解码,Token速率从 7.16 → 10.47 token/s,相当于获得了 1.46倍 的 tokens/秒提升。 那么MTP推测解码到底是个什么玩意呢? 首先要搞明白一个点,大模型的文本生成目前始终还是以找规律预测的形式来一个 token 一个 token 的生成,这种简单的思想,就叫做自回归。意思就是模型的推理始终是以上一个字出现结果后,再出现下一个可能的结果的字。 比如,对于同一个字“你”,下一个字可能是“好”,也有可能是“吃”,这种方式带来的缺点就是,始终是等待上一个词出现后才能出现下一个...... 那什么是 MTP?MTP简称投机解码(Multi-Token Prediction),自 2024 年开始,MTP 加速推理就只干了一件事,那就是多 Token 预测。 说人话就是:大模型还是那个大模型,它不会一口气写出整段答案。前面先让很轻的 MTP 模块顺着往下猜后面几个字,当成草稿;然后大模型再一次性核对这些字对不对——对的留下,从第一个不对的地方自己重写。小模块负责打草稿,大模型负责验收,一次前向就能往前走好几个字,所以推理更快。内容和原来一个字一个字生成的一样,不是另写几份答案再汇总。 目前国内的主流大模型,Qwen、DeepSeek、GLM、Kimi、Xiaomi 等等均已支持这种技术,而且 在 vllm和sglang 中要使用也非常简单。 MTP到底什么时候开,请看截图,截图内容仅供参考,正在自学中
顯示更多
0
20
14
0
轉發到社區
📢📢📢参加 Tutti 商单的朋友要注意了, 📢📢📢参加 Tutti 商单的朋友要注意了, 📢📢📢参加 Tutti 商单的朋友要注意了, 📢📢📢参加 Tutti 商单的朋友要注意了, 📢📢📢参加 Tutti 商单的朋友要注意了, 📢📢📢参加 Tutti 商单的朋友要注意了, 发完贴一定要马上回tutti把推特链接 补上发布的推文链接。 朋友回填晚了,前面获取的曝光和互动数据完全归零了。 大家引以为戒,做商单前一定要把相关规则看仔细了。
顯示更多
We're proud to announce that Tutti is now listed as No.1 on We're on our mission to give builders and creators extra channels to monetize their influence.
顯示更多
远程控制AI一定是大趋势,但是试过 Codex 远程、WorkBuddy 远程和豆包远程后,感觉用起来还是有不少问题,不能覆盖我的全部需求。 因为一旦你还想查看电脑上的产出的文件、验证 Vibe Coding 的效果,又想参考电脑上其他工具里的数据等等,这些个 Codex 远程、WorkBuddy 远程、豆包远程通通都很难办到,所以试了一圈我还是选择用 UU 远程。 手机连接到电脑后可以随意放大缩小,十几个终端面板指哪打哪,文件、网页和其他AI软件也能随时切过去看,操作起来意外地顺手。 而且目前免费、没广告,画质和延迟表现也比我预想中好不少。 我把实际使用过程录进视频了。如果你也经常让 Codex 或其他 AI 工具在电脑上长时间跑任务,可以看看这种用法。
顯示更多
0
72
73
12
轉發到社區
Hugging Face 上 Unsloth 量化的模型为什么下载量这么惊人,看下图就知道 Unsloth 量化的模型效果基本都是相同量化精度下效果最好的。 Unsloth 主要解决本地大模型的推理和训练效率问题。对于本地推理来说,本质上就是尽量少损失模型能力,同时把显存和内存占用压下来,让原本跑不动的大模型也能在普通电脑上运行。 这也得益于 Unsloth Dynamic 3.0 GGUFs。同时它们也有了自己的Unsloth Desktop 。 首个在本地运行和训练模型的桌面应用程序。 - 1、 开源。支持 Mac、Windows 和 Linux - 2、 支持 MLX、扩散图像/视频、音频、GGUF - 3、 将 Claude Code 和 Codex 连接到本地 LLM - 4、准确率提高 50%,自愈工具调用 + 沙箱代码执行 - 5、支持 CPU + 多 GPU 配置 - NVIDIA、AMD、Intel、Mac -6、使用 70% 更少的 VRAM 训练模型速度提高 2 倍 - 7、私有网络搜索、深度研究、RAG、MCP 和导出(NVFP4、GGUF) -8、使用 Unsloth 的 OpenAI 兼容 API 和云模型 -9、 安全远程部署 LLM 并随时随地访问 Unsloth Desktop 现已在 和 GitHub 上提供。 GitHub:
顯示更多
0
32
37
5
轉發到社區
刚刚查了一下 huggingface 上关于 Qwen3.8-27B的模型数量已经来到了 1232个,而模型相关下载量更是惊人。这是多么恐怖的一件事情,从侧面也说明了Qwen3.8-27B 在开源大模型领域的热度是空前的,能力仍然还可以被继续挖掘。 来看看这个视频,用的就是自己部署的 Qwen3.8-27B 直接现场写游戏。最后浏览器里真的跑出了一个国风庭院FPS,鼠标锁定、冲刺、换弹、战术瞄准一应俱全,玩家举着一把颇具东方审美的枪,在园林里打“瓷器无人机”。 那么自己部署模型的时候该怎么选配置、又该怎么选模型、稠密模型还是稀疏模型、又要下载什么量化模型,来看看这个实践哥这篇硬核测评文章,或许对你非常有帮助的。
顯示更多
0
65
61
9
轉發到社區