註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

WeZZard
@realWeZZard
The crazy one. Building something, ex-ByteDance infra, ex Industrial Designer My skills 2*DGX Spark, 2*ChatGPT Pro, 2*Claude Max
878 正在關注    4.8K 粉絲
玉伯终于想到这一点了。 不过我的 thesis 是:新时代不存在任何微信这样子的超级 app。新时代的入口属于硬件。 启发我这么想的是我最近做的 GTM 工作流,做完这一套之后,我认为只要任何 IM 提供任何 GUI 的使用方式,那它就必然不可能成为下一个时代的入口。 我首先在本地制作了标准的 Ubuntu 以及 macOS 虚拟机镜像,里面提供了浏览器以及一些 IM 软件。 然后我开发了一个采集程序,在 IM 群组以及社交媒体中采集信息,然后寻找符合用户画像的潜在客户。 因为 Chrome 的 profile 是可以直接抽出然后存储在虚拟机外的,所以针对 web app 我并不需要每次都重新登录。如果不是 web app 也有对应的解决方法。 最后一步就是发起和潜在客户的沟通了。这里比较拙劣的用法是直接使用 AI 产生的信息去和用户沟通。但我依然只会要求 AI 帮我编排好沟通材料,由我自己真人去沟通。 在整个过程中帮我建立连接的,其实并不是我而是我的 AI + 我的意图。我的 AI 可以横跨所有的即时通讯软件及社交媒体,只要它提供任何图形界面的访问方式。 所以只要任何 IM 提供任何 GUI 的使用方式,那它必然就不可能成为下一个时代的入口。因为它必然可以被运行在虚拟机上,然后由 AI 采集信息,帮助用户完成横跨数个 IM 以及社交媒体的连接。 那么下一个时代的入口是什么?我认为它一定会和硬件绑定在一起。或者下一个时代的入口,一定会是 OS 级别搭配硬件销售的。 而且整体看下来我自己做的 GTM 流程存在数据飞轮,而这个飞轮最后掌握在 GTMer 手中。 考虑到数据主权,通过 Qwen 3.8.27B 所有 API 请求和数据都可以留在本地。而我构建这一套设施的硬件成本是 M4 Pro Mac mini 64GB RAM+ 2* DGX Spark。当然,目前 M5 Ultra Mac Studio 256GB 是性价比更高的选择。我目前的配置加起来应该已经超过 10 万了。 但是硬件价格一定会下降,以及目前这一套设备在未来很有可能就可以运行在一个像 Mac mini 甚至像 iPhone这样小的设备里面。iPhone 在发布的时候,其 CPU 相当于 2000 年左右的桌面级 CPU。而目前 A20 Pro 也已经比肩同年代的桌面处理器能力。所以相关的能力在未来一定会走入千家万户。而通过 IM 构建起来的护城河,最后也一定会被瓦解。 另外从这点看,本地 AI 会是一个越来越重要的话题,以及 Qwen 27B 这个模型权重会是一个越来越重要的模型权重。我不得不说,阿里 Qwen 实验室的这个模型权重系列设计真的是非常的有品位。 目前的大厂都只能够自己做软件,最有资源的那一位,却没有做硬件的耐心。所以最后愿机会属于每一位不愿意在大厂打螺丝的朋友们。
顯示更多
这个结论应该只在 prototyping 阶段有效。你依然需要一个人类可以高效阅读的文档作为唯一真相源。如果没有这一层隔离,当你的项目复杂程度上到一定阶段的时候,会经常出现「按下葫芦起了瓢」的情况。因为人类很难有精力完全审查AI 在复杂项目中产出,而人类审查文档的效率更高,通过文档又可以发展出对项目的测试用例,通过测试用例,就可以更高效地管理软件开发结果。
顯示更多
了解了 DGX Spark 四节点方案之后退缩了,那个交换机居然要 2 万到 3 万人民币一台
看完论文后发现 DeepSeek 应该喜欢 PL 的人,难怪我之前投简历都没有进面试,小红书上找到他们的 HR 问也不理我。早知道把 Apple Swift 编译器贡献者及在字节为 Swift 做的 runtime feature 也写在简历上,而不是写一堆自己写的 AI harness 了。 不过目前看是歪打正着。特别是最近听到王虹说在北大被 discouraged 之后。 初中的时候我主动报了我们学校的信息学竞赛队,但是进去之后我觉得讲的东西很无聊:汉诺塔、八皇后、约瑟夫问题——而觉得无聊是因为看不懂。但是知道很后来我才知道,我不懂并不是因为我笨。 彼时的我喜欢用 Borland C++ Builder 和 Vanilla JS 在桌面端和浏览器里面做酷炫的效果,还喜欢 WindowBlinds 换装。是的,我当时和觉得 DeepSeek Harness 的 GUI 不酷炫就觉得没意思的各位一样。 对了,当时的竞赛班老师还推荐了我们一本书叫「具体数学」,这个是一个伏笔。 而这个「看不懂」的问题我后来总算明白了:计算机只会通过循环解决问题,而循环的每一步都必须通过「有限的方法」让问题向解决推进一步。 但是人看问题不是这样,人可以在一个问题的某些具体场景下看到捷径。而所谓「算法思维」就是整理出所有捷径和非捷径的共同模式,然后在「默认使用循环」的情况下给出「每一步」中最高效和最通用的做法。 所以你要能「看懂」这些算法题必须得假设自己和一台计算机一样,只能做循环操作,去思考每一步的通用最优动作,然后解题。 当然,这么简单且显然本质在这么好的(中国)学校里面老师是不会教你的。默认你应该懂。但我最终懂这个道理的路可谓一路曲折。 我的中学时代其实和每一个中国出生长大的人一样,课业繁重。大学选择了自己心心念念的工业设计,画了四年画,毕业后转的码。转码过程中自己下载了清华、巴黎高师和北美四大金刚的公开课,然后买书看公开课学的。 在某次看清华的邓俊辉老师的算法课时,他提了提「具体数学」这本书。这次我终于把这本书买了回来,然后打开一看:1. 汉诺塔,2. 约瑟夫问题,…… 是的,原来初中竞赛班上的老师是照着这本书讲的…… 而当时我已经学了 MIT 的算法导论以及斯坦福 CS 143,看了 Engineering a Compiler, 2/e,自己撸了个小编译器出来。我觉得能学懂什么是自动机(EaC, 2/e 里面有涉及)的,应该都能够理解计算的本质吧。所以彼时再看「具体数学」会发现: 1. 原来在理解了计算的本质的前提下,这些题目这么好理解; 2. 原来 Donald Knuth 这种大神也需要先通过几个直觉 case 来测试自己的算法设计,遭遇失败、然后迭代几次之后才能得出正确答案; 3. 原来初中竞赛班上那些能够一步就给出正确答案的同学们应该:要么比 Donald Knuth 还要聪明几倍;要么就是在外面事先学过了; 所以这种竞赛班的本质其实并不是教计算机,而是:通过向远没达到对应成熟度的儿童传播一次远超他们成熟度的信息,测试反馈,筛选天才。 当然,也有可能筛选出提前过拟合的人。 到彼时总算放过了还是青少年的自己。回想我自学计算机的过程也算是一趟「王虹」之途——早年学习被环境吓到,之后自己把兴趣找了回来。当然,我没有王虹那么耀眼的成就。只能算是青年版的「重新把喜欢计算机的自己养了一遍」。 另外,某年我看到中科大的博士课程居然也把「具体数学」作为 prequisites 课程材料。所以我初中学不懂真的不是我的问题了。 但是到了 AI 时代,我们不能再做自己不擅长的事情了。 我觉得每个人都应该在 AI 时代想想是不是能做新的事情、做回自己本来擅长的事情。 AI 的放大能力应该用于你的长板。 同样的放大系数,拿来放大你的长板和补齐你的短板相比,收益的差别会随放大系数同样被放大。 如果考虑复利效应,这个收益差别还会随着年月积累。 所以接下来我应该还是会 focus 在自己擅长的事情上面。比如,下一个产品和下一个开源项目。所以,简历看都没被看一眼,应该也是好事。 附图:上一段程序员工作时放在身边看的一些计算机书。不过感觉之后应该会多看一些设计和 GTM 的书籍了。 * 看了看 deepseek-ai/deepseek-harness 仓库目前的贡献人数是 19 人,不太清楚是不是团队规模,但是只招进去两个人应该不实,论文中一人可能是北大软件学院教授。
顯示更多
0
54
652
44
轉發到社區
听说老东家把 AI 数据提成了一级部门,只感觉模型会越来越落后。这种动作一般适合终态已经存在并且时机成熟,通过加大投入和大力出奇迹迅速追赶。但目前显然不是这个格局。 模型能学会什么,不只取决于有多少数据,也取决于出题的人能看见多大的任务。更合适的组织形态是: 「认为 agent 下一阶段哪个方向重要的人」定义 topic 制作 evals,自己给 harness 贡献代码弥补现有模型不足,然后制作数据参与训练,并且自己贡献代码补齐训练所需 infra 短板。这些工作都应该按 topic 划分颗粒度,重叠在一个人身上。 否则每个环节独立一个部门会导致每个部门都有自己的 priority list,都会算自己的 ROI。 其实上面这种人很好找,也就几个标签取交集: 1. 大厂 infra 2. 是转码的而不是一直学计算机的 3. 转码前学术水平突出或者用非计算机背景就业过 4. 有 AI-native sense(看 AI 订阅,token 用量和用 token 做的事) 5. 有生活、不是工作狂,或者 work hard, play harder 这些标签里面:大厂 infra 足够说明技术过硬;转码并且学术背景突出或者非计算机就业过说明自身泛化能力强;有生活、不是工作狂或者 work hard, play harder 大概率有品位;剩下需要动态判断的就是用 AI 订阅做过什么事了。 而 agent 在非 AI-native 组织和 AI-native 组织中「下一个阶段重要的事情」其实并不一样。比如: Anthropic,OpenAI 和月之暗面目前都在 bet 「Agent 组织」,从公开的 papers 和 feature release 都可以看到「动态生成 subagents」的能力: Anthropic 2025 年 6 月就在 Claude Code 释出 subagent 功能了;OpenAI 在 GPT 5.6 Sol Ultra 也训练了主动拆解任务到 subagent 的能力;月之暗面则是紧跟 Anthropic 其后的:我在 2025 年 8 月时针对 Opus 4.1 制作了基于 subagents 的生产流水线,在上面跑 2025 年 9 月发布的 Kimi K2 时发现 K2 的 subagent 能力就已经达到了 Anthropic 同代 Opus 4.1 的水平(这也是我认为月之暗面是目前国内唯一真正未掉队的选手的原因之一)。 这个能力的本质是在任务拓扑方向上部署算力。当能力训练进入模型后 AI 做得比人好,人可以在仅 focus 在目标的前提下 leverage 更多算力处理更多事情。 但同样是这个能力,在非 AI-native 玩家看来,从任务横向上拆解好即可。而在 AI-native 玩家看来,除了对任务进行横向的拆解,还需要做以「更大目标」为导向的先后顺序依赖的拆解。 因为非 AI-native 玩家短时间无法化解汇报层级,目前基本上是给每一个员工配置一个 agent,所以 agent 的任务通常无法跨越员工汇报层级。 而 AI-native 玩家里面没有这个限制,agent 上跑的任务就是全链路的。所以他们的预期是:动态生成一个临时 agent 组织,然后达成目标,目标可以足够大。而这种预期最终就会进入训练。 Claude Code Dynamic Workflows 和 Kimi Agent Swarm 就是这种大目标实现能力在 2026 年年中的一个具体实现。 大厂们想躲过明星创业公司的碾压和斩杀,除了投入度需要跟上,还需要在组织形态上做变革。但是旧的秩序依然需要维护,激进改革很有可能杀死现金奶牛。不过如果最后组织形态变革没有跟上,认知比不过明星创业公司的话,就很难完成涅磐。
顯示更多
Manus 从产品形态看基本就是朝着「终局」去的: 1. 本地无打扰完全运行在云上 2. 2025 年中引入 wide research 增加任务拓扑方向上智能调用密集度 3. 2025 年年底透露在做主动式 agent 拓展时间维度智能调用密集度 4. 很早就建立了 evaluation 团队 只能说季逸超牛逼。老天让这个团队运气再好点吧。
顯示更多
0
36
250
15
轉發到社區
我觉得以后面试都可以在面试前先邮寄一个这个玩意儿过去要求候选人在面试时戴上。
0
13
349
35
轉發到社區
其实厉害的观点和实践并不需要学术机构或者科研人员才能做出。 这篇论文中的方法论在早前就有一位 X 友( @qqqqqf_ )在使用了。并且在 Fable 5 发布时就用这个方法测量出 Fable 5 模型指纹相较 Opus 系列发生的显著改变,推测使用了不同的数据集进行训练。
顯示更多
0
3
121
12
轉發到社區
我不认同,这是典型的唯参数论。忽略了模型厂商的战略眼光、模型训练对用户体验的供给以及模型使用人口变迁。 Kimi K3 标注是 Opus 4.8 级别,我个人体验下来其实是基于它的木桶短板标的,而它的长板完全可及 Fable 5。Kimi K3 在长尾数据的训练上面并没有 Fable 5 训练得那么全,会导致在多轮对话的任务中失败一次,然后次次修补,进入一个很差的体验。这和 Opus 4.8 的体验完全一致。 而 2026 年中的顶规模型可以保证状态一直在线。首先 Fable 5 的长尾数据训练非常全面。然后 Fable 5 的急剧性能衰减需要到达上下文长度的 80% 到 90% 才会出现。而 Kimi K3 基本在 40-50% 时就能感受到性能衰减。 上述 Fable 5 的优势对于整体体验来说提升的不只是一点两点,而是四五倍的提升——因为每一步有 5% 的任务失败概率,那么 10 步都成功的概率仅为 60%;而把每一步的失败概率消除一半,那么 10 步都成功的概率将提升至 78%。这个提升对于长程任务来说只会更夸张,比如放大到 50 步则可以将成功率提升接近 4 倍。 这就是 Fable 5 对于从事从 0 到 1 创新的工作者来说体验非常棒的原因——因为从 0 到 1 不可能 one-shot、也极有可能进入数据训练盲区。 那为什么大家会觉得 Kimi K3 好?是因为它的 one-shot 能力真的很强。而 one shot 成功自然会带来成就感。 而早在移动互联网开始时,很多人争相阅读的 Emotional Design 中就强调过「成就感」对用户体验带来的提升。Frog Design 的创始人 Hartmut Esslinger 也提出过 "Forms follow emotion(形式追随情绪)" 的设计原则。 所谓「形式追随情绪」就是让情绪成为恰到好处的功能装置。而大部分用户想用最快的速度搞点东西出来,那极高的 one shot 成功率带来的极高情绪满足就是最好的功能装置。 但 one shot 很多 AI IDE 在 2025 年就能做到,为什么 2025 年它的传播效应没有这么高,而 2026 年可以? 这是因为用户人群发生了改变。在 2025 年的主要适用人群——专业开发者看来,one-shot 能力是非常鸡肋的,因为我们要对工程细节进行打磨。但是 2026 年更多非程序员群体以办公人群的身份加入,导致评价标准发生了变化。 就像在移动互联网时代我们不能说:对于普通人来说想处理照片 Lightroom 足够了,没有必要购入 Photoshop。因为对于普通人来说真正合适的是美图秀秀、醒图、各种风格化相机。 可以说月之暗面在模型训练方面押注前端 one-shot 能力确实是一手好棋。 当然,这些用户会成长,会想做一些个性化的改动、会有创造新东西的需求。最后还是会碰到长 K3 上下文性能衰减和长尾数据不全面的短板。不过我想国产开源大模型应该已经有了第一批国内原住民——这些人没有用过美国头部两家的模型,在他们眼里,Kimi 就是最好的。
顯示更多
0
9
87
10
轉發到社區
我个人还是希望 Lin Junyang 所率领的团队后续可以有高质量的本地模型,因为 qwen 3.6 27B 4-bit 对我来说真的很重要 另外这个模型可以复现 J-Space,后续对于全球开发者理解大模型是如何工作的,应该也是非常重要的基建 模型公司以外的开发者真的很需要高质量的本地模型
顯示更多