说Meta的muse不好用,并非我脱离群众太久。而是我把模糊的感觉跟严谨的数据分开得出的结果
一个可爱的形象、好的传播途径,是重要,但我更多注意的是:
1. 次日留存和七日留存
2. 用户的 lifetime value
3. 对 Meta 资源的消耗以及带来的收益
4. 真正的付费比例
不论怎么说,我作为实际使用过 Muse 和高频使用各种 AI 助理的人,我都认为 Muse 是个半成品
包括我帖子的评论区,很多人估计都不太会用 AI,情绪被渲染得这么高。这在我这里是一个情绪跑在基本面前面的强烈信号
我认为 随着这个美国大豆包真正的留存和付费意愿被揭露, META 的股价可能会开始震荡甚至下跌。我打算买入看跌期权等待情绪回归
顯示更多
最近有很多关于 RSI(Recursive Self-Improvement,递归自我改进)的讨论,也让大家开始担心,AI 会不会不断升级自己,最后超出人的控制
我周末集中看了一批 RSI 2026 年的论文和公开项目,想把几个问题讲清楚:现在到底发展到了哪一步,业界 popular 的讨论是什么,以及我们普通人能怎么用。最后我会给大家一个可以用来直接给 AI 实现初步 RSI 的 Prompt
这次按方向来聊,论文和项目放在对应段落,大家可以收藏下来慢慢看
1/ 先分清楚,大家说的“自我改进”,有三件不同的事
第一件,AI 根据反馈,把当前任务再做一遍。
第二件,它把有效经验、工具或工作流程留下来,下一次任务也能用上。
第三件,它进一步改进“下一轮怎么学习、怎么做实验、怎么选方案”这套方法。
越往后,接手的研发决策越多。9 月 10 日发表的的《The Last AI Built by Humans》把这些自主范围拆成了执行、策略、经验获取、环境适应和元改进几层,适合当阅读地图
2/ 今年一条很密集方向研究线,是让 AI 改自己的 Harness
Harness 可以理解为模型周围那套实际干活的系统:读哪些文件、给模型看什么上下文、怎么调用工具、失败后怎么恢复、什么时候算完成。
今年 3 月的 Meta-Harness,6 月首发、8 月更新的 Self-Harness,以及 7 月底的 DarwinX (Salesforce),都在研究怎样把这套系统交给自动实验来优化
3/ 另一条已经出现企业内部应用的路线,是把人的纠错变成持久经验
今年 1 月的 MemRL,把经验和“这条经验实际有多管用”一起保存。下次先找相关经验,再根据使用效果挑选,而不只是找文字最相似的记录
到了 9 月 2 日,Meta 公开了一个更贴近日常工作的内部案例:专家纠正 Agent 后,系统会判断错误来自知识缺口还是处理流程,把纠错转成文件修改,重放原来的问题、跑回归测试,再交专家审核。
通过后,这次失败还会进入以后的测试集。这是 Meta 在特定专业领域的内部实践
对我们普通用户来说,这一条就很有用了, 人的一次纠错,开始有机会变成后续任务都能使用的改进
回到关键问题,我觉得今年这些工作的共同价值,是让我们开始认真维护一个会积累经验的系统。所以我们现在可以怎么用?
篇幅有限,我把一个我们都能用上的效仿 RSI 的基础 prompt 放在评论区里,
我最近也在观察,每次任务留下什么,每次纠错改到哪里,下一次能否因此做得更好,这些都已经可以在自己的工作里动手验证了。
为了防杠,我得说明一下:这三个方向只是工程向的,硅谷大佬们担心的更多是研究向的内容。
这些内容比较硬核,研究向 RSI我会在后面帖子里单独去聊
顯示更多
这个周末我认为最重要的一件事情:
OpenAI、Anthropic、xAI在同一个周末集体来了表态,一致同意并呼吁放慢 AI 的发展速度……
Dario 已经在原文里点名:AI 正在越来越多地参与研发下一代 AI。他担心这种加速,会超过人类理解和控制模型的速度
OpenAI 甚至说:“如果真到了那一步,为了拯救人类,我们愿意把自己的 GPU 都熔掉。”
通常这类 frontier lab 的管理层会比我们提前看到新一代模型的能力。显然,AI 已经突破了某个临界点,而且事情严重到把所有人都吓住了
这个或许是我们过度解读了。但有一点是肯定的,无论如何呼吁,整个世界这么多 lab 一定不会完全步调统一、暂缓步伐
顯示更多
这个周末我认为最重要的一件事情:
OpenAI、Anthropic、xAI在同一个周末集体来了表态,一致同意并呼吁放慢 AI 的发展速度……
Dario 已经在原文里点名:AI 正在越来越多地参与研发下一代 AI。他担心这种加速,会超过人类理解和控制模型的速度
OpenAI 甚至说:“如果真到了那一步,为了拯救人类,我们愿意把自己的 GPU 都熔掉。”
通常这类 frontier lab 的管理层会比我们提前看到新一代模型的能力。显然,AI 已经突破了某个临界点,而且事情严重到把所有人都吓住了
这个或许是我们过度解读了。但有一点是肯定的,无论如何呼吁,整个世界这么多 lab 一定不会完全步调统一、暂缓步伐
顯示更多
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so.
Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our systems, so that they can verify adherence to our safety measures, report on incidents, and assess models’ alignment during training.
You can read the full post here:
顯示更多
我始终觉得,人人都值得拥有 AI 平权、知识平权。这个时代已经到来了,关键是很多人还没有意识到,我建议大家今天就开始用 AI 大胆地犯错
1/ 为什么我对这个时代既感到焦虑,又欣喜若狂?高强度每天使用 10 亿 GPT-6、Fable 5.1 Token之后,这种感受越来越强烈。一个人的学历、专业和过去接触过什么,曾经很大程度上决定了ta能理解什么、参与什么。
2/ 过去没学会的,可以重新学。这难道还不是最好的时代吗?
以前觉得“这是专业人士才能做的事”,现在可以亲手试。你甚至不必先相信自己很聪明,只需要对一个问题有兴趣,愿意追问,愿意动手验证。
3/ 当然,我也焦虑,我有时会想,这是最混乱的时代
自己花了很多年积累的能力,还有多少会继续值钱?当工具越来越强,工作会怎么变,我和身边的人又该往哪里走?参与开发和使用 AI,并不会让我免于这些担心。因为离得近,反而更难把这些问题放到一边
4/ 模型的发展,至少让我变得非常矛盾和混乱
刚刚为模型完成了一件复杂的事而兴奋,紧接着就想到,这原本可能是某个人赖以谋生的工作
所以,我希望大家能尽早接触它、理解它,有机会为自己的下一步做准备。我做这个账号,分享一线体验,把芯片、产业链和公司财报尽量讲明白,也有这层心愿
投研平权在我这里,有一个很具体的愿望:你读完我的文章,能够自己回去看材料,知道该问什么,甚至能有依据地指出我哪里想错了,知道问什么,是最重要的一步
顯示更多
这事很重要,长话短说:今晚加州半夜(约北京时间下午 3 点),Codex 又会迎来一次额度重置,大家快用 GPT6 Ultra /fast 开始蹬
今天我跟一个朋友聊天,ta跟我说 Codex 不让注册 200 刀了,让ta非常难受,像是吸了*,悔不当初。现在算力紧缺,好的 Token 自然得靠抢
我的读者朋友中,有很认真在看我帖子的。因此我准备来一个 AI 投研系列 101入门,把我如何把 AI 融入行业研究?分为四个章节,后面的帖子会把详细内容发出来
我的目标是做到 AI 投研平权,每个人都可以跟着做,搭建自己的投研助手。我已经开始想今晚让 GPT-6 干什么大活了。今晚继续🔥
没什么能做的,到时候我把 AI 投研平台开放出来,大家可以自己本地部署,我也送大家一点 GPT-6 和Fable 5.1 的 Token 来在线体验
顯示更多
OpenAI 表示 GPT-6 的需求太多,可能会考虑暂停 Pro 新会员的注册。
我赶紧爬起床又抢了一个200$ pro会员,太好用了,不够用
我建议大家都给GPT6一个需要运行3小时以上的任务,否则你会一直低估AI。如果你没有这么复杂的任务,那应该反思一自己
Pro会员意味着没有5小时额度limit,只要你想,你可以给最复杂的任务,探究AI的上限
这下我彻底不担心 $ORCL 了,好在前段时间底部吸够了筹码
另外一个冷知识:企业版的codex是按照API用量计费的,目前200$的个人账号纯属是亏欠赚吆喝,顺路收集数据
顯示更多
不知道你是不是跟我有一样的问题?,跟 AI 聊天,经常脑子里有一堆想法,背景没交代清楚,目标也有点模糊,聊着聊着就散了。
我思考下来,其实缺的就是一个用户记忆的体系化管理
如何解决这个问题?这个帖子分享我本人的最佳实践,只是一句 prompt复制给你的 AI 就好,使用下来效果非常的惊艳,希望能帮到你
如果使用效果也给你带来了惊喜,欢迎分享出来你的使用体验!
把下面直接复制给 Codex(或者任何 AI)
'''根据你已经了解的我,对我做一次深入访谈,重点问那些你还不了解、但会影响你帮助我的背景、目标和困惑。一次问一个问题,让我自由回答,适合时给选择题。根据我的回答继续追问,遇到含糊或矛盾的地方,让我举具体例子。每聊清一个主题,就帮我梳理已知信息、还没想清楚的问题,以及接下来可以做什么。把我明确说过、确认过的信息整理进项目的记忆文件,方便以后接着聊,没确认的继续问'''
这几天一直拿它让 Codex 拷打我自己,帮我捋清了不少思路。有些问题,它问出来之前,我自己都没想过
总之,真的建议大家试试!
顯示更多
给 GPU 接上更多内存,为什么它还会等数据?
把缓存复用、带宽和客户成本这几笔账算清楚,才能看懂 connectivity 的价值,以及美光、海力士和 Marvell 各自赚什么钱。
$MU $MRVL
顯示更多
和我的体验几乎一致,GPT-6 感觉可能偷偷“降智”了,没有上周刚发布的时候那么惊艳。几天一直在用 Astra 的朋友,你们感觉怎么样?上周我夸得很认真,现在觉得没那么好了,也想把原因弄明白
从我个人的经验上来判断,这个降质本质上还是算力和资源不够,是不是做了更激进的 quantization,省显存、省带宽?
或者同样选高思考档位,实际给的推理预算变少了?这些都可能影响体验
如果真是为了省资源,最后让用户来回追问、返工,那这笔账也未必划算。本来一次能做好的事情,来回做三次,省下来的计算可能又花回去了。但对于普通用户来说,我们的额度上限是一定的。用户来回追问、返工,消耗的也都是我们自己的额度。再结合 OpenAI 今天宣告暂停了 200 美元的会员申请,逻辑就圆了回来了
当然,除了这个技术角度之外,我想再往下深入一层:现在还缺算力&互联&存储,远远没有饱和
顯示更多
GPT Astra really needs to be tested with the same prompts over time.
The difference in these outputs is wild, makes you wonder what changed under the hood. 👀
分享一份最近收集的 AI Infra 入门阅读清单,建议收藏,慢慢看
AI 已经可以生成很多很好的内容,解释概念、翻译论文、整理资料,都越来越方便。但在这个时代,能静下心来,把一篇好文章认真读完,把没懂的地方再琢磨一遍,我觉得更加难能可贵
这次整理的材料,主要集中在大模型推理这一块。从 KV Cache、显存管理,到请求调度、推理加速,再到怎么判断性能有没有真正变好
做工程的朋友,可以顺着往源码和实验里走。平时看 AI 产业、算力和存储的朋友,也可以先把原理读明白
读文章,挑值得反复读的。
1. 如果只选一篇,我会选 Inside vLLM。
Inside vLLM: Anatomy of a High-Throughput LLM Inference System,作者 Aleksa Gordić
把很多零散的概念串进了一个真实系统:一个请求进来,怎么排队,怎么分配 KV Cache,怎么执行,最后又怎么把结果送回来
PagedAttention、continuous batching、chunked prefill、prefix caching、投机解码、P/D 分离、多卡和性能测试,都能在这条线上找到位置。
这篇适合当主线,后面的材料用来补不懂的地方
2. 想弄懂 continuous batching,先看 Anyscale 这篇。
Continuous Batching 博客
llm用户的回答有长有短,有的已经生成完了,有的还在继续。已经空出来的位置,能不能马上接下一个请求?
这篇用静态批处理和连续批处理的对比图,把这个问题讲得很直观。看完你会理解,GPU 的效率,也取决于请求怎么安排
建议重点看图和机制
3. NVIDIA 的两篇,一篇帮你建立全貌,一篇教你怎么看性能。
Mastering LLM Techniques: Inference Optimization
适合先建立基本认识:处理输入的 prefill 和逐步生成输出的 decode 有什么区别,模型权重和 KV Cache 分别占什么空间,量化、批处理、多卡并行又各自解决什么问题
LLM Inference Benchmarking: Fundamental Concepts
这一篇我也很推荐。用户等多久才看到第一个 token,后面生成得快不快,整个系统一秒能服务多少请求,是不同的问题。TTFT、ITL、TPOT 这些指标,要连着测试口径一起看
4. 想再往下算一层,读 kipply 的 Transformer Inference Arithmetic
Transformer Inference Arithmetic
这是一篇 2022 年的文章。它带你从计算量、内存容量、带宽和通信开销出发,估算推理为什么快、为什么慢,以及 batch size 改变后会发生什么
硬件和模型的具体例子有年代了, 作为 optional 选读
顯示更多
上午我说,如果最前面的用户都在排队,后面已经建好的算力,是不是根本不愁租?。 $ORCL 盘后发布财报,拉升 +6%,我的信心更加明确和坚定了,这个帖子速览财报数据,我的逻辑和操作
1/ 首先:财报前一个小时,跟大家分享了我买入了 ORCL 的 call option,并且持有正股。欢迎回看。有时间质疑一切、怀疑一切,不如低头虚心学习,把认知换来的钱揣进兜里不好吗?(笑)
还是那句话,我不是一个喜欢喊单的博主,除非信号太明确,偏离基本面太明显。这一切的认知都源于我在硅谷一线积累的经验和 AI 使用的体验(笑)
账户里的冰冷上升的数字是最真的,是底气
2/ 先看这季实际交出来的成绩:
> 营收 193 亿美元,同比增长 30%,市场预期 191.4 亿美元,超预期约 0.8%。
> 调整后每股盈利 1.92 美元,同比增长 30%,市场预期 1.74 美元,超预期约 10.3%。
> 云业务收入 116 亿美元,同比增长 62%;其中 OCI 云基础设施收入 74 亿美元,同比增长 121%。
> 调整后经营利润 82 亿美元,同比增长 31%,经营利润率 42%。
我的理解是,营收小幅超预期,每股盈利给的惊喜更大。云业务已经占到总收入约六成。其中云应用收入增长 10%,OCI 增长 121%,这轮增长主要是谁在推动,已经很清楚了
Q2 指引按美元口径看:
总收入同比增长 30%~34%,本季实际增长 30%。
云收入同比增长 65%~71%,比本季的 62% 还要快。
调整后每股盈利 1.85~1.93 美元,中点 1.89 美元,正好符合市场预期
3/ 我的逻辑和操作
我的逻辑其实在过去的一个月阐述得很明确了:
1. OpenAI 这么强,我现在买了 3 个 200 刀的 Pro 账号
2. ORCL 根本不缺客户,我也不相信 OpenAI 会违约
3. 此外,ORCL 不被大家看好,被评为垃圾股,当网上都在骂的时候,我就知道我稳了
目前长线我仍然没有卖出的打算,leap call到期日期是明年 1 月 145 行权价,是否清空,会根据财报会议管理层的表述
上午盯的三个问题里,收入这一项给了正面反馈;机房是否按期交付、资金缺口有没有持续收窄,还要接着核对
财报会议之后,我会给大家带来更多的分享
顯示更多
09/10 前天半夜爬起来,又买了一个 $200 的 Pro。今天看到 OpenAI 宣布已经暂停这一档的新订阅,感觉这次确实抢对了。2026 年,好的 Token 开始要抢,谁拥有了足够多的高质量 Token,谁就有下一个时代的入场券
1/ 穿透现象看本质,还是算力紧缺了:
这让我更想研究给 OpenAI 提供算力的公司,尤其是 $ORCL,今天尤其关键,马上要发布财报
2/ 我的核心研究问题是:如果最前面的用户都在排队,后面已经建好的算力,是不是根本不愁租?
查了甲骨文的披露,这个判断还真有直接证据。6 月发布的财报演示稿里,AI 基础设施利用率是 97.5%,AI 数据中心容量 98% 已经签约
3. 这让我对需求多了一份信心。但这里还要往后想一步:已经签约的容量,什么时候交付、开始收钱?
上次财报之后,甲骨文被狠狠惩罚,需求很强,建设也确实很烧钱
解决了需求问题,甲骨文想要上线,要解决烧钱的问题。我觉得更值得看的是客户怎么参与出资。甲骨文披露,大型 AI 合同中,客户预付款和自带硬件的部分合计已达 750 亿美元
它说明,客户愿意承担部分前期硬件资金,甲骨文可以减少垫资,同时继续提供集群建设和运营服务。这个变化,才可能帮助它把旺盛需求变成更好的资本回报
今天 PPI 公布后的回调,也不能直接理解成宏观风险已经出尽。明天还有 CPI,甲骨文自己今天盘后也要交财报。利率会影响它后续融资的成本,也会影响市场愿意给未来利润多少估值
4/ 下午的财报:我会继续盯住 $ORCL,看三件事:新机房是否按期交付,交付后收入是否跟上,以及收入增长时资金缺口有没有收窄
5/ 我的操作
前段时间的下跌吸纳了不少低价筹码。今天甲骨文财报前跌了 5%,我认为是好事情。
目前我同时持有甲骨文的正股,今天财报前买了一部分看涨期权,小赌怡情
甲骨文在我的目标持仓里目前还没达到 50% 的阶段。如果下跌,我会放心大量买入,希望有回头的机会
顯示更多
09/10 前天半夜爬起来,又买了一个 $200 的 Pro。今天看到 OpenAI 宣布已经暂停这一档的新订阅,感觉这次确实抢对了。2026 年,好的 Token 开始要抢,谁拥有了足够多的高质量 Token,谁就有下一个时代的入场券
1/ 穿透现象看本质,还是算力紧缺了:
这让我更想研究给 OpenAI 提供算力的公司,尤其是 $ORCL,今天尤其关键,马上要发布财报
2/ 我的核心研究问题是:如果最前面的用户都在排队,后面已经建好的算力,是不是根本不愁租?
查了甲骨文的披露,这个判断还真有直接证据。6 月发布的财报演示稿里,AI 基础设施利用率是 97.5%,AI 数据中心容量 98% 已经签约
3. 这让我对需求多了一份信心。但这里还要往后想一步:已经签约的容量,什么时候交付、开始收钱?
上次财报之后,甲骨文被狠狠惩罚,需求很强,建设也确实很烧钱
解决了需求问题,甲骨文想要上线,要解决烧钱的问题。我觉得更值得看的是客户怎么参与出资。甲骨文披露,大型 AI 合同中,客户预付款和自带硬件的部分合计已达 750 亿美元
它说明,客户愿意承担部分前期硬件资金,甲骨文可以减少垫资,同时继续提供集群建设和运营服务。这个变化,才可能帮助它把旺盛需求变成更好的资本回报
今天 PPI 公布后的回调,也不能直接理解成宏观风险已经出尽。明天还有 CPI,甲骨文自己今天盘后也要交财报。利率会影响它后续融资的成本,也会影响市场愿意给未来利润多少估值
4/ 下午的财报:我会继续盯住 $ORCL,看三件事:新机房是否按期交付,交付后收入是否跟上,以及收入增长时资金缺口有没有收窄
5/ 我的操作
前段时间的下跌吸纳了不少低价筹码。今天甲骨文财报前跌了 5%,我认为是好事情。
目前我同时持有甲骨文的正股,今天财报前买了一部分看涨期权,小赌怡情
甲骨文在我的目标持仓里目前还没达到 50% 的阶段。如果下跌,我会放心大量买入,希望有回头的机会
顯示更多
OpenAI 表示 GPT-6 的需求太多,可能会考虑暂停 Pro 新会员的注册。
我赶紧爬起床又抢了一个200$ pro会员,太好用了,不够用
我建议大家都给GPT6一个需要运行3小时以上的任务,否则你会一直低估AI。如果你没有这么复杂的任务,那应该反思一自己
Pro会员意味着没有5小时额度limit,只要你想,你可以给最复杂的任务,探究AI的上限
这下我彻底不担心 $ORCL 了,好在前段时间底部吸够了筹码
另外一个冷知识:企业版的codex是按照API用量计费的,目前200$的个人账号纯属是亏欠赚吆喝,顺路收集数据
顯示更多
我知道很多人想转 AI Inference, 但 Day0 怎么开始呢?我在团队内整理了一个 1 小时的学习路径,分享出来,作为 Day0 的阅读和“开智”使用
大家可以通勤路上、上厕所、吃饭的时候,扫上两眼。收藏下来,慢慢品,都是干货请放心使用,希望对你有帮助。
这个学习路径是:AI 模型如何生成 → 哪些计算存储资源可以复用 → GPU 为什么忙不过来 → 高并发请求如何共享资源 → 怎样判断 AI 模型推理用户体验
1. 先理解模型生成和 KV cache|20 分钟
带着一个问题读:模型权重、KV cache、生成的文本,分别是什么东西?
这是后面理解长上下文显存占用、缓存收益的基础
2. 理解 GPU 的两类主要瓶颈|15 分钟
看 GPU Architecture Fundamentals 的结构图,重点读 Understanding Performance
带着一个问题读:为什么换算力更强的卡,AI生成速度不一定按比例变快?
文档里的 GPU 示例比较早,今天学习原理即可
3. 理解不同请求之间怎样复用缓存|10 分钟
读开头、Example workloads、Limits
第一篇讲生成过程中复用旧 K/V;这一篇讲不同请求共享相同前缀时,怎样进一步复用计算
它直接节省的主要是输入处理,也就是 prefill;新答案仍然需要逐步生成。
带着一个问题读:为什么缓存命中率很高,用户仍可能觉得慢?
4. 理解长短请求如何争用同一张 GPU|20 分钟
读 Preemption、Chunked Prefill、Performance Tuning with Chunked Prefill
到这里,你就开始把已有的资源调度、容量和延迟知识,接到 LLM 服务上了
5. 理解性能数字究竟在衡量什么|10 分钟
三个概念:TTFT 看第一段输出等多久;ITL 看流式输出的间隔;TPOT 看除首 token 外,平均每个输出 token 的耗时
5. 最后把这些概念接回数据|5 分钟
读 Workloads 和 Trace Format,看懂到达时间、输入长度、输出长度、前缀块 hash 四项。
带着一个问题读:这些记录能描述哪些负载特征,哪些东西仍然必须在真实 GPU 服务里测?
6. 读完后思考 10 分钟
一个长请求进来以后,短请求为什么可能变慢?开启缓存以后,哪些成本减少了,哪些等待仍然存在?
如果你能通俗易懂地解释了,说明这一个小时没白过
这一个小时的教程是我为投研团队成员准备的。他是我在
@meta 的前同事,和我一起合作了很多 Marvell 的分析
他现在是在硅谷某个大厂的 SDE,对 AI infra 一窍不通,我在督促他建立一个 X 的账号,让他分享起来。从 Day One 开始,分享他从普通 SDE 转到 AI 的学习路径,相信会对很多人有帮助,坚持下来,大家的水平应该可以拉齐
顯示更多
最近很多朋友问我,怎么从 SDE(Software Engineer)转到做 AI Infra 和大模型相关的工作?
或者普通人想做 Pro 级别的 AI 投资者,零基础怎么扫盲,怎么搞懂这么多术语?给大家推荐两个免费的入门友好的 AI 相关学习网站(课)
如果你要做基本的 AI 投资,看完第一个 Stanford CS336 课程也就差不多了。如果想专攻某个领域,可以看看第二个的公开课?
1. Stanford s开课 Stanford CS336 Language Modeling from Scratch
2.
@AndrewYNg 创办的学习平台, 里面的课程非常多,点开你就使劲学吧,从 pre-training 到 post-training,从训练到推理,全都涵盖 链接⬇️
不知道我的 follower 中有多少对这些感兴趣的。可能和投资不直接相关,但我觉得都是很好的认知提升课程。
有时间还是要多看教程、多看课、多读书,武装自己的大脑
如果有朋友感兴趣,我后续可以分享更多
顯示更多
大家日常高频使用 AI 的,应该都有这个痛点:AI 足够聪明能把任务跑完,但是!距离结果好到我能直接用,中间还有很长一段距离,有的时候 AI 的结果好得一塌糊涂,但就未必是我想要的
这个事情的解药在于Evaluations,AI 评估:我觉得每个想认真用 AI 的人都值得理解。我用 AI,越来越把重心放在 Evaluations上:什么叫做好,怎么验收,犯过的错怎么减少?
今天结合我自己的的工作流,尝试把这件事彻底讲清楚
1/ 把“我觉得不行”,变成具体的验收标准
我之前分享过,让不加以特化的 AI 解读研报,有时每个字都认识,连起来却看不懂,还得追问好多轮。
它确实写完了。但我需要的是:读完能讲清楚公司靠什么挣钱、发生了什么变化,以及变化怎么影响盈利和估值。
所以,当前的工作流我会检查:数字有没有原始出处?季度和全年有没有混用?公司指引、券商预测、自己的判断有没有分开?市场 price in 预期的反推和我自己的建模 gap 在哪里?市场有哪些错误的逻辑?是否错杀?是否超买
Eval,就是把心里“这样才算做好”的标准,变成能反复执行的检查
能算清楚的,用程序检查;“有没有解释清楚”这种开放问题,就写成 rubric,评分标准,配上好坏案例,让 AI 辅助评判、人来校准。久而久之,你的私有化模型会越来越好
2/ 让它在真实工作的条件下接受测试,留下错误记录,持续进步
一套 eval,基本就是:Agent + 工作环境 + 任务 + 验收标准
以前 AI 输入文字、输出文字。现在 Agent 会开网页、读文件、改笔记。我会明确地写 skill 和 prompt,让 AI 去记录下来自己曾经做错了什么事情,然后再让它进行自更新(也就是 RSI),最后再让它把错误的部分重新再做一遍。
久而久之,模型的效果会越来越好。通常我会让AI做两件事情:
1. 对公司基本面短期、长期的判断
2. 实际的股票操作
回溯:哪些判断对了,就继续加强;哪些判断错了,就让模型记住错误的原因,下次不要再犯。久而久之,模型会变得出乎意料的好
3/ Evaluation 非常重要
这就是为什么目前我的每一个工作流或者工作体系,我都会写好 Evaluation 和自进化的规则。AI 顶尖聪明了,但问题就是,它有的时候认为它做的正确的方式,未必是你想要的
有了可靠的标准,AI 就可以帮忙找失败、提修改方案,再接受验证。人仍要定义什么是好,并确认评分规则衡量的确实是自己在乎的东西。
因此我建议大家如果想让 AI 把工作做好,先把“什么叫做好”写清楚
顯示更多
09/09 在过去的一个月里,我一共公开押注买入三次 MRVL。过去一周 $MRVL 上涨了 15%,30.62 美元。我的 call 整体盈利了 74%,200 区间抄底的短线正股股份获得了+16%,长期一直持有并且加码。
谁再说 AI 认知和工具的使用无法变现?我觉得这是变现途径 ROI 最高的方式
我通常不是一个喊单博主,除非我觉得信号太明确了,这个帖子分享我的操作和原因
下面都是原帖,欢迎回看
07/29 168$买入,那时候一片恐惧
08/20 我认为财报会跌,跟大家分享了我买入财报的 put
08/31 我认为市场错杀了 MRVL,股价惩罚得太厉害,买入了 10 月到期的 call。并加了不少正股长线
今天,我买入了下周Protective Put,做个保护。依旧等待 Investor Day
长线接下来 MRVL 会有不少重磅的事件,篇幅有限,我放到第三张截图里。我的认知和 AI 实践告诉我,MRVL互联行业方向是绝对没有问题的,而且是市场仅有的还在蓬勃向上的行业
顯示更多
我自己是怎么应对 AI 焦虑的?分享3点这个月我的亲身实践,大家作为参考,这对我自己提升很高
1. 我把每个月工资的 10% 固定拿出来投入AI学习,我认为 ROI 非常高
除了公司消耗的Token之外,我个人订阅了 3 个 200 刀的 Codex Pro,1 个 200 刀的 claude code。做投研、自动化工作流、做强化学习,任何我想做的。因为Token沟通了,解放了生产力,才能看到别人看不到的问题
其余的钱,买卡、租服务器等等。回报不只是我的认知提升,走在AI的前沿,股票投资也给我带来了回报和成长
2. 把我的过往经历全部送给了AI,让 GPT-6 帮我指明下个阶段的方向,充分利用 Computer use
我的过往经历包括工作经历、生活经历、投资经历,现在过往电脑和浏览器的一切。让 AI 充分了解我的上下文,做每个决策都能充分思考
3. 把AI当人而不是工具,给他一些更困难的任务,跳出使用“工具”的思维框架
通常来说,我给 AI 的 prompt 会包含三段论
a. 背景信息:因为背景我已经收集好了,所以我只会告诉它去哪里找
b. 我要做什么
c. evaluation(非常重要):一定要注明这一项,告诉 AI 我想要达到什么样的效果,怎么样才算真的结束了
尝试把你最难的任务给他,包含好 evaluation 这一项。相信我,你会有意外收获的
有没有人想听我分享几个我最近使用的、运行数个小时、我认为相对复杂的任务的 prompt,给大家参考?如果有的话,我下个帖子把我的 prompt 和任务拆解分享给大家
顯示更多
刚刚看到,这个博主真的用心了,总结了我过去对mrvl的关键操作的时间和帖子,如果这不是ai帖子,我会感动的
回过头来看,如果我对 $MRVL 恰好踩对了时间点和方向,别怀疑,我只是看懂了外加运气好了点。如果你看完也赚到了钱,那我替你感到开心
赚到钱了去买个codex pro学学AI 吧,就当投资自己了
顯示更多
OpenAI 表示 GPT-6 的需求太多,可能会考虑暂停 Pro 新会员的注册。
我赶紧爬起床又抢了一个200$ pro会员,太好用了,不够用
我建议大家都给GPT6一个需要运行3小时以上的任务,否则你会一直低估AI。如果你没有这么复杂的任务,那应该反思一自己
Pro会员意味着没有5小时额度limit,只要你想,你可以给最复杂的任务,探究AI的上限
这下我彻底不担心 $ORCL 了,好在前段时间底部吸够了筹码
另外一个冷知识:企业版的codex是按照API用量计费的,目前200$的个人账号纯属是亏欠赚吆喝,顺路收集数据
顯示更多
09/08,今天 $QCOM 和亚马逊宣布多代 AI 合作,股价应声跳涨 10%,合作内容和 $MRVL 很像,MRVL 会因此丢单承压吗?这个问题吓到了不少人。
我认为不会,不足以推翻我对 MRVL 增长的判断。结合我的模型预测,给大家带来这条消息的深入解读
1. 合作主要做两件事:
为 AWS 定制 AI 推理芯片,以及合作开发最高 1.6T 和后续代际的光互连。前者提高推理效率,后者解决大规模集群的数据搬运问题
2. 对 $MRVL 当然有竞争压力
定制芯片和光 DSP 都有重叠,AWS 多一个供应商,后续份额和价格就可能承压。高通也说已经为 Amazon 投产,预计今年 12 月季度开始贡献收入,值得认真跟踪
但今天 AI 板块过于热情,MRVL 同样上涨
3. 真的会挤压 MRVL 的份额吗?我看未必
根据消息和我的序列建模
MRVL 来自 Amazon 的定制芯片收入,FY2028 到 FY2029 本来就预计从约 21 亿美元略降到 20 亿;
同期全部定制芯片收入,从约 45 亿增长到 95 亿。两个财年大致对应自然年 2027、2028
因此可以见得,高通挤占 Marvell 的份额早有预计,属于符合预期。至少在我的这套预测里,后面的增长主要靠其他客户和项目,例如 $GOOG , 没有押注 AWS 这条线持续高速增长
所以,对我继续沿着 AI 主线投资的判断,这条消息分量不大。目前还不足以让我推翻对 MRVL 的增长判断。
我更看重的是:客户继续围绕推理效率、带宽和成本做多代投入
一旦后面 Marvell、英伟达又跟 Amazon 搞一个大的合作,这都是增量
顯示更多
在 GPT5, Fable5.1 发布的当下,我观察到一个反差:
> 走在最前沿、真正把 AI 用进工作的人,觉得它已经跨过了某个坎。越用越觉得有用,也越觉得自己还有很多东西要学,过去的经验和工作方式都需要重新审视
> 没怎么认真用过的人,结论反而特别笃定:“GPT 时刻还没来,没有什么生产力革新,全是幻觉,根本做不好。”
你今天还能照常上班、照常领工资,并不能证明你的工作方式没有过时。也可能只是公司还没调整流程,客户还没找到更便宜的选择。
等到这些变化真的发生,你才开始学,留给自己的余地会有多少?
因为认真用的人,每做完一件事和 AI 的交互,都在积累下一次的优势:哪些任务值得交给 AI,怎样提供背景,哪里必须检查,哪些旧流程可以直接删掉
如果你一直觉得它没用,不去突破上限使用。等你终于决定认真学,别人已经完成了多少轮尝试?
同一代技术,为什么会让人产生这么大的认知差异?
顯示更多
日没夜用了两天 GPT-6、Fable 5.1。消耗了 21 亿 Token,我现在最大的感受是焦虑,以及深度恐惧。
我的核心判断:社会分工和财富会因为 AI 重新洗牌,而留给我们调整自己的时间,可能比想象中少得多。
这个帖子想给各位敲响警钟,也分享一下,我觉得普通人接下来应该怎么办。在硅谷,我几乎经历了整个机器学习到如今 AI 的演变。这一次,我觉得跨过了某个奇点
1/ 先分享一组数据:累计消耗了 2,101,817,483 个 token,我几乎重构了我所有的工作流,删掉了约 95% 的 prompt,效果甚至更好
我之前几个月的调优工作,在这次更新面前,突然显得微不足道。这让我开始怀疑,自己过去积累下来的方法,有多少只是为了弥补上一代模型的不足?
2/ 2022 年 12 月,我第一次使用 ChatGPT
到现在,连四年都不到。四年,很多人可能才刚熟悉一份工作,AI 却已经跨过了这么多技术节点。以前还要反复追问、解释的东西,现在交流起来,我真的越来越觉得像在跟一个真人对话。甚至,我感觉这次出现了某种“灵性”
这个词不严谨,但它很接近我的感受。我暂时也不想展开解释,只能说,单看参数和跑分,已经很难传达这次使用带给我的冲击
3/ 让我恐惧的还有另一件事:这种能力,还没有充分进入每个人的日常工作
我坚定认为,一部分工作今天还需要人来做,只是因为把 AI 用到足够好、足够稳定,仍然很贵。
这些门槛到底还能维持多久?
我感到的倒计时,是我们今天赖以挣钱的能力,还能稀缺多久。
一个人学一门技能,要读书、练习、犯错,可能花上好几年。模型的能力一旦得到改进,同一套能力就可以被部署到大量系统里。我们面对的是一种完全不同的积累和复制速度。拿它跟人类个体的学习速度比较,我只有无力感!
所以我觉得,人类需要放下一部分 ego。包括我自己。
不能因为自己有经验、懂技术,就默认 AI 永远只能当实习生,永远只能等人类安排下一步
在它更擅长的问题上,我愿意让AI带着我走。让它指出我哪里想错了,告诉我还缺哪些信息,甚至提出一个我根本没想到的方向。能接受它来指导我,同时检查它的依据,是我这两天跟 AI 的相处模式
4/ 那普通人现在能做什么?
篇幅有限,我把它放在评论区
顯示更多
继续上个帖子:如果 AI 的发展势不可挡,人类现在的职责分工必将终结,财富会重新洗牌,那普通人现在能做什么?
我分享几点在硅谷我看到的和我正在做的,一定对你有帮助
1. 多放手一点,让 AI 帮你找方向
把你现在的工作、擅长的事情、遇到的困难,以及现实约束,认真讲给它听。让它先追问,弄清楚你的处境,再提出下一步
我们很容易只问自己已经想得到的问题。但GPT6,我认为它的灵性可以弥补你的盲区
2. 有条件的话,试一个月 200 美元档的Codex会员
这笔钱对很多人不便宜,量力而行。但如果预算允许,我真的建议拿一个月,体验高额度的模型使用,把一件复杂的事做下去。20$ 或者什么 API 中转站,根本无法支撑你去完成复杂任务
拿出一个你现在觉得最难、最害怕面对,甚至已经拖了很久的问题。把背景交代清楚,让它帮你分析,追问它的依据,再一起往前做
你得给它一个足够重要的问题,才能知道它对自己到底有多大用处。有些事情我们从来不去尝试,是因为早就默认自己做不到。现在有了AI,可以尽情释放你的想象力了
3. 放下对现有工作的执念,也放下周围人的评价
给自己留好收入和生活的余地,但别再把现在的职位、老板的表扬、过去最擅长的工作,当做最重要的。我跟我自己团队成员也是这样说的
一项工作今天被需要,不代表它会一直以同样的方式被需要。周围人认可你的能力,也不代表市场以后还会为它支付同样的价格
如果你已经看见变化,就值得花时间,为自己试出另一条路。哪怕它暂时没有成效,一定要坚持下去。当 AI 持续变强的时候,你过去所做的一切都会成为你的积累。到了某个节点,你会发现这件事情会一夕成真
4. 保持健身,降低皮质醇,享受活着的快乐
越觉得焦虑,越容易只刷消息、只焦虑,最后什么也没做。
身体和睡眠一旦跟不上,就会被社会彻底淘汰。每天推进一点具体的事,看看结果,改一下,再继续。做不动了就去运动、休息
写这个帖子的时候,我依然焦虑,这两天总共只睡了 6 个小时,剩下时间,除了吃喝拉撒,都给了 AI。这可能是普通人改变自己处境的一次重要机会。我也想把握住
顯示更多
日没夜用了两天 GPT-6、Fable 5.1。消耗了 21 亿 Token,我现在最大的感受是焦虑,以及深度恐惧。
我的核心判断:社会分工和财富会因为 AI 重新洗牌,而留给我们调整自己的时间,可能比想象中少得多。
这个帖子想给各位敲响警钟,也分享一下,我觉得普通人接下来应该怎么办。在硅谷,我几乎经历了整个机器学习到如今 AI 的演变。这一次,我觉得跨过了某个奇点
1/ 先分享一组数据:累计消耗了 2,101,817,483 个 token,我几乎重构了我所有的工作流,删掉了约 95% 的 prompt,效果甚至更好
我之前几个月的调优工作,在这次更新面前,突然显得微不足道。这让我开始怀疑,自己过去积累下来的方法,有多少只是为了弥补上一代模型的不足?
2/ 2022 年 12 月,我第一次使用 ChatGPT
到现在,连四年都不到。四年,很多人可能才刚熟悉一份工作,AI 却已经跨过了这么多技术节点。以前还要反复追问、解释的东西,现在交流起来,我真的越来越觉得像在跟一个真人对话。甚至,我感觉这次出现了某种“灵性”
这个词不严谨,但它很接近我的感受。我暂时也不想展开解释,只能说,单看参数和跑分,已经很难传达这次使用带给我的冲击
3/ 让我恐惧的还有另一件事:这种能力,还没有充分进入每个人的日常工作
我坚定认为,一部分工作今天还需要人来做,只是因为把 AI 用到足够好、足够稳定,仍然很贵。
这些门槛到底还能维持多久?
我感到的倒计时,是我们今天赖以挣钱的能力,还能稀缺多久。
一个人学一门技能,要读书、练习、犯错,可能花上好几年。模型的能力一旦得到改进,同一套能力就可以被部署到大量系统里。我们面对的是一种完全不同的积累和复制速度。拿它跟人类个体的学习速度比较,我只有无力感!
所以我觉得,人类需要放下一部分 ego。包括我自己。
不能因为自己有经验、懂技术,就默认 AI 永远只能当实习生,永远只能等人类安排下一步
在它更擅长的问题上,我愿意让AI带着我走。让它指出我哪里想错了,告诉我还缺哪些信息,甚至提出一个我根本没想到的方向。能接受它来指导我,同时检查它的依据,是我这两天跟 AI 的相处模式
4/ 那普通人现在能做什么?
篇幅有限,我把它放在评论区
顯示更多