注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 GarryTan
GarryTan 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 GarryTan 的推特
好久没有 #buildInPublic# 同步下最近的动作吧, 已经完成,我甚至搭配了一个 chatbot😂,听上去有点过时,但是就像早上转发的 @garrytan 的推文,Claw 对于有开发经验或者"聪明的人"来说是法拉利,但不是每个人都需要法拉利,也不是每件事都需要从零推理。 比如我最近经常处理 PDF 材料,一开始用 Claude Code 调 Gemini 3 Flash 多轮处理,跑通之后我就写成了一个 Clip(可以理解成 Agent 的 App),现在 `pinix invoke pdf parse --url "xxx"` 一行搞定。 还有很多内容只有小红书上才有,以前让 agent 搜小红书得 browser-use,操控浏览器,慢而且不稳。现在就是 `pinix invoke xiaohongshu search --keyword "种草"`,结构化返回。 Google 搜索也是,`pinix invoke google search --query "AI agent"`,这是我用得最多的 Clip。 这些 Clip 装到 Pinix 上,我手机上的 chatbot 就都能用了。它只能做 Clip 能做的事,但每多一个 Clip 就多一项能力。50 多个 Clip 下来,日常大部分事情手机上就搞定了。 code agent 探路,Clip 沉淀。越用越收敛,越收敛越可靠。 给 Agent 装能力,像给手机装 App。这就是 Pinix。
显示更多
🔥NVIDIA CEO 黄仁勋 @JensenHuang 开通X账号4天,发了两条推文,AI全球影响力排名来到全球第64,粉丝数接近百万。 这哪是新号上线,分明是AI圈顶级大佬集体来给老黄“随份子”。🤣 有意思的是,这些大佬里,老黄只回关了3个,剩下7个还在“单向关注”状态: 🟢老黄已回关的(互关) Elon Musk @elonmusk| XHunt AI排名:8 xAI创始人、特斯拉&SpaceX CEO,亲自转发力挺黄仁勋首帖 Demis Hassabis @demishassabis | XHunt AI排名:10 Google DeepMind联合创始人&CEO,诺贝尔奖得主 Garry Tan @garrytan| XHunt AI排名:25 Y Combinator总裁&CEO 🔴老黄没回关的(单向关注) Andrej Karpathy @karpathy | XHunt AI排名:1 前OpenAI创始成员、前特斯拉AI总监,现Eureka Labs创始人,AI圈最强技术布道者 Yann LeCun @ylecun| XHunt AI排名:7 Meta前首席AI科学家、图灵奖得主,深度学习三巨头之一 Andrew Ng @AndrewYNg | XHunt AI排名:11 Coursera联合创始人、斯坦福教授,前Google Brain和百度AI负责人 Logan Kilpatrick @OfficialLoganK | XHunt AI排名:15 Google Gemini与API核心技术负责人 Jim Fan @DrJimFan | XHunt AI排名:16 NVIDIA机器人与具身智能方向顶级科学家,GEAR Lab联合负责人 AK @_akhaliq | XHunt AI排名:19 AI论文圈最强分发节点,Hugging Face ML Growth Lead(原Gradio核心成员) hardmaru @hardmaru | XHunt AI排名:27 Sakana AI联合创始人&CEO(David Ha)
显示更多
最近正在梳理专属于自己的AI编程套件,用于提升自己的编程效率 我先花了几天收集和测评了 5 个 GitHub 26 万星的 AI 编程套件!直接把结论分享给大家: 1. obra/superpowers 这个应该大家都很熟悉了,superpower已经存在了2年左右 14 个技能硬编码工作流:brainstorming(苏格拉底式提问出 spec)→ writing-plans(拆成 2-5 分钟粒度任务)→ 子代理逐任务实现 + 双阶段评审(5 轮修复上限,超限强制停机裁决) 适合场景:你在意“防 AI 跑偏”多于交互流畅,需要无人值守的长任务 2. mattpocock/skills — 按需取用的工程工具箱 这个最近可以说是火爆了,我实测下来单环节的效果最好,强烈推荐大家用用,我之后的ai套件也会基于这个skill体系进行优化 两个杀手级技能值得单独说: /grill-with-docs — 把需求对齐变成文档资产 这是我测下来最聪明的一个设计 它不是简单的“AI 问你问题”,而是边问边写 CONTEXT.md 和 ADR(架构决策记录) 举个例子,你说“课程里的 lesson 变成真实文件时有问题” 它会逼你定义“真实文件”是什么,然后把这个概念写进 CONTEXT.md,术语统一叫“materialization cascade” 下次 AI 看代码时直接用这个词,不用每次都解释一遍 更绝的是:它会拿你的新想法去撞现有的 CONTEXT.md,发现矛盾就当场质疑你 “你上周说 X,这周又说 Y,到底哪个对?” 这个反向质疑机制,是我见过唯一能防止需求飘移的工具 /diagnosing-bugs — 6 步诊断法,强制你别瞎猜 这个技能解决了 AI 调试最大的问题:跳过复现直接改代码 它强制执行 6 个阶段: 先写一个能让 bug 稳定复现的测试(红灯) 最小化复现场景(删到不能再删) 提出假设(不许直接改代码) 加 log 验证假设 修复 写回归测试 3. garrytan/gstack — Web 产品从想法到上线的流水线 YC CEO Garry Tan 开源的个人配置,59 个技能,角色分工(CEO 拷问 /office-hours、安全官 /cso、发布工程师 /land-and-deploy) 这个skill我主要吸收以下两块内容: Playwright 驱动真实 Chromium 的常驻 daemon(首次 3 秒、之后每命令 100-200ms,登录态全程保留,/qa 边点页面边改码边复验) careful/freeze/guard 三个护栏用 PreToolUse hook 真拦截,不是靠提示词“记得小心” 4. multica-ai/andrej-karpathy-skills — LLM 通病的行为补丁 这个之前推荐过,karpathy的编程准则,非常适合写入claude.md中 本体就是一份 2.3KB 的 CLAUDE.md,四组守则: Think Before Coding(不静默假设) / Simplicity First(不过度抽象,“200 行能写 50 行就重写”) / Surgical Changes(每行改动可追溯到用户请求,不顺手重构) / Goal-Driven(“修 bug”→“先写复现测试再让它通过”) 5. anthropics/skills — 官方能力扩展 + 写 skill 的标尺 GitHub: anthropics/skills(16.7 万星,官方仓库) 17 个能力型技能:docx/pptx/xlsx/pdf 操作、Playwright 网页测试、MCP 构建指南等 它给 Claude 加“会做的事”,不管“怎么工作”,和上面四家不构成竞争 最值钱的是 skill-creator:唯一带闭环评测的技能(自动跑 with-skill vs baseline 对照、优化 description 触发率、格式校验脚本) 你以后自己写 skill 时它是标尺 适合场景: /plugin marketplace add anthropics/skills,装 document-skills(pdf/xlsx/docx);另装 skill-creator 这些套件的共同点是:它们都在用代码重新定义“什么是好的 AI 编程工作流” 以前写代码是在 IDE 里敲,现在是在跟 AI 描述你要什么 但 AI 不懂工程规范,所以这些开源作者做的事,本质上是把工程纪律编译成了 AI 能理解的规则 我认为每一个资深的开发者都值得搭建一个自生长的专属ai编程套件,从而适配自己的编程习惯! 如果这次的分享对你有帮助,欢迎大家点赞支持一下!谢谢大家~
显示更多
养龙虾最蠢的事,就是每次都重复说同一句话。 YC创始人Garry Tan放出了他自己在用的OpenClaw神提示词,可以把龙虾从一次性工具变成一次指令、永久生效的自动系统。 这样你再也不用每次都叮嘱它“记得按这个格式”“别忘了加这一列”“每周一跑一次”。 把这四条规则复制到你的AGENTS.md最前面,重启就生效。 核心规则简单到离谱,但威力巨大: 1. 禁止一次性工作 第一次做3-10个样本给你确认,满意了自动写成SKILL.md存进技能库。 是周期性任务?直接自己用openclaw cron add加定时,以后到点就跑。 2. MECE原则 一个活只能有一个技能管,不重叠不空白。能扩展旧技能就绝不新建。 3. 最狠的失败判定 如果你第二次还要问它同一件事,它就失败了。 第一次是发现需求,第二次就该自动完成。 4. 标准六步流程 概念→原型→评估→编码→定时→监控,全流程自己闭环。 这个prompt相当于给龙虾定了一套自我进化的底层规则, 不用教它每一件具体的事,只需要教它“怎么学会做事”。 而且用得越久,你的技能库越厚,整个系统自己会复利增长。 我已经用了小一个月了, 现在每天早上起来,龙虾已经把昨天的报表、邮件、数据整理好了。 所有重复工作,一次教完,永久自动运行。 以下配图是我用 Cloud 的 Opus 4.7HTML 输出,真的非常清晰漂亮! @garrytan Thank you so much, Garry. You’ve been incredibly helpful. #OpenClaw# #养龙虾# #AI# #Agent# #YC# #GarryTan#
显示更多
Claude团队的工程师,已经彻底抛弃Markdown了。 不是Markdown不好用, 是AI变得太快,它已经跟不上了。 以前AI写10行笔记,Markdown刚刚好, 现在AI能一次性输出1000行计划、复杂流程图、完整代码审查, 密密麻麻的纯文字墙谁有耐心看得完? 作者自己都说,他从来没完整读完过100行以上的AI生成MD文件。 更要命的是:现在都是AI写,我们只看不改。 Markdown最大的优点“易手动编辑”,现在已经彻底没用了。 而HTML,才是AI时代真正的沟通语言, 它能做到的事,Markdown想都不敢想: • 直接生成带颜色的表格、SVG流程图、可点击的原型 • 加滑块调参数、拖拽排序任务、实时预览Prompt效果 • 改完一键导出成代码或Prompt,喂回给AI继续迭代 • 发个链接别人点开就能看,不用下载任何工具 作者直接放出了20个现成示例: 从代码审查的彩色diff, 到可拖拽的任务看板, 从动画参数调试器, 到一键生成的幻灯片。 每一个都是能直接用的生产力工具。 最爽的三个用法,现在就能抄: 1. 代码审查:让AI把PR生成带注释的彩色diff+模块调用图 2. 做计划:生成带时间线、风险表、流程图的交互式项目页 3. 临时工具:让AI写一个Prompt调参器,改完直接复制结果 当然它也有缺点: 多花一点token,生成时间长2-4倍,版本控制不如MD干净。 但作者说:体验提升了10倍,这些代价完全值得。 本质上不是格式之争,而是人机协作方式的升级。 因为Markdown是给人写给人看的, 而HTML是给AI写给人用的。 随着当AI越来越聪明,我们需要的不再是文字墙,而是能互动、能操作、能思考的界面。 现在打开Claude,输入“帮我做一个HTML文件……”,你会打开一个全新的世界。
显示更多
0
13
119
25
转发到社区
这周,我最想安利的 4 个 skill 最近在折腾 coding agent 的人应该越来越多了,如果你也在用 Claude Code、Codex、Cowork、OpenClaw、Hermes 这些,下面几个 skill 值得试一下。 安装方式巨简单:开个新聊天窗口,把 GitHub 链接丢进去,跟 agent 说“帮我安装这个”就行。 GStack:github 117k stars。Y Combinator CEO Garry Tan 做的。它给你的 agent 搭一支 23 人的虚拟工程团队,有负责压力测试产品创意的 CEO、能识别劣质 AI 内容的设计师、跑 OWASP 审计的安全官、还有负责 merge request 发布的发布工程师。你可以跑 /gstack-office-hours,在写任何代码之前先对创意做压力测试。 (token 粉碎机,预算够的可以试试) Stop Slop:github 12.6k stars。一个小 skill,去 AI 文本痕迹的。把 ChatGPT 的输出粘进来,跑一下,出来就是更干净的文字。拿 AI 写剧本或写博客的人应该会需要。 Graphify:github 72.7k stars。把代码库、文档或你的第二大脑转成可查询的知识图谱。你能看到一个很漂亮的知识图谱,展示这些内容之间的相关性。你的 agent 可以直接查这个图谱当记忆用,不用每次都重新读所有文件。文档说大型项目每次会话的 token 使用量能降 71 倍。 非常实用的skill,省token利器。 Last 30 Days:github 47k stars。这个是我最喜欢的skill。在 Reddit、X、YouTube、Hacker News、Polymarket 和开放网络上做实时情绪研究。输入 /last30days research [主题],就能看到大家对一个话题到底感兴趣什么、困惑什么、在猜什么。 #agent# #Skill# #REDSkill#
显示更多
强烈推荐大家看看DeepMind CEO Demis的最新判断。 真的,Google DeepMind 的 CEO Demis Hassabis 每一期访谈我觉得值得都花时间看看。这哥们讲东西很实在,而且通俗易懂。 早上边跑步边听完了他和 YC CEO Garry Tan 的最新一期播客。 刚刚把笔记写完,也给大家分享下。 多说一句,好多人问我这种笔记是不是 AI 写的。我说下自己的流程。 我会先完整听完播客,然后用语音输入法把感触尽量充分地讲出来,再让 AI 帮着整理初稿,最后自己逐字修改优化。 如果全部交给 AI 做总结,那等于把思考和理解的能力让渡给了 AI,对自己理解这件事其实没有任何价值。 OK,咱们进正题。 1 Demis 的态度非常明确,现在的大模型范式(大规模预训练 + RLHF + CoT)一定会是 AGI 最终架构的一部分,他不认为这会是条死路。 但要实现 AGI,还有几个关键问题要解决。这几个问题包括:持续学习、长程推理和记忆系统。 先从最容易看到的现象讲起,Context Window。 现在大模型处理长信息,最常用的招就是把 Context Window 一直撑大。一开始 8k,后来 32k,再后来 100 万 Token。听起来很厉害,但本质上是暴力堆砌。 Context Window 其实就相当于人脑里的 Working Memory,工作记忆。人的工作记忆能同时装多少东西?心理学里有个经典数字,7 个左右。背电话号码能记住 7 位上下,再多就溢出了。 大模型呢?已经做到 100 万 Token。 按理说,模型的工作记忆比人大几十万倍,应该比人聪明几十万倍才对。但显然不是。 问题也恰恰就出现在这。把所有东西都塞进 Context Window 里,里面包含了不重要的东西、错的东西、过时的东西。看起来信息很多,其实是一团乱麻。 那人为什么 7 个数字的工作记忆就够用? 因为人脑背后还有另一套机制在工作。我们记得几年前的事,记得童年的事,记得几小时前发生的事。这些都不塞在工作记忆里,而是另一套系统。 具体来说这套系统是海马体,大脑里负责把新知识整合进已有知识库的那个部分。 研究发现,人睡觉的时候,特别是 REM 睡眠阶段,大脑会重放白天重要的片段,让大脑从中学习。新东西在睡觉的过程里,温柔地融进了旧的知识体系。 这个把新东西融进旧知识库的过程,就是持续学习。 模型现在没有这套机制。每一次对话结束,刚学到的东西就会忘记。下次重新打开,还是上次那个模型,没长进。 2 再聊聊长程推理的问题。英文表达是 Long-term Reasoning。我翻译为了长程。 长程推理这个词太抽象了。Demis 讲了一个特别具体的故事,听完会立刻明白他说的是什么。 他说自己喜欢跟 Gemini 下国际象棋。下棋的过程里能看到模型的 thinking trace,也就是它在那里到底想了什么。 然后他发现一件怪事。 模型考虑一步棋的时候,思考链里清清楚楚写着,这步是个昏招。但接下来,它没找到更好的走法,于是又走回这步昏招。 明明知道是错的,还是把错的那一步走出去了。 这个细节比任何 benchmark 数据都说明问题。因为它暴露的是模型缺少对自己思考过程的某种内省能力。 正常人下棋,意识到一步是昏招之后,脑子里会有一个反应,停一下,再想想。停一下、再想想这个能力,模型现在没有。它能在每一步局部判断对错,但没法基于整盘棋的局势去调整整体策略。 这就是长程推理还没搞定的样子。模型可以一步一步往前走,每一步看起来都合理,但走到后面整盘棋的方向其实是错的。它没有那种退回到当前思考的上一层、重新审视一下的能力。 说到底,模型缺的是一种内省。 3 学习、长程推理、记忆,这是 Demis 在播客里点出来的三个 AGI 鸿沟。 除此之外,他还反复提到了创造力。 2016 年 AlphaGo 跟李世石下棋,第二局走出了著名的 Move 37。那一步棋走出来的瞬间,全世界的围棋高手都看呆了。 所有人类几千年下围棋积累的经验都告诉它不该下那里,但 AlphaGo 下了。下完之后大家发现,是一步神来之笔。 很多人觉得,这就是 AI 的创造力来了。 但 Demis 说,对他自己来说,Move 37 只是起点。他真正想看到的是另一件事。AI 能不能发明围棋这件事本身。 这两件事的区别非常关键。 Move 37 是在围棋这个现成的规则里,找到了一步人类没想到的招。但围棋的规则、棋盘的形状、黑白子的对弈方式,是人类发明出来的。AI 在已有的框架里非常厉害,但能不能自己造一个框架,是另外一回事。 Demis 给了一个具体的设想。 如果给 AI 一个高层次的描述。造一个游戏,五分钟能学会规则,要好几辈子才能精通,棋局有审美,一下午能下完一局。AI 能不能根据这个描述,自己倒推出围棋? 目前做不到。 为了把这件事讲得更清楚,Demis 还提了一个测试,他自己叫爱因斯坦测试。 用 1901 年人类已有的全部知识训练一个模型,看它能不能在 1905 年那个时间点,自己推出狭义相对论。 爱因斯坦在 1905 年那一年里,连写了几篇改变物理学的论文,后来叫爱因斯坦奇迹年。那些工作不是从已有的物理学论文里通过拼接得到的,是基于已有材料做了一次全新的概念跳跃。 爱因斯坦测试想问的就是这件事。AI 能不能做这种跳跃。 目前的大模型主要在做两件事,pattern matching 和 extrapolation。一个是从大量数据里找规律,一个是把规律往外延伸一点。但发现新东西需要的是类比推理的能力。从一个领域里抽出深层结构,搬到另一个全新的领域去用。 这个能力,模型现在还没有。也可能是有,但用法不对所以激发不出来。 4 除此之外,Demis 还分享了一个让我特别出乎意料的判断,他说未来 6 到 12 个月,真正的价值不在更大的模型,在更小的模型。 这一部分内容我反复听了好几次,确实突破我的已有认知。 不知道大家的想法,反正我自己,这一年来并没有怎么关注小模型的进展。毕竟行业的焦点就是把模型做大嘛。 那小模型的价值到底在哪? 最直接的是成本。同样一个任务,小模型的推理价格可能只是前沿模型的十分之一甚至更少。 但 Demis 说,比成本更重要的其实是速度。 这里有一个前提得先说清楚。Demis 不是在说速度可以替代智能。 他的原话是,当小模型的能力已经达到前沿模型的 90% 到 95%,也就是已经相当不错的时候,剩下那 5% 到 10% 的能力差距,比不上速度带来的好处。 比如现在工程师用 AI 写代码,已经形成了一种新的工作节奏。一个想法冒出来,几秒之内就能看到结果,不行就改,再不行再改。 这个一改再改的循环跑得越快,做出来的东西就越好。如果每次调用都要等十秒,整个工作流就被打断了。 更关键的是,快到一定程度,工程师在这种节奏里能进入心流。一个想法、一次尝试、一个反馈、再来一个想法,思维不被打断。 这件事写过代码的人都懂,进入心流和频繁掉出心流,产出的差距是数量级的。 Agent 也是同样的逻辑。一个 Agent 跑完一个任务可能要调几十次模型,每次慢一秒,整个任务就慢一分钟。慢到一定程度,Agent 就从一个能用的东西变成鸡肋。 小模型不是大模型的廉价替代品。有些事只有小模型能做。 比如手机、眼镜、家用机器人,需要的就是一个能在本地跑起来的模型。本地跑除了反应快,还有一个特别重要的好处,隐私。 家里机器人看到的视频、听到的对话,全部在设备本地处理,根本不上云。这件事对很多用户来说不是加分项,是底线。 成本、速度、边缘部署,这是小模型的价值。 5 讲完小模型的价值,接下来一个更关键的问题是,能力被压到这么小的参数里,会不会有上限? Demis 的判断是,目前没看到信息密度有任何理论上限。小模型的智能天花板还远没看到。 支撑这个判断的,是 DeepMind 在蒸馏这件事上的积累。蒸馏简单说就是先训练一个超大的模型,然后用这个超大模型去教一个小模型。教完之后,小模型用极少的参数,能复现原来 95% 以上的能力。 为什么 DeepMind 这么重视蒸馏?因为要把 AI 能力放进谷歌的头部产品中,前提是低延迟、低成本。前沿模型再强,每次推理花几秒钟、花几毛钱...这条路,恐怕很难走得通。 一个前沿模型发布之后,6 到 12 个月内,他们就能把这个模型的能力蒸馏到边缘设备能跑的小模型上去。这个时间表比很多人想的要快。 在很多场景中,小模型和大模型会相互配合。 举个例子,一个端到端的智能助手,绝大部分日常任务在本地的小模型上跑。智能眼镜看到的画面、家里机器人听到的对话、手机里的私人助理,模型直接在设备里读懂,不需要往云端传一遍。 只有遇到特别复杂、本地搞不定的问题,才向云端的前沿模型发起请求。 也就是说小模型在边缘做主力,前沿模型在云端做后援。 不过,这个构想对小模型的要求也比较高,它不能只会处理文字,还得能理解物理世界。 这就是为什么 Gemini 从一开始就坚持多模态,不光处理文字,也处理图像、视频、声音。 一开始这么做比只做文本要难得多,但眼镜也好,机器人也好,需要的是一个能看懂周围世界的模型,不是一个只会聊天的模型。 讲到这里,小模型这条路的轮廓就完全清楚了。它独立成立,不是前沿模型的廉价替代品,而是另一条同样重要的路。 嗯,很有启发。
显示更多
0
48
1.2K
239
转发到社区