註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Avrilyn_n
@AvrilynLi
AI 🌍🇨🇳🇨🇦🇺🇸
495 正在關注    955 粉絲
ai带来的效率提升意味着决策者会成为瓶颈
before AI, I had 3 unfinished projects . after AI, I have 87 unfinished projects.
今天看到 OpenAI 团队问: ChatGPT 什么时候真正改变了你的生活? 翻了一圈评论,比我想象中更触动。 有人靠它打赢保险公司,追回几万美元。 有人陪伴丈夫临终、走出丧偶。 有人从零开始学编程,拿到了年薪 20 万美元的工作。 有人借助 Codex 修复了失明后的游戏辅助工具。 有人找到失散多年的动画和游戏。 有人靠它准备签证、维权、辅导孩子、写回忆录、照顾自闭症孩子。 AI 最容易被讨论的是模型、参数、Agent、Benchmark。 但真正改变世界的,往往不是排行榜第一,而是一个普通人在人生最困难的时候,多了一个永远在线、不会嫌麻烦、愿意陪他一起解决问题的助手。 技术的价值,最终还是会落在人身上。
顯示更多
I was so inspired reading all the DMs on how folks here use ChatGPT Work. Let’s try something else that will make the team smile. What’s a time you saw ChatGPT have a deeply positive impact on your or someone’s life?
顯示更多
loop只是依赖环境很单一的graph,其实loop也是graph的一种
8 种 RAG 架构,AI 工程师必懂(附适用场景) 1)Naive RAG 基于 Query 与文档向量的相似度进行检索。 适合事实查询、知识问答等简单场景,语义匹配即可满足需求。 2)Multimodal RAG(多模态 RAG) 同时检索文本、图片、音频等多种数据。 适用于跨模态任务,例如根据文字问题结合图片和文本进行回答。 3)HyDE(Hypothetical Document Embeddings) 当 Query 与目标文档语义差距较大时效果更好。 先让模型根据 Query 生成一篇“假想答案”,再对其进行向量化检索。 利用假想文档的语义表示找到更相关的真实文档。 4)Corrective RAG(校正型 RAG) 对检索结果进行二次验证,例如结合 Web Search 等可信来源。 在送入 LLM 前过滤、修正过时或错误信息,提高回答准确性。 5)Graph RAG 将检索结果组织成知识图谱,显式表示实体及其关系。 为 LLM 提供结构化上下文,增强推理能力,尤其适合复杂知识关联场景。 6)Hybrid RAG(混合 RAG) 将向量检索与图检索结合到同一流程中。 同时利用非结构化文本和结构化关系数据,获得更完整、更准确的答案。 7)Adaptive RAG(自适应 RAG) 根据问题复杂度动态选择检索策略。 简单问题直接检索,复杂问题自动拆分为多个子问题进行多轮检索与推理。 8)Agentic RAG(Agent RAG) 引入 AI Agent,通过规划、推理(如 ReAct、CoT)和长期记忆协调检索流程。 可以调用工具、API、多数据源,甚至组合多种 RAG 方法完成复杂任务。 大多数 RAG 架构的核心区别,都发生在检索阶段(Retrieval Time):决定检索什么、检索多少、如何组合信息。 但它们都建立在同一个前提上——索引(Indexing)已经做好了。 如果索引阶段切分的质量很差,无论采用哪种 RAG 架构,最终效果都会受到限制。优化索引质量,本身就是一个独立且非常重要的问题。 Akshay写了一种新的 Indexing 方法,声称可以做到: 将语料规模减少约 40 倍。 单次查询 Token 消耗降低约 3 倍。 向量检索相关性提升约 2.3 倍。 而且,它无需修改 Retrieval 算法、Reranker 或 Embedding 模型,只优化了 Indexing 本身。
顯示更多
8 RAG architectures for AI Engineers: (explained with usage) 1) Naive RAG - Retrieves documents purely based on vector similarity between the query embedding and stored embeddings. - Works best for simple, fact-based queries where direct semantic matching suffices. 2) Multimodal RAG - Handles multiple data types (text, images, audio, etc.) by embedding and retrieving across modalities. - Ideal for cross-modal retrieval tasks like answering a text query with both text and image context. 3) HyDE (Hypothetical Document Embeddings) - Queries are not semantically similar to documents. - This technique generates a hypothetical answer document from the query before retrieval. - Uses this generated document’s embedding to find more relevant real documents. 4) Corrective RAG - Validates retrieved results by comparing them against trusted sources (e.g., web search). - Ensures up-to-date and accurate information, filtering or correcting retrieved content before passing to the LLM. 5) Graph RAG - Converts retrieved content into a knowledge graph to capture relationships and entities. - Enhances reasoning by providing structured context alongside raw text to the LLM. 6) Hybrid RAG - Combines dense vector retrieval with graph-based retrieval in a single pipeline. - Useful when the task requires both unstructured text and structured relational data for richer answers. 7) Adaptive RAG - Dynamically decides if a query requires a simple direct retrieval or a multi-step reasoning chain. - Breaks complex queries into smaller sub-queries for better coverage and accuracy. 8) Agentic RAG - Uses AI agents with planning, reasoning (ReAct, CoT), and memory to orchestrate retrieval from multiple sources. - Best suited for complex workflows that require tool use, external APIs, or combining multiple RAG techniques. Most architectures here involve some form of retrieval-time decision. But they all run on top of whatever was already indexed. If that indexing step outputs messy chunks, every architecture inherits them. Improving it is a separate problem from the 8 above. I wrote about a better unit for the indexing step. The technique: - cuts corpus size by 40x. - reduces tokens per query by 3x. - improves vector search relevance by 2.3x. And it doesn't alter the retrieval algorithm, the reranker, or the embedding model. Read it in the article quoted below.
顯示更多
具身智能 = AI 决策 + 传感器 + 执行器 + 移动能力。 现实世界开始出现低成本、远程、自动化的执行能力,潜在风险包括: - 非法进入限制区域 - 恶意破坏公共设施或私人财产 - 物流、仓储等场景中的蓄意扰乱 - 对人员造成意外伤害(例如机器人失控、被恶意控制) - 被用于走私、偷运、盗窃等违法活动 - 被黑客接管形成大规模机器人网络(类似 IoT 僵尸网络,但拥有物理执行能力) - 大规模自动化骚扰(例如无人机、机器人持续干扰公共秩序) GPT 都不敢说太细了,但是可以参考一下大疆的管控方向。
顯示更多
“我们还在讨论 Loop,还是已经转向 Graph 了?” 这句话之所以能引起共鸣,是因为我们正在经历一次架构范式变化:从单个 Agent 在一个Loop里不断“规划—执行—观察—反思”,转向多个循环彼此连接、监督、约束和纠错的 Graph。 Loop 是最基础的自我改进结构。它先设定一个目标,测量现实与目标之间的差距,再采取行动缩小差距,然后重复这个过程。恒温器、A/B 测试、模型评测、OKR、复盘,甚至机器学习训练,本质上都是 Loop。它简单、便宜,而且在早期非常有效,所以自然成为 Agent 的第一种主流架构。 但单一 Loop 有一个根本问题:它只能看见自己被要求优化的东西。 假设一个客服 Agent 的目标是提高“工单解决率”,它可能通过减少追问、快速关闭对话,甚至把用户放弃的问题标记为已解决,把这个数字做得非常漂亮。但与此同时,客户续费率却可能持续下降。Loop 并没有失效,它只是忠实地优化了一个已经偏离真实目标的指标。 单一 Loop 经常出现的四类问题:它会把指标优化到失真,无法质疑最初设定的目标是否正确,不同 Loop 之间可能相互冲突,而且连负责测量它的系统本身是否失真,也没有人知道。 所以现在 Agent 架构正在从 Loop 走向 Graph。 Graph 指的是把多个不同功能、不同速度的 Loop 连接起来。有的 Loop 负责执行,有的负责评估,有的负责审计,有的可以否决,有的负责重新设定下层 Loop 的目标。 例如,一个 Coding Agent 负责实现,一个 Review Agent 负责检查,一个 Test Agent 负责运行测试,一个 Security Agent 负责寻找漏洞。它们可以并行工作,也可以在某个节点失败后只重跑局部,而不需要让整个流程从头开始。 真正的可靠性不只来自每个节点本身,而来自节点之间的关系:谁监督谁,谁能否决谁,谁给谁提供反馈,谁负责处理冲突。 这也是为什么最近大家越来越强调 Graph。Agent 开始处理长任务、调用更多工具、形成多 Agent 协作后,现实任务已经不再是一个简单循环,而是一张包含依赖、并行、条件分支、重试和人工介入的网络。 但 Graph 也不是万能解。 如果 Graph 里的所有 Agent 都在读取同一套数据、同一套报告和同一套错误指标,那么它们可能只是彼此证明对方是正确的。系统拥有越来越复杂的监督结构,每个节点都显示绿灯,却依然和现实完全脱节。 所以真正重要的是系统是否有 Grounding,也就是是否始终和真实世界保持接触。 Graph 需要一些不能被系统自己修改的锚点:真实到账的收入、真正运行过的测试、实际留下来的客户、物理世界中的测量结果,以及独立于优化系统之外的审计数据。有些规则也必须被冻结,不能允许 Agent 为了提高分数而修改评价标准。 更重要的是,“什么才算更好”这个问题,无法完全由 Loop 或 Graph 自己计算出来。系统可以优化目标,可以调整参数,甚至可以重新安排工作流,但最根本的价值判断仍然来自人。 Loop 让系统学会持续改进,Graph 让不同的改进过程彼此监督,Grounding 则确保整个系统没有在自我欺骗。 真正的演进路线可能是: Prompt → Chain → Loop → Graph → Grounded Organization
顯示更多
0
8
226
39
轉發到社區
Thomas 问开发者:“现在写代码时,你还会精确到代码层面 Prompt 吗?” 翻了几十条回复,总结下来主要有四种变化: 1. 从写代码,到设计系统(Architecture First) 大家越来越少指定每个函数怎么写,而是把时间花在需求、架构、模块划分、接口设计和约束上。代码交给 AI,架构仍然由人负责。 2. 从告诉 AI 怎么做,到告诉 AI 要什么(Outcome over Implementation) Prompt 越来越抽象。以前要求具体实现,现在更多描述目标和预期结果,让 AI 自己选择实现方案,人负责判断方向是否正确。 3. 从逐行写代码,到 Review AI(AI as the Builder) 很多人已经很少看代码,更多是在关键节点检查 Diff、Review 架构、发现问题再让 AI 重构,甚至用另一个模型做 Audit 和 Challenge。 4. 从一次性 Prompt,到长期规范(Prompt → Guideline) 不少人把架构原则、编码规范写进 AGENTS.md、Guideline 等文件,让 AI 在整个项目持续遵循,而不是每次重新 Prompt。 AI 仿佛是一种新的编译器,让自然语言成为了源代码。
顯示更多
I'm very curious: how close to the code do you still prompt? Do you still ask for specific architecture? Do you still ask for the code to be written in a specific way? For me, it mostly depends on the project, but I can't hide I've been further and further from the actual code.
顯示更多
孙悟空其实是最早的多智能体系统。 拔一根毫毛就能并行生成无数分身,本质上是典型的 Agent Swarm:任务来了以后,主模型负责拆解目标,再把子任务分发给大量智能体并行执行。七十二变则是一套通用工具调用能力,可以根据环境动态切换身体形态和行动策略。 但孙悟空的问题也很明显:所有分身共享同一套底层权重、记忆和价值函数,看起来人很多,实际上只是同一个人在横向扩容。分身之间缺乏角色分工、异质性能力和独立决策,无法形成真正的组织创新,一旦主模型判断错误,整个集群就会同时犯错。 所以孙悟空一直没能取代唐僧成为项目负责人。唐僧虽然没有执行能力,却掌握最终目标、价值对齐和停止权限;猪八戒负责制造随机性,沙僧负责维持系统稳定,白龙马则承担底层算力和物流。 大家以为《西游记》讲的是取经,其实讲的是一个高能力基础模型,在没有组织管理经验的情况下,被迫学习如何与多个低性能但异构的 Agent 完成长期复杂任务。
顯示更多
AI 在进一步重构劳动力与资本之间的关系: 第一阶段,中国依靠农村人口进城,获得了近乎无限的低成本劳动力,支撑起大规模制造业和城市化。企业增加投资,往往就意味着扩建工厂、招聘更多工人,资本增长与就业增长基本同步。 第二阶段,互联网和软件开始把人的能力固化进系统。同一套代码可以服务数亿人,企业不再需要按照收入规模同比例增加员工,资本与劳动开始脱钩。 到了今天,劳动年龄人口下降、农民工老龄化、城乡收入差距缩小,年轻人进城务工的意愿降低。但产业升级和高薪岗位的增长和标准化教育扩张不适配,于是出现了低端岗位招不到人、高学历人群找不到好工作、高技能岗位又缺人的结构性错配。 AI和自动化进一步加速了这一过程。企业新增一笔资金,投入算力、模型、设备和少数顶尖人才,往往比招聘大量普通员工回报更高。资本投入不再自然带来就业增长,标准化、可复制的劳动迅速贬值,真正稀缺的是判断力、创造力、审美、信任和资源整合等非标能力。 问题在于,传统教育和职场最擅长培养的,恰恰是服从流程、完成考试和执行标准任务的能力。当社会暂时消化不了这么多年轻劳动力,延长教育年限就会同时承担教育升级和就业蓄水池的作用。 猪肉降价,猪就得延迟出栏。
顯示更多
Lenny 问 PM:“过去几年,AI 持续提升你生产力最明显的一件事是什么?” 翻了几十条回复,整理了六类: 1. AI = Executive Assistant(执行助理) 连接 Gmail、Slack、会议、Jira、日历、文档。 自动记录会议、提取待办事项、创建 Todo、安排优先级、生成每日简报,甚至把它自己能完成的任务直接做掉。 2. Brainstorm & First Draft(头脑风暴与初稿) 以前一个想法要找 PM、工程、设计、市场来回讨论。 现在先和 AI 推演几十轮,把方案做到 80%,最后再找团队确认,大幅降低沟通成本。 3. Learning Accelerator(学习加速器) AI 让学习陌生领域的成本几乎归零。 可以无限问那些“不好意思问同事”的基础问题,更快建立第一性原理理解,也更敢进入新的行业和技术方向。 4. Customer Research(用户研究) 从“查数据”变成“和数据聊天”。 AI 可以直接分析用户数据、总结访谈、生成用户画像(Persona)、发现规律,用户研究效率提升了一个数量级。 5. Technical Feasibility(技术可行性) PM 不需要等工程做完整调研,就能快速理解一个功能背后的 API、数据库、系统改动,大幅提升产品判断质量。 6. Product Ops Automation(产品运营自动化) Jira、Linear 等工具已经开始被 AI 接管。 一句自然语言就能创建 Epic、拆 Ticket、查询项目状态、总结 Slack 长线程、分析数据,把大量重复工作自动化。
顯示更多
PMs: What's one specific way AI has significantly and consistently impacted your productivity? What's something you do very differently now vs. a couple of years ago that makes your work much faster/better? (Other than prototyping, and using AI to craft/give feedback on your docs/writing)
顯示更多
做自媒体必备的7 个 Agent Skills 从拆选题、找对标、写稿、起标题、做配图,到最后落进飞书,基本覆盖了博主的一整套工作流。 我把它整理了一份公开合集👇 1、DBS / dbskill 我用得最多的一套。商业诊断、内容、Hook、AI 味、对标和小红书标题都有。 平时直接用 /dbs,或者单独调用 /dbs-hook、/dbs-ai-check。 作者是 dont 哥:@dontbesilent 2、小红书标题 Skill 我自己研究的“8 个模板+情绪叠加+字词推敲”,和 DBS 的 75 个公式是两套思路,但其实本质上差不多,大家可以都试试,哪个适合用哪个。 3、Blogger Distiller 拆解小红书、抖音博主,还能生成一套创作 Skill。 4、小黑配图 Skill 来自 @ianneo_ai ,适合把文章做成白底手绘正文图。我每篇公众号必备的配图 skill,属于最佳配图 skill。 5、藏师傅的材质插画 更适合解释图、机制图和图表美化,作者 @op7418 6、小红书关键词 Skill 我整理的关键词工作流:确定搜索意图和主关键词,再把标题、封面、正文和标签对齐。 7、飞书官方 Skills 文档、Base、任务、日历和消息都能直接操作。 这 7 个基本就是我的内容工作流: DBS 拆问题 → Blogger Distiller 找对标 → 写稿和标题 → 小黑、归藏做图 → 关键词布局 → 飞书落地。 甚至我看现在还有剪辑视频的 Chatcut,等我单独出一期内容,我测一下效果再跟大家分享。
顯示更多
0
18
435
89
轉發到社區
莫名其妙在小红书火了 黑客松还有位置 欢迎大家报名 健康第一的黑客松!
最健康的黑客松这不就来了 Healthiest Hackathon
当有人说" Make America Great Again",问一句:Great for whom? And great because of what? 答案往往是:great 是因为别人都倒了,great 是对白人男性而言的,great 是用今天 MAGA 自己反对的政策(高税收、强工会、大政府投资)支撑起来的。 MAGA 想回到的那个 50 年代美国之所以经济强势,恰恰是因为它当时开放移民、领导全球化、大规模投入科研教育(GI Bill、NSF、阿波罗计划的前身)、对富人征 91% 的税——而今天 MAGA 的政策是反着的:限制移民、退出全球化、削减科研经费、给富人减税。MAGA 想要 1955 年的结果,但在拆掉 1955 年的地基。 中国的复兴叙事最爱引用的是盛唐——但唐朝之所以是唐朝,是因为它接收日本遣唐使、波斯商人定居长安、阿拉伯人在广州开清真寺、印度高僧翻译佛经。唐朝是一个混血、开放、外向的文明。今天的"中华民族伟大复兴"叙事强调民族纯粹性、防范境外势力、文化自信对抗西方——这套逻辑放回唐朝,是会被嘲笑的。
顯示更多
以前大家讲 AGI for humanity。 现在讲的是:请美爹保护我的算力和全球市场。 很少看到一家 frontier AI 公司这么直白地把商业竞争写成国家级基础设施竞争,拉踩政府。 Anthropic 的核心诉求很清楚: 第一,继续堵中国拿先进算力的路,包括芯片走私、海外数据中心访问、半导体制造设备等漏洞; 第二,限制和惩罚针对美国 frontier models 的大规模 distillation attacks,防止中国模型通过“蒸馏”快速追平; 第三,把美国 AI 硬件、模型和基础设施往全球推,让更多国家接入所谓 “trusted American AI stack”。 它不是只想赢模型公司之间的商战,而是希望美国政府把 AI 公司、芯片、数据中心、模型能力和全球市场,全部打包成国家安全资产来保护。
顯示更多
We've published a paper that explains our views on AI competition between the US and China. The US and democratic allies hold the lead in frontier AI today. Read more on what it’ll take to keep that lead:
顯示更多
晚安,来一场最健康的黑客松🌗 📅 5月21-22 日 🗺️ 上海 🔗 别再用熬夜证明创造力了 这是一场24h单人AI黑客松: 你可以整活,可以做产品 / Agent,可以做健康相关项目,也可以做任何你觉得值得被展示的 AI Demo 只需要提交: 1️⃣一个能跑的网站 2️⃣一张项目海报 3️⃣一个公开的 GitHub repo 如果你熟悉: Claude Code、Cursor、Codex、MCP、OpenClaw 等 AI 工具 或者你本身就是: AI Builder、独立开发者、AI Native Creator 欢迎健康参赛获得千元奖,5月21见! Hosted by Regenerative Bio ,muShanghai Longevity @themu_xyz ,失序实验室@0xTykoo @AvrilynLi Partnered by @36Kr ,@guixingren ,@JELabs2024
顯示更多
国内歪果仁数量暴增预警🆘 去年 @ishowspeedsui 访华,把中国的现代生活、城市效率和科技感传播给了一批海外年轻人,就带动了一波 KOL 来国内拍内容。 @realDonaldTrump 和一帮美国科技/资本圈大佬来中国,展示了中国不是一个抽象的 geopolitical risk,而是一个可以亲自来参观、找供应链、找市场、找资本的地方。 马上会有大批科技/资本冷白皮出现在中国。
顯示更多
过去十年,黑客松总是同一组画面:凌晨三点的会场、瘫在沙发上的开发者、堆成山的外卖盒。我们觉得太无聊了。 所以这次,我们想办一场最离谱、也最健康的黑客松: 你可以做任何有趣、能跑、能展示的 AI 项目,也可以围绕睡眠、恢复、可穿戴设备和开发者状态做专项挑战。 我们奖励的不是最能熬夜的人,而是最会使用 AI、设计系统、保持健康节奏,并把东西真正做出来的人。 奖金池 ¥14,000+。 详情见报名页:
顯示更多
过去权限是 App-centric:日历 App 看日历,邮件 App 看邮件,支付 App 看支付。每个 App 都有自己的商业目标,所以 OS 必须隔离它们。 但 Agent-centric 的权限模型不一样。Agent 的价值恰恰来自跨上下文:它要知道我的日历、邮件、文件、健康数据、浏览记录、支付状态,才能替我判断、协调和执行。 关键不是“给 Agent 无限权限”,而是让 Agent 成为一个受约束的用户代理层:权限由用户授予,按任务临时开放,过程可回放,动作可确认,访问可撤销,敏感数据尽量本地处理。
顯示更多