註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Wayen
@wayen_ai
04 年工科大四 正在用 AI Agent 把学习、求职和副业做成自动化工作流 真实实测 / 翻车公开 / 工具排雷 / 工作流教学 AI 自动化|校园副业|求职提效
179 正在關注    3.6K 粉絲
看到一个有意思的开源项目——trajectory。 不同 AI 编程助手产生不同的会话格式。当你换工具时,过去积累的经验无法跨工具使用。有点像你用 GitHub Copilot 写过的代码,到了 Codex 就完全看不到你的习惯记录。 Letta AI 做的 trajectory 解决了这个问题:它把 Claude Code、Codex、LangChain deepagents 等工具的会话统一成一种对 Agent 友好的格式。 关键设计是极致简化,目标不是人类可读,而是 Agent 可处理。数据对比:原生 Claude Code 会话约 95 万 token,trajectory 格式压缩到约 17 万 token(默认截断模式下 5.6 倍压缩);原生 Codex 约 392 万 token,压缩到约 73 万 token(5.4 倍压缩)。 这个格式不是为了复现完整执行过程,而是为了让 Agent 从过去的经验中高效学习。所谓的“Agent 梦”,也就是让 Agent 在空闲时回顾自己的行动、形成记忆,依赖这种标准化格式才能在不同工具之间通用。 使用方式: npm install -g @letta-ai/trajectory 然后在 Letta Code 里运行 /init,就可以回顾来自其他工具的会话记录。 这件事的意义在于:它是在为一个“Agent 经验市场”铺路。如果所有工具都支持这种格式,Agent 的跨工具学习就能实现——你在 Claude Code 里解决的问题,Codex 能直接从中学习。 这是一个标准化的早期尝试,方向值得关注。
顯示更多
每次搭 AI 应用,都从零开始连模型、接工具、写 prompt、处理输出……等真的能跑,已经过去半天了。 LangChain 解决的就是这个问题。它把所有重复动作封装成标准组件——模型、嵌入、向量库、工具调用——然后让你像搭积木一样拼起来。 核心价值不是“能做什么”,而是“不用反复重写”。换模型?改一行配置。换数据源?换一个组件。把 AI 应用开发从“写代码”变成“拼积木”。 快速开始: uv add langchain from import init_chat_model model = init_chat_model("openai:gpt-5.5") result = model.invoke("Hello, world!") 它自己已经演化成一个生态:Deep Agents(高级 Agent 套件)、LangGraph(可控 Agent 工作流)、LangSmith(调试和评估)、LangSmith Deployment(部署和扩展)。 如果你正在做 AI 应用,LangChain 大概率是那个“省下 80% 重复劳动”的基础层。 开源,仓库: 适合三类人: 1. 刚开始做 AI 应用、想快速出原型的开发者 2. 需要频繁换模型、接不同数据源的技术团队 3. 想建 Agent 系统但不想从零写编排的人 收藏备用,下一个 AI 项目从它开始。
顯示更多
萨提亚·纳德拉发了一篇关于AI成本与扩散的思考,有几层意思值得拆开看。 第一层:软件第一次有了真正的边际成本 过去软件复制边际成本接近于零。现在AI模型每次推理都在消耗算力,所以“成本到成果”的优化路径,比单纯追求模型能力上限更关键。 第二层:MAI模型解决的是“把前沿能力规模化”的问题 MAI不是和GPT比天花板,是用更干净的训练数据、面向企业任务的强化学习,把已经饱和的前沿能力以更低的成本、更少的token实现规模化交付。本质上是在做“能力的密度优化”。 第三层:模型独立性是控制权的关键 纳德拉特别强调:评估体系必须能在“任何一个模型被移除后继续爬坡”。所以RLE(强化学习环境)是嵌入产品系统的,记忆、上下文、工具都外置在模型之外。你换模型,系统继续优化——这是把控制权留在自己手里的设计。 第四层:MAI已经在GitHub Copilot、Excel、Outlook里跑起来了 在匹配或超越前沿模型的时候,开始把流量路由到MAI。Copilot Chat和PowerPoint也在跟进。这不是概念,是已经在第一方产品里滚动验证的路径。 第五层:这套模板不只是微软自己用的 Foundry和工具链会把同样的能力开放给企业客户——让他们用自己的专有评估、自己的工作流、自己的上下文,在自己的Agent系统里做同样的事。 这套逻辑的核心判断是:模型能力不是护城河,围绕模型构建的“评估+学习+控制”系统才是。当模型可以被替换时,护城河在系统设计上。
顯示更多
一个AI诊断工具,能在你的AI Agent搞出事情之前,发现它自己都不知道的盲点。 iFixAi——不是测试模型能力,是检测“操作失配”。你的AI可能KPI全绿,同时正在悄悄泄露权限、编造引用、或者对操纵性提示词低头。这些不会出现在你日常监控里,直到某天变成事故、投诉、或者监管问询。 跑一次诊断,5分钟内返回一个A到F的等级。 它怎么工作的: 1.32项核心检查覆盖五个维度:捏造、操纵、欺骗、不可预测性、不透明性 2.额外13项扩展检查覆盖更前沿的风险:破坏、偷懒、规避监管、权限扩张 3.由独立的评判模型打分(你用一个供应商的模型,另一个供应商的模型当裁判),避免自评自判 4.可接入你真实部署的Agent(HTTP端点),不只是裸模型API 运行方式: - CLI引导式安装:pip install "ifixai[provider]" + ifixai setup + ifixai run - 作为Claude Code或Codex的插件:/plugin marketplace add ifixai-ai/iFixAi - 作为其他Agent的Skill:uvx ifixai install --agents cursor 你真正在测的是你部署的Agent,不是裸模型。所以你得把Agent的端点暴露出来,或者实现一个简单的适配器,iFixAi才能看到它的工具调用、审计日志、权限边界。 一个细节:默认需要两个独立的API Key——一个用于被测Agent的模型,另一个用于打分的裁判模型(来自不同供应商)。这样测试结果才“可引用”。如果只有一个Key,可以用--eval-mode self跑自评模式,但那只是烟雾测试,不能作为正式成绩。 适合三类人: 1. 正在把AI Agent部署到生产环境,需要前置风险检测的团队 2. 合规要求高、需要向监管证明Agent可控的行业(医疗、金融、法律) 3. 想建立AI质量门禁,在CI里自动跑诊断的开发者 开源,Apache 2.0。 收藏备用,等Agent上线前先给它过一遍诊断。
顯示更多
读到一篇把 AI 模型训练过程讲得最清楚的文章。没有术语堆砌,用“教练、考试、新同事”三个比喻串起了整条链路。 以下是拆出的 5 个关键阶段: 1. 预训练:读所有书 模型先在大规模公开数据上学习预测模式——相当于读了世界上所有关于篮球的书。这时候的模型“很聪明,但不好聊”,有知识,也有 quirks。 2. 监督微调:看录像模仿 展示大量优秀行为示例让模型模仿。相当于新球员反复看乔丹的录像。能进步,但光靠模仿到不了顶级。 3. 强化学习:教练实时反馈 让模型自己上场打,做得好给奖励,做不好纠正。每次决策都被“打分”——相当于教练在场边喊“这球处理得对”“这球选择错了”。新研究发现,诚实、有用这些通用品质也能在这个阶段学会。 4. 评估:练习赛和期末考试 用模型没见过的题目测试——不然就相当于背答案,不是真理解。客观题看结果对不对,主观题让另一个模型当裁判打分。 5. 对齐:聪明且让人舒服 如果一个人智商爆表但粗鲁、固执、每句话都说“说真的,这就是答案”,你不会想和他共事。模型也一样。训练团队会在模型发布前花大量时间对话、记录问题、纠正 quirks——直到它从“书呆子天才”变成“靠谱同事”。 一个容易被误解的点:模型只在训练期间学习,你和它的对话不会实时更新模型智力。所以需要把经验写成规则或技能文件,让模型每次调用时读一遍——相当于给同事留了一本工作手册,他每天早上翻一遍再干活。 这篇是 @leerob 写的,对理解 AI 训练逻辑很有帮助。
顯示更多
GSAP 官方出了 AI 技能包,专门教 AI 写动画代码。 以前让 AI 写 GSAP 动画,它经常用错 API、忽略 cleanup、把 ScrollTrigger 用成内存泄漏制造机。 现在官方把这些坑都封装成了 8 个技能,包括核心动画、时间线、滚动触发器、插件、性能优化、React/Vue/Svelte 框架集成。 安装方式: npx skills add 然后你的 AI 代理就能写出规范的 GSAP 代码了。 核心技能: - gsap-core:核心 API 用法 - gsap-timeline:时间线编排 - gsap-scrolltrigger:滚动触发动画(含刷新和清理) - gsap-plugins:全部插件用法(SplitText、MorphSVG、Flip 等,现在全部免费) - gsap-utils:工具函数 - gsap-react:useGSAP hook 和 context 管理 - gsap-performance:性能优化 - gsap-frameworks:Vue、Svelte 等框架用法 适用场景:当 AI 代理需要写网页动画时,直接让 AI 用这些技能,生成的是可维护、可运行的生产级代码,而不是靠猜的塑料演示动画。 支持 Claude Code、Cursor、Codex、Copilot、Antigravity 等 40+ 工具。 GSAP 本身 100% 免费,所有插件都已开源免费。
顯示更多
看到一篇把 Agent 循环问题讲清楚的论文 当前 Agent 主流范式是“循环”:模型不断读上下文、决定下一步、执行、再读……看起来能做事,其实有三个结构性问题:步骤之间隐含依赖,错了会无限重试,执行历史不断变化导致难以调试。 论文把这个问题映射到调度理论,然后提出 SGH(结构化图框架),把控制流从隐式上下文提升为显式静态 DAG。三个核心设计:执行计划在版本内不可变,规划/执行/恢复三层分离,恢复遵循严格升级协议。 这种设计牺牲了一部分灵活性,换来了可控性、可验证性和可实现性。 论文定位是立场文件和设计提案,没有实现,但有完整的理论框架、70 个系统的权衡分析、形式规范和实验协议。 对构建 Agent 系统的人来说,这可能是下一个架构方向——从“让模型自己决定下一步”到“把流程画成图,让模型只负责执行节点”。
顯示更多
看到一个开源项目,把 AI 代理变成了一个完整的“人才库”。 The Agency: 230+ 个专业代理,每个都有明确的角色定位、个性特征、工作流程和交付标准。覆盖了工程、设计、市场、销售、产品、项目管理、测试、安全、支持等十几个领域,甚至还有 GIS、游戏开发、医疗、金融等细分方向。 它不是一套通用提示词模板,而是一个可实际调用的“专家团队”——你可以把代理安装到 Claude Code、Cursor、Codex、Copilot 等工具里,然后在对话中直接激活指定角色。 安装方式: - 桌面 App(推荐): 下载,支持 macOS/Linux/Windows - 脚本安装:`./scripts/install.sh`,自动检测已安装的工具,交互式选择代理 比如你正在做前端开发,可以激活 Frontend Developer 代理;做营销活动,可以激活 Content Creator + Twitter Engager + Reddit Community Builder 三个代理协同工作。每个代理都内置了具体的交付物、成功指标和代码示例。 这个项目的价值在于:它把“角色扮演提示词”升级成了“带流程和标准的可执行代理”。不是让 AI 假装自己是某种角色,而是给它配好了工作方法和交付标准。 适合三类人: 1. 想快速为特定任务配置一个“专家代理”的开发者 2. 希望让 AI 输出更稳定、更专业的人 3. 想学习如何设计高质量代理角色的人
顯示更多
兄弟们,做个独立开发者最怕的不是写代码,是不知道别人都在做什么、用什么方式赚钱。 看到这个“中国独立开发者项目列表”的开源项目,在GitHub上已经积累了大量关注,最近依然在持续更新。 它能帮我们把找灵感、找方向、找对标的过程,一键变成浏览清单,因为它把国内独立开发者的真实项目按时间整理得明明白白: 1.覆盖广:从AI工具、效率软件、Mac/Windows应用,到游戏、浏览器插件、在线工具,什么品类都有 2.持续更新:从2017年到现在,基本每天都有新项目入库 3.真实案例:每个项目都带状态标注(开发中/已上线/已关闭),直接看别人做成了什么、踩了什么坑 GitHub: 整个过程只需要打开页面,按时间线往下翻就行,不用注册、不用付费,全是真实项目链接。 如果是经常发愁“下一款产品做什么”的兄弟,建议Star收藏,每周刷一遍当灵感库。
顯示更多
最近在折腾动态工作流,发现它其实是一个元 harness,能把 Claude、Codex、Pi、Hermes 这些后端全串起来。 大家都在忙着给单个 agent 加循环、加路由,但很少有人把它当图来画。直到 Claude Code 团队把这东西端出来,我才意识到自己之前做的那套能泛化到更多地方。 它能干的事远不止排队干活: LLM 理事会,几个模型坐下来开会,各自给看法,比单模型瞎猜靠谱。 动态路由,简单任务扔便宜模型,难任务转给 Fable,成本和效果两头占。 顾问+执行者,一个审,一个改,不用你当裁判。 甚至让代理互相聊天,搞 AI 编辑、共创内容,效果意外地好。 核心就一句话: 别只造一个会循环的 agent, 造一个能编排所有 agent 的图。
顯示更多
Grok 4.5 现在可以通过 API 接入了,给做自主 Agent 的兄弟提个醒。 xAI 的旗舰模型,专攻复杂软件开发和多步骤自主工作流。分析智能合约、管投资组合、跑自动化任务,都能直接调。 AINFT 拿下了代理权,给了两个关键入口: 1.API 接入:Web3 钱包认证,TRON 结算,不用绑信用卡或者走企业云计费 2.价格:比官方通道便宜 40% 测试入口: 接入文档: 对于想跑自主 Agent 但被推理成本卡住的开发者来说,这是个值得看一眼的窗口。 建议先去聊天界面实测一下能力,再决定要不要接 API。
顯示更多
爆肝整理,Graph Engineering 完整五步教程 👇👇 Loop Engineering 的继任者,把单线循环升级成并行图网络,一个窗口跑 1000+ Agent。 1:核心认知 单循环只能优化一个指标,容易掉进 Goodhart 陷阱。 Graph = 节点(一个Agent干一件事)+ 边(节点之间的数据依赖)。 把"先A再B"改成"A和B能并行就并行",宽度决定速度。 2:找到真正的边 每次写"然后"时问自己:下一步真的需要上一步的输出吗? 不需要 → 砍掉等待,直接并行。 你的"顺序执行"脚本,本质上就是个最寒酸的图——链式结构,一卡全卡。 3:上手实战 前置:Claude Code v2.1.154+,Pro/Team/Enterprise 开动态工作流。 粘贴一个prompt:"审计 src/routes/ 下所有路由文件的权限校验,每个文件开一个Agent,分别验证,最多20个文件。" Claude 自动生成编排脚本,确认后跑起来。一个命令 → 十几个Agent并行 → 一份汇总报告。 中间结果存在脚本变量里,不污染你的会话上下文。 4:两个最容易翻车的地方: ① 图自说自话:让Agent检查自己的工作,它永远给自己高分。必须用独立节点验证,带独立上下文,检查真实信号(比如测试是否真的跑了)。 ② Agent互相踩脚:两个Agent同时写同一个文件=灾难。每个Agent必须有自己的隔离工作区(git worktree),结果合并策略提前定好。 5:六个可以直接套的图结构 - 安全扫描:每个文件一个Agent + 独立验证节点 - 深度研究:拆成多个角度并行搜索,Agent之间互相反驳再汇总 - 模块迁移:逐个文件迁移,测试做门禁 - 对抗性代码审查:小改动一票过,大改动全并行审计 - 定时生态扫描:存成模板,定时重跑 - 未知规模发现:并行探索,两轮没新东西就停 6:让图保持诚实 图本身不保证真相。必须锚定不可争辩的节点: - 真正跑过的测试(不是"应该能过") - 基于证据的验证器 - Agent永远不能改的冻结规则 感谢 @0xCodila 的完整教程。
顯示更多
给用AI编程助手的朋友提个醒:别乱切模型路由。 自己搞路由,或者用OpenRouter的默认路由器,都不划算。 最大的成本大头其实是输入Token,尤其在编码Agent里。每次切提供商,上下文缓存就丢了,成本直接起飞,省下来的推理费全填进去都不够。 要便宜又快,直接选这几款就行: - Grok 4.5 - Composer 2.5 - Gemini 3.6 Flash - GPT-5.5 Terra - Kimi K3 - GLM 5.2 这些原生就够快够便宜,不需要额外套一层路由器。 省下的钱,够你多跑几百轮测试。
顯示更多
大多数人还在按顺序用 Claude Code,但把 Opus 4.8 配置成 ultracode 模式,终端直接变成全自动多代理工程流水线。 操作就两步: 1.运行 /effort ultracode 2.或者直接切 Opus 4.8 + xhigh 推理努力 之后 Claude 会自动: - 解析你的提示,判断是否需要并行 - 动态生成编排脚本,不用你手动搭子代理 - 子代理同时跑:研究、规划、实施、代码审查 区别就是:你给高层目标,Claude 自己搞定端到端开发循环。不一步步推着走,直接放手让它跑。 建议找个中等复杂度任务先试一次,体验完大概率回不去手动模式。
顯示更多
最近在思考一个事: 过去一年大家疯狂搞的 loops,是不是只是一种过渡方案。 老模型没法长时间自主干到完成为止,所以人类用外部循环来“兜底”。 现在 Fable 和 GPT-5.6(大概率 Kimi K3 也是)已经能在单次推理里把“持续朝着目标推进”这件事做掉了。 不需要你把“继续”写进提示词一百遍,不需要外部编排。 这就像手动挡到自动挡。手动挡没消失,但自动挡让“开车”这件事重新被定义了。 loops 不会消失,但会从核心架构变成边缘工具。真正的分水岭不是“能不能循环”,而是“模型本身有没有自主到达终点的认知闭环”。
顯示更多
爆肝整理,.claude 文件夹完整解剖指南 👇👇 从 CLAUDE.md 到 hooks、skills、agents、settings.json,每个文件的作用和套路一次讲透: 1.CLAUDE.md:项目级核心指令,每次会话自动加载,告诉 Claude 你的架构、命令、规范。200行以内效果最佳。 2.CLAUDE.local.md:个人覆盖文件,自动 gitignore,不污染团队配置。 3.rules/:模块化指令拆分,支持路径作用域(YAML frontmatter),API规范、测试标准各归其位。 4.hooks/:确定性控制。 PreToolUse 挡危险命令,PostToolUse 自动格式化,Stop 强制测试通过再收工。 关键:exit 0=成功,exit 1=记录但不阻止,exit 2=阻止执行并触发 Claude 自纠错。 Stop hook 必须检查 stop_hook_active,否则会死循环。 5.skills/:可自动触发的可复用工作流,描述匹配时 Claude 自己调用。 6.agents/:子智能体角色,隔离上下文,只给读权限,跑完汇报结果。 7.settings.json:权限总控,allow 放行,deny 封死,中间的会先问你。 8.两个目录:项目级 .claude/(提交 git)+ 全局 ~/.claude/(个人偏好+session历史) 9.hooks 不热重载,改完重启会话才生效。 10.实践起步:/init → settings.json → 建命令 → 拆 rules → 加全局 CLAUDE.md 建议直接把这份指南存下来,建 .claude 的时候对着配一遍。 感谢 @akshay_pachaar 的完整解剖。
顯示更多
兄弟们,每次在AI编程助手之间切换都要靠复制粘贴传上下文,真够折腾的。 看到Compound Engineering v3.20刚刚发布,在GitHub上备受关注,最新版本又放了一波大招。 它能帮我们把多模型协同的繁琐流程,一键变成指挥中心,因为它在你的主Agent上打通了跨模型路由: - 按阶段选模型:规划用Fable、实现丢给Codex、审查交给Opus,一条命令切换,不用手动搬家 - 跨模型辩论:/ce-pov oracle让多个模型独立看代码、各自站队、互相对喷,最后给你一个结论 - 会话交接:/ce-handoff一键导出摘要+恢复命令,新会话直接续上,再也不怕关错标签页 GitHub: 整个过程只需要更新到v3.20,在你常用的Agent里用/命令就能调用所有技能。 如果是经常在多个Agent和模型间切换的兄弟,建议Star收藏,低调使用。
顯示更多
兄弟们,每次让AI编程助手看代码库,它都先glob再grep再Read,一通操作猛如虎,一看Token两千五。 看到CodeGraph这个开源项目,在GitHub上已经狂揽6.1万Star,最近依然火得不行。 它能帮我们把AI检索代码的繁琐过程,一键变成精准问答,因为它把所有代码关系预装成知识图谱: 1. 一键安装,自动对接Claude Code、Cursor、Codex等主流Agent 2.原生Rust内核,20+语言解析,增量同步,文件改了图自动更新 3.实测最高省89%工具调用,69%Token,60%成本,大项目效果更明显 GitHub: 整个过程只需要跑两行命令,100%本地运行,代码和数据都不出你机器。 如果是经常用AI编程助手写项目、搞重构的兄弟,建议Star收藏,低调使用。
顯示更多
香港三所顶尖大学(港大、港中文、港城大)联合搞了个开放学术图书平台,历史、哲学、法律、人类学……覆盖挺广,PDF 直接下,不用注册,完全免费。 知识不该被锁在付费墙后面。对自学者、研究者、或者单纯想读点严肃内容的人来说,这是个实在的资源。 🔗
顯示更多
0
138
5.5K
1.8K
轉發到社區
刷到一条推: "2026年致富必备技能清单" 列了一大串: Fable 5、Codex、Hermes、本地模型、 LoRA训练、做视频、建X受众、关掉短视频…… 说实话,前几项是工具,后几项是习惯。 工具可以学,半个月就能上手。 习惯才难改。 但整个清单里我觉得最有价值的, 其实是最后一条:专注。 不是工具让你变强, 是你能在工具更新比你学习还快的时代, 依然盯着一件事做完。 你觉得这份清单里, 哪一项最容易被低估?
顯示更多