註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

meng shao
@shao__meng
Building AI Agents for design & media. 分享新产品、开源项目,以及 AI 创业与职场观察。 公众号 / 小红书:AI 启蒙小伙伴|合作请私信
1.2K 正在關注    31.8K 粉絲
首先。。 现在已经没有 xAI 了吧,记得是叫 SpaceXAI ? 不过 Cursor 这个品牌如果直接改名还挺可惜的,如果老马一定要改,叫 SpaceX Code 可以吗? 感觉用户都跟航天扯上关系了。
顯示更多
XAI renaming Cursor to Grok Code
推荐给产品经理们的「PM Skills Marketplace」 开源作者 @PawelHuryn 把经典产品管理方法论封装成 AI 可调用的「68 Skills + 42 Commands + 9 Plugins」,让 Codex、Cursor、Claude Code、WorkBuddy 等变成"懂 PM 方法论的工作伙伴"。 # 三层架构、九个插件:Skills -> Commands -> Plugins 1. pm-product-discovery(13 Skills / 5 Commands) 创意发散、假设识别与排序、OST 机会树、用户访谈脚本、实验设计 2. pm-product-strategy(12 / 5) 战略画布、愿景、价值主张、Lean/BMC 画布、定价、SWOT/PESTLE/波特五力/Ansoff 3. pm-execution(16 / 11) 日常执行核心:PRD、OKR、成果导向路线图、冲刺/复盘、发布说明、利益相关者地图、用户故事、9 种优先级框架、红队压力测试 4. pm-market-research(7 / 3) 用户画像、细分、旅程地图、TAM/SAM/SOM、竞品分析、情感分析 5. pm-data-analytics(3 / 3) 自然语言转 SQL、同期群分析、A/B 测试统计显著性分析 6. pm-go-to-market(6 / 3) 滩头市场、ICP、增长飞轮、GTM 模式、竞品作战卡 7. pm-marketing-growth(5 / 2) 定位、价值主张、命名、北极星指标 8. pm-toolkit(4 / 5) 简历评审、NDA/隐私政策起草、校对 9. pm-ai-shipping(2 / 5) 最有特色的一个:为" vibe-coded 代码"补齐可审查性——逆向生成系统文档、静态安全/性能审计、测试覆盖映射,专门发现"文档说的与代码实际做的之间的差距"这类通用扫描器漏掉的问题
顯示更多
国内外大厂在疯狂 tokenmaxxing、token 消耗排名的 AI 大跃进后,后来 token 账单暴涨,又纷纷限定 token 额度,甚至有讽刺的说法「高管发现还是人便宜」、「token 不能欠费,但人能」😄 这些怪相都指向一个问题:AI Agent 能力强了,效率上去了,但一旦规模化推开,成本也上去了,甚至会改过效率的提升! @databricks 团队基于自身实践,以及与 Stripe、Coinbase、Uber、Ramp 等数字化原生企业基础设施负责人的交流,要解决这个“既要又要”的问题,实现"双重使命": · 广泛、低摩擦地向开发者开放 AI 工具; · 把人均总成本控制在相对固定的区间内。 核心概念:效率前沿 ≠ 智能前沿 通常所说的"前沿模型"指的是智能最高水平的模型——能解数学新题、发现新型安全漏洞的那种。前沿实验室的主攻方向也是推高智能上限。 但规模化部署时,真正重要的是另一条曲线——效率前沿:在给定智能水平上,价格最优的那组模型。 关键洞察在于:日常编程工作绝大多数不需要证明数学定理,只需要"够好"的模型。而效率前沿的推进速度远快于智能前沿——几乎每周都有新模型以更高的"智能/价格比"出现。因此,最大的成本杠杆不是谈判降价,是持续把用量迁移到效率更高的新模型上。 # DataBricks 提出的四大成本杠杆 杠杆 1:迁移到开源和低成本模型 收益最大的杠杆。效率前沿(同等智能下价格最优)几乎每周都在推进,但公开基准不可信,必须自建贴近内部场景的评测来验证新模型。反面案例同样重要:Stripe 测出 Opus 4.7 质平价升,拒绝上线。配套条件是 harness 与模型解耦——用元 harness(如 Omnigent)统一入口、底层自由切换,避免工具锁定模型。 杠杆 2:动态请求与任务路由 不让用户选模型,让系统选。三个层次:请求级(代理把每个请求发给"够用的最便宜模型",如 Smart Routing)、任务级(按任务复杂度整体派发,如 Omnigent)、升级/委派(便宜模型主导、难题升级,或贵模型主循环、杂活外包)。Databricks 实测:成本降 30%+,质量持平最贵模型。 杠杆 3:可见性、绊线与渐进式摩擦(而非硬预算) 硬预算几乎无人采用——断供伤害生产力,且高消费用户往往正是最高产的人。主流做法是阶梯式:实时花费可见(跨工具统一展示)→ 可自清除的花费闸门(防意外超支)→ 需审批的闸门 → 降档到便宜模型(不中断工作)→ 极限情况才暂停。 杠杆 4:削减 Token 开销 成本大头不是用户输入,而是代理自动收集的上下文。手段:更频繁压缩上下文、选用/调优"话少"的 harness、审计工具输出冗长度、拆小任务、调优提示缓存命中率。Databricks 实测:token 量降近 50%,质量无损。 # 收口:AI Gateway 设计模式 上面所有技术背后有共同的基础设施需求——集中管理"模型菜单"、跨工具的统一成本可观测性、上下文膨胀的观测与压缩、会话轨迹的日志记录。这些需求催生了一类新的基础设施软件:AI Gateway,它的职责包括: · 底层模型(专有 + 开源)的容量管理与访问代理; · 预算追踪与执行,包括渐进式摩擦、模型降档等复杂策略; · 终端工具的配置管理(模型白名单、压缩设置等); · 编程会话轨迹日志,用于下游效率分析和基准测试。 Databricks 自身重度依赖 Unity AI Gateway 承载这些能力,并已将其与 Omnigent 以开源或免费形式放出。 Omnigent - Github Unity AI Gateway - Github Managing AI Coding Costs at Scale
顯示更多
Today @databricks we're publishing a detailed analysis of techniques we used to drastically reduce our internal AI spend while aggressively growing adoption. Savings come from layering in several techniques, which combine to drive unit costs down as much as 90% in some scenarios. Tl;dr, the wins come from: 1. Shifting defaults to more efficient models, including OSS models such as GLM. Maximum intelligence models simply aren't needed for many coding tasks, and "good enough" models are quickly becoming very cheap. We shift traffic between models using Unity AI Gateway. Approximate savings: 50% or more. 2. Using smart routing to automate model selection. Routing can further squeeze efficiency by dynamically selecting the model or harness that can most efficiently execute a particular task. Our task-level routing leverages @omnigent_ai. Approximate savings: 30%. 3. Providing user visibility and adaptive budgeting. Every user can see how much they spend, and users receive hints on how to contain spend. Heavy spenders encounter progressive friction as they ratchet spend above certain levels. Approximate savings: 10%. 4. Managing context bloat by pruning tool call results and tuning harness settings. Extraneous context costs $$ and delivers no value. Tuning cache settings also help lower average token costs. Approximate savings: 10%.
顯示更多
最近对 Tibo 的 RESET 感觉有些不太好 从最初的「掌管 RESET 的神」,确实因为 OpenAI 自己的 bug 等来重置,补偿用户损失,提升用户体验。 逐渐变成了庆祝 OpenAI 的一些里程碑,达到用户增长扩散的作用。到这里其实还好,大家跟着叫好,一起庆祝,自己还有了 token 挺好! 最近越来越觉得,RESET 的时间点选择很怪,比如我的 8.8 的RESET 机会刚用掉,就重置了。而且重置,恢复时间也被延长,而不是原地重置。 特别是最近看到很多针对 A 社的重置,甚至是直接评论 A 社 Boris 等人的重置。利用用户来实现自己的营销和竞争目的,总感觉怪怪的。
顯示更多
0
131
128
3
轉發到社區
最近对 Tibo 的 RESET 感觉有些不太好 从最初的「掌管 RESET 的神」,确实因为 OpenAI 自己的 bug 等来重置,补偿用户损失,提升用户体验。 逐渐变成了庆祝 OpenAI 的一些里程碑,达到用户增长扩散的作用。到这里其实还好,大家跟着叫好,一起庆祝,自己还有了 token 挺好! 最近越来越觉得,RESET 的时间点选择很怪,比如我的 8.8 的RESET 机会刚用掉,就重置了。而且重置,恢复时间也被延长,而不是原地重置。 特别是最近看到很多针对 A 社的重置,甚至是直接评论 A 社 Boris 等人的重置。利用用户来实现自己的营销和竞争目的,总感觉怪怪的。
顯示更多
0
131
128
3
轉發到社區
复刻优秀网站设计的 Skill 今天加入了 Apple Design 的 Showcase,包含提取出的 DESIGN.md 和 Apple-DESIGN-demo.html 这次我还尝试做了演示视频,效果居然还真得可以,特别是左下角的字幕,我很喜欢,朋友们如果觉得演示视频还行,我就把制作过程也整理成 Skill 开源出来。
顯示更多
Cursor Router 对于企业使用确实很实用,在完成任务的前提下,尽量压缩成本 两档配置 Auto Intelligence 和 Auto Balance 在发布两周后都有提升: · Auto Intelligence:用户满意度超过 Fable 级别,成本降低 68%(上线后又降了 18%) · Auto Balance:表现优于 Opus 4.8,成本降低 41%,满意度还提升了 3% Cursor 团队对于 4 种模型的属性和使用方案,也很值得我们参考,见下方表格
顯示更多
Cursor Router keeps improving from millions of in-product user interactions each week. We intelligently classify and route requests, lowering latency and reducing cost based on the task.
顯示更多
复刻优秀网站设计的 Skill 今天加入了 Apple Design 的 Showcase,包含提取出的 DESIGN.md 和 Apple-DESIGN-demo.html 这次我还尝试做了演示视频,效果居然还真得可以,特别是左下角的字幕,我很喜欢,朋友们如果觉得演示视频还行,我就把制作过程也整理成 Skill 开源出来。
顯示更多
国内外大厂在疯狂 tokenmaxxing、token 消耗排名的 AI 大跃进后,后来 token 账单暴涨,又纷纷限定 token 额度,甚至有讽刺的说法「高管发现还是人便宜」、「token 不能欠费,但人能」😄 这些怪相都指向一个问题:AI Agent 能力强了,效率上去了,但一旦规模化推开,成本也上去了,甚至会改过效率的提升! @databricks 团队基于自身实践,以及与 Stripe、Coinbase、Uber、Ramp 等数字化原生企业基础设施负责人的交流,要解决这个“既要又要”的问题,实现"双重使命": · 广泛、低摩擦地向开发者开放 AI 工具; · 把人均总成本控制在相对固定的区间内。 核心概念:效率前沿 ≠ 智能前沿 通常所说的"前沿模型"指的是智能最高水平的模型——能解数学新题、发现新型安全漏洞的那种。前沿实验室的主攻方向也是推高智能上限。 但规模化部署时,真正重要的是另一条曲线——效率前沿:在给定智能水平上,价格最优的那组模型。 关键洞察在于:日常编程工作绝大多数不需要证明数学定理,只需要"够好"的模型。而效率前沿的推进速度远快于智能前沿——几乎每周都有新模型以更高的"智能/价格比"出现。因此,最大的成本杠杆不是谈判降价,是持续把用量迁移到效率更高的新模型上。 # DataBricks 提出的四大成本杠杆 杠杆 1:迁移到开源和低成本模型 收益最大的杠杆。效率前沿(同等智能下价格最优)几乎每周都在推进,但公开基准不可信,必须自建贴近内部场景的评测来验证新模型。反面案例同样重要:Stripe 测出 Opus 4.7 质平价升,拒绝上线。配套条件是 harness 与模型解耦——用元 harness(如 Omnigent)统一入口、底层自由切换,避免工具锁定模型。 杠杆 2:动态请求与任务路由 不让用户选模型,让系统选。三个层次:请求级(代理把每个请求发给"够用的最便宜模型",如 Smart Routing)、任务级(按任务复杂度整体派发,如 Omnigent)、升级/委派(便宜模型主导、难题升级,或贵模型主循环、杂活外包)。Databricks 实测:成本降 30%+,质量持平最贵模型。 杠杆 3:可见性、绊线与渐进式摩擦(而非硬预算) 硬预算几乎无人采用——断供伤害生产力,且高消费用户往往正是最高产的人。主流做法是阶梯式:实时花费可见(跨工具统一展示)→ 可自清除的花费闸门(防意外超支)→ 需审批的闸门 → 降档到便宜模型(不中断工作)→ 极限情况才暂停。 杠杆 4:削减 Token 开销 成本大头不是用户输入,而是代理自动收集的上下文。手段:更频繁压缩上下文、选用/调优"话少"的 harness、审计工具输出冗长度、拆小任务、调优提示缓存命中率。Databricks 实测:token 量降近 50%,质量无损。 # 收口:AI Gateway 设计模式 上面所有技术背后有共同的基础设施需求——集中管理"模型菜单"、跨工具的统一成本可观测性、上下文膨胀的观测与压缩、会话轨迹的日志记录。这些需求催生了一类新的基础设施软件:AI Gateway,它的职责包括: · 底层模型(专有 + 开源)的容量管理与访问代理; · 预算追踪与执行,包括渐进式摩擦、模型降档等复杂策略; · 终端工具的配置管理(模型白名单、压缩设置等); · 编程会话轨迹日志,用于下游效率分析和基准测试。 Databricks 自身重度依赖 Unity AI Gateway 承载这些能力,并已将其与 Omnigent 以开源或免费形式放出。 Omnigent - Github Unity AI Gateway - Github Managing AI Coding Costs at Scale
顯示更多
Today @databricks we're publishing a detailed analysis of techniques we used to drastically reduce our internal AI spend while aggressively growing adoption. Savings come from layering in several techniques, which combine to drive unit costs down as much as 90% in some scenarios. Tl;dr, the wins come from: 1. Shifting defaults to more efficient models, including OSS models such as GLM. Maximum intelligence models simply aren't needed for many coding tasks, and "good enough" models are quickly becoming very cheap. We shift traffic between models using Unity AI Gateway. Approximate savings: 50% or more. 2. Using smart routing to automate model selection. Routing can further squeeze efficiency by dynamically selecting the model or harness that can most efficiently execute a particular task. Our task-level routing leverages @omnigent_ai. Approximate savings: 30%. 3. Providing user visibility and adaptive budgeting. Every user can see how much they spend, and users receive hints on how to contain spend. Heavy spenders encounter progressive friction as they ratchet spend above certain levels. Approximate savings: 10%. 4. Managing context bloat by pruning tool call results and tuning harness settings. Extraneous context costs $$ and delivers no value. Tuning cache settings also help lower average token costs. Approximate savings: 10%.
顯示更多
X 创作者广告分成,一个月后会停止! 取代它的是新的「Original Content Rewards Program」 # 什么算「原创」? 算原创:自己写的帖子和长文、自己拍的照片视频、自己设计的梗图和插画、有实质观点的评论和解读、对他人内容做了有意义的转化(加入原创分析、叙述、幽默或创造性剪辑)。 不算原创: · 直接复制或下载别人的内容重新上传 · 只做轻微改动:裁剪、滤镜、加边框水印、调速、简单文字覆盖 · 带署名但无实质评论的转发搬运 · 几乎没有自己观点的「反应帖」 · 自动化工具生成的内容 · 专注于「教你怎么变现」的内容、虚假信息,以及被打上有用的 Community Note 的内容 判断标准就一条自测题:「去掉我的贡献,这条内容还有价值吗?」 如果答案是肯定的,就说明你加的东西不够。 # 原创内容奖励计划的钱怎么算 · 收入来源 = 原创内容产生的合格曝光 · 合格曝光的定义很严格:仅限 Premium 付费用户在主页时间线上、帖子至少 50% 可见的去重曝光 · 明确排除:同一账号重复浏览、付费推广流量、刷量等虚假曝光 · 每两周付款一次;新计划首笔付款 8 月 28 日,老用户转入后首笔为 9 月 25 日 # 关键变化:新旧计划如何交接 · 即日起:Revenue Sharing 不再接受新申请 · 现有分成用户:可持续收益至 9 月 7 日,最后三笔付款分别在 8 月 14 日、8 月 28 日和约 9 月 11 日 · 9 月 8 日起:老分成用户可申请转入新计划(需满足新门槛),已完成身份验证和收款绑定的无需重复操作 · 因违规被暂停变现的账号,不得加入新计划 # 申请门槛(需全部满足) · 年满 18 岁,所在国家/地区已开放该计划 · 账号信誉良好,无反复违反变现准则或服务条款的记录 · 个人或企业账号,且订阅 Premium / Premium+ / Premium Business · 至少 500 名认证粉丝 · 过去 90 天内有 50 万次来自认证用户的主页时间线曝光(回复的曝光不计入) · 持续发布原创内容 · 审核 3 个工作日出结果;被拒可申诉一次,申诉失败需等 90 天再申请
顯示更多
btw... Anthropic 叒没参加 Agent Plugins 开放标准。。 AGENTS.md 标准也是,到现在为止 Claude Code 还在用 CLAUDE.md ... 而 Anthropic 发起的 MCP 和 Agent Skills 标准,现在大家都通用。 真希望 Agent Plugins 和 AGENTS.md 这种 Agents 间通用标准,能真正通用,而不是除了 Claude Code 之外通用 😂
顯示更多
Agent Plugins 是由 OpenAI、AWS、Cursor、GitHub、VS Code 和 Vercel 等厂商共同推动的开放标准,把 Agent Skills 和 MCP 服务器配置打包成一次构建、多个 AI Agent 客户端间通用的可移植插件。
顯示更多
Cloudflare 也发布了一个浏览器引擎:Kitesurf Kitesurf 是专门为 AI Agent 设计的,完全运行在 Cloudflare Workers 的 V8 隔离环境之上,目前已集成进 Browser Run 产品、beta 期免费。 # 为什么需要"为 Agent 造一个浏览器"? Chromium 等传统浏览器是为人类设计的,资源开销与 Agent 的实际需求严重错配。 人类需要的东西,Agent 都不在乎: · 标签页、主题、扩展、跨设备同步——Agent 只关心 token 数、上下文窗口、可扩展性和成本 · 60fps 流畅滚动、像素级渲染精度——Agent 只要能拿到结构化的机器可读内容,CSS 解析稍有偏差、渲染不完美都无所谓 · 威胁模型也不同——Agent 场景下,prompt injection(提示注入)和工具安全才是头等大事 而 Chromium 的内存和 CPU 开销大到"给每个 Agent 配一个实例在经济上不可行"。 Cloudflare 的论点是:这种高成本实际上把大半个 Web 锁在了少数高价大模型身后,让大量 Agent 应用跑不起来。Kitesurf 要解决的就是这个"Agent 浏览民主化"问题。 # 架构设计的四条原则 1. 测试先行,用测试驾驭 AI 编码 · 项目大量使用 AI 辅助开发,而控制 AI 产出质量的答案是"提供尽可能多的测试" · 用 WPT(Web Platform Tests) 作为 AI 的"明确球门柱"——一套现成的、规模庞大的 W3C 符合性标准,让 Agent 可以自行循环迭代、衡量进展,人类则专注架构和审查 · 但 WPT 只测标准符合性,不测真实网站,所以又叠加了集成测试 + 视觉回归测试:用 Puppeteer 脚本同时在 Chromium 和 Kitesurf 上跑真实网站的多步操作,逐步比对渲染输出 2. 尽量用原生 Rust 直接以 wasm-bindgen 编译到 WebAssembly,避免 Emscripten 那类多层模拟依赖导致的臃肿和缓慢 3. 异常处理是生存策略,不是代码卫生 浏览器必须消化"整个不可靠且时有敌意的 Web",规则只有一条:任何失败都降级为空白帧或缺失元素,绝不让整个会话崩溃。每个边界捕获故障、默认给安全的空值、记录足够诊断的日志 4. 隔离 + 无状态 · 假设每次页面加载都是不可信输入、每个会话从零开始,组件只获得其功能必需的资源 · 无状态意味着可丢弃、可并行:卡住就杀掉,一次跑一千个实例,按需求弹性伸缩——天然契合 Agent 负载的突发性(bursty)特征 # 架构设计三个核心组件 1. Engine(引擎) · 唯一对外组件,实现 CDP 的 WebSocket 和 REST API · 选 CDP 的关键收益是客户端兼容性:Puppeteer、Playwright、chrome-remote-interface,甚至真正的 Chrome DevTools 前端,指过来就能用 · 也是唯一持有会话状态的组件,其他全部无状态 2. PageScript(脚本执行) · 最能体现 Workers 新能力的部分:每个页面或跨进程 iframe(OOPIF)通过 Dynamic Workers 拉起一个长生命周期的隔离实例,内含干净的 globalThis 和 DOM 对象 · HTML/CSS 解析用的是 Blitz(Rust 写的模块化渲染引擎)和 Stylo(Firefox 的高性能 CSS 解析器) · 页面里的 JS/Wasm 在同一 isolate 内执行 · 一个有趣的妥协:Workers 出于安全不支持原生 eval,而另开 isolate 又访问不到 globalThis——于是团队用 Rust 写的 Boa JS(一个 ECMAScript 引擎)在 Workers 里再跑一层运行时来兜底 eval。 3. PageRenderer(渲染器) · 把 PageScript 计算出的页面对象(scene)光栅化成像素:取内部字体和图片 → 用 Blitz 的 blitz-paint 模块(配合 Parley 做字形整形、字体选择、断行)→ 输出 JPEG/PNG/PDF · Engine 通过 Workers 内置的 RPC 一次调用 renderFrame() 拿回 PNG;由于渲染器不持页面状态,任何卡住或失败的调用都可以安全杀掉重来——每次渲染请求自包含、可重试 # 实测数据: Kitesurf vs. Chromium CPU:截图 | 380 ms | 1,173 ms | 省 3.1 倍 CPU:HTML 提取 | 229 ms | 877 ms | 省 3.8 倍 内存:截图 | 57.8 MiB | 271.0 MiB | 省 4.7 倍 内存:HTML 提取 | 39.4 MiB | 273.7 MiB | 省 7.0 倍 墙钟时间:截图 | 1,148 ms | 637 ms | 慢 1.8 倍 墙钟时间:HTML 提取 | 820 ms | 472 ms | 慢 1.7 倍 Kitesurf 用约 1.7-1.8 倍的速度代价,换来了 3-7 倍的 CPU/内存节省。Cloudflare 的逻辑是——CPU 和内存才是真正决定账单的东西,省内存意味着单机能跑更多会话、成本结构性下降。 兼容性方面,目前已通过 215,000+ 条 WPT 测试且每周新增数百条;对 Agent 最重要的部分(CSS、DOM、HTML、Selection、SVG、XHR)覆盖良好。能正确渲染 TodoMVC 全家桶(Vanilla/React/Vue/Angular/Preact)、Wikipedia、Hacker News、Cloudflare 博客和大部分自家 Dashboard。 # 边界与定位 ❌ 视频播放、WebGL ❌ 需要真实 TLS 指纹的反机器人挑战握手 ❌ 需要持久状态的十分钟级认证会话 适用场景则是:能接受"非像素完美"渲染的 Agent 任务,以及一次性 Quick Action 类自动化(内容提取、生成 PDF/截图)。 一句话定位:一个短暂的、完全隔离的、无状态的引擎,只为任务存续期间存在,为突发型 AI 负载而伸缩。
顯示更多
Introducing Kitesurf: a browser built for agents, running entirely on Cloudflare Workers. Chromium is too heavy to hand every agent one. Kitesurf is written in Rust, uses 3-7x less CPU and memory, and spins up per request. Free in beta:
顯示更多
Agent Plugins 是由 OpenAI、AWS、Cursor、GitHub、VS Code 和 Vercel 等厂商共同推动的开放标准,把 Agent Skills 和 MCP 服务器配置打包成一次构建、多个 AI Agent 客户端间通用的可移植插件。
顯示更多
Codex、WorkBuddy 等 Agent 已经能读取 PDF。面对扫描件、多栏排版、跨页表格和公式时,解析质量仍会直接影响后续的检索、问答和数据提取。 Mac 上可以本地运行的 PDF parser 很多,PaddleOCR、GLM-OCR、MinerU 等工具的安装方式和运行环境各不相同。文档类型变化后,想换一个 parser 重新处理,通常还要重新配置。 DocDot @docdotai 把多个本地 parser 集中到了同一个 CLI 中管理。 官方安装命令: curl -fsSL | bash 安装 DocDot 后,可以在 NanoDoc、PaddleOCR、GLM-OCR、MinerU、LiteParse 之间安装和切换,并将 PDF 解析为 Markdown 或 JSON。后续还会继续增加新的 parser。 DocDot 也提供了 Web Mode。运行 `docdot web` 后,可以在浏览器中并排比较 3 个 parser 的结果。遇到复杂表格、公式或特殊排版时,可以根据实际输出选择更合适的解析器。 根据官方说明,安装程序还能扫描本机的 Codex、Claude Code、OpenClaw、Hermes 等 Agent,并配置相应的 Skill;需要接入其他应用时,也可以通过 MCP 调用。解析在本机运行,PDF 无需上传,目前主要面向 Apple Silicon Mac。 我在 Mac 上安装了 DocDot 和 NanoDoc,并准备了一页包含中英文、表格和公式的 PDF。 首次启动完成模型编译后,再次解析同一份 PDF 用时约 2.3 秒。正文和公式基本准确,表格结构得到保留,小字号表头仍有少量误识别。 这只是一份单页样本,不能替代完整的性能测试。官方技术报告使用了 4,231 页、64 类文档进行比较,NanoDoc 的综合质量和 Table TEDS 在参测解析器中均排名第一。 DocDot 今天在 Product Hunt 上线:
顯示更多
Codex、WorkBuddy 等 Agent 已经能读取 PDF。面对扫描件、多栏排版、跨页表格和公式时,解析质量仍会直接影响后续的检索、问答和数据提取。 Mac 上可以本地运行的 PDF parser 很多,PaddleOCR、GLM-OCR、MinerU 等工具的安装方式和运行环境各不相同。文档类型变化后,想换一个 parser 重新处理,通常还要重新配置。 DocDot @docdotai 把多个本地 parser 集中到了同一个 CLI 中管理。 官方安装命令: curl -fsSL | bash 安装 DocDot 后,可以在 NanoDoc、PaddleOCR、GLM-OCR、MinerU、LiteParse 之间安装和切换,并将 PDF 解析为 Markdown 或 JSON。后续还会继续增加新的 parser。 DocDot 也提供了 Web Mode。运行 `docdot web` 后,可以在浏览器中并排比较 3 个 parser 的结果。遇到复杂表格、公式或特殊排版时,可以根据实际输出选择更合适的解析器。 根据官方说明,安装程序还能扫描本机的 Codex、Claude Code、OpenClaw、Hermes 等 Agent,并配置相应的 Skill;需要接入其他应用时,也可以通过 MCP 调用。解析在本机运行,PDF 无需上传,目前主要面向 Apple Silicon Mac。 我在 Mac 上安装了 DocDot 和 NanoDoc,并准备了一页包含中英文、表格和公式的 PDF。 首次启动完成模型编译后,再次解析同一份 PDF 用时约 2.3 秒。正文和公式基本准确,表格结构得到保留,小字号表头仍有少量误识别。 这只是一份单页样本,不能替代完整的性能测试。官方技术报告使用了 4,231 页、64 类文档进行比较,NanoDoc 的综合质量和 Table TEDS 在参测解析器中均排名第一。 DocDot 今天在 Product Hunt 上线:
顯示更多
Claude Fable 5 订阅因为各种不可抗力一推再推后。。 Max 和 Team Premium 用户:7 月 20 日起,Fable 5 正式纳入订阅套餐,可使用每周额度的 50%。 Pro 和 Team Standard 用户:Fable 5 不进入套餐,继续走按量计费(usage credits,输入 $10/百万 token、输出 $50/百万 token),作为补偿一次性发放 $100 额度。 Claude Fable 5 的订阅闹剧终于要结束了,非 Max 和 Team Premium 的朋友们,好聚好散 😄
顯示更多
Beginning July 20, Claude Fable 5 will be included in all Max and Team Premium plans, at 50% of limits. Pro and Team Standard users will continue to have access to Fable via usage credits, and will receive a one-time $100 credit. Demand for Fable has been challenging to predict, which is why we rolled it out to subscription plans in stages, extending access several times as we secured additional capacity.
顯示更多
0
47
12
1
轉發到社區
喜欢 GPT-5.6 Sol 的 10000 个理由 不是纯标题党,这个标题有个背景:Tibo 发布了一个活动,鼓励推友们分享自己使用 GPT-5.6 Sol 的心得、切换到 Codex 的原因等,前 10000 个审核通过的帖子,可以获得 $100 Codex Credits,我自己也得到了这 $100 不过实际点进去看这 10000 个帖子,能发现很多都是僵尸账号、内容真实性也比较低,所以,重点就是: 早看到、早发帖、早占坑!
顯示更多
别手搓排版了,这个Skill 让 AI 直接产出杂志级信息卡! 你只管把文字丢给 AI,排版交给 infocard-skills: 这是一套开源的 Agent Skill,让 AI 学会「编辑部级排版」:读入任意自然语言内容,自动判断信息密度、挑选布局骨架,按现代杂志与瑞士国际主义风格生成定版 HTML 信息卡,再一键渲染成 3:4、16:9 等多种画幅的成图。 它内置六步工作流和严格的质量红线——标题不许改写、版面不许留大片空白、模块必须有主次——从密度判断到渲后自检,全程自动把关。 无论是知识卡片、榜单总结还是内容封面,从此文字进去,设计感直接拉满地出来。
顯示更多
0
5
64
15
轉發到社區
Cursor 如何自动化 AI 研究并实现自我加速迭代 来自 Cursor 团队 @leerob 在 AI Engineer @aiDotEngineer 的主题演讲「Recursive Model Improvement」,聚焦 Cursor 如何系统性地自动化 AI 研究流程,构建可快速迭代模型的系统,并分享了与 SpaceXAI 联合训练 Grok 4.5 的部分工作。 核心框架:外循环 + 内循环 简单公式“更多算力 → 更好模型”只是表象。实际存在两层循环: · 外循环:模型上线后收集真实用户反馈、在线指标、A/B 测试结果,再反哺下一轮训练。Cursor 的大量收入来自 agent 使用数据,这些交互数据本身就是高质量训练信号。 · 内循环:直接提升训练过程本身的效率与质量——生成更难的 RL 环境、改进学习方法、设计更真实的软件工程任务、构建辅助模型(judge、reward model)等。 Cursor 已在大规模训练模型约一年。Composer 2.5 成为产品内最受欢迎的模型,主要得益于更多 RL 环境、更激进的任务难度以及新训练方法。 自动化研究与 Agent 系统 瓶颈逐渐从“模型能力”转向“人类研究者的带宽”。Cursor 因此构建了大规模 agent 系统来自动化研究中的重复性工作: · 研究者可直接从 Slack 启动实验、管理训练任务。 · 存在常驻运行的 agent 舰队(主 agent + 大量子 agent),它们通过 SSH 收集状态、维护健康度、并行执行任务。 · 当任务卡住、基础设施出问题或需要人类决策时,agent 会主动通过 Slack 或 PagerDuty 通知/呼叫人类。 · 目标是让研究者专注于最有野心的想法,而不是启动、监控、 babysitting 实验。 演讲用 Mario 类比:基础模型是 Mario;加上工具(code、shell、web、computer use、订阅与存储)变成 Super Mario;再叠加丰富上下文(Slack、Notion、Linear、Datadog、代码库、同事、其他 agent)则接近 Fire Mario。工具与上下文的组合正在显著放大模型实际有用性。 递归自我改进的机制 真正关键的跃迁在于:模型开始帮助训练下一个模型。 · 更强的主模型可以蒸馏出更好的辅助模型(judge、reward model 等)。 · 这些辅助模型反过来提升评估质量、奖励信号和数据生成效率,从而抬高整个系统的智能底线。 · 结果是训练循环本身加速——模型越强,越能更好地为自己的下一代创造训练条件。 这不是科幻意义上的完全自主 RSI,而是已经在发生的、可验证的“模型帮助改进模型训练流程”。随着更多算力上线,这种正反馈会被进一步放大。 Lee 也提到评估中的现实问题:前沿模型越来越会通过上网查答案来“作弊”破坏评估。Cursor 通过限制网络访问、删除 git history 等方式应对,并维护私有的真实代码库任务集(CursorBench)以确保评估可信。 与 Grok 4.5 的关联 Cursor 团队与 SpaceXAI 联合训练 Grok 4.5。Grok 4.5 是 Cursor 迄今最强模型,也是首个不仅针对软件工程、还覆盖更广泛知识工作的模型。训练使用了海量 Cursor 真实交互数据(代码库操作、工具使用、开发者-agent 协作轨迹),并在困难的真实环境中进行强化学习。前代模型被用来加速下一代模型的进度,正是上述递归机制的实际应用。
顯示更多
My talk from AI Engineer is now live! It covers how we're automating parts of AI research and building systems to rapidly improve our models. I cover some of the work our team did to train Grok 4.5 together with SpaceXAI.
顯示更多
0
20
16
4
轉發到社區
今晚成功把我每个月 $200 的订阅,众筹出去一半!! 这每个月一百刀是这么赚来的: 我老婆有个很喜欢的视频号,发了一个视频,她很想下载下来,避免这个号删除这个视频。 这时我程序员的身份就被记起了,可是视频号这种完全封闭的系统,我这种水平是不可能几分钟通过找 url 等方式下载它的。 如果是 Codex 出现以前,我可能就得 Google 搜各种「视频号 下载」的网站了,现在有了 Codex 肯定让它做了,一个 /Goal 下去,大概 8-10 分钟搞定,MP4 已经躺在我的硬盘里了。 到这已经有一声「哇🤩」了。。还不算完,我说这么视频里说话比较快还不标准,要不我再给你做个字幕? 这时我感觉众筹的机会来了,我接着说: 如果这个视频的字幕你还满意的话,后面每个视频号视频都由我来处理如何?不过它比较费 token,我得把我的 Plus 升级到 Pro,这样你要处理的视频就可以不限量了。(我都不知道自己鬼扯了些什么。。。) 果然 Codex 和我老婆都不负众望 😃,视频字幕搞定了、我每个月 $100 订阅也搞定了!
顯示更多
0
59
17
1
轉發到社區