注册并分享邀请链接,可获得视频播放与邀请奖励。

阿诚|AI实战
@byCanen
前360增长运营|亲手投放2000万+广告费|做过8万粉小红书账号 AI超级个体实践中|分享AI工具、工作流、产品与商业机会 记录网站开发、GEO、内容增长和真实踩坑经验 公众号:阿诚AI实战
1.9K 正在关注    2.7K 粉丝
SOL模型的1个问题是上线之前会做大量的测试,严重拉长了这个开发周期,完全没有必要
我原来也这么想的,CodeX 100刀不够用了,得上200刀了 然后,我体验了一下5.6 Luna Max,发现很多重复性的任务,交给它,比交给Sol Ultra要好 Luna Max干活爽快简单,不会想太多,Sol Ultra简直就是一个强迫症患者… 而Luna Max 用了半天,就1-2%,根本用不完……
显示更多
Claude封号申诉失败,现在说我违背了他们的用量政策,我印象里应该只有一两次触发了5小时限额,这不是封号的理由吧?
天塌了!我的Claude账号也被封了!我是DMIT的美国IP啊,这个号用了1年多了,下午用的好好的没想到也被封了,啊!!!!! 应该是按剩下天数退款的,现在不是全额退了
显示更多
Deepseek-V4flash实在是太便宜了,我有1个网站简单的需求要调用api,测了一下同样的1个任务 Deepseek-V4flash 需要1分钱 Gemini-3.5flash-lite 需要6分钱 Gemini-3.5flash 需要6毛3 Deepseek-V4flash 和Gemini-3.5flash的成本差距有63倍 这个成本区别实在是太夸张了,我本来觉得Gemini-3.5flash已经很便宜了,没想到成本差异还是很大
显示更多
一开始,我以为彭博社只是忘了把DeepSeek V4的价格放上去。
想做国内自媒体又不知道怎么起号,选题可能根本不用自己去费力找。 我刚刷视频号,居然刷到有人把 @AYi_AInotes 的推文截图做成了视频。问了 AYI 才知道,这种玩法之前就有人在干,而且数据经常好到爆。 真要做就三步: 1.去 X 找已经爆过的内容 2.截图引用原帖,用中文重新讲一遍 3.做成视频,分发到抖音、视频号、小红书 至少选题已经在 X 上跑出来了,比每天从零找内容快多了。
显示更多
4 个单词,让 Grok Build 自己干一整晚,第二天早上交结果。 原帖作者用的就是这句: “Turn on overnight mode” 这个 Prompt 对做产品的人太实用了。 睡前把任务、验收标准和不能碰的东西说清楚,最后加上这句,让它继续跑。 可以直接这样写: 我的目标是:____ 完成后必须满足:____ 不要修改:____ Turn on overnight mode. 这 4 行就是一个可以直接复制的夜间任务模板。
显示更多
“Turn on overnight mode” is such a magical prompt to drive Grok Build to deliver the results in the morning.
60B tokens 磨出来的 8 条 AGENTS.md 规则,确实值钱。 Codex、Claude Code 写不出来的时候反而少,麻烦通常出在它太能写。 一个小需求,它能顺手加几层抽象、补一堆配置,再造一个项目里本来就有的轮子。 这份规则一直在提醒 Agent 收手: - 能简单做就别绕 - 先跑通最小版本 - 成熟工具能解决就直接用 - 动手前先检查项目已有依赖 - 需求没提的功能别自己加 这几句话看着很普通,真拿 Agent 写过项目的人,一眼就知道有多有用。 把这 5 条放进自己的 AGENTS.md,已经是一份很好用的最小版本了。
显示更多
简直就是省Token焚决!!! Vercel Next.js团队的老哥,烧了大约60B tokens,总结出一份AGENTS.md,核心就8条规则。 60B tokens什么概念?大概六位数美元。 这8条规则的本质就一句话:让你的AI编程Agent别像个实习生什么都想自己造,要像个干了十年的老油条一样写代码。 直接上规则: 1. 不保留向后兼容。过时的直接删,别加兼容层、别写migration、别留fallback。 2. 选能满足当前需求的最简单实现。不要预防性抽象,不要多此一举的配置层。 3. 系统分层长。先跑通一个最小的端到端版本,再往上加东西。绝不为了未完成的复杂度拆掉能跑的东西。 4. 组件保持模块化,关注点分离。 5. 优先用成熟的、有人维护的库。没有明确理由别自己重写。 6. 先翻项目里已有的依赖能做什么,再考虑加新包或自己写。别上来就假设库里没有。 7. 架构决策往长了做。不接受"先这样以后再换"的临时方案。 8. 先看成熟产品怎么解决同一个问题,用已验证的模式,别从零发明。 就这8条,丢进你项目根目录的AGENTS.md里,Cursor、Claude Code、Codex、Windsurf全会自动读。 为什么这能省token?因为AI写代码最大的浪费其实不是写错,是重复写多。 它给你引三个依赖写五个抽象层来解决一个标准库十行就能搞定的事,你让它改,它再给你写两百行。 这8条规则就是在它动笔之前先把它摁住:能不写的不写,能复用的复用,能简单的别复杂。 代码短了,返工少了,token自然就省了。 之前推荐过的Ponytail那个插件,干的是同一件事,只不过它是在运行时强制检查,这个是在AGENTS.md里从源头约束,两个一起用,简直效果拔群。 但作者自己加了个非常重要的警告: 这玩意儿只适合side projects,生产环境慎用。 他亲口说的,"不保留向后兼容"那条曾经让Agent差点删了生产数据库的表,差点丢了2000美元的数据。生产环境你得自己改,至少把第一条删了或者改温和点。 所以如果你在做side project、做内部工具、做原型,把这8条抄进AGENTS.md,你会发现AI写出来的代码突然像个人了。 如果你在生产环境用,把第一条和第七条之间的度自己把握好,别让AI把你库表删了。 省token的方法有很多种,换便宜模型是一种,写好prompt是一种,但最有效的,是在你项目根目录放一个文件,告诉AI: 别给我整花活,写最少的能跑的代码。
显示更多
格局真的大 一口气把自己在用的 8 个 Codex / Claude Code Skills 全放出来了,基本把“搜资料—保存—整理—发布”这一条链包了: ▫️全网和社媒搜索 ▫️网页、视频下载归档 ▫️音视频 ASR 转写 ▫️Agent 长期记忆 ▫️微信、企微内容导出 ▫️公众号文章批量抓取 ▫️调用 ChatGPT 网页做调研 ▫️Markdown 上传到 X Articles 草稿 其中我觉得最有用的是 yichen-web-research。 你不用记每个平台该用什么工具,给它一个任务,它会自己把搜索、下载、归档和转写分给对应的 Skill。 但这里有个很多人会漏掉的坑: 仓库虽然公开了源码,许可却不是 MIT、Apache 那种可以直接商用的开源协议。 个人学习、研究和非商业工作流可以用;拿去做付费产品、客户交付、课程或者公司内部工具,都要先获得作者书面许可。 所以个人玩家可以挑着研究,商业项目别看到“开源”两个字就直接搬。
显示更多
把我自用的8个Skills一口气全部开源了,最全的一次!兄弟们随意逛逛,挑点对自己有用的就好😋 1. yichen-web-research Skill:全网搜索、链接下载、收藏导出、音频转写一体。 2. Codex和Claude Code共用的记忆系统Skill:Markdown格式储存,可编辑,自进化。 3. 微信Skill:聊天记录、联系人、朋友圈、收藏夹全部可导出,可增量查询。Mac和Windows均可,数据在Mac本地,很安全。 4. 企业微信Skill:一个是解析聊天记录,一个是管文档、日程、待办、会议。 5. 公众号文章批量抓取Skill:需要切换代理,并且用自己的微信扫码,可以保存为Markdown、HTML等多种格式 6. ChatGPT调研Skill:Codex调用网页版ChatGPT Pro进行调研和深度思考 Skill: 7. X文章上传Skill:把本地 Markdown 上传成 X Article 草稿,丝滑处理封面、图片和表格。 8.微信双开Skill:有风险,慎用,经常会掉线重新登录。。。但是用起来配合微信解析是真的爽。条件好的还是用两台电脑吧。 还有一些大佬们开源的Skill,我也把我经常用的列一下: 1.DBS系列:栋哥的商业分析和自媒体流量Skill 2.飞书CLI系列:飞书的所有操作都封装成了Skill 3.前端UI: taste Skill,审美: impeccable Skill,固定风格文档: tw93大佬的简历、推荐信Skill: 张咋啦老师的精美HTML PPT Skill 4.微信读书Skill:整理你的读书笔记、推荐书目 5.PUA Skill:让你的Agent 更好地干活。 6.审核Skill:防止你乱安装Skill。 7.发布Skill:更规范,适合经常发布Skill的朋友。 8.生成/goal提示词Skill:
显示更多
Claude Code 2.1.221 这次最实用的,不是几十项更新,而是一个快捷键: Ctrl + Alt + F 在 VS Code 里按一下,满屏的工具调用会被折叠成每轮摘要,只留下当前正在跑什么。 长任务终于不用盯着一屏屏日志了。 另外,这版还修了几个更该升级的权限问题: ▫️Linux/WSL 沙箱新增凭证文件 mask 模式 ▫️修复 zsh 隐藏命令绕过权限检查的问题 ▫️修复 PowerShell 含引号路径的权限检查问题 如果你每天用 Claude Code 跑真实项目,这版的收益很直接: 界面更清楚,权限检查也更稳。 更新后在 VS Code 按 Ctrl + Alt + F,就能打开 Focus View。
显示更多
Claude Code 2.1.221 has been released. 39 CLI changes Highlights: • Focus view hides tool activity behind per-turn summaries with a live running-tool indicator, reducing clutter • Write tool documented to create or modify local files, clarifying outputs will alter disk state • Grep note recommends ripgrep-backed tool, documents output modes and line/offset limits for stable searches Full details available in thread ↓
显示更多
我去,OpenAI 这次把 AI 做数学研究的账单直接摊开了: 约 2000 美元,10 项新结果,每一项论证都配了 Lean 形式化证书。 用的还是没发布的下一代模型 Astra。 这 10 项结果横跨球面堆积、编码理论、群论、量子复杂性、格密码学等领域。 准确说,不是 10 道世界难题全部被破解。官方原话是:有的解决了长期开放问题,有的取得了重大进展。 他们还把论文手稿和模型的推理讲解一起放了出来。 以后再看到“AI 解决科学难题”,我觉得先看三样就够了:花了多少钱、到底产出了什么、证明材料能不能公开检查。
显示更多
An internal version of our next major model produced 10 new results on long-standing open problems in mathematics and theoretical computer science, using roughly $2,000 worth of tokens at GPT-5.6 Sol API rates.
显示更多
做网站开发的朋友都可以试一下这个产品
🎁 转发 + 评论,免费领取 SiteData Pro 和 2000 API Credits! 如果你平时会做 SEO、网站分析、Google Ads、AI Agent 或竞品研究,推荐试试 SiteData。 SiteData 不只是一个网站流量查询工具。 它整合了网站流量、Google Ads、关键词、外链、WHOIS、关联网站等能力,帮助你更快发现竞争对手、分析网站增长,并找到背后的商业机会。 🎁 活动奖励 🚀 SiteData Pro 1 个月(价值 49 美金) ⚡ SiteData API 2000 Credits(有效期 365 天) 📌 参与方式:评论 + 转发(Repost)这条推文 完成后私信我你的 SiteData 账号邮箱,奖励会按顺序发放。 ⏰ 活动截止:2026-08-09 23:59:59(UTC+8)
显示更多
我现在同时跑十几个 Codex 线程以后,发现最浪费时间的已经不是模型慢了。 是 Agent 特别勤快地做错事。 一个线程方向错了还好。十几个 Agent 一起开工,错误需求和错误假设也会被同时放大,最后看起来完成了很多,实际上还得返工。 所以我现在开工前,先让 Agent 说清楚三件事: 1. 最终要交付什么? 2. 哪些事情明确不能做? 3. 做到什么程度才算完成? 这三项没说清楚,就不让它开始执行。 可以直接把这句话加到任何 Codex、Claude 任务后面: “先不要执行。请用5句话以内复述你理解的目标、禁止事项和验收标准,等我确认后再开始。” 多 Agent 真正怕的不是速度慢,而是把返工也一起并行了。
显示更多
我去,MiniMax-H3 这次真把开放权重做实了。 最高 2K、最长 15 秒,画面和立体声音频一起生成。 更夸张的是,ComfyUI 给出的最低本地实测配置,竟然只要: RTX 3060 12GB 显存 + 32GB 内存 + NVMe 固态硬盘 跑 5 秒 480P 视频,不到 9 分钟。 为了把这个大模型塞进消费级电脑,ComfyUI 直接做了裁剪、INT8 量化和动态显存卸载,把最小模型组合的内存占用从 123.6GB 压到了 42.5GB。 而且开放当天,完整工作流就一起接上了: • 文生视频 • 图生视频 • 首尾帧控制 • 参考图和参考视频生成 • 直接修改已有镜头 • 原生生成立体声音频 更新 ComfyUI,打开 MiniMax 模板,按提示下载对应权重就能跑。 一张用了很多年的 RTX 3060,现在居然也能在自己电脑上生成带声音的视频了。 这次不是只放个权重文件给大家围观,是真的把本地运行的路也铺好了。
显示更多
MiniMax-H3 Is Now Publicly Available
这个工具对做网站的朋友很有用啊,推荐大家都注册一下领一下积分
🎉 新项目 上线,送一波积分作为福利。 🎁 上线福利:每人赠送 5,000 积分,本次赠送的积分有效期为 1 年。 参与方式: ✅ 评论这条推文 ✅ 引用或转发这条推文 TabAPI 把网站流量、WHOIS、RDAP、DNS、外链、反查 AdSense、Google SERP、网页转 Markdown 和网站截图等能力,整合进了一个 API。 不用注册多个平台,也不用维护一堆 Token,一个 Token 就能调用,直接返回干净的 JSON。购买积分无需订阅,一次购买,永久有效。 领取方式:完成以上步骤后,私信我你的 TabAPI 账号,会按照顺序发放积分。每个账号限领一次。 活动截止:8 月 7 日 23:59:59
显示更多
我去,Qwen 这波真的有点狠。 2.4T 参数的 Qwen3.8-Max 正式发布,下周直接开放权重。 但最夸张的根本不是参数,而是它已经开始连续干十几天了。 官方展示的几个案例: • 从空文件夹开始,连续工作 10+ 天,把项目做到生产环境 • oh-my-cli 连续迭代 16 天 • 跑了 365 天电商模拟,最终资金做到 4.16 倍 • 自带视觉反馈,能看实际结果继续修改,不是写完代码就收工 这已经不是让 AI 写个网页 Demo 了。 它在尝试自己规划、执行、看结果、发现问题,再继续修改,把一个长期任务真正做完。 价格也不贵: 输入 2 美元/百万 Token, 输出 6 美元/百万 Token。 我最近连续用 Grok 和 Codex 做产品,最烦的已经不是模型不会写代码。 而是它干到一半忘了目标,看不到真实页面,改完不复查,中断以后又要重新解释。 模型一口气写几千行代码,已经没那么稀奇了。 Qwen 这次把 AI 编程的竞争点又往前推了一步: 以前比谁更会写代码, 现在开始比谁能连续几天,把一个产品真正做完。
显示更多
📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub: - Real work, real results: Production-quality deliverables across hundreds of professions. - Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. - Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction. 💰Pricing: Input: $2.0 / M tokens Output: $6.0 / M tokens Implicit Caching: $0.25 / M tokens Start building with Qwen3.8-Max! 🚀 📖 Blog: ✅ Qwen Studio: ⚡ API:
显示更多
哈哈哈 卷起来卷起来~
🚨 DeepSeek Code Is Coming > DeepSeek is building a dedicated AI coding agent powered by its new Harness framework > The project is designed for autonomous software engineering, including planning, tool use, and code execution > Harness will provide long-running agent workflows with memory and repository awareness > Recent V4-Flash benchmarks were already evaluated using DeepSeek Harness, signaling it’s a core part of DeepSeek’s roadmap > The company is positioning it as a direct competitor to Claude Code and OpenAI Codex > Closed beta testing is expected to begin soon Can DeepSeek Code become the biggest open-source coding agent? 👀
显示更多
我去,AI会员这个账算完真的有点离谱。 200块一个月,用3次就没额度; 30美元的SuperGrok,我拿Grok 4.5在VS Code里连续干了几天,直接把一个产品从想法做到1.0上线,额度到现在都很耐用。 到底哪个更贵,这下太清楚了。 我这几个月基本把几个顶级会员都踩了一遍: Claude Max确实聪明,结果我的号直接被封,额度再多也等于0; ChatGPT Pro拿来修复杂Bug、检查和审计很严谨,但做产品前期沟通太慢,我还遇到过Pro模型被降到5.5 mini; SuperGrok一个月30美元,Grok 4.5速度快、额度足,前期想法沟通、原型开发和快速上线都能连续跑。 所以“支持顶级模型”这句话,根本判断不了一个会员值不值。 能点3次也叫支持; 能连续把一个产品干到上线,也叫支持。 我现在已经不看模型名单有多豪华了,只看三件事: 最强模型到底能跑多久,用完会降到什么,最后能不能换来一个真正做完的结果。 顶级模型只能体验几次,再便宜也是贵; 30美元能把产品干上线,那才是真的便宜。
显示更多
我去,DeepSeek V4-Flash这个翻译成本已经低得有点夸张了。 小互刚刚拿它跑了一次网站翻译: 原来需要20–60分钟, 现在只要3分钟, 单篇成本不到1毛钱! 这不是便宜一点,而是把批量翻译的成本直接打下来了。 按这次实测的价格算,10篇内容全部跑一遍也不到1块钱。 以前做多语言内容,最头疼的是页面一多,改一次原文,其他语言版本又要全部重跑。 现在速度压到3分钟,成本压到几分钱,翻译终于从“做一次就不想再动”,变成了可以反复跑的日常任务。
显示更多
测试用DeepSeek V4 Flash 代替网站的翻译 速度真是快啊 之前需要20-60分钟的翻译任务,现在只要3分钟 单篇一毛钱不到😂
Karpathy 给 Opus 5 整整 100 万 token,让它跑了两个小时,最后写出 5500 行 Three.js 代码。 代码能跑,场景也做出来了,但画面还是很卡,很多地方一眼就能看出不对。 这和我最近用 Codex 做网站的感受太像了。 AI 现在写前端代码已经够快了,问题是它看不出自己做得丑,也不知道动画到底顺不顺。 所以我现在做前端,不会再只让 Codex 读代码: 1. 先让 Figma 或 v0 出视觉方向; 2. 页面实现后,必须打开真实网页; 3. 分别截桌面端和手机端; 4. 让 Agent 对照参考图检查,再改一轮; 5. 改完重新截图,不看代码自我感觉良好。 不给它真实截图和视觉反馈,哪怕最强模型写了 5500 行代码,最后也可能只是“能运行”,离真正好用、好看还差得远。
显示更多
Karpathy去了 Anthropic 以后,第一次发长帖。 他想了一个新的测试,就是摆脱那种靠画“骑着自行车的鹈鹕”之类的测试方式,给了 Opus 5 大概 100 万个 Token 的预算,要求它生成三个渲染版本去讲述《指环王》的故事。然后 Opus 5 给他整了一个 3D 的出来。 不过他提到,这中间确实暴露了一个很大的问题: 在生成这种内容的时候,AI 没有办法很清楚地感知到自己的工作,因为它没办法直接看到内容本身,只能一段一段地去截图,也没办法连续地感知到截图中间的状态。所以,这确实是个问题。
显示更多
我去,原来 Codex的开发额度还能这样省! AYI 的用法不是全程死磕 Sol,而是: 日常写代码、Debug、文档和 PR,用 Luna + Max reasoning; 复杂重构、架构、难 Bug 和审计,再切 Sol。 他实测下来,Luna Max 处理大部分日常任务已经接近 Sol Medium,但额度消耗低很多。 开启也很简单: Settings → Models → Available reasoning efforts → 给 Luna 打开 Max。 我前两天还在吐槽 Codex 干活周期太长,Pro 又经常给我降到 mini。 现在看,与其所有任务都抢最强模型,不如把 80% 的体力活交给 Luna,最贵的额度只留给最难的判断。 当然,“接近 Sol”是 AYI 的个人实测,不是 OpenAI 官方保证,但这种模型分工比全程死磕 Sol 合理多了。
显示更多
刚发现一个OpenAI订阅的隐藏用法,感觉像白捡的。 GPT-5.6不是分三档吗——Sol最强最贵,Terra中间,Luna最便宜最快。大部分人默认选Sol,觉得贵的就是好的。 但现在一堆重度用户测出来一个组合:Luna + Max reasoning effort,也就是所谓的"Luna Max"。 效果离谱🤯 日常写代码、debug、改bug、写文档、过一遍PR,Luna Max的实际表现已经接近Sol Medium,部分任务甚至打平。 但消耗的额度少太多了——因为Luna本身单价低,Max推理虽然加了思考力度,但整体quota消耗跟Sol完全不是一个量级。 结果就是,同一个ChatGPT Pro/Team订阅,你选Sol可能一天就撞限额了,选Luna Max感觉怎么用都用不完。 不是bug喔,是OpenAI自己的定价和推理力度设计带出来的性价比窗口。 模型本身便宜,把思考力度拉满,推理质量上去了,但额度消耗没跟着涨多少。 怎么开: 设置里找到Available reasoning efforts,把Max打开(默认可能是隐藏的)。 然后模型选GPT-5.6 Luna,推理力度选Max。API用户直接指定gpt-5.6-luna,reasoning effort设max就行。 日常干活直接Luna Max拉满,真遇到需要深度推理、复杂架构决策、多步长链的任务,再切回Sol。 说白了就是:80%的活Luna Max干得跟Sol差不多,但额度花得跟不要钱似的,剩下20%的硬骨头再上Sol。 趁现在还能用,这种窗口一旦用的人多了,OpenAI大概率会调额度计算方式,到时候就没这么香了hh
显示更多
我最近有个很明显的感觉: ChatGPT网页版的5.6极高,好像比Codex里的Sol extra high更聪明。 尤其是审核网站文案的时候,网页版经常能发现Codex一直没发现的问题。 我甚至怀疑,网页版用的是没有降智的高级版本。 当然也可能是因为Codex长期待在项目上下文里,已经习惯了原来的文案和产品逻辑;网页版第一次看到全站文本,反而更像一个真正的新用户。 所以我现在做网站,代码和页面基本完成以后,会直接让Codex或Grok导出全站所有用户能看到的文字,整理成一个Markdown文件。 然后把这个文件发给ChatGPT网页版,让它检查不说人话、翻译腔、错误卖点,以及不同页面的套餐数量、价格、功能和限制不一致等实质问题。 审完以后,再把问题清单交给Grok或Codex统一修改。 这一轮做完,整个网站不说人话和前后矛盾的地方会少很多。 以前是让写网站的Agent自己检查自己,现在多了一次独立审核,效果确实好很多。
显示更多