注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Checkpoint』
Checkpoint』 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Checkpoint』 的推特
闲不下来一点 , 一无聊就强制自己干点啥。 Checkpoint Galxe Quest 第二周新任务上线 , 完成所有社交任务收集 9 个 NFT 结束 :5 月 17 日 晚上 11 点(UTC) 任务 :
显示更多
0
21
28
1
转发到社区
真的感觉很多工作流(Agent)不用搭的太复杂,模型一迭代就直接给你全干废了,最好是轻量的一层壳,让模型自由发挥就好了。 前阵子opus5没出的时候我魔改了很多东西,让fable5 low 作为planner和checkpoint reviewer,opus 4.8 high作为worker,基本所有的工作都是这套逻辑,避免频繁的切换Model。 甚至还写了一篇小文档来记录这个系统,然后opus5一出这些就全都作废了,无脑opus5就行
显示更多
本月结束前我们会看到的新模型清单⬇️ 已确认✅ @Zai_org GLM5.2(据说非常不错,1M上下文,多模态) @OpenAI GPT-5.6(已经确认了checkpoint,也许会是Fable的低价平替) @GeminiApp Gemini Omni(全新的checkpoint,在Sora关闭、Seedance2.0高昂API价格下,这是非常不错的选择) @MiniMax_AI M3的开源权重与代码(M3是一个被低估的模型,在很多方面其实是个非常有性价比的选择) 可能发布❓ @Kimi_Moonshot K3 @deepseek_ai V4.1
显示更多
0
33
216
10
转发到社区
iOS 27 在钱包里的 ID 好像被改成了可以直接选择共享信息范围的! 这样是不是就不会在 TSA checkpoint 当雕像了🗿
看到一个重磅消息说ChatGPT 6 下周要发布了,名字叫Astra,不过大概率要走美国政府的预发布审查流程,GPT-5.6都因为这推迟过。 模型可能早就ready了,卡的是安全评估和监管。 说是最大新预训练, 如果是真的,那就很牛逼了, 因为最近整个行业的叙事是:基础模型差不多了,接下来拼后训练、拼应用、拼Agent、拼推理时计算。 新的大规模预训练不划算,模型在商品化。 如果OpenAI回头做了一次GPT-4.5以来最大的预训练,而且结果是能做原创数学证明,那说明他们认为基础模型的天花板还远没到,scaling还没死。 这对所有押注"模型可互换、应用层为王"的人,是当头一棒。 命名也有意思, 现在的GPT-5.6系列是Sol、Terra、Luna——太阳、地球、月亮。 下一个叫Astra,星星。 从日地月到星空。 内部checkpoint叫mewfour,宝可梦梗,和之前的mewthree一脉相承。对外一套天文命名,对内一套宝可梦,OpenAI传统艺能。
显示更多
一篇不错的解读:《META出租H100与购买先进算力并不矛盾》 Meta 做 NeoCloud 与继续租 Crusoe 1.6GW,并不矛盾 昨天盘前,Meta 被报道正在考虑把多余 AI 算力对外商业化,甚至做成类似 NeoCloud 的业务。市场第一反应非常剧烈:Meta 盘前上涨接近 6%,但 AI算力和 neocloud 相关股票则受到负面 Narrative 影响, 市场担心的是:如果 Meta 也开始把 GPU 算力对外卖,是否会直接导致算力过剩? 这个反应可以理解,但我们认为市场把问题想简单了。 首先,Meta 这件事本质上不是“AI 算力需求见顶”,也不是“Meta 不需要继续买算力”。相反,Meta 同时还在继续锁定非常大规模的新算力。根据 Bloomberg/Reuters 报道,Meta 最近与 Crusoe 签署了新的 AI computing capacity 协议,将从 Crusoe 位于 Texas Childress 和 Missouri Warrenton 的两个数据中心获得合计约 1.6GW 的容量。 同时,Meta还在向其他Neocloud购买算力。我们在去年3Q25 META Preview中就提到过META正在向NeoCloud寻求购买3GW算力。 所以表面上看,这里确实有一个矛盾:如果 Meta 自己已经有多余算力,为什么还要继续向 Crusoe 租 1.6GW? 我们的理解是,这不是矛盾,而是算力代际切换。 过去两年,Meta 已经采购和部署了大量 H100/H200。这些 GPU 不是没价值,恰恰相反,它们对 inference、fine-tuning、企业模型服务、图像/视频生成、传统 ML workload 仍然非常有价值。但对于下一代 frontier model training,尤其是 3T+ 参数规模的 MoE、长上下文、多模态和 RL-heavy post-training,H100/H200 的训练经济性会明显下降。 关键不是 H100 不能训练,而是单位有效 token 成本变差。 当模型进入 3T+ 规模后,瓶颈不再只是单卡 FLOPS,而是 HBM 容量/带宽、GPU 间通信、scale-up 网络、checkpoint/restart、expert routing、sequence parallel、pipeline bubble、以及大规模 collective communication。H100 集群当然还能跑,但训练 wall-clock 更长,通信开销更高,集群利用率更难维持,最终表现为同样训练一个 frontier model,成本和时间都不如 GB200/GB300,未来更不如 Vera Rubin。 因此,Meta 现在面对的是一个很典型的资产配置问题: 最先进的 GB200/GB300/Rubin,要优先留给下一代模型训练;上一代 H100/H200,则应该尽量转成 inference 或外部商业化收入。 这也是为什么“做 NeoCloud”和“继续租 Crusoe 1.6GW”可以同时成立。 Meta 继续向 Crusoe 锁定 1.6GW,本质上是在为更长期、更先进、更大规模的 AI infrastructure 做准备。这种资源对于 Meta 来说,更多是未来 GB200/GB300/Rubin 时代的战略性产能,而不是简单补 H100 的缺口。 另一方面,Meta 既然已经买了大量 H100/H200,就不可能让这些资产在 frontier training 代际切换后闲置。Meta 内部当然有广告、推荐、内容排序等大量推理 workload,但这和 OpenAI/Anthropic 那种直接面向外部客户卖 token 的 LLM inference 业务并不完全一样。Meta 如果没有足够多可以直接 monetization 的外部 token demand,把 H100/H200 做成 cloud capacity 或 hosted model API 对外销售,是非常合理的资本回收方式。 这其实和 xAI / SpaceX 的思路有相似之处。xAI 今年公开宣布与 Anthropic 达成 compute partnership,向 Anthropic 提供 Colossus 1 算力;xAI 官方称 Colossus 1 包含超过 22 万张 NVIDIA GPU,包括 H100、H200 和 GB200,并可支持 training、fine-tuning、inference 和 HPC workload。(xAI) 这说明即使是 frontier AI 公司,也可能把一部分已有 GPU fleet 对外出租,同时把最新、最稀缺、训练效率最高的下一代集群保留给自己的 frontier model。 所以今天市场担心“Meta 进入 NeoCloud 会打垮所有 NeoCloud”,我们觉得有些过度。 更准确的判断应该是: AI 算力市场正在从单一的 GPU shortage,进入多代 GPU 分层定价和分层使用阶段。 第一层是最新训练算力:GB300、Rubin,以及后续更大 scale-up domain 的系统,主要服务 frontier model training。这部分供给仍然稀缺,客户仍然会向 Crusoe、CoreWeave、Nebius、Oracle、Microsoft 等各类供应商锁产能。 第二层是上一代高端算力:H100/H200/部分 GB200,更适合 inference、fine-tuning、enterprise AI、hosted model、agent workload 和中小模型训练。这部分不是没有需求,而是从“最稀缺的训练资源”变成“可以规模化商业化的推理资源”。 第三层是更通用的 GPU cloud 和 long-tail enterprise workload,对价格更敏感,但需求弹性也更大。 在这个框架下,Meta 的行为其实很合理:它不是停止建设 AI infrastructure,而是在把不同代际的 GPU 放到最适合的经济用途上。 因此,我们不认为这是 AI infrastructure 的大问题。真正重要的判断是:下一代 frontier model training 对 GB200/GB300/Rubin 的需求仍然非常强;同时,H100/H200 这类上一代 GPU 也不会被废弃,而会进入 inference monetization 和外部算力销售阶段。 这对整个 AI supply chain 的含义反而是: GPU fleet 开始变成多代际资产,而不是一次性训练工具。旧 GPU 不归零,新 GPU 继续稀缺。Meta 做 NeoCloud,不是需求崩了,而是算力资产终于开始金融化和商业化。
显示更多
Andrej Karpathy:“Claude 的错误里,90% 来自上下文缺失,而不是模型能力弱。” 没有 `CLAUDE.md` 时,错误率是 41%。 有 4 条基础规则时,错误率降到 11%。 使用下面这套 12 条规则时,错误率降到 3%。 这是资深工程师最终沉淀出的 12 条规则: 1. 写代码前先思考 先说明假设,不要猜。模型不会读心,别指望它能自动知道你的意思。 2. 简单优先 最少代码,不做投机式抽象。一旦你让 Claude 为“未来灵活性”加东西,可能就多出 200 行下季度要删的代码。 3. 外科手术式修改 只改必须改的地方。别让它顺手优化旁边的代码,PR 就是这么膨胀的。 4. 目标驱动执行 先定义成功标准,然后循环直到验证通过。没有成功标准,Claude 要么无限循环,要么过早停止。 5. 只把模型用于判断型任务 比如分类、草稿、总结、抽取。不要让模型处理路由、重试、状态码处理、确定性转换。代码能回答的,就让代码回答。 6. Token 预算不是建议 单任务 4000,单会话 30000。长时间调试到第 40 条消息时,Claude 会重新建议你第 5 条消息已经否掉的修复方案。 7. 暴露冲突,不要折中平均 代码库里有两种模式?选一种。Claude 把两种混在一起,错误就会被吞两次。 8. 先读再写 先读 exports、调用方、共享工具。Claude 很可能在一个已有相同函数旁边,再加一个重复函数,只因为它没读到。 9. 测试要验证意图,而不只是行为 如果业务逻辑变了测试却不会失败,这个测试就是错的。Claude 写的 12 个测试都可能通过,即使函数实际只返回一个常量。 10. 每个重要步骤都要 checkpoint Claude 可能在第 4 步已经坏掉的状态上继续完成第 5、6 步,而没人发现,浪费一小时。 11. 匹配代码库约定 项目用 class components,就不要默默改成 hooks。测试模式可能依赖 `componentDidMount`,hooks 会破坏它,却不一定暴露问题。 12. 失败要大声暴露 “成功完成”,但 14% 的记录被静默跳过,这是最糟糕的一类 bug。要暴露不确定性,不要藏起来。 真正会复利增长的,不是下一个框架,而是: - 把 `CLAUDE.md` 当作跨会话的组织记忆 - 基于 eval 改进,而不是凭感觉改 - 重视 checkpoint,而不是一味追求速度 - 明确暴露冲突,而不是静默混合 - 纪律永远比框架重要 - 一个仓库,一个规则文件,没有例外 在这件事变成 AI Twitter 的大众共识之前,提前领先几条规则。 研究它👇
显示更多
0
20
97
14
转发到社区
同一批基准里,本地跑的 DeepSeek V4 Flash 加上 J-Space 控制层之后,在大多数任务上压过了不加控制层的 V4 Pro。 《DeepSeek V4 × J-Space 能力释放报告》 DeepSeek V4 × J-Space:Benchmark 与工程观察记录 © 2026 Tiger3807861189,本记录采用 CC BY-ND 4.0(署名-禁止演绎)许可。 页面范围:本记录整理外部项目已经公开的工程观察、J-Space 使用的操作性术语、项目级 Benchmark 分数及其适用边界。它不是研究论文,非学术性质,不提供模型内部机制证明、形式化判定方法、消融设计或因果贡献分解。 J-Space Cognition Suite V3.6 是一套在推理阶段运行的模型无关控制系统,不修改模型权重。项目地址: 一、外部工程观察 1.1 Anchored Standard:首轮接口锚定 dsh-anchored-standard( DeepSeek Harness 的首轮接口条件。其基础方案在第一次模型请求中恢复 Minimal 的真实双工具 Schema,抑制自动注入内容;会话产生持久事件后,再开放一个较小的常驻工具目录,并按需解锁其他工具。 该项目的公开实验表明,首轮工具 Schema、输出预算和自动注入内容都可能改变首条推理轨迹。它也明确区分了"轨迹被锚定"和"任务能力已经稳定提升":当前仓库中的通用组合与早期高分运行并不完全相同,小样本独立复现尚不足以确定稳定的能力增益幅度。因此,本记录只引用其接口敏感性与路径保持观察,不把单项分数推广为普遍结论。 1.2 Routing Suite:任务感知的入口选择 dsh-routing-suite( 与工具面装配,把新会话送入不同的行为带。其公开材料报告了稳定区域和不稳定过渡区域,并据此避免把连续数值旋钮误当成可连续调节的推理深度。 该项目后来对早期"官方刻意设计双吸引子""自路由绝对不可能"等强归因作出了公开勘误( mixed 表示不稳定的过渡或竞争区域,不等于一种兼具短、长思维优点的可用中间态。 二、思维链二极管 2.1 操作性定义 本记录所称思维链二极管(chain-of-thought diode),是一个面向黑盒行为的工程术语:在同一个会话中,连续思维链会稳定落入以下两种形态之一: • 短思维直觉:较快形成判断并进入行动,推理块较短; • 长思维推理:先展开较长的分析、重估与规划,再决定是否行动。 两种形态在同一会话中不能稳定、按任务阶段自然地共同出现;首轮形成路径承诺后,后续思维链通常延续同一侧。外部实验中偶尔出现的词汇混合或不稳定过渡,不构成能够同时利用两侧优势的中间态。 这一术语描述的是会话级轨迹,而不是某一句话或某一个词。We need、Let me 等表达最多只能作为外部探针,不能单独证明模型能力、推理质量或内部状态。 2.2 形成原因:极简接口过拟合假说 J-Space 采用的工程诊断是:DeepSeek 的 Agent 后训练行为可能与 DSH 极简模式的接口分布形成了过强耦合。极简 persona、首轮工具 Schema、自动注入边界和输出条件共同构成接口指纹;当实际 Harness 接近这一分布时,一类轨迹更容易被唤起,接口发生变化时则可能落入另一类轨迹。 这里的"过拟合"是对黑盒条件敏感性的工程概括,不表示已经获得 DeepSeek 的训练数据、隐藏状态或官方内部解释。现有公开证据支持"接口条件与轨迹变化相关",但不足以从外部还原完整训练机制。 2.3 两侧的结构性弊端 • 短思维直觉:过早接受第一个流畅解释;复杂约束整合不足;跳过必要中间桥接;工具证据利用不足;局部测试成功后过早宣布完成。 • 长思维推理:分析惯性和行动延迟;反复推翻或重建已有判断;工具调用过晚;Token 与时间消耗增加;长程状态漂移;信息已经充分仍难以收束。 因此,二极管带来的主要工程问题不是某一侧必然更差,而是会话无法随任务阶段稳定调整推理形态:需要桥接时可能过快,需要行动时又可能持续推演。 三、三套方案的浅层关系 • Anchored Standard:作用于首次模型请求的接口条件。恢复已知的 Minimal 接口指纹,尽量让会话从入口进入并保持一条稳定轨迹。 • Routing Suite:作用于新会话开始前的任务分类与模式选择。根据任务选择较适合的稳定行为带,并回避不稳定过渡区域。 • J-Space:作用于会话进入轨迹后的完整任务生命周期。不宣称消除二极管,而是通过状态、行动、验证与恢复机制缓解会话落入任一侧后的结构性弊端。 三者可以被理解为入口恢复、入口选择和持续任务控制三个不同层面。这是一种便于工程使用的关系整理,不表示三套方案已经在统一 Harness 下完成组合实验,也不构成效果排名。 3.1 J-Space 对两侧弊端的浅层处理 当会话偏向短思维直觉时,J-Space 使用 bridge-before-conclusion、共享约束广播、Empirics、verifier 与 coverage,要求快速判断在交付前补足必要桥接、证据和验证范围。 当会话偏向长思维推理时,J-Space 使用功能性第一人称、明确的 Next、有限候选、差分测试与 checkpoint,把已经形成的判断绑定到行动、取证或收束,减少无新增约束的反复推演。 对于两种形态,Goal / Core / Verified / Open / Next 账本、工具接缝刷新与恢复机制负责维持跨文件、跨工具和长时间任务状态。这些机制调节外部任务过程,并不等同于让模型在同一会话中自由切换两种底层思维链。 四、Benchmark 记录 4.1 评测上下文 J-Space 在 DeepSeek 上的项目评测参照官方 Harness 极简模式。J-Space 通过工作空间路由、状态连续性、验证与恢复参与推理时流程。 结果形成于项目现有的评测环境。硬件条件、进程隔离、工具可用性与信息访问边界共同构成评测上下文;可访问资料及执行轨迹也可能影响观测结果。 以下汇总上述条件下的项目级 Benchmark 记录。其他模型的数据保留各厂商公开评测时的原有上下文,不同环境与 Harness 配置下出现分数变化属于正常现象。各 Benchmark 使用自身原生分数,数值越高越好;"—" 表示没有报告结果。 4.2 分数记录 顺序固定为:V4-Flash-0731 裸跑、V4-Flash-0731 + J-Space、V4-Pro-0813 裸跑、V4-Pro-0813 + J-Space、GLM-5.3、Kimi-K3、Opus-4.8、Fable 5(带 fallback)。 • HLE(无工具):37.8、45.5、42.7、48.0、未报告、43.5、49.8、53.3(全场最高) • HLE(有工具):51.5、60.6、60.0、67.7(全场最高)、62.5、56.0、57.9、63.0 • Terminal Bench 2.1:82.7、87.1、87.9、90.1(全场最高)、88.2、88.3、85.0、88.0 • NL2Repo:54.2、70.2、61.5、73.4(全场最高)、58.0、58.0、69.7、未报告 • CyberGym:76.7、81.7、83.3、86.8(全场最高)、84.5、80.0、78.3、83.1 • DeepSWE:54.4、67.4、62.7、72.0(全场最高)、66.9、67.5、58.0、70.0 • Toolathlon-Verified:70.3、77.7、74.1、79.5(全场最高)、73.0、76.5、76.2、77.9 • Agents' Last Exam:25.2、30.1、25.7、30.3(全场最高)、28.5、27.6、25.7、23.8 • AutomationBench(Public):25.1、31.7、31.8、38.2、48.2(全场最高)、30.8、27.2、29.1 4.3 Benchmark 与二极管弊端的定性对应 • HLE(无工具):短侧可能过早下结论,长侧可能在知识边界之外无效延伸;J-Space 对应必要桥接、置信控制与独立复核。 • HLE(有工具)、CyberGym:短侧可能少用或少整合证据,长侧可能迟迟不进入工具取证;对应 Empirics、工具接缝与验证覆盖。 • Terminal Bench:短侧可能快速执行但遗漏核验,长侧可能分析过度、行动延迟;对应明确的 Next、诊断重试与 checkpoint。 • NL2Repo、DeepSWE:短侧可能丢失跨文件约束,长侧可能反复重建计划;对应共享广播、Loop 账本与持续验证。 • Toolathlon-Verified:短侧可能跳过编排检查,长侧可能困在工具选择和重新规划;对应共享状态、接缝审计与 coverage。 • Agents' Last Exam、AutomationBench:异构任务或长间隔会放大固定路径与任务阶段的错配;对应选择性 pass、持久状态与恢复。 上述对应关系是工程解释,不是从分数反推出内部状态的证明。当前 Benchmark 记录没有逐次标注会话所处的二极管状态,因此不能据此计算二极管对分数的贡献比例,也不能把全部分数变化归因于单一机制。 4.4 数据来源 • DeepSeek V4-Flash-0731 模型卡: • 智谱 AI( GLM-5.3 发布评测记录 • Kimi-K3 模型卡: • Claude Fable 5 与 Claude Mythos 5 System Card: • J-Space Cognition Suite V3.6 README: 五、适用边界 • 思维链二极管和极简接口过拟合属于黑盒工程诊断,不是 DeepSeek 官方披露的模型结构或训练事故。 • 词汇、首行风格和思维链长度只能作为轨迹探针,不能替代任务完成、工具行动、验证覆盖和得分。 • Anchored Standard、Routing Suite 与 J-Space 的关系是作用层面的整理,尚未经过统一组合实验验证。 • 当前分数是项目记录,不足以建立跨模型普遍性,也不支持精确的因果贡献分解。 • J-Space 不创造基础模型缺少的知识,也不保证对所有任务、模型或 Harness 产生正向变化。 引用:工程使用请引用 J-Space Cognition Suite V3.6( 原文: #DeepSeek# #J-Space# #本地AI#
显示更多
🔥X 平台杠开源了整个平台的算法权重,这次连“你的每个动作值多少分”都公开了。 X 直接放出了主要生产权重、可见性过滤规则、账号与内容标签系统、SimClusters,以及真正用于训练和 Serving 的 Phoenix 生产代码。 先猜你会对每条帖子做什么,再按一张“行为价目表”算分,然后经过限流、去重、圈外折扣、新作者扶持,最后决定你看到什么。 工作原理: 1、先找一批“候选帖子”,现在主要有三个入口: • Thunder:你关注的人刚发的内容 • Phoenix Retrieval:根据你的历史行为和内容语义,从全网找 AI 认为你可能感兴趣的帖子 • SimClusters:根据“哪些人经常喜欢同一类东西”形成兴趣簇,再从这些圈子里捞内容 2、然后 Phoenix 对每条帖子预测一串概率: 点赞 / 回复 / 转发 / 引用 / 分享 / 私信分享 / 复制链接 / 点击 / 看视频 / 关注作者…… 负反馈也一起预测: 不感兴趣 / 静音 / 拉黑 / 举报 / 没有停留。 而且它看的信息比“你过去点过什么赞”多得多。 新版生产模型里还有国家、语言、位置、当地时间、年龄段、性别、已安装 App、帖子年龄等上下文。 3、真正炸裂的地方来了: X 这次把主要生产默认权重公开了。 正向: • 复制链接分享:+20 • 回复:+5 • 引用:+5 • 私信分享:+5 • 关注作者:+4 • 普通分享:+2 • 转发:+1 • 点赞:+0.5 • 点击帖子:+0.4 负向更加夸张: • 举报:−234 • 静音作者:−58.8 • 不感兴趣:−43.2 • 拉黑作者:−31.2 还有一个非常有意思的隐藏项: 如果你和作者互相关注,而且对方发的是原创帖,“你会回复它”的权重额外 +15。 基础回复权重是 5。 也就是说,这类帖子对应的回复预测权重可以直接来到 20。 当然,这些数字不能简单理解成: “1 次复制链接 = 40 个赞”。 系统计算的是: 某个行为发生的概率 × 对应权重。 而且 X 自己在代码里专门解释,这些权重同时考虑了行为价值和这种行为在全网有多稀有。 4、打完分还没结束。 圈外内容,也就是你没有关注的账号,默认分数还要乘 0.75。 同一个作者连续出现,也会被强行衰减。 按目前公开的默认参数计算: 同一批候选里,同一个作者的第二条大约只剩 62.5%,第三条约 43.75%,继续出现会越来越接近 25% 的下限。 所以疯狂连续刷帖,并不能无限霸占推荐流。 更有意思的是,小账号真的有代码级“新人保护”。 当前默认参数里: 作者粉丝不超过 1000,帖子浏览低于 1000,满足条件的原创帖,有机会被系统主动往大约第 16 位附近的目标分数抬。 另外,超过 48 小时的帖子,在打分之前就会被过滤。 5、这次对创作者最重要的一个变化,是“限流”终于开始变得可解释了。 X 把 Visibility Filtering 整条链路开出来了。 Spam、恶意链接、NSFW、辱骂、Do Not Amplify 等标签,都可能让一条帖子在“推荐给非关注者”时直接被 DROP。 这就解释了过去一种很常见的现象: 你的粉丝依然可以看到你。 陌生人的 For You 推荐流里,你却几乎消失了。 X 还配套推出了 Under the Hood,可以查看自己账号和帖子身上影响可见性的标签统计。 6、另外还有一个旧版解读需要更新。 Phoenix 内部依然采用 Candidate Isolation。 模型给某条候选帖打基础分时,它看不到同一批里的其他候选帖,所以 Phoenix 这一层的分数不受 Batch 里其他帖子的影响。 但之后还会继续经过: 作者多样性衰减、圈外 0.75 折扣、新作者扶持,以及 DPP 多样性重排。 所以“每条帖子独立打分”依然成立于 Phoenix 这一层。 最终出现在第几位,依然会受到整个推荐管线影响。 几个最值得记住的结论: 第一,复制链接分享的默认权重非常高。 X 明显很在意一条内容有没有强到让人愿意“带出信息流”。 第二,回复远比普通点赞值钱。 互相关注关系里的原创内容,回复预测还会得到巨额加权。 第三,连续刷屏会被作者多样性机制主动压制。 第四,小账号确实存在明确写进代码里的冷启动机会。 第五,负反馈非常贵。 举报、静音、不感兴趣带来的负权重,远高于一次普通点赞提供的正权重。 第六,这次透明度已经高了一个级别,但距离 100% 仍有空间。 真实生产数据和 checkpoint 没有开放,部分 Grox prompts 和 Botmaker 规则依然保留。 对于创作者来说,新的优先级已经非常清晰: 让内容值得被回复、私信分享、复制链接带走; 建立真实的双向关系; 减少连续刷屏; 尽量避免触发“不感兴趣”、静音、举报和各种安全标签。 X 的算法越来越像一个实时预测“你下一步会做什么”的 AI 编辑部。
显示更多