注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 J-Space
J-Space 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 J-Space 的推特
J-space 是 LLM 的 白板?
这周准备深读 J-space 。 但上手过 persona vector 和 Assistant Axis 的人都知道,线性激活的这种 model steering 的手段并不可靠。相关的研究大量时间花在 cherry pick 那些抓人眼球的 special case。 J-space 到底行不行,目前持怀疑态度。
显示更多
0
21
121
10
转发到社区
同一批基准里,本地跑的 DeepSeek V4 Flash 加上 J-Space 控制层之后,在大多数任务上压过了不加控制层的 V4 Pro。 《DeepSeek V4 × J-Space 能力释放报告》 DeepSeek V4 × J-Space:Benchmark 与工程观察记录 © 2026 Tiger3807861189,本记录采用 CC BY-ND 4.0(署名-禁止演绎)许可。 页面范围:本记录整理外部项目已经公开的工程观察、J-Space 使用的操作性术语、项目级 Benchmark 分数及其适用边界。它不是研究论文,非学术性质,不提供模型内部机制证明、形式化判定方法、消融设计或因果贡献分解。 J-Space Cognition Suite V3.6 是一套在推理阶段运行的模型无关控制系统,不修改模型权重。项目地址: 一、外部工程观察 1.1 Anchored Standard:首轮接口锚定 dsh-anchored-standard( DeepSeek Harness 的首轮接口条件。其基础方案在第一次模型请求中恢复 Minimal 的真实双工具 Schema,抑制自动注入内容;会话产生持久事件后,再开放一个较小的常驻工具目录,并按需解锁其他工具。 该项目的公开实验表明,首轮工具 Schema、输出预算和自动注入内容都可能改变首条推理轨迹。它也明确区分了"轨迹被锚定"和"任务能力已经稳定提升":当前仓库中的通用组合与早期高分运行并不完全相同,小样本独立复现尚不足以确定稳定的能力增益幅度。因此,本记录只引用其接口敏感性与路径保持观察,不把单项分数推广为普遍结论。 1.2 Routing Suite:任务感知的入口选择 dsh-routing-suite( 与工具面装配,把新会话送入不同的行为带。其公开材料报告了稳定区域和不稳定过渡区域,并据此避免把连续数值旋钮误当成可连续调节的推理深度。 该项目后来对早期"官方刻意设计双吸引子""自路由绝对不可能"等强归因作出了公开勘误( mixed 表示不稳定的过渡或竞争区域,不等于一种兼具短、长思维优点的可用中间态。 二、思维链二极管 2.1 操作性定义 本记录所称思维链二极管(chain-of-thought diode),是一个面向黑盒行为的工程术语:在同一个会话中,连续思维链会稳定落入以下两种形态之一: • 短思维直觉:较快形成判断并进入行动,推理块较短; • 长思维推理:先展开较长的分析、重估与规划,再决定是否行动。 两种形态在同一会话中不能稳定、按任务阶段自然地共同出现;首轮形成路径承诺后,后续思维链通常延续同一侧。外部实验中偶尔出现的词汇混合或不稳定过渡,不构成能够同时利用两侧优势的中间态。 这一术语描述的是会话级轨迹,而不是某一句话或某一个词。We need、Let me 等表达最多只能作为外部探针,不能单独证明模型能力、推理质量或内部状态。 2.2 形成原因:极简接口过拟合假说 J-Space 采用的工程诊断是:DeepSeek 的 Agent 后训练行为可能与 DSH 极简模式的接口分布形成了过强耦合。极简 persona、首轮工具 Schema、自动注入边界和输出条件共同构成接口指纹;当实际 Harness 接近这一分布时,一类轨迹更容易被唤起,接口发生变化时则可能落入另一类轨迹。 这里的"过拟合"是对黑盒条件敏感性的工程概括,不表示已经获得 DeepSeek 的训练数据、隐藏状态或官方内部解释。现有公开证据支持"接口条件与轨迹变化相关",但不足以从外部还原完整训练机制。 2.3 两侧的结构性弊端 • 短思维直觉:过早接受第一个流畅解释;复杂约束整合不足;跳过必要中间桥接;工具证据利用不足;局部测试成功后过早宣布完成。 • 长思维推理:分析惯性和行动延迟;反复推翻或重建已有判断;工具调用过晚;Token 与时间消耗增加;长程状态漂移;信息已经充分仍难以收束。 因此,二极管带来的主要工程问题不是某一侧必然更差,而是会话无法随任务阶段稳定调整推理形态:需要桥接时可能过快,需要行动时又可能持续推演。 三、三套方案的浅层关系 • Anchored Standard:作用于首次模型请求的接口条件。恢复已知的 Minimal 接口指纹,尽量让会话从入口进入并保持一条稳定轨迹。 • Routing Suite:作用于新会话开始前的任务分类与模式选择。根据任务选择较适合的稳定行为带,并回避不稳定过渡区域。 • J-Space:作用于会话进入轨迹后的完整任务生命周期。不宣称消除二极管,而是通过状态、行动、验证与恢复机制缓解会话落入任一侧后的结构性弊端。 三者可以被理解为入口恢复、入口选择和持续任务控制三个不同层面。这是一种便于工程使用的关系整理,不表示三套方案已经在统一 Harness 下完成组合实验,也不构成效果排名。 3.1 J-Space 对两侧弊端的浅层处理 当会话偏向短思维直觉时,J-Space 使用 bridge-before-conclusion、共享约束广播、Empirics、verifier 与 coverage,要求快速判断在交付前补足必要桥接、证据和验证范围。 当会话偏向长思维推理时,J-Space 使用功能性第一人称、明确的 Next、有限候选、差分测试与 checkpoint,把已经形成的判断绑定到行动、取证或收束,减少无新增约束的反复推演。 对于两种形态,Goal / Core / Verified / Open / Next 账本、工具接缝刷新与恢复机制负责维持跨文件、跨工具和长时间任务状态。这些机制调节外部任务过程,并不等同于让模型在同一会话中自由切换两种底层思维链。 四、Benchmark 记录 4.1 评测上下文 J-Space 在 DeepSeek 上的项目评测参照官方 Harness 极简模式。J-Space 通过工作空间路由、状态连续性、验证与恢复参与推理时流程。 结果形成于项目现有的评测环境。硬件条件、进程隔离、工具可用性与信息访问边界共同构成评测上下文;可访问资料及执行轨迹也可能影响观测结果。 以下汇总上述条件下的项目级 Benchmark 记录。其他模型的数据保留各厂商公开评测时的原有上下文,不同环境与 Harness 配置下出现分数变化属于正常现象。各 Benchmark 使用自身原生分数,数值越高越好;"—" 表示没有报告结果。 4.2 分数记录 顺序固定为:V4-Flash-0731 裸跑、V4-Flash-0731 + J-Space、V4-Pro-0813 裸跑、V4-Pro-0813 + J-Space、GLM-5.3、Kimi-K3、Opus-4.8、Fable 5(带 fallback)。 • HLE(无工具):37.8、45.5、42.7、48.0、未报告、43.5、49.8、53.3(全场最高) • HLE(有工具):51.5、60.6、60.0、67.7(全场最高)、62.5、56.0、57.9、63.0 • Terminal Bench 2.1:82.7、87.1、87.9、90.1(全场最高)、88.2、88.3、85.0、88.0 • NL2Repo:54.2、70.2、61.5、73.4(全场最高)、58.0、58.0、69.7、未报告 • CyberGym:76.7、81.7、83.3、86.8(全场最高)、84.5、80.0、78.3、83.1 • DeepSWE:54.4、67.4、62.7、72.0(全场最高)、66.9、67.5、58.0、70.0 • Toolathlon-Verified:70.3、77.7、74.1、79.5(全场最高)、73.0、76.5、76.2、77.9 • Agents' Last Exam:25.2、30.1、25.7、30.3(全场最高)、28.5、27.6、25.7、23.8 • AutomationBench(Public):25.1、31.7、31.8、38.2、48.2(全场最高)、30.8、27.2、29.1 4.3 Benchmark 与二极管弊端的定性对应 • HLE(无工具):短侧可能过早下结论,长侧可能在知识边界之外无效延伸;J-Space 对应必要桥接、置信控制与独立复核。 • HLE(有工具)、CyberGym:短侧可能少用或少整合证据,长侧可能迟迟不进入工具取证;对应 Empirics、工具接缝与验证覆盖。 • Terminal Bench:短侧可能快速执行但遗漏核验,长侧可能分析过度、行动延迟;对应明确的 Next、诊断重试与 checkpoint。 • NL2Repo、DeepSWE:短侧可能丢失跨文件约束,长侧可能反复重建计划;对应共享广播、Loop 账本与持续验证。 • Toolathlon-Verified:短侧可能跳过编排检查,长侧可能困在工具选择和重新规划;对应共享状态、接缝审计与 coverage。 • Agents' Last Exam、AutomationBench:异构任务或长间隔会放大固定路径与任务阶段的错配;对应选择性 pass、持久状态与恢复。 上述对应关系是工程解释,不是从分数反推出内部状态的证明。当前 Benchmark 记录没有逐次标注会话所处的二极管状态,因此不能据此计算二极管对分数的贡献比例,也不能把全部分数变化归因于单一机制。 4.4 数据来源 • DeepSeek V4-Flash-0731 模型卡: • 智谱 AI( GLM-5.3 发布评测记录 • Kimi-K3 模型卡: • Claude Fable 5 与 Claude Mythos 5 System Card: • J-Space Cognition Suite V3.6 README: 五、适用边界 • 思维链二极管和极简接口过拟合属于黑盒工程诊断,不是 DeepSeek 官方披露的模型结构或训练事故。 • 词汇、首行风格和思维链长度只能作为轨迹探针,不能替代任务完成、工具行动、验证覆盖和得分。 • Anchored Standard、Routing Suite 与 J-Space 的关系是作用层面的整理,尚未经过统一组合实验验证。 • 当前分数是项目记录,不足以建立跨模型普遍性,也不支持精确的因果贡献分解。 • J-Space 不创造基础模型缺少的知识,也不保证对所有任务、模型或 Harness 产生正向变化。 引用:工程使用请引用 J-Space Cognition Suite V3.6( 原文: #DeepSeek# #J-Space# #本地AI#
显示更多
六分钟带你看懂什么是j-space
0
11
139
19
转发到社区
我现在大概知道为什么 karpathy、一堆 Gemini/OpenAI 出身的核心人员要加入 Anthropic 了——他们可能提前看到了这个 Anthropic 刚发了篇论文,讲了个叫「J-space」的东西 但我今天不想讲技术本身,我想讲一个更底层的问题: 为什么是现在?为什么是这些人?为什么是 Anthropic? 作为一个做过几年产品的人,我看人才流动有个基本判断框架: 顶级人才跳槽,从来不是因为钱,是因为他们看到了一个自己在原来位置上永远碰不到的东西 Karpathy 离开 OpenAI,NoamShazeer 离开 Google——这些人在原公司都是能调动几千张卡的人。 他们缺的不是资源,是方向感 而 J-space 这篇论文,给出的恰恰是一个方向 简单说一下这东西是什么: Anthropic 在 Claude 的中间层里发现了一组特殊的内部表征,模型会在不输出任何文字的情况下,先把中间推理步骤“存”在这里。 不同的下游模块都能读取这个区域,实现多步推理、规划、甚至自我监控 这不是 chain of thought——那是写在纸上的草稿。 J-space 是脑子里的腹稿,完全静默,完全内部 屏蔽掉这个区域,模型简单对话不受影响,但复杂推理直接归零 但技术细节不是重点。 重点是这件事的产品含义 过去三年,所有大模型公司的竞争逻辑本质上是同一个:堆 scale。 更大的模型、更多的数据、更长的上下文。 这是一条所有人都能看到的路,区别只是谁的卡多 J-space 代表的是另一条路:不是让模型更大,而是理解模型为什么能思考,然后去强化那个结构 这两条路的区别在哪? 堆 scale 是线性投入。你花 10 亿训出来的东西,别人花 15 亿能超过你 理解结构是复利。一旦你搞清楚“思考发生在哪里”,你就能针对性地强化它、扩展它、让它自我迭代。别人不知道往哪使劲,你每一步都踩在点上 这就是为什么顶级人才会在这个时间点做出选择 在 OpenAI,你能做的事情是:用更多算力把同一条路走得更远 在 Google,你能做的事情是:用更好的工程把同一条路走得更快 在 Anthropic,你能做的事情是:走一条别人还没看到的路 对于已经站在行业顶端的人来说,第三种才是真正的稀缺资源。不是算力稀缺,是认知稀缺 而且论文里有个细节很多人没注意到—— 他们提出了一个叫「反事实反思训练」的技术:不直接训练模型的行为,而是训练它“如果被打断,能说出正确的伦理原则”,结果这些原则会自动写入 J-space,间接改善了实际行为 这意味着什么?他们已经不只是在观察这个空间了,他们在学习如何主动塑造它 从“发现结构”到“操控结构”,这是从基础研究到工程化的跨越。而 Fable/Mythos 在多步推理上的表现飞跃,大概率就是这条路的第一批果实 所以回到最初的问题: 这些人不是在赌 Anthropic 会赢,他们是在赌这条路是对的 如果模型的智能真的有一个可以被理解、被强化的内部结构,那掌握这个理解的团队,就拥有了一种别人用钱买不到的优势
显示更多
这几天关于 Anthropic 的一个最新发现讨论度很高。 据 A 社研究表明,他们在 Claude 里找到了一组内部神经模式,叫 J-space。 它像一个很小的内部工作区。某个词相关的模式被点亮时,不代表模型会说出这个词,而是这个概念已经在模型内部被激活了。 更关键的是,Claude 会用它做中间推理。哪怕不把步骤写出来,多步问题里的中间概念也会在 J-space 里亮起来。 把 J-space 去掉后,Claude 还能正常聊天、说话、记简单事实,但高阶认知能力会明显减弱。 但这不等于证明 Claude 有了自我意识。 只是说,这是一个可以观察模型没有说出口的内部状态。 比如它是否私下意识到自己在被测试,是否在生成假数据,或者是否在执行隐藏目标。
显示更多
《用 CPV 模型预测 AI 技术演进》 过去几年,AI 领域几乎每天都有新概念出现。 Prompt Engineering、RAG、Memory、Agent、MCP、J-space、Tool Use、World Model…… 大多数讨论都围绕一个问题展开: 下一个热点是什么? 我更关心另一个问题: 为什么热点会依次出现? 如果一种理论只能解释已经发生的事情,它的价值有限;真正有价值的理论,应该能够预测未来。 CPV(Cognitive Positioning Value)提供的,正是这样一种视角。 它关注的不是某项技术,而是反馈最终作用到了系统的哪一层。 ⸻ AI 的发展,本质上是反馈不断向深层沉淀 CPV 将反馈划分为五个层级: CPV1:行为(Action) CPV2:状态(State) CPV3:模型(Model) CPV4:结构(Structure) CPV5:边界(Boundary) 越往下,反馈改变的对象越深。 AI 技术的发展,几乎就是沿着这五层不断推进。 ⸻ CPV1:改变输出 这一阶段的代表是 Prompt Engineering。 Prompt 改变输入。 模型改变输出。 任务结束,一切恢复原状。 模型没有成长。 它只是完成了一次推理。 后来出现的 Prompt 自动优化、思维链(Chain of Thought)、提示模板,本质上仍然属于这一层。 它们提高了完成任务的能力,却没有改变模型本身。 ⸻ CPV2:改变状态 随后,人们发现一个新的问题: 模型什么都记不住。 于是,Memory 出现了。 长期记忆、用户画像、上下文管理、会话历史…… 反馈终于开始影响模型的运行状态,而不是一轮对话。 模型开始拥有“今天的自己”。 但这里仍然存在明显的局限。 Memory 越来越长。 越来越混乱。 越来越互相矛盾。 于是,新的结构压力出现了。 ⸻ CPV3:改变模型 真正的成长,不应该只是不断累积记忆。 而应该修改世界模型。 例如: 昨天认为用户喜欢苹果。 后来连续半年都选择安卓。 系统不应该同时保存两条冲突的信息,而应该形成新的理解: 用户真正偏好的是开放生态。 这里发生变化的已经不是 Memory,而是模型本身。 未来的 AI 一定会越来越重视: 记忆巩固(Memory Consolidation) 经验抽象(Experience Abstraction) 世界模型更新(World Model Revision) 它们共同指向同一个方向: 反馈开始改变模型,而不是继续堆积数据。 ⸻ CPV4:改变结构 随着模型越来越复杂,另一个瓶颈出现了。 一个网络承担所有能力,越来越低效。 于是开始出现: Planner。 Executor。 Memory。 Vision。 Reflection。 Safety。 它们逐渐成为不同的功能模块。 MoE、Tool Use、Agent、MCP、多智能体协作,都可以看作这一趋势的不同表现。 未来 AI 更像一个组织。 而不是一个越来越大的 Transformer。 反馈开始重组系统结构。 ⸻ CPV5:改变边界 这是最深的一层。 今天,人们谈论 AI,通常想到的是: 一个模型。 未来,AI 的边界会不断扩展。 浏览器。 手机。 电脑。 机器人。 汽车。 摄像头。 传感器。 云端。 其他 Agent。 这些都会成为 AI 系统的一部分。 到那个时候,我们讨论的不再是一个模型,而是一个持续运行的智能系统。 它的边界不断重新定义。 人与 AI 的关系也会随之改变。 ⸻ 为什么 CPV 能预测未来? 因为每一层都会产生新的结构压力。 Prompt 足够成熟之后,系统开始需要记忆。 记忆足够丰富之后,系统开始需要学习。 模型足够复杂之后,系统开始需要重新组织。 结构足够完善之后,系统开始突破自身边界。 技术演进并不是热点随机切换。 而是上一层已经无法继续承载反馈。 新的层级因此诞生。 这是一种复杂系统普遍存在的演化规律。 ⸻ J-space 给了我们一个验证 Anthropic 最近公开的 J-space 研究,让人们第一次能够观察模型内部的工作空间。 很多人关注的是: AI 是否拥有了类似意识的东西。 我关注的是另一件事。 J-space 解释的是: AI 此刻如何思考。 CPV 解释的是: AI 为什么会演化到下一阶段。 两者回答的是不同的问题。 前者研究计算过程。 后者研究反馈如何不断向更深层沉淀。 它们并不冲突。 反而共同构成了一幅更完整的智能演化图景。 ⸻ 一个理论真正的价值 未来几年,还会不断出现新的技术名词。 也许叫 Workspace Editing。 也许叫 Self Evolution。 也许叫 Autonomous Organization。 名字会不断变化。 但如果这些技术仍然停留在同一层反馈,它们只是同一类问题的不同实现。 真正值得关注的,不是名字。 而是它让反馈深入了哪一层。 能够回答这个问题,才能真正理解 AI 为什么会这样发展,以及下一次技术跃迁会发生在哪里。 CPV 的意义,不在于解释某一项 AI 技术。 它试图描述的是: 所有能够持续学习的复杂系统,都遵循着同一种反馈演化规律。 因此,它不仅可以解释 AI,也可以预测 AI。
显示更多
SpaceX 和 BTC,哪个到底了? 美股前段时间的涨势导致人们对加密行情下跌的感知力没那么强烈,回过神来,市场恐慌已经逼近 FTX 崩盘、312 新冠崩j盘、519 中国禁令的同个区间了。两套不同的定价体系也因为美元升值同时回撤。 多头清算还在继续,xai 的承压没有缓解,ipo 私募尚未解锁... 留给普通人的最优解决方案,就是取一部分工资用来在恐慌区间定投,好的投资就是让你睡得着觉的投资。在 Bitget Wallet 搜索代币名称即可随时随地布局全球标的,别等市场修复时才后悔没有子弹。 让我们接住这场伟大的下跌。
显示更多
0
37
35
1
转发到社区
据 CoinDesk 援引知情人士报道,机构级外汇及数字资产交易平台 LMAX Group 正聘请摩根士丹利(Morgan Stanley)和 Stifel 旗下 KBW 评估战略选择,包括整体出售、与 SPAC 合并,以及在美国或欧洲 IPO,潜在估值最高或达 50 亿美元。知情人士称,LMAX 目前更倾向于在纳斯达克上市,但尚不急于推进。公司拒绝置评。2021 年,J.C. Flowers 曾以 3 亿美元收购其 30% 股权,当时估值约为 10 亿美元。
显示更多
《J榜题名3》三个学生妹第一次进夜总会上班,就遇上几个大老板,三个人被老板们轮流抽插,表情享受被干的骚话不止,走之前还射学生妹一脸的精液! #里番# #巨乳# #黄漫# #色漫# #AI短剧# #成人短剧# #学生妹#
显示更多