註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 定性为外部势力借口
定性为外部势力借口 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 定性为外部势力借口 的搜尋結果
【七月一日 反对中共 #赤纳粹# ,从我做起】反对赤纳粹 #民促法# 《中华人民共和国民族团结进步促进法》 是披着“团结”外衣 #高度绑架# 和控制全国人民的 #制造分裂# 的工具,以“团结”之名,行控制 渗透与海外 #长臂管辖# 之实 1 #党国民族三位一体# 法律依据:序言、第2条、第11条“五个认同” 内容:坚持中共领导,认同伟大祖国、中华民族、中华文化、中国共产 觉,中国特色社会主义更想,要求全民“认同”,为后续控制奠定思想基础 2 #定性为外部势力借口# 法律依据:第10条第2款 内容:任何批评家教、人权、民族政策的高论和行为,都可能被定性为“污蔑抹黑”“遏制打压”“渗透破坏”。成为打压异议的万能借口 3 #升级为破坏团结制造分裂# 法律依据:第6条、第8条、第10条第1款 内容:将批评、抗议、记录真相等正常表达,定义为“破坏民族团结、制适民族分裂,上升到违法层面 4 #衔接刑责# 构成犯罪即追刑责 法律依据:第58条、第62条 内容:破坏团结、分裂国家的行为,依法追究刑事责任:组织、策划、实施、煽动或资助者从重处罚 5 #境外组织个人也一并追责# 打击海外异见人士 法律依据:第63条 内容:对境外组织、个人实施上述“破坏团结、制造分裂”行为的,依法追究法律责任,无视国境,威胁海外异见人士与组织 6 #全面扩权形成长期高压机制# 内容:赋予各級政府大量权力:教育渗透、网络监控、文化管控、宗教控制、社会动员⋯形成一张无孔不入的控制网络、代际持续,人人自危
顯示更多
0
15
26
13
轉發到社區
刚看完All-In Podcast最新一期,黄仁勋亲自下场怼AI末日论,中途特朗普还突然打电话进来 黄仁勋直接开怼Dario Amodei的人类灭绝论 这期的重磅嘉宾是英伟达创始人兼CEO黄仁勋,一上来他就针对Dario Amodei此前那篇讨论人类灭绝风险的博客文章,做了一番相当直接的反驳。他强调保持快速创新、确保美国的领先地位,跟安全这两件事根本不冲突,把它们对立起来本身就是个伪命题。针对部分前沿实验室提出的所谓10%人类灭绝风险这类量化指标,黄仁勋直接把这个说法定性为凭空捏造,而且相当不负责任。 他还翻起了旧账,回顾了这几年那些落空的悲观预言,曾经有人预言AI五年内会让放射科医生彻底失业,结果现实是现在需要更多医生,AI只是被用来辅助读片。也有人预言六到十二个月内90%的代码会由AI编写、初级岗位大幅消失,这些说法后来也都被证明是错的。他的判断是,业界所谓的AI失控事件,主要发生在研发端向工程化过渡的这个阶段,本质上是工程管理和验证流程的问题,应该靠沙箱、监控、评估体系这类工程手段去从根源解决,不是拿这些问题去向公众贩卖恐慌。 针对业界热议的递归自我改进(RSI)——也就是AI训练下一个AI这个概念,黄仁勋的解释是,这本质上就是上下文学习、LoRA微调、强化学习加上合成数据生成这几种工程手段的组合,是提升生产力的正常逻辑,跟外界想象的那种指数级失控走向毁灭完全是两回事,企业发布模型之前必须经过严格的基准测试、评估和防退化验证,这套流程本身就已经脱离了失控这个想象的现实基础。 特朗普突然打电话进来了 访谈中途,特朗普直接给黄仁勋打了电话,通过免提跟现场观众和主播聊了起来。他直言所谓AI毁灭论就是一场骗局,说所谓机器人将接管世界完全是谎言,很多政治势力和外部竞争对手其实是想借这套说法来阻碍美国的科技发展。他还把数据中心比作未来20到25年的石油,认为这场变革的规模比当年的互联网革命还要宏大,不仅带动了大量就业,还让很多本来濒临衰退的社区重新焕发了活力。他总结的一句话挺直接,谁赢得AI,谁就赢得一切,如果美国自己放慢脚步、阻碍数据中心建设,只会白白便宜了竞争对手,所以必须全力以赴打赢这场AI竞赛。 开源vs闭源:黄仁勋用瓶装水和自来水做了个比喻 黄仁勋把闭源模型比作瓶装水,开箱即用、体验极致。把开源模型比作自来水是不可或缺的基础设施,能满足主权AI、数据隐私以及各种特定业务定制的需求。他给出了一个挺有说服力的数据:过去六个月流入AI原生初创公司的4000亿美元风险投资里,有80%其实是依赖开源模型的,这说明开源在实际产业落地里的分量比很多人想象的要重得多。 关于英伟达自己在整个生态里的定位,他也讲得比较坦诚。很多下游厂商担心英伟达凭借算力和资金优势去侵蚀应用层,他的回应是英伟达的策略是能做多深就做多深,但业务层尽量往下靠,也就是通过研发底层框架(比如cuDNN、Megatron)来给整个行业铺路,扶持所有的前沿实验室、模型厂商和新型云厂商,让整个生态能够百花齐放,不是自己去抢下游的生意。 针对一些需要极高专业门槛、普通车企或药企根本没法独立承担研发成本的垂直领域,英伟达也在打造专属的基座模型。比如具备推理能力的自动驾驶模型Alpamo,以及用于蛋白质分子研究的ESM/Proteina Complexa,这些模型正在被用来赋能礼来、默克这类药企以及各大车企。 全球芯片竞争与超智能的定义 黄仁勋判断中国在本土先进制程光刻技术上,预计会在2030年左右取得突破。他认为中国的强项在于极致的大规模量产能力和高密度的工程技术人才,美国不能指望靠限制对手或者自己放慢脚步来应对,唯一的办法就是超速狂奔,靠自己跑得更快来保持领先。 他还给出了自己对AGI和超智能这两个概念的定义,按照具备常人同等智力水平这个标准,他认为行业实际上已经跨过了AGI这道门槛。而在一些特定垂直领域,超智能其实已经实现了,比如自动驾驶领域的事故率已经降到人类的十分之一,蛋白质结构预测和高通量虚拟筛选这类领域,AI的能力也早就超过了人类顶尖科学家的水平。
顯示更多
0
33
158
21
轉發到社區
👂传阿里全面禁用Claude,员工被要求卸载Claude Code等Anthropic产品 据 @BeatingOfficial 监测,阿里巴巴今日内部通知,将全面停止使用Anthropic相关产品,要求员工卸载Claude Sonnet、Claude Opus、Claude Code等模型与Agent工具,禁令预计于7月10日正式生效。 自今年初起,阿里一直鼓励员工使用AI,不仅提供内部模型免费额度,还报销Claude、GPT、Gemini等外部模型费用,不少研发人员长期将 Claude Code、OpenAI Codex与阿里自研Qoder混合使用。此次禁令意味着Claude将退出阿里内部研发工具链。 此次调整与Anthropic近期持续收紧中国用户风控有关。今年6月,Anthropic曾向美国参议院提交材料,指控阿里通过大量账号与Claude进行高频交互,并将其定性为「工业级模型蒸馏攻击」。随后,双方关系持续趋于紧张,大量中国用户账号也在近期遭遇封禁。
顯示更多
0
21
14
1
轉發到社區
【民進黨當局稱台商投資大陸要慎重 國台辦回應】9月9日,國務院台辦舉行例行新聞發布會。有記者問,近日,民進黨當局宣稱,2025年台商對大陸投資較前一年下降59%,2026年上半年下降30%,大陸經濟發展陷入困境,台商在大陸投資要慎重。請問對此有何評論? 發言人陳斌華答問表示,兩岸經濟聯繫緊密,共同利益基礎紮實,兩岸產業鏈、供應鏈穩定強韌。今年以來,我們有力應對地緣政治衝突,經貿摩擦等外部環境變化,延續了總體平穩、向新向優的發展態勢,經濟展現出蓬勃活力和強大韌性,為世界經濟注入強勁動力和難能寶貴的確定性,也為加強兩岸經濟合作,深化融合發展不斷提供新機遇,開拓新空間。大陸始終是廣大台商台企投資興業的最佳選擇,創新發展的深厚沃土,抵禦風險的強大依靠,民進黨當局的抹黑、唱衰已經並將繼續被證明是徒勞無功的。
顯示更多
后大选时代的预测市场:Polymarket 守长尾,Kalshi 抢机构 预测市场近年的爆发,不只是链上博弈玩法的流行,更像是一套生产“群体共识与即时真理”的社会信息基础设施开始成型。 问题在于,这套基础设施并没有沿着单一路径成熟,而是被外部合规监管与内部清算信任同时拉扯。 一、行业正在形成“双路线流动性错位” 预测市场近年的爆发,不只是链上博弈玩法的流行,更像是一套生产“群体共识与即时真理”的社会信息基础设施开始成型。问题在于,这套基础设施并没有沿着单一路径成熟,而是被外部合规监管与内部清算信任同时拉扯。 Kalshi 代表的是制度化路线:以 CFTC 指定合约市场(DCM)牌照、银行托管、法币清算和标准化 API 为核心,吸引传统机构和合规做市商。Polymarket 代表的是链上原生路线:以 USDC 结算、非托管体验、全球长尾流量、做市返佣和持仓奖励为核心,快速捕获政治、加密与文化事件中的共识交易需求。 真正的分水岭不是谁的 CLOB 更先进。两家底层都采用连续中央限价订单簿,技术轨道高度相似;真正拉开差距的是流动性激励、资金沉淀收益、司法准入边界,以及最终结算时“谁来裁判、裁判是否可信”。 二、CLOB 不是差异点,流动性激励才是 Polymarket 与 Kalshi 的订单簿微观结构并无本质差别,二者都选择连续中央限价订单簿(CLOB)。这一机制在流动性充足时具备极高价格即时性,适合把突发新闻、民调变化、宏观数据和体育事件迅速映射成概率价格。 差异出现在“谁愿意把资金挂在簿上”。Polymarket 用 0 Maker 手续费、15%-25% Maker Rebates、平方评分规则(Quadratic Scoring Rule)每日结算流动性激励,以及最高 50% 的 Taker 交易费返还,降低算法做市商在链上持续报价的库存风险和手续费损耗。结果是核心市场的买卖价差可被压缩到 1-3 美分。 Kalshi 的吸引力不在补贴,而在制度确定性。作为受 CFTC 监管的 DCM,它提供的是合规订单簿、法币美元通道、银行托管框架和机构可审计的交易接口。这类安排对不能触碰加密货币、但需要对冲宏观或事件风险的传统对冲基金更关键。 三、资金收益改变长周期合约的持有意愿 Polymarket 的 Web3 USDC 结算让平台能够对符合条件的持仓提供 Holding Rewards。官方口径显示,当前官方执行利率约为 3.25% 可变年化收益率,较 2025 年 9 月推出时的 4.00% APY 已经下调,平台也保留继续调整的权利。该机制通过每小时随机快照并每日结算支付。 这对长周期事件合约很重要。政治大选、宏观路径、长期科技或监管事件都可能占用资金数周乃至数月,持仓奖励可以部分抵消资金沉淀成本,提高散户和套利者持有至结算的意愿。Kalshi 则受客户隔离资金、银行托管和传统清算规则约束,无法提供类似链上持仓孳息。 但这不是无风险红利。随着 Polymarket 总交易量扩大,固定预算或底层孳息能力需要覆盖更大的资金池,3.25% 可变 APY 本身就意味着未来收益空间可能被进一步压缩。 四、流动性不能看总量,要按市场类别拆开 把 Polymarket 与 Kalshi 简单做平台总量对比会误判格局。体育、政治、加密、宏观经济数据的参与者结构、合规要求、入金通道和信息来源完全不同,因此有效深度也呈现明显分层。 全年数据同样支持这种分层判断。官方显示,Kalshi 2025 年全年交易量达到 228.8 亿美元,并在 2026 年 Q1 爆发至 330 亿美元,其中包含特定大户的机构对冲套利行为。与此同时,2024 年美国大选期间,Polymarket 仅总统大选主合约(不含子市场)的累计下注额就达到 32 亿美元,显示政治事件的注意力与资金高度集中。 因此,预测市场不是一个单一流动性池,而是一组事件风险市场的集合。Kalshi 更像机构级、合规化、宏观与体育风险的集中场;Polymarket 更像全球政治、加密与长尾共识的链上流量场。 五、谁在赚钱:专业套利者连接价格,散户承担磨损 专业套利者与量化机构已经成为预测市场的核心参与层。他们通过跨平台套利、民调偏差套利、时间衰减套利和事件驱动统计套利,把同一事件在 Polymarket 链上 USDC 与 Kalshi 链下 USD 之间的价格偏差快速收敛。官方给出的跨平台基差套利日收益率通常在 0.1%-0.5% 区间。 这种机会来自司法辖区、KYC 门槛、入金通道和结算体系的摩擦。两个平台的同类合约会在短时间内产生价格背离,高频做市商通过自动化 API 监控限价订单簿,并借助 Polymarket 的 Maker/Taker 返佣降低手续费磨损。 散户的处境则相反。实证统计显示,预测市场普通散户亏损率处于 69%-70% 区间,约 70% 用户最终以亏损出局。Polymarket 上的亏损主要来自信息不对称和算法做市捕获;Kalshi 上的亏损更多来自长尾市场买卖价差较宽、以及过度高频交易造成的本金磨损。 这说明预测市场不适合被包装成大众低门槛理财工具。它更接近高度专业化的事件风险和共识对冲市场。散户面对的对手不是传统博彩中的单一庄家,而是在 CLOB 中持续撤挂单、建模新闻、追踪民调并自动执行的专业机构。 六、Polymarket 的第一性风险不是监管,而是清算可信度 外部监管固然重要,但对去中心化预测市场而言,内生的预言机信任危机更可能成为长期资金进入的第一性否决项。Polymarket 的合约清算依赖 UMA 乐观预言机,基本流程包括提议、48 小时挑战和代币投票结算。 UMA 于 2026-06-25 推出 Managed Optimistic Oracle V2,引入由 37 个地址组成的白名单机制以防止投票操纵。这是重要修补,但也暴露出悖论:越是需要白名单和托管式治理兜底,越说明纯粹去中心化结算难以独立承载机构级信任。 大型对冲机构宁愿接受 Kalshi 没有持仓利息,也未必愿意把长期大额资金沉淀在存在预言机争议、利益冲突和无统一保险兜底的链上清算体系中。 七、合规双轨制:Kalshi 被地方围堵,Polymarket 被美国吸回 Kalshi 的路径是先进入监管框架,再与地方司法持续拉扯。它已获得 CFTC 批准,以 DCM 身份运营全国性预测市场,并在 2026 年 2 月因微小合规漏洞被处以 2,246.36 美元罚款。 但州级监管并未因此退出。华盛顿州总检察长起诉 Kalshi,联邦法官于 2026-07-21 发布临时禁止令阻止其特定合约运营;伊利诺伊州也试图将其划为体育博彩并征收惩罚性博彩税,Kalshi 正在诉讼抗争。 这背后是美国金融监管和博彩监管的联邦-州双轨制。即使 CFTC 给出联邦通行证,各州仍可能基于博彩法、地方税收和既有利益格局进行二次围堵。Kalshi 正推动国会通过 Clarity Act,以确立联邦专属管辖权;官方提到,Polymarket 上关于该法案能否签署的合约已产生 230 万美元交易额。 Polymarket 则走相反路线:先通过离岸和链上原生体验获得全球流量,再试图回到合规主流市场。 它在 2022 年与 CFTC 达成 140 万美元和解,承诺关闭美国区业务并执行美国 IP 地理屏蔽。目前主平台对包括美国在内的 37 个国家和地区实施严格封锁,并执行高强度 VPN 禁令。 为了回归美国市场,Polymarket 已向 CFTC 递交 DCM 注册申请,其 US 做市商计划也已获得 CFTC 备案,有效期至 2029-11-15。 但 2026 年 6 月,CFTC 再次对 Polymarket 启动涉及虚假交易和误导性社交媒体营销的新调查。Polymarket 的难题在于:一旦 US 实体引入与 Kalshi 类似的 KYC/AML、SSN 验证和银行清算,它就可能失去 Web3 原生平台最核心的无摩擦、非托管与持仓孳息优势。 八、局限性与关键逆转变量 流动性深度口径:体育类、加密类市场的深度比属于基于公开成交量的方向性判断,并非实时挂单快照。由于平台 API 与历史快照限制,无法精确还原分类实时挂单量。 政策变量:美国国会 Clarity Act 的最终走向,以及 CFTC 对 Polymarket DCM 牌照的审批进度,是改变双雄割裂格局的关键外部变量。 激励变量:Polymarket 的 3.25% 可变持仓收益与 Maker/Taker 返佣若继续下调,长周期资金锁定和跨平台套利 ROI 都会被重新定价。 清算变量:UMA Managed Optimistic Oracle V2 能否真正降低争议市场数量、利益冲突和投票操纵风险,将决定机构资金是否愿意进一步进入 Polymarket。 九、最终判断:后大选时代的预测市场会继续分叉 预测市场已经告别早期“博彩”或“娱乐”定性,开始具备事件衍生品与社会共识基础设施的双重属性。但它不会以单一路径统一。未来行业会在两条轴线上继续分叉:外生合规监管决定平台能否承接美国机构与法币流量,内生预言机信任决定链上市场能否承接长期大额资金。 Kalshi 将继续依靠 DCM 牌照、法币清算、银行托管和机构 API,在体育、宏观经济数据和美国合规交易中占据优势。Polymarket 则会继续依靠全球化、非托管体验、政治长尾和加密原生用户,在高波动、高敏感度、高注意力事件中保持深度。
顯示更多
0
29
19
2
轉發到社區
【中國按下“緩衝鍵”,展現大國戰略遠見】美國《紐約時報》前專欄作家馬克斯·費舍爾近日發布的一段名為“中國悄悄拯救了世界”國際能源觀察視頻,在海外社交平台引發廣泛共鳴。畫面裡,他攤開一張全球油輪航線圖說:“最讓人意外的不是誰在搶油,而是誰在放慢腳步。”這條視頻播放量突破600萬,2萬多條留言裡不少網友用“清醒”“穩妥”來形容中國的應對。 作為全球能源運輸的咽喉要道,霍爾木茲海峽近來通航形勢持續緊張,推高了國際原油的風險溢價。按照過往市場邏輯,地緣衝突引發供給擔憂時,主要消費國往往會加急採購、囤積庫存,而供需缺口的放大會進一步拉動油價上漲,通過能源成本向全球通脹傳導。本輪中東局勢升級後,市場對能源價格反彈衝擊全球經濟復甦的擔憂持續升溫,“搶油潮”的預期一度瀰漫在大宗商品交易市場。 但是,中國市場給出了不一樣的答案。國內煉化企業順勢調整生產節奏,靈活有序放緩了高價原油的新增採購,從需求端平緩了進口增速。中國以一種極為克制的方式,為緊張的全球供需按下了“緩衝鍵”。《華爾街日報》撰文指出,中國減少石油進口的舉動,為承壓的世界經濟提供了重要支撐;法國《費加羅報》說,這是中國自2008年國際金融危機以來,第二次為全球經濟穩定發揮關鍵作用。 長久以來,全球應對石油危機的思路主要圍繞供給端展開,大型消費國大多只能被動承受價格波動。但這次的實踐表明,超大規模消費市場同樣可以通過產能調節、庫存調度發揮緩衝作用,成為維繫市場均衡的重要力量。路透社認為,本輪中東局勢升級以來,中國原油採購量的縮減,在相當程度上抵消了中東供給波動帶來的衝擊;《金融時報》也評論稱,中國正成為影響全球石油市場平衡的關鍵變量。 中國為何能反其道而行之,走出一條不同的軌跡?這份底氣來自於中國的戰略遠見。 前些年國際油價處於低位周期時,中國穩步推進商業庫存體系建設,逐步積累起厚實的家底。本輪油價上漲過程中,國內市場暫停了常規的商業庫存增持節奏,以前期積累的存量替代部分高價進口,既保障了國內煉化的基本運行需求,也避免了在國際市場高位搶貨進一步加劇供需緊張。手裡有糧、心中不慌,充足的儲備正是中國能夠靈活調節進口節奏的直接支撐。 經過持續深耕,中國已形成順暢高效的商業庫存周轉體系,原油進口來源持續向巴西、非洲等國家和地區拓展,不斷降低對單一運輸航道的依賴。更重要的是,市場化的煉化運行機制日益成熟,企業能夠敏銳捕捉價格與風險信號,靈活調整採購與生產計劃。這種多元、彈性的能源供給體系,讓中國在面對地緣局勢擾動時,擁有了更多騰挪空間。 站在更長遠的視角看,真正重塑能源邏輯的,是一場正在向縱深推進的綠色轉型。國際能源署的數據顯示,今年二季度,僅電動汽車一項,中國日均替代的原油量就達150萬桶,遠超市場此前的普遍預期。中國新能源的快速發展,不僅重塑著自身的能源格局,也在悄然改變著全球能源市場運行的底層邏輯。 從過去國際能源價格波動的被動接受者,到如今全球市場平衡的主動穩定者。變化背後,是中國能源發展一以貫之的穩健邏輯——把自己的能源飯碗端穩端牢,以自身發展的確定性應對外部環境的不確定性,這本身就是對全球市場穩定最實在、最持久的貢獻。
顯示更多
同一批基准里,本地跑的 DeepSeek V4 Flash 加上 J-Space 控制层之后,在大多数任务上压过了不加控制层的 V4 Pro。 《DeepSeek V4 × J-Space 能力释放报告》 DeepSeek V4 × J-Space:Benchmark 与工程观察记录 © 2026 Tiger3807861189,本记录采用 CC BY-ND 4.0(署名-禁止演绎)许可。 页面范围:本记录整理外部项目已经公开的工程观察、J-Space 使用的操作性术语、项目级 Benchmark 分数及其适用边界。它不是研究论文,非学术性质,不提供模型内部机制证明、形式化判定方法、消融设计或因果贡献分解。 J-Space Cognition Suite V3.6 是一套在推理阶段运行的模型无关控制系统,不修改模型权重。项目地址: 一、外部工程观察 1.1 Anchored Standard:首轮接口锚定 dsh-anchored-standard( DeepSeek Harness 的首轮接口条件。其基础方案在第一次模型请求中恢复 Minimal 的真实双工具 Schema,抑制自动注入内容;会话产生持久事件后,再开放一个较小的常驻工具目录,并按需解锁其他工具。 该项目的公开实验表明,首轮工具 Schema、输出预算和自动注入内容都可能改变首条推理轨迹。它也明确区分了"轨迹被锚定"和"任务能力已经稳定提升":当前仓库中的通用组合与早期高分运行并不完全相同,小样本独立复现尚不足以确定稳定的能力增益幅度。因此,本记录只引用其接口敏感性与路径保持观察,不把单项分数推广为普遍结论。 1.2 Routing Suite:任务感知的入口选择 dsh-routing-suite( 与工具面装配,把新会话送入不同的行为带。其公开材料报告了稳定区域和不稳定过渡区域,并据此避免把连续数值旋钮误当成可连续调节的推理深度。 该项目后来对早期"官方刻意设计双吸引子""自路由绝对不可能"等强归因作出了公开勘误( mixed 表示不稳定的过渡或竞争区域,不等于一种兼具短、长思维优点的可用中间态。 二、思维链二极管 2.1 操作性定义 本记录所称思维链二极管(chain-of-thought diode),是一个面向黑盒行为的工程术语:在同一个会话中,连续思维链会稳定落入以下两种形态之一: • 短思维直觉:较快形成判断并进入行动,推理块较短; • 长思维推理:先展开较长的分析、重估与规划,再决定是否行动。 两种形态在同一会话中不能稳定、按任务阶段自然地共同出现;首轮形成路径承诺后,后续思维链通常延续同一侧。外部实验中偶尔出现的词汇混合或不稳定过渡,不构成能够同时利用两侧优势的中间态。 这一术语描述的是会话级轨迹,而不是某一句话或某一个词。We need、Let me 等表达最多只能作为外部探针,不能单独证明模型能力、推理质量或内部状态。 2.2 形成原因:极简接口过拟合假说 J-Space 采用的工程诊断是:DeepSeek 的 Agent 后训练行为可能与 DSH 极简模式的接口分布形成了过强耦合。极简 persona、首轮工具 Schema、自动注入边界和输出条件共同构成接口指纹;当实际 Harness 接近这一分布时,一类轨迹更容易被唤起,接口发生变化时则可能落入另一类轨迹。 这里的"过拟合"是对黑盒条件敏感性的工程概括,不表示已经获得 DeepSeek 的训练数据、隐藏状态或官方内部解释。现有公开证据支持"接口条件与轨迹变化相关",但不足以从外部还原完整训练机制。 2.3 两侧的结构性弊端 • 短思维直觉:过早接受第一个流畅解释;复杂约束整合不足;跳过必要中间桥接;工具证据利用不足;局部测试成功后过早宣布完成。 • 长思维推理:分析惯性和行动延迟;反复推翻或重建已有判断;工具调用过晚;Token 与时间消耗增加;长程状态漂移;信息已经充分仍难以收束。 因此,二极管带来的主要工程问题不是某一侧必然更差,而是会话无法随任务阶段稳定调整推理形态:需要桥接时可能过快,需要行动时又可能持续推演。 三、三套方案的浅层关系 • Anchored Standard:作用于首次模型请求的接口条件。恢复已知的 Minimal 接口指纹,尽量让会话从入口进入并保持一条稳定轨迹。 • Routing Suite:作用于新会话开始前的任务分类与模式选择。根据任务选择较适合的稳定行为带,并回避不稳定过渡区域。 • J-Space:作用于会话进入轨迹后的完整任务生命周期。不宣称消除二极管,而是通过状态、行动、验证与恢复机制缓解会话落入任一侧后的结构性弊端。 三者可以被理解为入口恢复、入口选择和持续任务控制三个不同层面。这是一种便于工程使用的关系整理,不表示三套方案已经在统一 Harness 下完成组合实验,也不构成效果排名。 3.1 J-Space 对两侧弊端的浅层处理 当会话偏向短思维直觉时,J-Space 使用 bridge-before-conclusion、共享约束广播、Empirics、verifier 与 coverage,要求快速判断在交付前补足必要桥接、证据和验证范围。 当会话偏向长思维推理时,J-Space 使用功能性第一人称、明确的 Next、有限候选、差分测试与 checkpoint,把已经形成的判断绑定到行动、取证或收束,减少无新增约束的反复推演。 对于两种形态,Goal / Core / Verified / Open / Next 账本、工具接缝刷新与恢复机制负责维持跨文件、跨工具和长时间任务状态。这些机制调节外部任务过程,并不等同于让模型在同一会话中自由切换两种底层思维链。 四、Benchmark 记录 4.1 评测上下文 J-Space 在 DeepSeek 上的项目评测参照官方 Harness 极简模式。J-Space 通过工作空间路由、状态连续性、验证与恢复参与推理时流程。 结果形成于项目现有的评测环境。硬件条件、进程隔离、工具可用性与信息访问边界共同构成评测上下文;可访问资料及执行轨迹也可能影响观测结果。 以下汇总上述条件下的项目级 Benchmark 记录。其他模型的数据保留各厂商公开评测时的原有上下文,不同环境与 Harness 配置下出现分数变化属于正常现象。各 Benchmark 使用自身原生分数,数值越高越好;"—" 表示没有报告结果。 4.2 分数记录 顺序固定为:V4-Flash-0731 裸跑、V4-Flash-0731 + J-Space、V4-Pro-0813 裸跑、V4-Pro-0813 + J-Space、GLM-5.3、Kimi-K3、Opus-4.8、Fable 5(带 fallback)。 • HLE(无工具):37.8、45.5、42.7、48.0、未报告、43.5、49.8、53.3(全场最高) • HLE(有工具):51.5、60.6、60.0、67.7(全场最高)、62.5、56.0、57.9、63.0 • Terminal Bench 2.1:82.7、87.1、87.9、90.1(全场最高)、88.2、88.3、85.0、88.0 • NL2Repo:54.2、70.2、61.5、73.4(全场最高)、58.0、58.0、69.7、未报告 • CyberGym:76.7、81.7、83.3、86.8(全场最高)、84.5、80.0、78.3、83.1 • DeepSWE:54.4、67.4、62.7、72.0(全场最高)、66.9、67.5、58.0、70.0 • Toolathlon-Verified:70.3、77.7、74.1、79.5(全场最高)、73.0、76.5、76.2、77.9 • Agents' Last Exam:25.2、30.1、25.7、30.3(全场最高)、28.5、27.6、25.7、23.8 • AutomationBench(Public):25.1、31.7、31.8、38.2、48.2(全场最高)、30.8、27.2、29.1 4.3 Benchmark 与二极管弊端的定性对应 • HLE(无工具):短侧可能过早下结论,长侧可能在知识边界之外无效延伸;J-Space 对应必要桥接、置信控制与独立复核。 • HLE(有工具)、CyberGym:短侧可能少用或少整合证据,长侧可能迟迟不进入工具取证;对应 Empirics、工具接缝与验证覆盖。 • Terminal Bench:短侧可能快速执行但遗漏核验,长侧可能分析过度、行动延迟;对应明确的 Next、诊断重试与 checkpoint。 • NL2Repo、DeepSWE:短侧可能丢失跨文件约束,长侧可能反复重建计划;对应共享广播、Loop 账本与持续验证。 • Toolathlon-Verified:短侧可能跳过编排检查,长侧可能困在工具选择和重新规划;对应共享状态、接缝审计与 coverage。 • Agents' Last Exam、AutomationBench:异构任务或长间隔会放大固定路径与任务阶段的错配;对应选择性 pass、持久状态与恢复。 上述对应关系是工程解释,不是从分数反推出内部状态的证明。当前 Benchmark 记录没有逐次标注会话所处的二极管状态,因此不能据此计算二极管对分数的贡献比例,也不能把全部分数变化归因于单一机制。 4.4 数据来源 • DeepSeek V4-Flash-0731 模型卡: • 智谱 AI( GLM-5.3 发布评测记录 • Kimi-K3 模型卡: • Claude Fable 5 与 Claude Mythos 5 System Card: • J-Space Cognition Suite V3.6 README: 五、适用边界 • 思维链二极管和极简接口过拟合属于黑盒工程诊断,不是 DeepSeek 官方披露的模型结构或训练事故。 • 词汇、首行风格和思维链长度只能作为轨迹探针,不能替代任务完成、工具行动、验证覆盖和得分。 • Anchored Standard、Routing Suite 与 J-Space 的关系是作用层面的整理,尚未经过统一组合实验验证。 • 当前分数是项目记录,不足以建立跨模型普遍性,也不支持精确的因果贡献分解。 • J-Space 不创造基础模型缺少的知识,也不保证对所有任务、模型或 Harness 产生正向变化。 引用:工程使用请引用 J-Space Cognition Suite V3.6( 原文: #DeepSeek# #J-Space# #本地AI#
顯示更多
中共被定性为邪恶政党,#习近平# 被定性为残暴独裁者。
美国参议院全票通过:中共被定性为“犯罪组织” 2026年6月16日,美国参议院一致同意全票通过S. R es.444号决议由共和黨議員里克·斯科特提出。 决议将中国共产党定性为“对全球稳定与和平构成严重威胁的犯罪组织”,强烈谴责习欺骗世界破坏和平安全并策划危害人类罪行。内容涵盖侵犯人权、压迫新疆和西藏
顯示更多
一名联邦法官周四晚间裁定,特朗普政府将Anthropic列入黑名单并定性为供应链风险的举动构成“非法报复”,侵犯了该公司的第一修正案权利。
顯示更多