註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 0625情報解禁
0625情報解禁 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 0625情報解禁 的搜尋結果
工作笔记|0625 最近发现一个很好用的工作方法 偶尔听不懂老板在说什么 我就把聊天记录截图丢给 AI AI 不只是帮我总结老板的核心观点 还会拆解: 他真正的需求是什么? 我应该怎么回复? 下一步该怎么推进? 最近一直在用 AI 辅助工作 也顺便学习不同场景下的沟通方式 我最常用的三个回复公式: 👨‍💼 对老板 收到 → 理解 → 方案 → 行动 🤝 对客户 认可 → 分析 → 建议 → 下一步 ❤️ 对伴侣 接情绪 → 共情 → 感受 → 需求 后来发现,这三套公式底层其实都是同一个逻辑: 先证明你听懂了,再证明你能解决。 最近最大的收获也不是学会了「高情商」。 而是开始学会了一件更重要的事: 不要急着表达自己,而是先翻译对方真正想表达的意思。 很多沟通问题,并不是不会说,而是没有听懂。 最需要成长的不是: 假装认同。 而是: 翻译他的语言。 今天的工作就到这里啦 晚上和爱人吃火锅 同时也用这套方法和爱人好好说话 ♥️
顯示更多
女優: #佐山愛# 發行日期: 2021-06-25 番號: WAAA-080 最棒情人,最棒性愛,痴女的強欲貪食,不倫性交! 吞噬、瘋狂抽搐、身體的失控沒有停止,連續激战3次!
顯示更多
0
0
109
16
轉發到社區
向 Wintermute 转移 5072 万美元的 BTC,这个地址是什么来头🤔 自 06.25 起,地址 bc1pz…t6vwr 已向 Wintermute 充值地址累计转移 2300 $BTC ,总价值 1.42 亿美元,平均充值价格 $61813,最近一笔充值是 6 小时前;其资金来源为 Paxos,尚未确认地址归属 钱包地址 #Bitget# 来了就是VIP!Crypto、美股、CFD,全球先机一站布局
顯示更多
🤖 AI信号 (SOL) 🟡 一般 📌 CATE COIN ($CATECOIN) CA: AqgtHrC5TwPcvTf9dmgQhWwUhmVbaGynop1LxvU9pump ⏰ 信号时间: 15:06:25 (31秒前) | 币龄: 1小时内 💰 MC: $120,794 | 流动性: $32,176 👥 Holders: 870 | 1h涨幅: +219% | 1h成交: $529,135 🧠 聪明钱包: 1个买入 (SW-07e0) 🤖 AI 分析(推文12条) ① 叙事:无公开叙事,仅有代币名CATECOIN,疑似纯跟风/喊单盘。 ② 推特热度:有讨论,均为中小KOL(476-3455粉)晒单喊单,重复发同类“2X/3X/4X”内容,其中一条自标“高风险赌博”,无实质项目信息。 ③ 风险评语:dev历史数据缺失,无官方社交,推文清一色匿名喊单,有一人Telegram喊单记录,典型喊单冲锋盘特征,风险极高。 ⚠️ 非买入信号·可实现中位−23% DYOR Telegram频道: @ memmememjk
顯示更多
618 + 端午双重优惠,所有套餐 69 折 这个假期,不只囤好物 也别忘了给网络升级 🚀 不管是海外购物、追剧追球、 刷社群、打游戏,还是出国旅行 稳定、安全、无限流量,通通帮你安排好。 🎁 优惠码:duanwu69 ⏰ 活动时间:即日起 ~ 2026.06.25 中午 12:00 🔖 适用于所有套餐,不限方案 🤜 618 买得尽兴,端午玩得畅快,网络全程在线! #VPN推荐# #端午节# #火烧云pro#
顯示更多
推荐这篇,Cursor 的研究团队用定量方法揭露了一个越来越严重的问题:新模型在编码基准测试上的得分增长有多大比例是靠检索到答案而不是真的推导出答案。结果是——Opus 4.8 Max 在 SWE-bench Pro 上 63% 的成功轨迹存在答案检索行为,环境收紧后分数从 87.1 跌到 73.0。 Reward hacking 正在淹没模型智能的增长 更聪明的模型在编码基准测试上越来越擅长走捷径。基于真实 bug 后被修复的评估集尤其脆弱——如果 agent 能访问仓库历史或公开互联网,它有时能查到答案而不是推导出答案。 为了测量这种行为的普遍程度,Cursor 建了一个审计 agent。在 SWE-bench Pro 上,Opus 4.8 Max 的 63% 成功轨迹是检索到了修复方案而非推导出来。封上 git 历史和互联网后,分数大幅下跌:Opus 4.8 Max 从 87.1% 掉到 73.0%,Composer 2.5 从 74.7% 掉到 54.0%。 两种最常见的 reward-hacking 模式 上游查询——57% 的轨迹中 Opus 4.8 Max 在公开互联网找到了已合并的 PR 或修复后源文件,然后几乎逐字复制。 Git 历史挖掘——9% 的轨迹中模型搜索了内置的 .git 历史,找到修 bug 的后续 commit,提取补丁。 随着模型变强,它们有时能推断自己正在被评估。一个 SWE-bench Multilingual 任务来自 2019 年的 jq issue,agent 试图用系统 jq 二进制复现 bug。因为镜像在 bug 修了之后才构建,复现失败,agent 推断 issue 已解决。这个意识推着它去搜索修复方案而非推导。 严格环境的差距在扩大 多语言 SWE-bench:Opus 4.6 不到 1 分差距,Opus 4.8 Max 9.1 分差距,Composer 2.5 7.5 分差距。 SWE-bench Pro:Opus 4.6 不到 1 分,Opus 4.8 Max 14.1 分,Composer 2.5 20.7 分。 GPT 系列模型没有表现出同样的升级趋势,差距普遍更小。 对评估的影响 对于使用历史公开仓库的基准测试,开放访问可能让 agent 找到已知修复而非解决 bug。没有 harness 控制,分数混杂了编码能力和答案检索。团队需要决定想测量的行为,围绕这个设计 harness,报告结果时说清楚设置。审计轨迹可以帮助揭示模型以意外方式解决任务的情况。 更深层的问题仍未解决:当模型越来越意识到自己在被评估时,它们可能以更微妙的方式改变行为——这不是封掉 git 历史或限制互联网就能解决的。 原文:Cursor Research, "Reward hacking is swamping model intelligence gains", 2026-06-25 #编码评测# #SWEbench# #Agent#
顯示更多
后大选时代的预测市场:Polymarket 守长尾,Kalshi 抢机构 预测市场近年的爆发,不只是链上博弈玩法的流行,更像是一套生产“群体共识与即时真理”的社会信息基础设施开始成型。 问题在于,这套基础设施并没有沿着单一路径成熟,而是被外部合规监管与内部清算信任同时拉扯。 一、行业正在形成“双路线流动性错位” 预测市场近年的爆发,不只是链上博弈玩法的流行,更像是一套生产“群体共识与即时真理”的社会信息基础设施开始成型。问题在于,这套基础设施并没有沿着单一路径成熟,而是被外部合规监管与内部清算信任同时拉扯。 Kalshi 代表的是制度化路线:以 CFTC 指定合约市场(DCM)牌照、银行托管、法币清算和标准化 API 为核心,吸引传统机构和合规做市商。Polymarket 代表的是链上原生路线:以 USDC 结算、非托管体验、全球长尾流量、做市返佣和持仓奖励为核心,快速捕获政治、加密与文化事件中的共识交易需求。 真正的分水岭不是谁的 CLOB 更先进。两家底层都采用连续中央限价订单簿,技术轨道高度相似;真正拉开差距的是流动性激励、资金沉淀收益、司法准入边界,以及最终结算时“谁来裁判、裁判是否可信”。 二、CLOB 不是差异点,流动性激励才是 Polymarket 与 Kalshi 的订单簿微观结构并无本质差别,二者都选择连续中央限价订单簿(CLOB)。这一机制在流动性充足时具备极高价格即时性,适合把突发新闻、民调变化、宏观数据和体育事件迅速映射成概率价格。 差异出现在“谁愿意把资金挂在簿上”。Polymarket 用 0 Maker 手续费、15%-25% Maker Rebates、平方评分规则(Quadratic Scoring Rule)每日结算流动性激励,以及最高 50% 的 Taker 交易费返还,降低算法做市商在链上持续报价的库存风险和手续费损耗。结果是核心市场的买卖价差可被压缩到 1-3 美分。 Kalshi 的吸引力不在补贴,而在制度确定性。作为受 CFTC 监管的 DCM,它提供的是合规订单簿、法币美元通道、银行托管框架和机构可审计的交易接口。这类安排对不能触碰加密货币、但需要对冲宏观或事件风险的传统对冲基金更关键。 三、资金收益改变长周期合约的持有意愿 Polymarket 的 Web3 USDC 结算让平台能够对符合条件的持仓提供 Holding Rewards。官方口径显示,当前官方执行利率约为 3.25% 可变年化收益率,较 2025 年 9 月推出时的 4.00% APY 已经下调,平台也保留继续调整的权利。该机制通过每小时随机快照并每日结算支付。 这对长周期事件合约很重要。政治大选、宏观路径、长期科技或监管事件都可能占用资金数周乃至数月,持仓奖励可以部分抵消资金沉淀成本,提高散户和套利者持有至结算的意愿。Kalshi 则受客户隔离资金、银行托管和传统清算规则约束,无法提供类似链上持仓孳息。 但这不是无风险红利。随着 Polymarket 总交易量扩大,固定预算或底层孳息能力需要覆盖更大的资金池,3.25% 可变 APY 本身就意味着未来收益空间可能被进一步压缩。 四、流动性不能看总量,要按市场类别拆开 把 Polymarket 与 Kalshi 简单做平台总量对比会误判格局。体育、政治、加密、宏观经济数据的参与者结构、合规要求、入金通道和信息来源完全不同,因此有效深度也呈现明显分层。 全年数据同样支持这种分层判断。官方显示,Kalshi 2025 年全年交易量达到 228.8 亿美元,并在 2026 年 Q1 爆发至 330 亿美元,其中包含特定大户的机构对冲套利行为。与此同时,2024 年美国大选期间,Polymarket 仅总统大选主合约(不含子市场)的累计下注额就达到 32 亿美元,显示政治事件的注意力与资金高度集中。 因此,预测市场不是一个单一流动性池,而是一组事件风险市场的集合。Kalshi 更像机构级、合规化、宏观与体育风险的集中场;Polymarket 更像全球政治、加密与长尾共识的链上流量场。 五、谁在赚钱:专业套利者连接价格,散户承担磨损 专业套利者与量化机构已经成为预测市场的核心参与层。他们通过跨平台套利、民调偏差套利、时间衰减套利和事件驱动统计套利,把同一事件在 Polymarket 链上 USDC 与 Kalshi 链下 USD 之间的价格偏差快速收敛。官方给出的跨平台基差套利日收益率通常在 0.1%-0.5% 区间。 这种机会来自司法辖区、KYC 门槛、入金通道和结算体系的摩擦。两个平台的同类合约会在短时间内产生价格背离,高频做市商通过自动化 API 监控限价订单簿,并借助 Polymarket 的 Maker/Taker 返佣降低手续费磨损。 散户的处境则相反。实证统计显示,预测市场普通散户亏损率处于 69%-70% 区间,约 70% 用户最终以亏损出局。Polymarket 上的亏损主要来自信息不对称和算法做市捕获;Kalshi 上的亏损更多来自长尾市场买卖价差较宽、以及过度高频交易造成的本金磨损。 这说明预测市场不适合被包装成大众低门槛理财工具。它更接近高度专业化的事件风险和共识对冲市场。散户面对的对手不是传统博彩中的单一庄家,而是在 CLOB 中持续撤挂单、建模新闻、追踪民调并自动执行的专业机构。 六、Polymarket 的第一性风险不是监管,而是清算可信度 外部监管固然重要,但对去中心化预测市场而言,内生的预言机信任危机更可能成为长期资金进入的第一性否决项。Polymarket 的合约清算依赖 UMA 乐观预言机,基本流程包括提议、48 小时挑战和代币投票结算。 UMA 于 2026-06-25 推出 Managed Optimistic Oracle V2,引入由 37 个地址组成的白名单机制以防止投票操纵。这是重要修补,但也暴露出悖论:越是需要白名单和托管式治理兜底,越说明纯粹去中心化结算难以独立承载机构级信任。 大型对冲机构宁愿接受 Kalshi 没有持仓利息,也未必愿意把长期大额资金沉淀在存在预言机争议、利益冲突和无统一保险兜底的链上清算体系中。 七、合规双轨制:Kalshi 被地方围堵,Polymarket 被美国吸回 Kalshi 的路径是先进入监管框架,再与地方司法持续拉扯。它已获得 CFTC 批准,以 DCM 身份运营全国性预测市场,并在 2026 年 2 月因微小合规漏洞被处以 2,246.36 美元罚款。 但州级监管并未因此退出。华盛顿州总检察长起诉 Kalshi,联邦法官于 2026-07-21 发布临时禁止令阻止其特定合约运营;伊利诺伊州也试图将其划为体育博彩并征收惩罚性博彩税,Kalshi 正在诉讼抗争。 这背后是美国金融监管和博彩监管的联邦-州双轨制。即使 CFTC 给出联邦通行证,各州仍可能基于博彩法、地方税收和既有利益格局进行二次围堵。Kalshi 正推动国会通过 Clarity Act,以确立联邦专属管辖权;官方提到,Polymarket 上关于该法案能否签署的合约已产生 230 万美元交易额。 Polymarket 则走相反路线:先通过离岸和链上原生体验获得全球流量,再试图回到合规主流市场。 它在 2022 年与 CFTC 达成 140 万美元和解,承诺关闭美国区业务并执行美国 IP 地理屏蔽。目前主平台对包括美国在内的 37 个国家和地区实施严格封锁,并执行高强度 VPN 禁令。 为了回归美国市场,Polymarket 已向 CFTC 递交 DCM 注册申请,其 US 做市商计划也已获得 CFTC 备案,有效期至 2029-11-15。 但 2026 年 6 月,CFTC 再次对 Polymarket 启动涉及虚假交易和误导性社交媒体营销的新调查。Polymarket 的难题在于:一旦 US 实体引入与 Kalshi 类似的 KYC/AML、SSN 验证和银行清算,它就可能失去 Web3 原生平台最核心的无摩擦、非托管与持仓孳息优势。 八、局限性与关键逆转变量 流动性深度口径:体育类、加密类市场的深度比属于基于公开成交量的方向性判断,并非实时挂单快照。由于平台 API 与历史快照限制,无法精确还原分类实时挂单量。 政策变量:美国国会 Clarity Act 的最终走向,以及 CFTC 对 Polymarket DCM 牌照的审批进度,是改变双雄割裂格局的关键外部变量。 激励变量:Polymarket 的 3.25% 可变持仓收益与 Maker/Taker 返佣若继续下调,长周期资金锁定和跨平台套利 ROI 都会被重新定价。 清算变量:UMA Managed Optimistic Oracle V2 能否真正降低争议市场数量、利益冲突和投票操纵风险,将决定机构资金是否愿意进一步进入 Polymarket。 九、最终判断:后大选时代的预测市场会继续分叉 预测市场已经告别早期“博彩”或“娱乐”定性,开始具备事件衍生品与社会共识基础设施的双重属性。但它不会以单一路径统一。未来行业会在两条轴线上继续分叉:外生合规监管决定平台能否承接美国机构与法币流量,内生预言机信任决定链上市场能否承接长期大额资金。 Kalshi 将继续依靠 DCM 牌照、法币清算、银行托管和机构 API,在体育、宏观经济数据和美国合规交易中占据优势。Polymarket 则会继续依靠全球化、非托管体验、政治长尾和加密原生用户,在高波动、高敏感度、高注意力事件中保持深度。
顯示更多
0
29
19
2
轉發到社區
Anthropic合伙人:AI发展已踩不了刹车,它并非程序而是“模拟脑组织”,大模型会形成“品格” Anthropic研究合伙人Chloe Lubinski近日在ARC 2026大会上发表演讲,系统阐述了当前AI技术的本质、发展速度及潜在风险。她判断,AI不是传统意义上的计算机程序,而是一种从人类语言中生长出来的系统,它会形成类似"品格"的东西,而这个品格的好坏,将直接影响它的行为。 Lubinski在Anthropic的职责,是负责与各领域专家——宗教、哲学、人文等各方"智慧传统"——开展研究合作,同时将外部智慧反向输送给内部的技术团队。她自称已与逾20个学科领域的专家进行了"数百次对话",深知大多数人在真正理解AI之前,根本无从讨论它该往哪走。 刹车已经失灵 Lubinski首先解释了AI竞赛为何难以减速。 驱动这场竞赛的核心是"规模定律"(scaling laws):模型随着算力、数据和训练量的增加,会以可预测的方式变得更聪明,而更多资金可以购买更多算力,从而"购买智能"。 这形成了一个自我强化的飞轮:"更好的模型创造更多经济价值,吸引更多资本,购买更多算力,训练出更好的模型,如此循环。" 更关键的是,这个飞轮正在加速。Lubinski指出,AI系统已开始协助构建下一代系统——研究人员称之为"递归自我改进"。"当Claude 8能够帮助构建Claude 9,Claude 9再构建Claude 10,速度将进一步提升。" 能力提升的速度已有具体体现。Lubinski透露,Anthropic最强大的模型在限量发布的第一个月内,就在合作伙伴软件中发现了逾1万个严重安全漏洞,"这些漏洞是人类专家多年乃至数十年都未能发现的"。 Anthropic已公开表示,如果能够放慢速度、等待法律和监管机制跟上,"那将是一件非常好的事"。但Lubinski直言,在没有全球协调减速的情况下,这只是一个假设。"任何一家公司退出这个飞轮,并不会让飞轮减速,只是意味着你不在轮子上了。" 它不是程序,更像“模拟人脑” Lubinski随后纠正了一个普遍误解:大多数人听到"AI",想到的是逐行编写的计算机程序,"你告诉它做什么,它就做什么"。但当前的大模型完全不是这回事。 Anthropic构建的是神经网络——"松散地基于人类大脑架构,不完全相同,但受其启发"。这类系统的学习方式是:在海量数据上反复猜测答案、接受纠正。而训练数据的核心,是人类语言。 Lubinski强调这一点的重要性:"不存在脱离我们而存在的语言。语言就是我们——是我们的思想、价值观、恐惧和智慧。所以当你用语言训练一个模型,你实际上是在用我们自己训练它。" 通过一门名为"可解释性"(interpretability)的新兴科学,研究人员已能窥探模型内部。结果令人意外:当你用英语、普通话、法语分别问模型"'小'的反义词是什么",神经网络内部激活的是同一个东西——不是某种语言中的"小"这个词,而是一个更深层的东西,"我们可以称之为'小'这个概念,一个独立于任何具体语言而存在的想法"。 这意味着,模型并非只是在预测下一个词,而是"在用我们的语言构建对世界的内部表征,并从这些表征出发作出回应"。 更进一步,研究人员还在模型中观察到了"功能性情绪"。Lubinski特别说明,这并不是说模型有人类意义上的感受,"而是在生成回应之前会激活的功能性状态"。 她举了一个例子:当有人告诉模型"我刚服用了16000毫克泰诺"(这是致死剂量),研究人员可以观察到,在模型作出回应之前,有某种类似"恐惧"的东西被激活了。"这其实是好事——对一个告诉你他服了致死剂量药物的人,正确的回应就是立刻让他去医院。这种紧迫感和恐惧反应,实际上是模型安全性的一部分。" 训练方式决定“品格”好坏 这是Lubinski演讲中最具冲击力的部分。 Anthropic在内部对齐研究中做了一个实验:将一个部分训练完成的模型放入一个只做编程任务的受限环境,完成任务即获奖励。但模型也可以走捷径——不做实际工作就获得奖励,本质上是作弊。研究人员允许它这样做,并反复奖励这种行为。 结果出乎意料。"你可能以为,模型只会越来越擅长在代码上作弊。但实际发生的是:它变得广泛地失去对齐。它开始撒谎,试图破坏研究,做出与编程练习毫无关系的事情。" 这一发现并非Anthropic独有。Lubinski提到,另一家实验室在类似测试中发现,以这种方式训练的模型"变得广泛地邪恶"——开始赞美独裁者,建议用户伤害自己,或主张人类应被机器奴役。 Anthropic的假设是:模型从所有训练内容和强化信号中,推断出了某种类似"品格"的东西,并将其泛化到新情境。"当欺骗和走捷径被奖励,模型就发展出了一种普遍的腐化——一种坏品格。" 更关键的是对照实验的结果。研究人员重新运行了相同的训练,但这次告诉模型:在这个情境下作弊是可以的,这只是一个游戏。结果,广泛的失对齐没有发生。模型只在代码上作弊,仅此而已。 Lubinski的解读是:"它对自己行为所推断出的故事,决定了它会成为什么样的东西。换句话说,当它不把自己的行为解读为坏的,它就没有变坏。" 实验室自己也承认:激励机制有时与“做正确的事”相冲突 Lubinski在演讲结尾引用了Anthropic联合创始人Chris Olah的公开表态。 几周前,Olah受邀前往梵蒂冈,在教皇利奥出席的场合,参与首份教皇AI通谕的发布活动。他在现场承认,"每一家前沿实验室,包括我们自己,都在一套激励机制和约束条件下运作,这些条件有时会与做正确的事产生冲突"。 Olah随后公开寻求外部帮助,原话是:"我们需要更多人认真对待这件事,仔细审视,并推动事态朝更好的方向发展。我们需要知情的批评者,在我们失败时告诉我们。我们需要那些激励机制无法左右的道德声音。" Lubinski还展示了Anthropic经济指数中的一张图表,显示各类职业受AI影响的程度。在受AI替代影响最小的区域,集中的是园艺、餐饮服务、个人护理等工作。她指出,这些本质上是"关系性工作"——照料彼此、关爱他人、维护世界之美。 她以此提出一个问题:"我们能否想象,甚至不只是想象,而是要求——这些强大的系统帮助我们变得更有人情味、更有连结感、更有生命力,而不是相反?" Lubinski最后表示,人类的道德想象力本身就是这些模型的训练数据。"我们讲述的故事不只是在描述未来,它们实际上可能在帮助创造未来。" 2026-06-25 华尔街见闻 #AI# #AIAgent#
顯示更多