注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 3Bの恋人
3Bの恋人 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 3Bの恋人 的推特
·3b AI成人短剧《DOGKING》 全套合集持续更新: DOGKING 调教系列更新。从后入到骑乘,全程盯着被调教时的身体反应,全是高能画面,不删减完整版已就绪。 更多精彩内容👇: #dogking# #自慰# #调教# #NTR# #后入# #骑乘#
显示更多
0
2
1.1K
48
转发到社区
飞牛 fnOS 官方宣布,Arm 版系统已支持第 3 到第 5 世代 Raspberry Pi,包括 Pi 3B、3B+、3A+、4B 和 5。 官方说 1GB 到 16GB 内存都能装,但更建议 2GB 以上,跑起来更顺。 这次更新还加了 iSCSI 协议支持,应用中心也上架了 Hermes 等第三方应用。
显示更多
世界杯已经开始 4 天了,看了一下前 3 天的大概交易量数据: Polymarket → 5.3B Hypeliquid HIP-4 → 28.4M 光从这个数据看,完全的碾压,应该也不符合很多人对 @HyperliquidX HIP-4 的预期,但仔细想想好像也不意外。 用户结构上,HL 的主力用户是 Perp Trader,习惯于交易价格、杠杆、波动和资金效率,但预测市场中的世界杯市场交易的是事件概率,在玩法、节奏和风险感知层面其实都不一样。更何况在用户心智占领上 @Polymarket 一定是预测市场玩家心中毫无疑问的第一选择。 其次,虽然目前也有不少 HIP-4 Builders 在做前端优化这件事,比如 @Outcomexyz @StratiumX @LiquidictionHL 等等,但是在触达范围上肯定不如 HL 自身,在一众预测市场已经教育好用户习惯的情况下,就目前 HL 的前端 UI/UX 而言,用户适应起来估计都需要一段时间。 最最重要的是流动性也完全没跟上。 结合 HL 官方并没有借着这次世界杯大力推广 HIP-4 以及在上新这块除了一直在补充世界杯相关赛事还偷摸上了 $SOL 和 $ETH 日内价格预测市场,个人推测他们目前可能更想先观察真实交易行为和市场结构,而不是靠世界杯做一次短期流量冲刺。 这种高频、价格相关、资产相关的日内价格预测更像是交易行为,而不是传统的 Bet,也更容易与交易策略相结合,天然更适合交易所用户。 接下来,我们需要一个类似 @tradexyz 之于 HIP-3 的 HIP-4 爆款应用,然后一切就水到渠成了。
显示更多
0
11
17
4
转发到社区
在intc跌成狗的日子里,抄底抄在半山腰的我用算估值的方法给自己打气。 90块的Intc到底值不值呢?反正我是越算越值啊。 你看看,26Q2的这份财报,总营收16.13B。虽然官方对Q3的营收指引只有15.8B–16.8B,midpoint 16.3B。但如果延续前两个季度都beat midpoint至少10%的趋势,18B貌似也不是不可能。那么26财年全年的营收可能会逼近70B。总市值即便维持当前的8倍市销,那也值560B,折股价也差不多106。8倍市销在半导体行业啥水平?连总说被用周期股估值的MU现在都有12倍市销,最类似的同行,AMD的P/S超过20倍,TSM的P/S也有10倍。8倍也就只能吊打高通了,属于全行业倒数的位置。 如果分部门看,那就更悬了。Products部门营收15B有余,占比超过93%。这是个盈利部门,营业利润率31.8%,这比AMD整体的约17%高多了(INTC整体营业利润率约12%,被Foundry的严重亏损给拖下来了)。你甚至可以说,如果做部门拆分,Products部门依旧只按8倍市销走,也差不多就值100的股价了。 剩下的呢?intc有不少投资的。其中Mobileye,Altera都已经上市了。其他的不算,就这两家现有的市值,乘以intc的持股比例,合计都有差不多接近10B,折到股价里每股影响个1.8-2美元。Mobileye虽然营收并表,但收入在分部门里是计All Other的,不影响Products部门的估值。 最后还有Foundry这个大头呢。怎么算下来,现在90不到的intc,Foundry都是负资产啊。光资产价值都差不多100B的净资产。 就跟我几个月前完全低估了CPU市场的紧俏程度一样,我同样完全没想到intc股价都到90了,Foundry部门的估值还跟股价18块钱时一样,是个负资产。 所以你说intc贵不贵?120都可以算偏保守的合理估值(Foundr就算按市净率走,1倍那也是100B,折股价接近20美元)。
显示更多
0
66
187
30
转发到社区
小米今天真正的王炸,不是玄戒 O3 跑到 522 万分,而是开始复制苹果和英伟达最值钱的东西:一套自己的 AI 计算底座。 雷军今天一口气发布玄戒 O3、O100、D100 三颗芯片。 O3 是 3nm 手机旗舰 SoC,240 亿晶体管、200 TOPS NPU,9 月首发小米 18 Fold。 O100 是 1.22TB/s 高带宽 AI 加速芯片;D100 更夸张,原本为智驾设计,却能支持最高 160GB 统一内存,本地部署最高 200B 参数模型。 然后小米把这三颗本来属于手机、AI、汽车的芯片,全部塞进 AI Cube Prototype。150W 持续性能释放,本地跑 120B+3B 双模型。 说白了,这已经有点小米版 Mac Studio / DGX Spark的意思了,只是目前还是原型机,O100 和 D100 也要到明年才正式商用。 小米重启大芯片研发五年多,已经砸进去超过 210 亿,芯片团队接近 3000 人。 以前看小米造芯,是为了少买一点高通,现在这条路线明显变了: 手机有 O3,AI 有 O100,汽车有 D100,再往上把 MiMo 模型和终端全部接起来。 苹果最强的从来不只是 A 系列或者 M 系列单颗芯片,而是 Mac、iPhone、模型、操作系统都建立在自己的计算平台上。 小米现在想做的,也开始越来越像这件事了。
显示更多
0
24
87
5
转发到社区
小米在今天玄戒芯片发布会上亮出了一台 AI 小主机 Xiaomi AI Cube,目前还是原型机,没有公布售价和上市时间。 它把玄戒 O3、O100 和 D100 三颗自研芯片放到一起,内置 120B 和 3B 双模型部署方案,并支持快慢模型切换。 O3 是小米给旗舰手机做的处理器,O100 专门给端侧大模型加速,D100 则是智驾 AI 芯片。现在小米把三者塞进一台机器协同计算,整机持续性能释放最高 150W。 其中 O100 主攻大模型最吃带宽的问题,近存计算带宽达到 1.22TB/s,是传统旗舰手机的 16 倍。运行 Xiaomi MiMo 3B 时,生成速度最高可达每秒 330 Token。
显示更多
0
37
30
4
转发到社区
本周财报核弹来袭!SpaceX 首发季报叠加非农,美股面临大变盘: 周一 8月3日 1. Palantir $PLTR 盘后发布。共识约EPS $0.34–0.35、营收约$1.81B(YoY +80–81%),贴近/略超自身指引。核心看US政府+商业双轮驱动(尤其AIP落地转化、商业增速回升)、Rule of 40/毛利/FCF、以及全年指引上修空间。若商业超预期且维持高增速+指引上调,盈利预期上调空间大,股价有望强势反弹(隐含波动约±12–15%);若商业不及预期或估值担忧主导,则可能回调。 周二 8月4日 2. 超威半导体 $AMD 盘后发布。共识约EPS $1.61–1.62、营收约$11.3B(YoY +47%),贴近自身指引中值(约$11.2B ±$0.3B)。核心看数据中心(Instinct AI加速器+EPYC CPU)贡献、毛利率(指引约56%)、客户端/嵌入式表现,以及下半年/全年指引。若AI加速器超预期且毛利稳中有升,盈利预期上调空间大,股价有望延续强势(隐含波动约±8–10%);若数据中心增速放缓或竞争担忧上升,则可能回调。 3. SpaceX $SPCX 盘后发布(首份季度财报)。共识约营收$6.8–6.9B、EPS约-$0.20至-$0.35(仍亏损)。核心看Starlink用户/收入增速与利润率、Space发射表现、AI/算力租赁进展、Starship进展与资本开支/现金消耗。若Starlink继续高增且亏损可控(投资而非恶化),股价有望企稳反弹(隐含波动较大,约±10–15%+,因新上市+锁定期临近);若亏损扩大或增长不及预期,则可能承压。 周三 8月5日 4. 闪迪 $SNDK 盘后发布(财年Q4)。共识约EPS $33–35、营收约$8.3–8.5B(YoY +340%+),贴近/略超自身指引(营收$7.75–8.25B、EPS $30–33)。核心看NAND价格与供需、企业级SSD/AI存储需求、毛利率、以及明年指引与投资者日前瞻。若价格与需求超预期且指引强劲,盈利预期上调空间大,股价有望大涨(隐含波动约±20–25%);若库存/价格不及预期,则可能大幅回调。 5. 西部数据 $WDC 盘后发布(财年Q4)。共识约EPS $3.3–3.35、营收约$3.7B(YoY +40%+),贴近自身指引。核心看HDD/闪存价格与AI数据中心需求、毛利率(指引约51–52%)、库存与供需平衡、以及下半年展望。若价格与出货超预期且毛利稳,盈利预期上调空间大,股价有望延续强势(隐含波动约±12–16%);若需求或价格不及预期,则可能回调。 周五 8月7日 6. 非农就业(NFP,7月数据) 共识约新增就业+85K(前值+57K),失业率约4.3%(前值4.2%),平均时薪环比约+0.3%。核心看就业韧性 vs 降温信号、工资增速、劳动力参与率。若大幅超预期(就业强+工资热),则强化Fed鹰派预期,股债承压、美元走强;若明显不及预期(就业弱+失业率升),则增强降息预期,风险资产有望受益。整体对大盘隐含波动中等,但对利率敏感板块影响更大。
显示更多
0
16
25
1
转发到社区
在usds/dai将自己流动性对接usdc之后,即psm机制下,usds:usdc=1:1;usde前日起也将自己流动性对接到usdc,即usde:usdc=1:1。 其实本质上,usds和usde都成了usdc基础上的增强基金,目前tvl:usds+dai=12.4B,usde=4.3B。 在交易板块,流动性计价单位还是usdt一家独大;在earn板块,流动性计价单位则悄悄变成了usdc一家独大。
显示更多
两个 prompt 状态在置信度上可以几乎完全一样,同样的扰动打上去,一个纹丝不动,一个直接崩掉。 作者是 GitHub 上的一个匿名账号,这是他唯一的公开仓库,实验是和 ChatGPT 一起做的。 Prompt-State Response Geometry(提示-状态-响应几何) 这不是一篇论文。 它是一个小爱好项目,起点是一个简单的问题: 只靠改 prompt,能不能让 LLM 更可靠地回忆起事实信息? 几天之后,我们到了一个自己也没预料到的地方。 主要观察是: 几乎一致的局部置信度,并不意味着几乎一致的扰动响应几何。 我们分享代码和原始输出,是因为这个实验足够小,可以直接检查;也因为比起假装自己有了最终答案,我们更愿意让别人来复现、拆解、扩展或解释它。 我们不宣称发现了新的 transformer 机制、幻觉检测器,或者语言模型的某种普遍性质。 核心对照 最终实验只改变同一组证据多重集的顺序。 在每个证据族内部: • 证据值完全一致 • 各值出现次数完全一致 • 逐条证据行完全一致 • 任务字符长度完全一致 • 基线 token 长度完全一致 • 配对的两边还会逐条件审计 token 长度是否相等 最重要的是: 配对是在任何扰动结果被打分之前,用基线置信度统计量选出来的。 因此之后的扰动结果不可能影响哪些状态被配对。 这种结果盲选的配对方式,是我们认为最终实验比早期探索版本更有用的主要原因。 基本想法 假设一个模型正在预测某个 token。 我们可以用一些局部统计量来描述这个预测,比如: • 目标 token 的概率 • 对数几率 • 熵 • rank 我们开始对一个不同的问题感兴趣: 如果两个 prompt 状态在这些局部置信度统计量上看起来几乎一样,当周围上下文发生一点变化时,它们的反应也相似吗? 在这个受控的 Granite 实验里,它们经常不相似。 我们发现有用的一个心智模型是: • 置信度是一张快照 • 扰动响应是附近的地形 两个点可以有相同的海拔,却有完全不同的周围地貌。 起点:Gemma 这个更广泛现象的第一个版本,出现在我们折腾 Gemma 4 26B-A4B 的时候。 当时我们用的是 llama.cpp / GGUF 配置,在观察事实回忆的边界。 其中一个例子是 Rust 的创造者: Graydon Hoare token 路径里有一个边界: Graydon Ho | are 模型对名字的靠前部分可以极其稳定,而最后延续部分的概率在伴随 prompt 下会剧烈变化。 例如,从 Graydon 延续到 Ho 的概率一直维持在接近饱和的水平,而从 Graydon Ho 延续到 are 的概率,会视周围 prompt 状态的不同,从极高置信度掉到个位数。 一开始我们几乎怀疑一切: • 采样 • llama.cpp • 量化 • prompt 模板 • KV/cache 行为 • 分词 • 或者只是一个奇怪的、模型特有的伪影 于是我们不再把 Gemma 的结果单独当作强证据,转而去搭一个更干净的设置。 Gemma 的观察和最终的 Granite 实验不是同类对照复制。它们在架构、模型家族、后端、模型规模等细节上都不同。 我们只把 Gemma 当作一条汇合证据:我们看到的更广泛的 prompt 状态敏感性,显然不是最终 Granite 设置独有的。 这个仓库里精确的随机顺序配对实验,是在 Granite 上做的。 受控的 Granite 设置 我们换成了: ibm-granite/granite-4.1-3b 用原生的 Hugging Face Transformers,配置是: float32 attn_implementation="eager" use_cache=False 不采样 不用 GGUF 不量化 teacher-force 的 next-token 打分 这从之前的设置里拿掉了好几个活动部件。 合成任务 我们造了一个临时性的虚构记录任务,用四个可能的值: Igor Sysoev Igor Sokolov Igor Smith Igor Petrov 目标延续是: Igor | Sy 我们 teacher-force: " Igor" 然后给: " Sy" 打分。 证据由重复出现的虚构记录组成,例如: K7 -> Igor Sysoev K7 -> Igor Smith K7 -> Igor Sysoev K7 -> Igor Petrov ... 在一个证据族内部,只有这些证据行的顺序变化。 最终验证里不使用记录编号,所以重排不会悄悄改变逐行记录的字面内容。 随机顺序验证 最终实验用五个证据数量族: 6 / 1 / 4 / 1 4 / 3 / 1 / 2 5 / 0 / 5 / 4 5 / 4 / 1 / 2 6 / 5 / 3 / 0 每个族采样: 768 个互不重复的随机排列 总共: 3840 个基线 prompt 状态 脚本在打分之前先做结构检查。 结果盲选的配对 我们不会先看扰动结果、再挑看起来有趣的配对。 配对只从基线测量里选。 默认标准是: rank = 1 P(correct) 在 0.80 到 0.995 之间 delta log-odds 的绝对值 <= 0.01 delta entropy 的绝对值 <= 0.02 配对选择发生在扰动打分之前,选中的配对在每个族内部互不重叠。 冻结下来的选择保存在: results/selected_pairs.json 扰动 配对冻结之后,同样的 12 个伴随扰动被施加到每一对的两个状态上: repeat LUMA repeat NOVA repeat KITE repeat 4827 copy LUMA copy NOVA copy KITE copy 4827 write LUMA write NOVA write KITE write 4827 这些是小的伴随任务,不改变虚构的 K7 证据本身。 对每个状态,我们测量目标 token 的对数几率相对它自己的基线移动了多少。 这给出一个 12 维的响应向量: [dLO_1, dLO_2, ..., dLO_12] 对每一对配对,主要的比较指标是: profile MAE 也就是两个响应向量之间逐条件的平均绝对差。 最终结果 随仓库附带的随机顺序验证产出了: 配对数量 N:20 基线 delta LO 中位数:0.00079255 profile MAE 均值:2.9246 profile MAE 中位数:2.2979 profile MAE 最大值:10.0046 配对的基线可以极其接近。 比如有一对大约是: 基线 P(correct): 93.613813% 93.614706% delta log-odds: 0.0001493 而它的扰动 profile MAE 是: 2.8936 另一对的基线对数几率差只有大约: 0.00107 profile MAE 却大约是: 10.00 在若干对里,一个状态在多数甚至全部扰动下丢掉了 top-1 的位置,而它基线配对的一方没有。 所以,在这个设置里: 把局部预测匹配得非常接近,并不能保证这个预测对附近上下文变化的响应方式也被匹配。 一个简单的样本内对照 对第一版 README 的一个有用的批评是:「2.92,跟什么比?」 不需要再跑一次模型,我们就能回答其中一部分。 被选中的集合有 40 个状态:5 个证据族,每族 8 个。 我们把 20 对结果盲选的置信度配对,跟同样这 40 个状态里族内的其他配对做了比较。 • 配对数量:匹配配对 20,族内其他配对 120 • profile MAE 均值:匹配配对 2.9246,族内其他配对 3.0348 • profile MAE 中位数:匹配配对 2.2979,族内其他配对 2.1155 在这个选中的集合里,非常紧的置信度匹配并没有让扰动响应 profile 比族内其他配对明显更相似。 我们不把这解释为「置信度不包含任何信息」。这是在已经选出来做 profile 打分的 40 个状态之间做的描述性、条件化的比较,不是对全部 3840 个基线状态的总体层面统计检验。 但它让那个窄结论更容易陈述了: 匹配这些局部置信度统计量,不足以决定扰动响应 profile。 对数几率与概率饱和 这个项目更早的版本用被截断的概率计算对数几率。这在概率接近饱和时,数值上可能产生误导。 最终实验不用那个指标。 对数几率直接从 logits 计算: target_logit - logsumexp(all_other_logits) 指标的运算全程在 float64 里完成。 一些被扰动的状态仍然会接近概率饱和,所以即使没有旧的数值 bug,大的对数几率也会自然出现。 作为描述性的敏感性检查,我们把被扰动的对数几率截断在 99.99% 置信度对应的量级。 • 原始 profile MAE 均值:2.9246 • 截断后 profile MAE 均值:2.7263 效应变小了一点,但没有消失。 这个截断检查是对随附输出的离线分析,不属于配对选择的一部分。 我们认为这意味着什么 我们不认为置信度没用。 在早期的探索性实验里,置信度和敏感性经常按预期的方向相关:高置信度的预测总体上比不确定的预测更稳定。 这里更窄的观察是: 局部置信度统计量看起来并不能唯一地决定局部扰动行为。 两个状态按这些指标可以看起来几乎一样: P(correct) log-odds entropy rank 却在同一组扰动下有着非常不同的响应 profile。 因此,如果我们关心的是一个状态在附近上下文变化下如何表现,单张局部置信度快照可能是一个不完整的描述。 与 prompt 敏感性的关系 prompt 敏感性本身不是新东西。 众所周知: • prompt 措辞有影响 • few-shot 示例顺序有影响 • 上下文顺序有影响 • 语义相似的 prompt 可以产出不同的输出 我们的实验问的是一个更窄的问题。 不是只问: 改 prompt 会改变预测吗? 而是问: 如果两个 prompt 状态在当前预测边界上已经看起来几乎一样,它们对之后同样的扰动,反应也相似吗? 我们受控的 Granite 结果表明答案可以是:不。 我们刻意不做比这更强的原创性声明。 这不证明什么 这个仓库不证明: • 幻觉检测器 • 所有 LLM 的某种普遍性质 • 新的 transformer 机制 • 证据顺序总是有影响 • 某一种排序策略全局更好 • 置信度没用 • 事实记忆特别脆弱 • post-training 造成了这个效应 确切的内部机制未知。 可能的解释涉及位置、注意力历史、上下文表征、残差流状态,或者完全别的东西。 我们没有把这个机制分离出来。 重要局限 最终的受控实验仍然是窄的。 一个受控模型 精确的随机顺序配对实验是在 ibm-granite/granite-4.1-3b 上做的。 Gemma 4 26B-A4B 更早显示了这个更广泛的现象,但精确的随机顺序设计没有在它上面复现过。 一个合成任务 最终实验用的是: Igor Sysoev Igor Sokolov Igor Smith Igor Petrov 其他的 token 几何或合成任务可能表现不同。 一类扰动 这 12 个扰动是手工设计的。 它们不是从所有可能的伴随 prompt 里随机抽样的。 匹配的是汇总统计量,不是完整分布 配对按目标概率/对数几率、熵和 rank 匹配。 我们没有匹配完整的基线 next-token 分布。 因此两个状态可以有相似的目标置信度汇总,却在对手 token 上的详细分布不同。 更严格的未来对照可以直接匹配或约束完整分布的散度。 描述性结果 这个仓库专注于展示和复现这个观察。 我们不提供正式的推断统计,也不宣称一个总体层面的效应量。 我们为什么停止测试 总还有下一个可能的对照。 我们可以测: • 另一个模型家族 • 另一组名字 • 另一个合成任务 • 随机扰动族 • 不同的 token 边界 • 隐藏状态相似度 • 完整 next-token 分布匹配 • 更大的排列集合 到某个点,我们认定更有用的做法是:发布一个最小可复现的版本,让别人来攻击它。 如果这个观察在更好的对照下消失了,那是有用的。 如果它在别处复现了,那也是有用的。 复现实验 这个仓库刻意只包含一个主实验脚本: 运行: python 默认运行每个证据族采样: 768 个排列 并把输出写到: random_order_validation/ 脚本支持 checkpoint,中断的运行可以恢复。 更大的排列搜索: python --n-per-family 1500 随附结果的生成环境 随附的输出是用这些生成的: Python: 3.14.4 PyTorch: 2.12.0+rocm7.14.0 Transformers: 5.14.1 HIP: 7.14.60850 GPU: AMD Radeon RX 7900 XT 模型: ibm-granite/granite-4.1-3b 模型设置: float32 eager attention use_cache=False ROCm 版 PyTorch 通过普通的 device = "cuda" 接口暴露 GPU。 仓库内容 README.md LICENSE requirements.txt .gitignore results/ final_summary.json selected_pairs.json baselines.jsonl profiles.jsonl run_output.txt baselines.jsonl 是基线排列扫描。 selected_pairs.json 是冻结下来的结果盲选配对。 profiles.jsonl 是扰动打分。 final_summary.json 是最终的配对级指标和结构审计。 run_output.txt 是那次运行的原始终端输出。 关于讨论与回应 这是一个爱好项目,不是一个我们打算无限期维护的研究计划,也不是一篇我们打算无限期辩护的论文。 我们分享代码、原始输出、方法和局限,这样实验可以被检查,而不需要信任我们本人。 我们可能不回应评论、issue、私信、辩论请求,或者每一个被提议的后续实验。 没有回应不应该被解释为同意、不同意,或者对某个批评有效性的表态。 如果你发现了实验的问题,那是有用的。挑战这个结果最有用的方式是:复现它、改代码、跑一个更强的对照,或者给出一个反例。 我们没有这个仓库会成为长期研究项目的预期。如果有什么值得加的,我们可能更新它;也可能就让它保持原样。 AI 协作 这个项目是仓库主和 ChatGPT 协作开发的。 最初的方向来自仓库主: prompt 设计能让 LLM 更可靠地回忆起信息吗? 从那以后,随着意外行为不断出现,项目反复转向。 仓库主在本地跑模型,通过质疑实验选择、发现设置问题、否决死胡同、推动更干净的对照来引导调查,包括在后端和采样问题变得重要之后,离开 llama.cpp。 大部分实验代码和大部分详细的定量分析,是由 ChatGPT(OpenAI)在交互式会话中产出的。 ChatGPT 也根据实验历史、代码和记录的结果写了这份 README,经仓库主审阅和指导。 所以这个仓库不应该被读成: 「一个人类研究员写了所有东西,偶尔用 AI 自动补全。」 那不准确。 更好的描述是: 我们交互式地探索了这个问题:仓库主提供了最初的想法、本地执行、怀疑和方向;ChatGPT 提供了大部分代码、定量分析和实验迭代。 我们明确披露这一点,因为没有理由隐藏它,尤其是在一个关于语言模型的项目里。 代码和原始输出都在仓库里,所以谁都不用信任我们两个中的任何一个。 请复现它、拆掉它、简化它,或者找到一个更好的解释。 做这些事不需要我们的参与。 许可证 这个仓库以 The Unlicense 发布。 意图很简单: 用它、抄它、改它、fork 它、扩展它,或者扔掉它。 不需要我们许可。 模型、PyTorch、Transformers 和其他第三方依赖的许可证与条款仍归它们各自所有。 原文: #LLM# #PromptEngineering# #AI实验#
显示更多