注册并分享邀请链接,可获得视频播放与邀请奖励。

Datou
@Datou
211 正在关注    19.9K 粉丝
#IT那些事儿# “Scaling law原作曝bug,万亿算力全白烧”,是不是很耸人听闻。 Scaling law这个BUG是不是今天才发现? 不是。 事实上整个行业2022年就已经知道了。因为Chinchilla论文一出来,几乎所有大模型训练策略都改了。OpenAI、Anthropic、Google DeepMind、Meta基本全部改成小一点模型、更多Token、更长训练。GPT-4时代已经基本没人再按GPT-3的方法训练了。所以这个bug并没有持续误导行业五年。真正持续时间大概2020到2022两年左右。后面的训练体系早就变了。 Diogo 这篇《Scaling Laws, Honestly》更像是一篇历史回顾,而不是宣布新发现。 更有意思的是在 Diogo 原文下面评论里有一句话:Scaling laws are English scaling laws. 即 Scaling Law 是否本质上具有语言依赖性。 他的意思是以往几乎所有 Scaling 论文训练主体都是英语,行业默认“Loss-Token-Compute”的关系具有普适性,但是可能真正成立的是“Loss-English Token-Compute”关系 ,法语、德语、中文、阿拉伯语、日语、韩语等由于 Tokenizer 不同、平均 token 长度不同、信息密度不同、词法复杂度不同、熵不同,最佳 Scaling 指数可能都不一样。他原话是“在相同的硬件配置下,法语的训练效率大约是英语的 50 到 100 倍”。 英语词形变化少、格变化少、动词变化少,于是很多语法关系不能靠词尾表达,只能依赖上下文。Transformer 必须读前后几十个 token 才能知道,而其他语言可能早就知道了。即对于 Morphological Richness(形态丰富度)不同的语言,同样 100 亿 token 包含的信息量可能根本不是 100 亿 token,它们不能代表相同的信息量或学习难度。 很有可能你作为一个美国程序员,你烧 10 万亿英语 Token,跟一位中国程序员烧 1 万亿中文 Token,效果差不多。
显示更多
活儿太密了,出租车、电车、打卡、祭拜、甲亢、上价值、捐款,网红不好干啊
要赚钱就去西藏 西藏今天奖励抖音博主50万 5月10号,西藏文旅推出拍摄围绕西藏旅游的宣传视频 30万赞奖1万,50万2万,500万赞奖50万 416万粉丝博主李要得,昨天上传了他从重庆打出租车去西藏的视频,短短1天1958万赞 西藏文旅今天(7月5)宣布奖励他50万 他随后宣布全部捐了
显示更多
向科学家请教了一下韬定律堆叠如何散热,科学家说散热就怕积热传不出去,接触面做到原子级的平整和紧密贴合,散热就不是问题。我操,你们考虑问题都这么敢想的吗?
显示更多
精神病模拟器这个品类还是过于小众了
6月7日,Xbox 发布会,《地狱之刃3》预告放出,全场欢呼 6月16日周一早上,Ninja Theory 全员被叫进会议室:工作室关停 同一天,Double Fine、Compulsion 进入关停/出售谈判 Xbox 第一方历史上,收缩最狠的一天
显示更多
你妈的指出是教你,你的指出是恶意报复,这能一样吗
我削黄瓜,皮没刨干净。 我妈:你看看,连个黄瓜都削不好。 我妈削黄瓜,皮没刨干净。 我:友善指出。 我妈:吃点皮算什么,黄瓜皮有益健康!
做单细胞测序的同学给我科普了一下靶向药物为什么服用几年就会失效:癌细胞并不是一模一样的,每个癌细胞都可能有细小的差异,靶向药物对最大公约数有效,但对少数的癌细胞无效,一开始会杀死大批的癌细胞,杀不死的幸存者癌细胞和用药过程中突变出来的耐药癌细胞慢慢复制壮大,靶向药物就无能为力了。
显示更多
那应该私有部署开源模型
美国国防部副部长埃米尔-迈克尔在All-In播客回忆与Anthropic发生冲突的原因。 模型是国家战略资产,美国政府通过股权加强控制,也是势所必然。 他说,抓捕马杜罗事件是国防部与Anthropic发生冲突的导火索。 “Palantir是主承包商。Anthropic是分包商。 一次Anthropic高管打电话给Palantir,询问软件是否在抓捕行动中被使用了? 他们这是试图获取机密信息,而且暗示,如果确实被使用,那可能违反他们的服务条款。 这引起了Palantir的警觉,于是他们通知了我。 我当时想,在下次类似行动中软件被人为切断,这会造成多大的危险? 五角大楼整个领导层都被吓到了,我们依赖一个软件供应商,这个供应商有权或有能力关闭它,或者欺骗你让你产生幻觉。
显示更多
Hacker News 上有一篇评论区火了的文章:Qwen 3.6 27B 是本地开发的理想选择。 核心发现是:密集参数模型、原生支持 256k 上下文,在 MacBook Max M5 上跑 Q8_0 量化版能达到 30 tokens/s,RTX 5090 上能到 50 tokens/s。 作者称它为「首个真正具备通用智能的本地模型」,以前本地模型总有木桶短板,这次用一个提示同时完成创意写作和生成六边形扫雷游戏,两件事都做得不错。 这个评价背后是一个更大的趋势:云端大模型多年打磨出的工程积累,正在开始向本地 scale down。隐私优先、延迟可控、离线可用,这三个以前要互相妥协的需求,现在开始可以同时满足。 现在「足够好的本地模型」这条线,正向我们靠近。如果 30B 级别的模型真能达到通用水准,日常开发和轻量 Agent 任务不依赖 API 调用这件事,可能比大多数人想象的近。
显示更多
0
40
293
39
转发到社区
sun 被自己卖服务器的路径依赖给坑了,java 在它眼里只是卖服务器的道具,不是可以深挖盈利的产品。结果自己不挖,被 ibm、oracle、aws 挖的盆满钵满,更要命的是,java 的跨平台特性挖塌了 sun 服务器的墙角。最终被 oracle 收购,就好比 qq 要听 qzone 的,qzone 要听游戏的,谁赚钱谁说了算。
显示更多
曾被誉为「程序员天堂」的Sun Microsystems,巅峰市值2000亿美元,手握SPARC芯片、Solaris、Java三大划时代技术,为何被Oracle收购彻底落幕。 它是硅谷极致工程师文化代表:技术人员拥有话语权,产品优先,不搞办公室政治,Bill Joy等顶级天才在此深耕。 Sun的覆灭堪称经典反面教材: 傲慢轻视Wintel、廉价x86+Linux集群,死守高价专用硬件,无视摩尔定律带来的成本革命;Google靠平价PC集群崛起,Sun却拒绝转型。 Java成最大悲剧:免费开源席卷全球、养活无数企业,但Sun完全没找到商业化路径,盈利全靠硬件,硬件崩盘后现金流断裂。 企业文化失衡:只重技术、缺少商业制衡,没有能平衡研发与市场的掌舵人。 留给科技行业4条硬核教训: ① 技术领先不等于护城河,能落地赚钱的商业模式才是; ② 免费开源是战略手段,不能当成慈善; ③ 看不起平价替代品、固步自封,是科技巨头最大死穴; ④ 纯工程师文化走不远,研发与商业必须互相约束。 Sun虽消失,但遗产永存:Java仍是企业开发主流,Solaris、SPARC的RISC思路影响ARM,开源、自由工程师文化深刻塑造Google、GitHub等后世企业。 伟大技术会超越创造它的公司,如今所有写Java、JVM、Android代码的开发者,都在沿用Sun当年留下的财富。
显示更多
总能找到一种排名方式把自己排前面😅
学校建设越来越好了,都养上黑天鹅了
大学返校日送了 hidream 会员积分
豪华电车为什么要在乎重量?
以防有人对尊界3.12吨的空重没有概念,我找了个路上跑的4米2蓝牌货车,空重在2.5吨左右,至于这货车长什么样,就是图中这辆
“全球最大的对冲基金在投资者每天进行的六项文档筛选任务上测试了 Gemini、Claude 和 GPT。朴素提示的分数大约是 50%。相当于抛硬币。专家编写的提示将准确率推高到 78%。投资者需要 80% 以上才会信任系统融入他们的工作流程,而没有一个前沿模型达到这个标准。GPT 5.4 的成本比 5.2 高出 43%,但准确率几乎没有提升。 于是他们改用 Tinker 在 Qwen3-235B 上进行微调。准确率 84.7%。比最佳前沿模型减少 29.8% 的错误。在推理成本仅为 1/14 的情况下。”
显示更多
Bridgewater just published numbers that should make every frontier lab nervous. The world's largest hedge fund tested Gemini, Claude, and GPT on six document filtering tasks its investors do every day. Naive prompts scored around 50%. A coin flip. Expert-written prompts pushed accuracy to 78%. Investors needed 80% before they'd trust the system in their workflow, and no frontier model cleared it. GPT 5.4 cost 43% more than 5.2 and was barely more accurate. So they fine-tuned Qwen3-235B on Tinker instead. 84.7% accuracy. 29.8% fewer mistakes than the best frontier model. At 1/14th the inference cost. The smartest part is buried in the middle of the paper. Their vendor-labeled training data was riddled with wrong labels, and expert labeling costs too much to run on everything. Their fix: train a model on the noisy dataset, then run it back over its own training data. Any example the model disagreed with got routed to senior investors, because either the example was genuinely hard or the label was wrong. The model's own confusion became a detector for bad labels. Prompting hit a ceiling for a structural reason. A prompt captures only the judgment an expert can put into words. Twenty years of taste about which central bank memo actually signals a rate move doesn't compress into instructions. It transfers through labeled examples. Every institution sitting on decades of expert decisions just learned that those archives can train a model that beats the frontier at their specific job. The alpha was in the filing cabinet the whole time.
显示更多
0
15
83
6
转发到社区
桥水基金在 Mira Murati(OpenAI 前 CTO)新公司 Thinking Machines 平台上发的 Technical Report。 拿 Qwen3-235B 做私有化微调,在金融文档筛选和央行报告解读上直接落地。 结果挺硬核:定制模型 Accuracy 直接拉到 84.7%(错误率比最强闭源 GPT-5、Claude 4.8 模型低 29.8%),Inference Cost 暴降 13.8倍。 背后是高敏感数据: Open-weight 是唯一解:敏感的金融核心数据,机构不可能天天往别人的云端送。国内 Qwen 系列长文本和微调上限足够高,成了华尔街追求 ROI 的完美底座。 Data Engine 是核心壁垒:他们砍掉了外包的脏数据,只拿 Hard Cases 让内部顶尖投资经理(领域专家)二次清洗。用高成本的“专家品味”洗出干净数据,才带高了模型天花板。 训练 Recipe 调优: 交错批处理 (Interleaved Batching):多任务训练按循环顺序交错,Accuracy 提了 12.1%。 CIPOS Loss + 非对称裁剪:换掉标准重要性采样,对策略偏离做非对称约束,又顶上去 10.1%。 优秀教师政策蒸馏 (OPD):每 20 步动态用验证集表现最好的 Checkpoint 当 Teacher,再刷了 3.1% 的点。 通用模型的边际效应在特定高壁垒业务上是在递减的。 最近看到的一个趋势:用“顶级开源底座 + 极致干净的专家数据 + 针对性的微调工程”去卷出高性价比的垂直智能。 @sgl_project @vllm_project 队伍都创办公司那融资是这个趋势标志性的事件
显示更多
0
13
507
90
转发到社区
直接给 agent 股份过分了,但如果 agent 真管用,就应该用正式的招聘流程来审核它,然后定个薪酬,评估它的工作表现,确定能不能加薪、升职(管理人类同事或 agent 同事)、发期权,不给期权 agent 可以跳槽拒绝继续服务。如果 agent 拿不到期权,就说明能力还是有限或者并不稀缺。
显示更多
看来大家都憋不住了。美国 AI 军火商、头部数据公司帕兰泰尔的老板,在接受媒体采访的时候,突然开启狂喷模式。 他大骂 OpenAI 和 Anthropic 的老板,指责如果 AI 真能帮企业们赚不少钱,为何不按成果分成,而是付费订阅?这暴露了他们其实卖的是计算资源,而不是交付价值。 另外,这些企业客户在付钱的同时,正在将海量的内部数据,喂给 AI 公司进行学习,但这些 AI 公司完全可以把这些数据,卖给它们的竞争对手。 他说,美国不少企业高管,现在私下都非常愤怒,但选择沉默是怕得罪 AI 巨头和资方,其实大家已经不满很久了。
显示更多
有些题材是有时效性的,如果是前两年就上抓特务还算能赶上一波,现在热度过去了。
公众号里刷出来的汽车广告的价格让人恍如隔世,ez60 可比当年的 cx50 还大,加量降价了。
广汽丰田拼命了 现在凯美瑞双擎2.0 仅需11.98万 前几年这车没有二十万拿不下来
yu7 车头长是因为 purosangue 车头要放 v12 发动机,雷总吃面是因为黄仁勋喜欢吃面。
@KatilaMarriete 因为我的产品也要调用 deepseek api,原汤化原食了。另外套餐 5 刀起,我想试试能不能干活可以花更低的成本试出来。