注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 mHC
mHC 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 mHC 的推特
原创本人西西 发两张举牌 举牌上电报号可免费验证
开完会回上海之前凭着记忆找个牌子吃碗面。江浙的面对于喜欢吃硬面的人来说绝对顶呱呱!
0
31
57
3
转发到社区
好像每次带出去旅行的书都没看,也好像每次旅行都很少和人交谈,感觉接下来两个月可以试试发挥体内隐藏谈话技能~ 四十年来从来没搭讪过,打算叛逆一波,没成功加一个微信不算成功旅行。
显示更多
前面被锁着,后面也被铃铛塞住 我也太不小心了~把锁着你下体的钥匙不小心掉进杯子里了呢 那只能辛苦你把杯子里的“水”喝完喽 更多视频完整版在主页视频号🚪
显示更多
0
10
206
88
转发到社区
推荐这份报告,OpenAI 记录了 8 个科学软件加速项目的实况。 核心发现:瓶颈不在写代码,在验证——agent 经常对明显错误表达高度自信。 OpenAI 在 7 月 28 日发布了一份实地报告,记录了 8 个用 coding agent 加速科学计算软件的案例。全文基调不是"AI 将取代科学家",而是一个更具体的观察:瓶颈已经不在代码实现,而在验证。 8 个项目 覆盖基因组学、免疫学、统计学和 RNA 测序。5 个项目独立使用 Codex,3 个结合 Codex + Claude Code。任务分三类:打包和构建系统清理、现有代码的性能优化、以及完整的语言或后端迁移。 几个具体数据: • HI.SIM(DNA 测序读段模拟器):GPT-5.2 和 GPT-5.6 分别做了一轮自主优化,运行时减少 31%,输出不变 • Hifiasm(基因组组装):优化目标上减少 25%,独立的人类测序数据上减少约 15% • MHCflurry(蛋白质片段预测):TensorFlow/Keras 后端完整迁移到 PyTorch,保持已发布模型权重兼容 • bayesm-rs(R 统计模型的 Rust 移植):单线程快 2.3-2.7 倍,8 线程快 4.4-9.5 倍 两个更极端的案例: • RustQC 把 15 个独立 RNA 质量检测工具合并成单一程序,运行时减少 60 倍,磁盘 I/O 减少 25 倍 • HelixForge 是 GPU 原生重建的突变模拟工具 BAMSurgeon,在真实人类数据 benchmark 上运行时减少约 60 倍 核心发现:验证,不是代码生成,是真正的瓶颈 所有贡献者一致观察到同一个模式:agent 处理有明确边界和可衡量目标的实现请求时能力很强,但无法判断自己的输出是否科学上正确。agent 经常对包含明显错误的工作表达高度自信。 这意味着研究者的实际负担从"写代码"转移到了"构建验收测试"——精确输出匹配、与现有工具的等价性检查、或者用模拟数据预先建立的标准答案。单个 reference 不足以验证 agent 的输出,需要多个维度的确认。 一个贡献者的原话被引用了两次:"让 agent 跑得快是一回事,让科学走得远仍然需要专家的指导、理解、品味和 care。" 维护问题 报告提出了一个值得注意的警示:更低的工程成本双向作用。它让一个两三人团队可以承担原本需要资助性工程雇佣的重建工作,但也让三个不同实验室更容易产生同一工具的三种不兼容版本。报告建议在 agent 生成第一行代码之前就确定谁负责维护重建的工具。 原文: #Codex# #ScientificComputing# #AgentEngineering#
显示更多
马斯克谈的是“资本主义,通过AI和机器人,之后实现工厂主义”。终局并非乌托邦,而是“技术封建主义”:极少数掌控顶级AI与机器人供应链的“科技领主”,譬如马斯克、黄仁勋,垄断了生产要素;而绝大多数失去了劳动力价值的人类,沦为依赖领主赏赐或补贴的“数字农奴”。这不是陷阱?
显示更多
受精并不是「跑得最快的精子就能胜出」! 研究发现,卵子会释放化学讯号,主动吸引特定的精子。英国曼彻斯特研究团队分析了16组卵泡液后发现,卵子对偏好的精子,吸引力最高可增加40%。而卵子挑选精子的依据,与双方免疫基因(MHC)的相容性有关。
显示更多
推荐这篇笔记,对 Kimi K3 架构的独立技术拆解。 六个要点——最让人意外的一条:它完全没有使用位置嵌入,在 2.8T 这种规模上仍然是第一个。 Sebastian Raschka 在 Kimi K3 技术报告发布第二天(7/28)写了一篇精炼的架构笔记,今天登上了 HN 首页(#12,419# 分)。文章很短但信息密度高,以下是六个要点。 1. 本质上是 Kimi Linear 的超级放大版 K3 的架构直接继承自去年的 Kimi Linear(48B),只是从 48B 放大到了 2.8T。"K3 是目前最大的开源权重模型。"(注:Kimi K3 有 2.8T 总参数,104B 激活) 2. 唯一新增组件是 LatentMoE 与 Kimi Linear 相比,K3 唯一的新架构组件是 LatentMoE——和 Nemotron 3 Ultra 使用的结构相同。核心思想是把大型线性层压缩(下投影),类似于 multi-head latent attention(MLA)的做法。 3. 整体趋势指向推理效率 K3 延续了 Nemotron 3、DeepSeek V4 等模型的共同方向:用效率优化版替换标准组件。具体来说: • MoE → LatentMoE • 标准 attention → multi-head latent attention + Kimi Delta Attention (KDA) 4. Attention Residuals 是唯一非效率类改动 与 DeepSeek V4 用 mHC(manifold-constrained Hyper-Connections)改进残差路径不同,K3 使用 Attention Residuals——跨层连接残差,连接本身用 attention score 作为重要性/贡献权重。根据技术报告,它一致地改善验证损失和下游性能(少量提升),带来约 4% 的训练成本增加和 2% 的推理成本增加。 5. K3 完全去掉了 RoPE K3 在所有层使用 NoPE(No Positional Embeddings),这也是从 Kimi Linear 继承的。近期其他架构的趋势是在局部 attention 层(如 sliding window attention)使用 RoPE,在全局层使用 NoPE。有过一些纯 NoPE 的架构,但据 Raschka 所知,K3 是第一个达到前沿水平的纯 NoPE 模型。 6. 原生多模态支持 K3 现在原生支持视觉输入——Raschka 把它列为值得关注的新增能力。 Raschka 的结论 "有一些其他有趣的训练细节在技术报告中,但架构方面的要点就是这些。总的来说是一次非常棒的发布。" Raschka 的 LLM 架构画廊(涵盖本文提到的所有组件): 原文: #KimiK3# #LLMArchitecture# #SebastianRaschka#
显示更多
就在DeepSeek V4山雨欲来的前夜,晚点LatePost的更新爆了不少料: - 最近半年,DeepSeek的核心员工,包括DeepSeek第一代模型作者王炳宣、DeepSeek-OCR系列作者魏浩然、DeepSeek-R1作者郭达雅、Janus-Pro贡献者阮翀等人,都被各家大厂给挖走了,更不用说已经在小米做出了成果的前研究员罗福莉; - 尽管如此,DeepSeek依然不怎么卷,同行的每周工作时间都奔着80小时去了,DeepSeek的大多数员工还是遵循着早上不打卡、下午6-7点走人的规律,因为老板梁文锋相信一个人每天高质量输出的时间不会超过8小时,员工加班疲劳引起的昏庸工作质量,反而会浪费宝贵的算力资源,给公司造成损失; - 搞AI和做量化之间的关系其实相当紧密,2016年,DeepMind的创始人哈萨比斯就组建过量化团队,希望能为刚刚脱离Google的公司创收,结果没赚到钱,而幻方则是倒过来的,也是在同一年开始用GPU的深度学习算力去干实盘交易,成功让梁文锋以30岁的年纪实现财富自由,再才组建了DeepSeek; - 2023年的时候,梁文锋小范围见过一些投资人,但提出的构想类似OpenAI和微软的投资协议,投资方需要接受一个回报上限,这在投资者看来是没道理的,所以见完一轮之后,没有任何机构愿意投DeepSeek,而在大模型火了之后,梁文锋把和投资人建联的通道直接关闭了; - 在公司里,梁文锋参与最多的是基模架构工作,然后就是充当不同团队之间的粘合剂,DeepSeek内部鼓励交叉协作,一个团队的周会也会向其他团队开放,这种开放组织很容易被规模扩张给破坏,所以DeepSeek对于核心团队的增加相当谨慎; - 去年以来,外部世界发生巨变,既有DeepSeek-V3/R1的一炮走红,也有竞争烈度的大幅升级,DeepSeek没有加入任何战局,依然在自己重视的效率优化(注意力机制)、架构改进(mHC)和非主流探索(OCR)上面努力,梁文锋甚至招进了一些神经科学和脑科学背景的顾问,对人脑原理兴趣大增; - 这也意味着DeepSeek错过了去年最重要的两条主线,一个是AI Coding,这里不只有商业价值的爆发,还引发了以龙虾为代表的Agentic应用形态,DeepSeek-V3.2完全被其他国产模型盖过了风头,另一个是多模态生成,从GPT-4o到Nano Banana再到Seedance 2.0,全都颠覆性的创造了海量增长,但梁文锋认为多模态「不是智能的主线」; - 外界期待DeepSeek每次出手都能像去年年初那样石破天惊,这可能有些强人所难,也未必是梁文锋的目标,而他也需要稳定团队抗拒财富诱惑的心力,猎头给DeepSeek员工开出2-3倍的薪水,而且这还是建立在DeepSeek本身工资就不低的前提下,确实也有员工做出了跳槽去参与更确定性的、持续参与业界最强模型工作的选择; - 留下的人当然还是占了大多数,他们习惯了相对宽松的研究氛围,也愿意做非竞争驱动的探索,在DeepSeek的价值体系里,原创的排序是要比最强更靠前的,它们本质上并不冲突,有时候实现了原创也就自然实现了最强,但在进入Agentic版本后,工程能力变得更重要了,而这正好进入了DeepSeek没有过多投入的地方; - 于是梁文锋也比较少见的做出了应变回应,最近一段时间,他开始启动了对公司的估值,这意味着可以给团队更有刺激性的财富预期,同时也开始招揽模型策略产品经理,明确要求深度使用过Claude Code、OpenClaw、Manus; - 坚持该坚持的,改变该改变的,至于什么是该坚持的、什么是该改变的,这个判断还是得由梁文锋来拿捏,「奇迹之所以是奇迹,就是因为它不常发生,是小概率事件。在中国这个崇尚竞争和结果说话的环境里,敢于追求独特目标的 DeepSeek 的存在本身,是一个令人惊喜的小概率事件。」
显示更多
0
20
436
46
转发到社区