註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 gen1
gen1 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 gen1 的搜尋結果
一个 windows 非常诡异的设备替换问题,clone 的 gen1 网络 OK,gen 2 直接设备无了……愚蠢的头条 L4 让 AI 自己搞,搞出来就是不管怎么 clone mac 都一样,你问他这合理吗,他憋了半天屁都放不出一个,毕竟代码在哪都不知道 ……哎最后还得古法看了半天设备 PCI 找到根因做验证……
顯示更多
基于未来是视频时代不是文本时代, 先说结论:闪迪和海力士研究的HBF会成为未来AI领域主导的存储方案。 1.闪迪的 Optimus HBF Gen1分析; 单堆栈容量: 起步 512GB(未来可达数 TB),是当前 HBM 容量的 10 倍以上。 带宽水平: 目标带宽超过 1.6 TB/s,虽然延迟略高于 HBM,但读速度已极度接近。 物理结构: 采用 16 层以上的高速 NAND 堆叠,支持通过 TSV(穿硅通孔)技术直接与 GPU/NPU 互联。 成本优势:HBF 的单位成本仅为 HBM 的几分之一。 2. 视频 AI 场景下的优劣分析; HBM 的优势:实时生成与扩散模型的“加速器” 优势: 视频 AI(如 Sora、Runway、SeenDance 2)在生成每一帧时,需要进行海量的矩阵运算和参数读取。HBM 的低延迟确保了显存与 GPU 核心之间的数据交换没有“毫秒级”卡顿。 劣势: 容量焦虑。目前顶级 HBM(如 H200)也就 141GB,这导致长视频生成或 4K 高质量视频训练时,显存经常爆掉(OOM),必须通过昂贵的集群来拆分任务。 HBF 的优势:打破“视频素材墙”的“大水管” 优势: 视频数据极其庞大。HBF 允许 AI 模型直接在存储层进行“近内存计算”。 超长视频生成: 当 HBM 装不下权重模型时,HBF 充当“二级显存”,其高带宽保证了模型参数加载到 GPU 的过程不需要像普通 SSD 那样等待。 视频特征检索(RAG): 在处理海量视频素材库时,HBF 能以超高速扫描 TB 级数据,寻找匹配的素材特征,这是传统存储无法想象的。 劣势: 虽然带宽上去了,但 寻址延迟 依然高于 HBM。对于需要极高实时性反馈的 AI 交互场景,HBF 会有微小的滞后。 3. 视频 AI 场景下的“成本帐” 假设你要搭建一个能够实时生成 10 分钟 4K 视频的 AI 工作站: 全 HBM 方案: 你需要部署多块 H200/B200 显卡,仅显存成本可能就超过 5 万美元,且依然可能因为显存容量限制(141GB 封顶)无法处理超长上下文。 HBM + HBF 混合方案: 你只需要少量 HBM 负责核心运算,配合 4TB 的 HBF 存储 作为“大显存池”。总成本可能降至 1.5 万美元 左右,且能处理比前者多出 30 倍 的视频素材量。 根据以上我们可以很直观的判断出, 未来AI存储发展方向至少会演化成少量的HBM负责核心计算,搭配海量的HBF存储芯片。 那么现阶段谁最先掌握了的HBF全栈技术, 谁就能在接下来的视频AI浪潮中获取海量的利润! 毫无疑问现在西部数据wdc的彻底退出, 相当于给闪迪的估值模型松绑, 是闪迪真正走向堪比英伟达一样巨头的起点。
顯示更多
存储需求恐怕又要因为seedance2的出现指数级暴增. gpt3.5带来了文本时代,真正的视频时代,是seedance2带来的. 同样是几个提示词,视频ai消耗的存储将达到几百m,随着ai视频制作时长的增加这个体积还会更大. 这次衍生的存储需求会是原来文本的很多倍. 毕竟现在刷视频成瘾的群体是真多, 全球范围内从婴幼儿到老头老太太谁都逃不过,他们可能不爱看书不爱看新闻但绝对爱刷短视频. 基于此,又会产生新的投资需求. 视频ai需要的存储类型跟文本ai肯定有差异. gemini给出的现阶段抖音与yputobe采用的存储架构实录. 目前的视频存储并非单一介质,而是复杂的多级冷热分层架构 (Tiered Storage Architecture)。 A. 架构组成 1. 极热层 (Ultra-Hot Tier):用于应对瞬时爆发的流量(如顶流网红刚发布的视频)。 • 类型:NVMe SSD 集群 + 内存级缓存(Redis/Memcached)。 • 核心指标:**IOPS(每秒输入输出操作数)**和极低的延迟。 2. 热/温层 (Warm Tier):用于存放日常活跃观看的视频。 • 类型:高性能企业级机械硬盘 (HDD) 或大容量 QLC SSD。 • 核心指标:吞吐量 (Throughput) 与成本的平衡。 3. 冷层 (Cold/Archive Tier):用于存放数年前、几乎无人问津的长尾视频。 • 类型:高密度氦气硬盘 (HDD) 甚至物理隔离的磁带机。 • 核心指标:每 TB 持有成本 (TCO)。 B. 痛点:I/O 墙与存储孤岛 传统架构下,存储是“静态”的。但 AI 视频时代(SeenDance 2)要求存储从“仓库”变成“流水线”,这直接导致了存储逻辑的崩溃。 根据以上视频公司存储的现状与困境可以延伸出其三个未来发展方向. 视频 AI 存储的三个未来发展方向 1.方向一:从 HDD 到全闪存化 (All-Flash Data Center) AI 视频训练需要并行读取海量高清素材。传统 HDD 的寻道时间太慢,会拖累昂贵的 GPU 算力。全闪存阵列 (AFA) 将从“奢侈品”变成视频公司的“基础设施”。 2.方向二:CXL 技术下的“内存-存储”融合 Compute Express Link (CXL) 协议将打破内存和 SSD 的界限。对于 SeenDance 2 这种需要处理实时动作对齐的模型,数据在 SSD 和 HBM 之间的搬运速度决定了生成的流畅度。 3.方向三:近存计算 (Computational Storage) 与其把巨大的视频数据搬到 CPU 处理,不如直接在存储主控芯片上进行初步的数据预处理(如视频抽帧、格式转换). 基于以上及图片参数对存储公司作核心竞争力与趋势分析排序评级. SK海力士(S级): 凭借 Solidigm 的 QLC 容量优势和 HBM 的统治地位,卡死了“大容量读取”和“算力吞吐”两个核心环节。视频 AI 训练集的 EB 级存储首选。 三星Samsung (A+级): 读写最均衡。其 PCIe 5.0 写入速度冠绝群雄,是 SeenDance 2 生成 4K/8K 视频流时最佳的“高速缓冲区”。 闪迪SanDisk (A级): 独立后的黑马。其 HBF(高带宽闪存) 旨在打破内存墙,让 SSD 直接参与 AI 推理,极大利好 64G 内存(如你的 M4 Pro)在本地处理大模型视频生成。 美光Micron (A级): 写入寿命与能效比极高,适合 24/7 不间断生成视频的云工厂。 • WDC (B+级): 专注于 CXL 协议,解决数据中心内内存与存储的动态调配问题。
顯示更多
0
24
174
35
轉發到社區
Marvell Bravera SC6 Marvell $MRVL 於 2026 年 8 月 4 日 FMS 2026 發表 AI 記憶體基礎架構新品,核心為 Bravera SC6(MV-SF1410)PCIe Gen6 SSD 控制器。 核心亮點: - 專為 AI 推論優化,讓更多 KV Cache 從昂貴 HBM 轉移至 SSD,提升基礎架構效率、降低寫入放大並延長 NAND 壽命。 - 效能為上一代 Bravera SC5(PCIe Gen5)的 2 倍。 支援 PCIe Gen6(向下相容 Gen1–5)、NVMe 2.2,單埠四通道。 - 採用 NAND-agnostic 架構,相容多家廠商 SLC/MLC/TLC/QLC,方便超大規模雲端與 OEM 彈性採購部署。 - 預計 2026 年第四季開始送樣。 同時發表 Structera X(機架級 CXL 記憶體擴充與池化)與 Photonic Fabric(Pod 級光學共享記憶體,跨機架最高 50 公尺、支援最高 32TB 暖 KV Cache 卸載,聲稱可提升 2–3 倍 token 吞吐量)。 整體目標是讓記憶體更獨立於運算擴展,減少 GPU 停滯、提高利用率與 token 效率,協助超大規模業者因應大型模型與長上下文需求。
顯示更多
高通(Qualcomm)正强势进军AI数据中心,已与Meta达成多代Dragonfly C1000 CPU供应协议,并为另外两家未具名hyperscaler提供定制芯片,目标2029财年数据中心收入达150亿美元。 其核心技术HBC(High Bandwidth Compute)是亮点:采用近内存3D堆叠架构,将计算核心与LPDDR内存垂直融合,大幅缩短数据移动距离。相比传统HBM,HBC实现带宽/瓦特提升约6倍、容量/瓦特提升约200倍,同时显著降低功耗和总拥有成本(TCO),特别适合大规模AI推理和智能体AI场景。 HBM在峰值原始带宽上仍有优势,适合高强度训练负载;但HBC在实际AI工作负载中提供更低延迟、更高有效带宽和更好能效,尤其在电力和预算受限的hyperscale环境中更具吸引力。HBC并非全面取代HBM,而是成为高效补充方案——2027年中Gen1商用,2028年Gen2进一步提升,已获Meta等客户认可。 高通的优势在于能效+成本+定制化:利用成熟手机供应链降低成本,通过co-design和开放生态快速适配客户需求。这帮助高通从手机芯片巨头转型为数据中心重要玩家,在NVIDIA主导的市场中开辟差异化路径。 未来,HBC能否大规模分流HBM,取决于交付执行和软件生态成熟度。但在AI基础设施追求可持续性的今天,这种“省电即王道”的方案,已成为 hyperscalers 多元化供应链的热门选择。 但这种架构一旦被证明有效,行业复制速度可能会非常快。HBC不像CUDA,没有网络效应;不像x86,没有ISA锁定;也不像Windows,没有应用生态锁定。更大的可能是,Near-Memory Computing逐渐成为整个行业的新方向,而不是Qualcomm一家独占的技术。 因此,HBC本身更像是一张帮助Qualcomm切入AI推理市场的差异化王牌,而不是足以形成十年以上垄断优势的护城河。真正决定其长期竞争力的,不是单独的Near-Memory Compute模块,而是能否将HBC、LPDDR、Compiler、Runtime、软件生态以及完整的数据中心平台整合成一个系统级解决方案。如果这种整体体验能够持续领先,那么Qualcomm建立的将不是某一项硬件技术的优势,而是一整套AI推理架构的新范式。 免责声明:本人持有推文题及资产,观点充满偏见,非投资建议dyor
顯示更多
懒猫算力舱 X5 终于上线了,2070T 最强推理算力,128GB 超大显存,英伟达芯片,还配备 100GB 光口 和万兆网口,所有配置拉满 超帅超强,比 GB10 性能还强一倍,可以通过光口和 vllm 无限组网跑本地大模型,可以当独立电脑用 详细配置参数如下,预售 200 台已卖光,想要进一步了解软件性能的评论区打 1 懒猫 AI 算力舱(LazyCat AI Pod)详细硬件参数 1. 产品概述 紧凑型 AI 计算设备,面向硬核开发者 搭载 NVIDIA Jetson GPU,支持 CUDA 生态 统一内存架构,可本地部署大规模 AI 模型(如 DeepSeek-V4-Flash 284B) 预装 Ubuntu,支持本地 AI 部署,可作为私有 AI 超算替代云服务 从开箱到运行 AI 模型约 5 分钟 支持多机联网扩展算力 2. CPU 架构:Arm® Neoverse®-V3AE 64-bit X5-T4000**:12 核心,最高频率 2.6 GHz,每核心 1 MB L2 缓存,16 MB 共享系统 L3 缓存 X5-T5000**:14 核心,最高频率 2.6 GHz,每核心 1 MB L2 缓存,16 MB 共享系统 L3 缓存 3. GPU / AI 算力 架构:NVIDIA Blackwell X5-T4000(NVIDIA Jetson T4000)**: 1536 核心 第 5 代 Tensor Core MIG:6 TPC 最高频率 1.53 GHz AI 性能:1200T X5-T5000(NVIDIA Jetson T5000)**: 2560 核心 第 5 代 Tensor Core MIG:10 TPC 最高频率 1.57 GHz AI 性能:2070T 完整支持 CUDA 生态;非 CUDA 芯片实际 AI 性能约降低 50% 4. 内存 类型:LPDDR5X,256-bit 带宽:273 GB/s X5-T4000**:64 GB X5-T5000**:128 GB(可支持 DeepSeek-V4-Flash 284B 大模型:总参数 284B / 激活参数 13B,适合文生图、文生视频等任务;支持 vLLM 及多机联网扩展) 5. 存储 系统存储(嵌入式):64 GB eMMC 5.1(主要针对 X5-T5000 提及) 模型存储:最高 32 TB(通过最多 2 个 M.2 接口) 支持 PCIe NVMe 和 USB 3.2 SSD 6. 网络与接口 有线网络 X5-T4000**:1 × QSFP28 光口(最高 75 Gbps,3 × 25GbE)+ 1 × 10GbE RJ45 口(支持网络唤醒) X5-T5000**:1 × QSFP28 光口(最高 100 Gbps,4 × 25GbE)+ 1 × 10GbE RJ45 口(支持网络唤醒) 无线 Wi-Fi:海华 WIFI6 XB560NF 无线网卡,双贴片天线 蓝牙:5.4 其他端口 1 × Type-C 3.2 Gen2(10 Gbps) 2 × USB 3.2 Gen1(5 Gbps) 1 × HDMI 2.1(支持 8K 输出) 1 × DC 电源口(5.5×2.5 mm) 7. 电源与功耗 模块功耗: X5-T4000:40W ~ 70W X5-T5000:40W 130W(针对 AI 推理优化,远低于消费级 GPU 的 350W 450W) 电源适配器:氮化镓宽电压适配器,输入 100V ~ 240V,输出 12V/8A,频率 50/60 Hz,支持 UPS 不间断供电 8. 外观与物理规格 尺寸:144 × 130 × 61 mm(长 × 宽 × 高) 重量:2.3 kg 外壳:金属机身 颜色版本: 太空白(喷砂烤漆工艺) 星辰灰(阳极氧化工艺) 9. 散热 直吹液压静音风扇 10 mm 大风量风扇 静音 FDB 轴承 转速 3500 ± 10% RPM 配备定制静音转速算法,12V 供电 10. 软件与系统支持 操作系统:预装 Ubuntu(含 CUDA 加速驱动和 AI 开发环境) 支持框架:Ollama、vLLM、Shimmy 等 常见应用:Jupyter Notebook(一键安装 CUDA 支持)、ComfyUI(文生图)、AI 语音识别/合成、DeepSeek OCR、文档/PDF 翻译等 支持内网穿透,手机远程访问 100% 本地部署,数据物理隔离,无需上传云端 可独立作为 Ubuntu AI 电脑使用(接键鼠显示器),也可多机联网扩展
顯示更多
0
30
11
0
轉發到社區
机器人“大脑”正在成为 private market 的新定价对象。 据 Business Insider 报道,Generalist AI @GeneralistAI 正在洽谈新一轮融资,估值约 30 亿美元。就在上个月,它刚完成 4 亿美元融资,估值约 20 亿美元。 Generalist AI 并不是在制造某一种机器人本体。 它做的是 embodied foundation models,也就是让不同机器人理解并操作真实物理世界的通用 AI 模型。 公司的 GEN-1 模型目标是适配不同机器人手、工具和物理任务。Generalist 表示,其训练数据已经覆盖超过 50 万小时真实世界交互数据。
顯示更多
FEL:马斯克重新定义 EUV并开启太空芯片制造 马斯克最近一句“FEL FTW”,让 Free-Electron Laser(自由电子激光器,FEL)重新进入半导体行业视野。 市场很容易把这件事理解成“马斯克要造自己的 ASML”,但这可能并不是最准确的框架。 FEL 首先不是一种全新的光刻原理,而是一种新的 EUV 光源。如果这条路线最终进入 Terafab,它真正挑战的可能不是整台 ASML EUV scanner,而是过去二十多年 EUV 产业形成的一个基本架构:每台 scanner 配备自己的 LPP 光源。 FEL 更激进的可能性,是把 EUV 光源从 machine-level component 变成 fab-level infrastructure。 1、从锡滴到电子束 今天 ASML EUV 的核心波长是 13.5 nm。产生这种光的方法非常复杂:高功率激光每秒数万次击中高速飞行的微小锡滴,把锡瞬间变成高温等离子体,再从等离子体辐射中收集 13.5 nm EUV。这就是 LPP,Laser Produced Plasma。这里有巨大的工程问题:锡滴变成超高温 plasma然后才能产生 EUV。 但过程中必须处理:锡碎屑、collector污染、hydrogen plasma、镜面寿命、清洁、热负荷…… 这本身就是 ASML/Cymer 二十多年积累起来的一座巨大技术壁垒。ASML甚至长期与大学研究团队合作解决氢等离子体环境、锡清洁和组件寿命问题。 FEL 完全不同。电子枪产生电子束,加速器把电子加速到接近光速,再让电子穿过周期性磁场组成的 undulator。电子不断摆动并逐渐形成 microbunching,最终产生高度相干的电磁辐射。通过设计电子能量和 undulator,可以直接产生 13.5 nm EUV。 所以两条路线解决的是同一个问题:怎样大量、稳定地产生 13.5 nm 光子。LPP 的答案是“激光+锡等离子体”;FEL 的答案是“相对论电子束+加速器”并以此绕过锡等离子体的巨大工程技术壁垒,并还能增加EUV photon throughput。 2、FEL 最大的赌注是功率 EUV 光源功率直接影响曝光速度、光刻胶剂量和 scanner throughput。LPP 已经从早期几瓦一路发展到数百瓦,并正在向千瓦级推进。但继续提高功率越来越困难。更多激光能量意味着更极端的锡等离子体、更大的 collector 热负荷、更严重的污染和更复杂的系统可靠性问题。 FEL 的长期诱惑在于数千瓦甚至 10 kW 级 EUV。公开的 FEL-EUV 研究已经讨论过这种量级。这里必须区分“理论/工程设计目标”和“半导体量产能力”:今天并不存在一台 10 kW FEL 在先进晶圆厂里稳定量产芯片。但如果这种光源最终实现,它提供的就不只是“比 LPP 多一点光”,而可能是一个数量级不同的技术路线。 FEL 的优势也不仅是功率。它可以提供高度相干、窄频谱、可控偏振的辐射,没有 LPP 那套锡滴、锡碎屑和等离子体污染问题。某些偏振模式甚至可能改善极小尺寸图形的成像对比度和 process window。换句话说,FEL 不只是更大的灯泡,而可能是一台更强、更干净、更可控的 EUV photon engine。 代价也非常明显:它把“锡滴地狱”换成了“粒子加速器地狱”。 电子枪、RF、加速腔、磁铁、undulator、超高真空、beam control、energy recovery、冷却和控制系统,每一项都可以成为新的工程瓶颈。今天 LPP 最大的优势不是物理原理漂亮,而是已经经过数十亿小时级别的产业学习和大规模晶圆生产验证。FEL 最大的问题也不是能不能产生 EUV——答案早已是能——而是能不能把一个粒子加速器变成 semiconductor-grade manufacturing infrastructure。 3、Terafab 改变了 FEL 的经济学 如果目标是制造一台设备卖给 TSMC,FEL 的体积和复杂度是巨大劣势。但如果目标从“造一台光刻机”变成“从零设计一座超大型 AI 晶圆厂”,问题就完全不同。 传统架构大致是: Scanner A + LPP A Scanner B + LPP B Scanner C + LPP C Scanner D + LPP D FEL 更激进的架构可能是: 10 kW Central FEL → EUV Beam Distribution → Scanner A / B / C / D / E…… 这意味着不再试图把一个粒子加速器塞进光刻机,而是直接把整个晶圆厂建在粒子加速器周围。FEL 从一台机器的 component,变成整个 fab 的 utility,类似电力、超纯水和中央气体供应系统。 这可能正是 Terafab 与 FEL 结合最有想象力的地方。巨大的 accelerator 不再是单台 scanner 必须承担的固定成本,而可以由十台甚至更多 scanner 分摊。一套价值数亿美元甚至更高的 FEL,如果能够稳定向大量 scanner 提供数千瓦 EUV,其单位曝光成本可能完全不同。 4、长期看,FEL 甚至比传统光刻机更适合成为“太空半导体工厂” FEL 本身具有几个天然适合太空的特征。首先是高真空。电子束和 EUV 本来就需要真空环境,太空至少在外部环境上与这套系统高度兼容。其次是规模。地面建设一公里级 accelerator 意味着土地、建筑、隧道、地基和振动隔离;轨道大型结构如果未来能够低成本模块化部署,“很长”本身未必是最致命的问题。第三是机械环境。太空不存在传统地震和地面振动, 因此轨道 FEL 比轨道先进晶圆厂更容易想象。当低成本重型运输、机器人自主建设维修和高度自主 AI fab 同时成熟以后,“Orbital FEL Terafab”更可能从科幻式工程概念变成真正可以计算 ROI 的工业方案。 5、RSI 是 FEL 最值得关注的变量 这可能是整件事情最重要、也可能是最终让马斯克下定决心的因素。 AI 对成熟 LPP 和 FEL 都有帮助,但边际价值可能非常不同。LPP 已经经历二十多年极端工程优化。剩余问题越来越集中于 collector 寿命、热负荷、锡污染、材料耐久性、光刻胶和精密制造。这些问题 AI 可以帮助优化,但越来越受到现实材料和制造能力限制。 FEL 仍然拥有巨大的未搜索设计空间。Electron gun、beam energy、emittance、RF phase、bunch compression、magnetic optics、undulator geometry、energy recovery、beam distribution 和反馈控制形成一个极其复杂的高维系统,而且其中相当大一部分可以通过 Maxwell equations、particle dynamics 和 accelerator physics 在计算机里模拟。 这恰好是科研 AI 最容易产生巨大杠杆的领域。 过去是工程师提出一个方案,跑 simulation,修改参数,制造 prototype,再测试。未来可能是 AI 生成十万种 architecture,用 surrogate model 初筛,再通过高精度 physics simulation 搜索 Pareto frontier,最后只制造最有希望的几十种设计。 AI 的价值还不仅在设计。FEL 最大的工业问题之一是稳定性:RF phase、beam energy、magnet current、temperature 和 beam position 的微小漂移都可能最终变成 wafer 上的 CD variation。FEL 本质上也是一个巨大的实时高维控制系统,而这正是 advanced AI control 最可能发挥作用的地方。 能力不断增强的ai,会让FEL开发建设循环变成: AI 设计 FEL Gen 1 → 制造 → 自动采集 beam/wafer 数据 → AI 找到 simulation-to-reality gap → 修改 accelerator、undulator 和 control → FEL Gen 2 → 更多数据 → FEL Gen 3。 这也解释了为什么 FEL 在 RSI 时代可能比过去任何时候都值得重新评估。没有 AI,挑战拥有二十多年工业学习曲线的 LPP 是一个极其困难的命题。有了越来越强的科研 AI,FEL 大量尚未解决的问题恰恰属于 AI 最容易压缩的“simulation + search + optimization + control”空间。 因此,马斯克看好FEL,其底层的最重要的逻辑其实是: 当 AI 芯片需求扩大一个数量级、科研 AI 开始参与硬件设计、晶圆厂走向 Terafab 规模以后,FEL架构,相比今天以独立 scanner + 独立 LPP source 为核心的 EUV 架构,更可能会是最优解!
顯示更多
0
17
20
4
轉發到社區
《晚点聊》具身季报系列第二期:分享具身智能行业季度 Top 5 事件: 1/ 人形机器人马拉松第二年,终端大公司身影浮现 - 4 月 9 日的北京亦庄人形机器人马拉松,荣耀包揽了冠亚季军。他们有接近一两百人的团队,研发投入量级显著高于另外的两大夺冠热门宇树和北人(北京人形机器人创新中心)。荣耀定制了比赛所需的大扭矩电机和精密的液冷机制,当其他公司的机器人因为长时间高速跑动,导致电机过热不得不休息,荣耀的液冷机制让电机温度在整个比赛中都能控制在较低水平。 - 更深一层的信息是,荣耀夺冠预示了未来的竞争格局:大厂认真投入的话,可以快速拿出有竞争力极强的人形机器人产品。而在中国,拥有荣耀这样组织能力、人才能力和资金能力的大厂还很多——小米、小鹏、理想已经开始严肃投入。人形机器人正在从单一技术见长的创业公司视角,演变成一种系统工程和系统作战能力的竞争。 2/ Figure AI 的 200 小时直播:为何物流是人形机器人的好场景? - 5 月,Figure 连续直播200小时,这是第一次向全球公众展示人形机器人在工业场景的真实价值,三台人形机器人站在真实物流流水线旁做包裹分拣,把包裹翻面、让条码朝上,速度做到约3秒一个,。物流分拣是个好场景——重复、连续、长时间,不适合人类长期做。而之前的机器视觉加工业手臂的方案四五年来一直解决不好,因为快递软包裹上的二维码太容易遮挡和形变,不靠灵巧手很难处理那些长尾的corner case。 - 同期还有个插曲:成都舞者吴宇飞带着 8 台宇树 G1 在美国达人秀现场跳了一段舞,全票晋级。Figure 和这个节目的先后出现,让美国普通百姓非常直观的看到人形机器人怎么进入工业和商业场景。之前很多人看到中国春晚的机器人表演,还会怀疑是不是 AI 生成的、是不是录了很多遍。 - 物流场景在国内也有实质进展。星动纪元和中国邮政、顺丰做了长时间测试,已经能实现全自主的分包、翻面、扫描等一系列工序。中国公司在人形物流工业场景的落地能力,完全不亚于美国。 3/ 灵巧手与灵巧操作:舞肌可能成为灵巧手领域的 G1 - 灵巧手这个季度在 ICRA 维也纳会议上集中爆发。舞肌二代手20个自由度,体积只有全球头部玩家Sharpa的一半,反驱性能和散热大幅改进。舞肌的定位比较像宇树——专注于把一个低成本、高可靠性的硬件设备做到足够耐用,让大家在这个基础上做大量研究。过去一两个月,已经有大量中美创业公司基于舞肌的手发布了灵巧操作模型或工作进展。 - 灵巧操作模型的进展上, Genesis 发布了用定制五指手做的灵巧操作模型,他们公开称采集了约20万小时数据,用舞肌的手实现了拧魔方、做饭、弹钢琴等精细操作,被认为是目前高自由度灵巧操作的SOTA。 4/世界模型:英伟达发布 Cosmos 3,中国世界模型融资热 - 6月1日,英伟达发布 Cosmos 3,一个全开源的全能世界模型,可以原生处理文本、图像、视频、声音和动作,也可以输出这些模态。技术上用一个自回归 transformer 做推理、一个 diffusion transformer 做生成,中间靠共享注意力机制让两种模态相互影响。英伟达把机器人领域的世界模型分成三种:最底层是Video World Model ,本质底座是一个视频生成模型——根据条件或描述生成视频 、第二类是 Action-Conditioned World Model ,前提基于你的动作——给定一个动作,在这个条件下生成世界模型 和 World Action Model ,通过这个模型生成机器人的动作,可能同时也能生成未来的图像或视频。Cosmos 3 在这个分类里被英伟达放在 Video World Model 这一层,但它是一个 Omni-model,理论上三类任务都能做。 - 世界模型成了非常火热的创业风口。国内冒出大量新公司,有些今年刚成立就冲到10亿美元估值,截止到4月初,有人整理出来的世界模型公司名单已经有49家。 5/ Gen-1 和 π0.7 发布,不被 “VLA” 标签框定 - Physical Intelligence 的 π0.7 在一个传统 VLA 的基础上接了一个轻量世界模型,这个轻量的世界模型可以提供对未来任务图像的预测,用这个预测来影响生成模型生成相应的动作,用这个反馈去调整动作生成,类似于人扔纸团前会先脑补一下轨迹。 - Generalist 的 GEN-1 自己采集了50万小时的真实世界交互数据,不依赖预训练的 VLA 和视频生成模型,独立训练了一个端到端 transformer。这显示了对自家技术路线的极高自信,也展示了 Scaling Law 在具身数据上有效——从1万小时到50万小时,泛化能力持续提升。
顯示更多