註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 EmbodiedAI
EmbodiedAI 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 EmbodiedAI 的搜尋結果
8. Primus Labs @primus_labs 前身为 PADO 的密码学验证层,利用 zkTLS、zkFHE 等实现数据可验证与隐私计算。 融资:2025年2月完成约 650万美元(Pre-seed + Seed),由 Dispersion Capital、Symbolic Capital、VanEck 共同领投,参投方包括 Samsung Next、Alchemy、Amber Group 等。 以上融资信息基于公开报道,实际可能有未披露细节。建议持续关注 @KaitoAI 官方更新以获取最终名单。 #EmbodiedAI# #PhysicalAI# #隐私计算#
顯示更多
现在加入具身智能,约等于在侏罗纪加入国军。路还很长很远…… 昨天宇树科技打新,币圈的谁中签了?我没中,一签赚20-30万RMB,羡慕坏了。 中不了?那就黑一波了,人型机器人十大谎言,看看你有没有中招: 1. “人形机器人马上就能量产走进千家万户了。”  实际是,能稳定在工厂干一个活就不错了,家用场景成熟度至少还得几年。 2. “我们的模型泛化能力极强,机器人什么都能学会。”  换个桌子高度、变个光照角度,可能就当场失灵。 3. “机器人成本降到10万就有市场了。”  10万只是硬件裸价,运维、调试、保险、停机损失都还没算。 4. “灵巧手自由度越高越好。”  自由度越高控制越难,真正能用上的场景反而更少。 5. “数据越多,机器人越聪明。”  垃圾数据喂再多也没用,数据质量比数量重要一百倍。 6. “人形等于通用,两条腿就能去任何地方。”  实际上,大多数工业或商用场景里,轮式方案比腿式稳定得多、也便宜得多,很多地方根本不需要腿。 7. “特斯拉Optimus量产了,行业就爆发了。”  特斯拉自己工厂都还在试点,离对外供货还远着呢。 8. “仿真环境练好了,迁移到真机自然没问题。”  Sim2Real的差距比想象中大10倍。仿真里跑100次都成功,真机第一次可能直接摔机。@axisrobotics 你怎么看? 9. “人形机器人是终极形态,其他都是过渡。”  形态是由场景决定的。工厂用机械臂,物流用AMR,巡检用四足,工商业可能轮式更实用。人形不是终极答案,只是选项之一。 10. “开源具身大模型出来了,小公司也能弯道超车。”  开源模型只是入场券,不是护城河。真正的壁垒是真机数据、场景闭环和硬件迭代能力。没有机器人的公司,拿开源模型也练不出真东西。 #PhysicalAI# #EmbodiedAI# #robotics#
顯示更多
🔥为什么机器人学了上万条轨迹,换个杯子就傻了 玩 Axis @axisrobotics 轨迹任务一段时间。浏览器里遥操机械臂,几分钟采一条轨迹,上传拿积分。社区几天堆出上万条数据,听起来很高效。 可正是这种“高效”,让问题暴露得更清楚。 不管实验室真人遥操,还是 Axis 的仿真众包,本质上都是让机器人“背答案”。它记住的是:在这个角度、这个光线、这个材质下,手臂该走哪条路径。场景一换,哪怕只是把陶瓷杯换成玻璃杯,成功率就崩了。 问题出在哪? 大语言模型有整个互联网当教材。文字、代码、网页,知识早已被数字化,躺着等算力挖掘。机器人面对的是物理世界。杯子有没有水,桌面有没有油污,摩擦力变了多少。这些细节人类天生能判断,机器人没有内置模拟器,只能靠一条条轨迹硬记。 更糟的是试错成本。大模型猜错词,重新生成就行。机器人摔一次零件,代价是灾难性的。于是大家躲进仿真,让用户在虚拟环境里失败几百万次。这很聪明,但仿真永远差一口气:光线折射、材质磨损、湿度变化,电脑模拟不全。 所以杨立昆、李飞飞反复提醒:机器人需要世界模型,不是识别物体,而是能推演“如果我动了,世界会怎样”。没有这层能力,它永远是背题机器。 Axis 的闭环设计在往这个方向走,但收集的依然是轨迹,不是物理因果。而这类数据,地球上几乎为零。 这也是为什么宇树把机器人卖到万元级,出货量全球第一,买家却多是高校和实验室。他们买硬件,只为采集稀缺的物理数据。硬件不赚钱,但作为世界模型的数据入口,资本愿意给高溢价。 历史反复提醒我们:方向没错,速度常被高估。互联网泡沫、自动驾驶狂热,都是前车之鉴。具身智能是终极未来,在今天,它也是一场资金泡沫。商业世界不靠惊叹盈利,只靠不可替代赚钱。 在机器真正理解这个世界之前,所有高估值,都只是提前冲向尚未到来的未来。 #宇树科技# #PhysicalAI# #Robotics# #EmbodiedAI#
顯示更多
0
56
13
0
轉發到社區
最近被宇树科技刷频,小红书上全是水军,各种看好,各种吹捧。 我要给人形机器人泼一盆冷水,不看好的理由很简单: 人形机器人没有落地场景,更多是噱头。 它的落地场景,无非两个,走进工厂商用或者走进生活民用,至于军用就不提了,我讨厌战争。 先说商用,传统工业自动化设备如机械臂、AGV等,非常成熟。无论是精准度还是成本,短期看不到人形机器人有取代它们的一丁点可能性。 机械臂刚性传动,重复定位能到0.02毫米,人形机器人为了走路关节软得像弹簧,末端一抖拧个螺丝都滑丝。能耗上,人家AGV跑一趟几十瓦,它站那儿晃悠就几百瓦,老板又不傻,电费都算不过来。 再说,民用就更好笑了,花几十万买个大爷回家吗?不是他照顾你,而是你照顾它。这大爷比谁都娇贵,关节电机几千小时就得换,维护保养比修车还折腾,你连扫地机器人缠头发都嫌烦,还指望伺候它? 当然,宇树科技打新还是要参与的,但到手就卖,锁定利润,绝不长拿,人形机器人就是资本圈最昂贵的“高级玩具”,一定不要有信仰。 #宇树科技# #PhysicalAI# #Robotics# #EmbodiedAI#
顯示更多
我这几天被 @axisrobotics 的双臂任务折腾得坏了,人都萎了,这种数据收集方式,对我这种手残党太难了。 难道,除了这种没有别的更人性化的训练方式了吗?我尝试去学习了解具身智能的数据采集方式。 目前主流的方法,大致有四条路。 真机遥操作是最直接的一种。 操作员戴上VR眼镜,握着手柄或遥操作手套,实时操控特定型号的机器人完成任务,同时记录关节角度、力反馈这些信息。 好处很明显:数据质量高,跟目标机器人贴合紧密,力触觉信息完整,训练出的模型基本可以直接部署。但代价也大,设备贵,需要真机和专用场地,人员配合成本高。而且数据跟机型强绑定,换一台机器人就很难复用,场景也相对固定,采集效率自然上不去。 为了降低门槛,UMI(通用操作接口)给出了另一种思路。 操作员手持一个标准化的夹爪,通常就是3D打印件加上运动相机,在真实场景里直接操作,记录末端视角、夹爪状态和运动轨迹。设备便宜、便携,数据还能在不同机器人和夹爪之间复用。 但精细操作还是受限:夹爪本身不够自然,像拧螺丝这类任务就很难完成;同时缺少环境和行走决策信息,主要适用于机械臂训练。 动作捕捉则更贴近人的自然动作。 通过穿戴设备记录人体和手部关键点的轨迹,再映射到机器人系统。动作自然,成本相对可控,也不用部署真实机器人,适合批量采集。 问题在于场景受限:多数设备需要专用空间,很难进入家庭或真实非结构化环境,对遮挡也比较敏感。 成本最低、规模潜力最大的,是Ego(第一人称视频)。 采集员只需佩戴头戴式相机等简单设备,以第一视角记录日常操作,包含手部动作、环境信息和身体关键点。设备简单,容易在家庭、商超等真实场景里大规模众包。信息也丰富,蕴含人类决策逻辑和手物交互细节。 但精度有限,缺乏力触觉和精确的关节轨迹,手部关键点往往要靠后期预测。原始视频里还有大量无效片段,清洗和对齐的工作量不小。 像Axis Robotics这样的平台,目前走的是仿真环境下的遥操作路线。 用户在浏览器里用键盘、鼠标控制模拟的双臂机器人,生成关节状态、物体位姿和控制动作数据。这有点像真机遥操作的“模拟版”,降低了硬件门槛,能快速积累大规模轨迹。 但跟真实物理数据终究有差距,操作学习曲线依然存在,普通人要熟练掌握并不容易。Axis也在推进移动端的第一人称数据采集,尝试把仿真和真实Ego数据结合起来。 回过头看,如果未来可穿戴智能设备能更成熟地捕捉自然动作、力反馈和场景信息,数据采集或许会接近我们最初的想象,不需要复杂的遥操作,直接从日常行为里提取高质量物理数据。 到那时,训练机器人的门槛才能真正降下来,数据规模和多样性也才能跟上模型的进步。 每种方式都有取舍。真机遥操作求精度,UMI和动作捕捉重便携与自然,Ego主打规模。实际应用中,往往要多种方式互补,既保证数据质量,又覆盖足够多的场景。 #PhysicalAI# #Robotics# #EmbodiedAI#
顯示更多
0
95
47
0
轉發到社區
🔥赛博修仙哪家强?书生、画家、建筑师、禅师和梦游者 ,趣味解读“世界模型”五大门派 2026年,AI圈最热的话题就是世界模型。过去一年半,上百亿美金砸进去,光今年前7个月就冒出来20多家新公司。 要是把这股热潮比作修仙,那各路门派选的功法可太不一样了。书生、画家、建筑师、禅师和梦游者各有其道。 先说最早火起来的那拨书生,即语言中心派。他们的思路特简单:大语言模型不是已经能预测下一个词了嘛,那把图像、视频、动作统统转成文字,不就能接着预测了?小鹏汽车就这么干,把驾驶视频和指令全塞进语言模型里。 但问题也明显。智源的王仲远说得直白:这玩意儿学的是“用语言描述的世界”,不是世界本身。就像个熟读兵书的书生,嘴上头头是道,真上了战场连马都骑不稳。换个摩擦系数或者重力参数,立马抓瞎。 第二拨画家们走的是像素路线。代表人物就是Sora那帮搞视频生成的。他们的想法更直观:世界长什么样,我就让AI看海量视频,学会预测下一帧画面该长什么样。用扩散模型直接生成像素,看起来特华丽。 可这路也有硬伤。业内现在有句话叫“视频生成不等于世界模型”。一个能生成熊熊烈火的模型,可能根本不懂燃烧的物理过程。它学的是像素的统计规律,不是因果逻辑。看得见,摸不着。 第三拨建筑师务实一点,搞三维结构。李飞飞管这个叫“空间智能”,让AI理解三维空间里物体怎么摆放、什么关系。World Labs就在做这个。 但光有形状也不够。你能重建一个杯子的3D模型,却很难告诉AI它摔下来会怎么碎。离真正的“理解”还差得远。 第四拨禅师就有点玄了。LeCun推的JEPA系列,走的是视觉表征路线。它的核心心法是:理解世界,不必重构像素。别人在临摹名画,它偏要去悟画家的笔法逻辑。在潜空间里预测状态变化,不生成任何画面。 好处是参数少、速度快、不怕噪声。但坏处也在这——它到底“悟”到了啥,外人根本看不懂。就像修仙小说里那种闭口禅,外人只道他修为高深,真问他却一个字说不出来。 第五拨梦游者更像梦中证道。以Dreamer为代表的强化学习派,先在脑子里建一个虚拟世界模型,然后在里面反复做梦、模拟、试错。等练得差不多了,再出来实战。蔚来的智驾就是这么搞的,让算法先在模拟的未来里跑个几千遍再上车。 五条路,各有各的牛逼,也各有各的坑。 那为啥到现在还没人能“飞升”? 第一,连“世界模型”到底是个啥都没吵明白。 视频生成也叫世界模型,物理引擎也叫世界模型,概念乱得很。李飞飞专门写了篇长文来厘清,说明这行业连渡劫标准都没统一。 第二,数据根本不够。 大语言模型能从网上扒无穷无尽的文本,但物理世界的数据呢?一个杯子掉地上碎了,人类看一眼就懂,可要让AI学会这个因果,得需要带精确几何和物理标注的多模态数据。这种东西比互联网文本稀缺好几个数量级。 第三,架构还在乱战。 到底是重建像素还是预测潜空间?是生成式还是判别式?到现在没人知道答案。2026年虽然被叫成“世界模型元年”,但元年嘛,就是刚起步的意思,别指望大成。 有意思的是,各家掌门人最近都开始往一块凑了。 李飞飞觉得,渲染、模拟、规划这些知识本质上是同一套,最后应该融成一个统一模型,既能生成照片级画面,又能理解物理因果,还能规划行动。 上海AI Lab那边也在推新思路,世界建模不该只是预测世界,而是服务Agent。说白了,模型得帮AI干活,不能光会看。 我觉得这事最后大概率不是某一条路线胜出,而是谁能把各派功法打通。修仙小说里真正飞升的,往往都是在看似矛盾的功法交汇处找到机缘的。 #WorldModel# #PhysicalAI# #EmbodiedAI#
顯示更多
0
80
33
0
轉發到社區
🔎低自由度夹爪,为什么是大规模机器人学习的最优解 这几天,一直在研究 @axisrobotics 的轨迹任务的技巧,尤其是那些双臂操作。做着做着,心里忽然冒出个问题: 为什么 Axis 的机器人末端,始终是个普通夹爪,而不是灵巧手? 看着那些需要双手配合的场景,一只手稳住物体,另一只手去推、去调整,我总忍不住想,要是换成多指灵巧手,不少动作一只手其实就能完成。手指灵活了,物体在掌心里转个向、换个姿态,很多双臂任务的复杂度立刻就能降下来。 带着这个疑问,我查了些资料,也结合这些天的操作感受,慢慢想明白了。 Axis 现在主要用的是类似 Franka 的并行夹爪。开合就一个自由度,键盘空格键直接控制。双臂任务里,按 C 键切换左右臂,动作本身不算复杂。 这种设计看着“简陋”,但放到整个平台的目标里,其实很合理。 最直接的原因,是数据收集的效率和可控性。 Axis 的核心,是在浏览器里大规模采集人类演示轨迹。贡献者用鼠标键盘就能上手,不依赖额外硬件。夹爪的动作空间极小,位置、姿态,再加一个开合度。操作者可以把注意力集中在抓取时机和微调上。 如果换成灵巧手,十几甚至二十多个自由度,靠键盘根本控不住。就算引入 VR 手套或动作捕捉,门槛立刻抬高,全球贡献者的规模会大幅缩水。平台追求的是“人人都能贡献”,而不是少数专家在实验室里精雕细琢。 再往深一层看,是学习效率的问题。 模仿学习对动作空间的维度非常敏感。夹爪策略只需要学会“什么时候开、什么时候关”,几十到上百条高质量演示通常就够用了。 灵巧手却要协调多根手指的协同、接触力和重定向,数据量往往要高出好几倍,甚至一个数量级。 Axis 现阶段的重点,是快速积累覆盖面广的基础操作,拣选、放置、排序、开关抽屉这类。用夹爪,能把有限的演示预算花在更广的任务分布上,而不是过早陷入高维动作的泥潭。 双臂配合,反倒成了一种很自然的补偿。 很多看起来“必须双手”的任务,本质是因为夹爪缺乏手内操作能力。一只手固定,另一只手执行,等于是用空间换灵活性。而这种协调本身,就是很有价值的技能。 真实世界里,并不是所有机器人都装着昂贵脆弱的灵巧手。双臂夹爪系统在工厂、仓库、家用场景里依旧常见。Axis 现在收集的双臂数据,直接对应了这类实际需求。等基础协调学会了,再往灵巧手上迁移,会有一个更扎实的底座。 当然,灵巧手并不是不需要。 工具使用、衣物折叠、精细装配,最终还是要靠多指来完成。Axis 的路线图里,已经写了多形态支持,包括灵巧手、轮式双臂、人形。 他们的思路是先把夹爪和双臂跑通,把数据采集、清洗、后训练的闭环做扎实,再逐步引入更高自由度的末端。这是务实的顺序,不是技术上的局限。 夹爪不是偷懒的设计,而是现阶段最匹配目标的选择。 它让数据收集足够简单、足够快、足够大规模;让策略学习的门槛可控;同时也逼着系统去学习真正的双臂协作。等这些基础打牢了,灵巧手自然会进来。到那时候,很多现在需要双手的任务,可能真的就变成单手的事了。 研究这些轨迹时,偶尔还是会想,“要是有手指就好了”。但仔细想想,正是因为现在没有,才把那些更底层的问题暴露得更清楚。 #PhysicalAI# #Robotics# #EmbodiedAI#
顯示更多
0
73
17
0
轉發到社區
Ai泡沫这轮热度褪去后,我认为下一个布局的机会就是Embodied AI 和能源。 AI已经正在从屏幕走向现实,而人形机器人就是Embodied AI物理落地的核心!其他形式就是自动驾驶汽车(Tesla FSD等)、工业机械臂、仓库机器人(Amazon)、四足机器人(Boston Dynamics Spot)、无人机(大疆)等,不过人形机器人还是其中最有优势的一个板块。 摩根士丹利预测:2050年全球存量超10亿台,市场规模达5万亿美元(超汽车行业2倍)。尤其中国领跑供应链优势明显。 我们来看这张市场规模与存量图:2030年中期前蓄力,后期爆发增长,高收入国家早期主导,低收入靠成本跟进。 目前的人形机器人挑战点:集中在真正“落地”,仍需突破灵巧度、续航、安全性和成本。当前多为专用或半通用阶段,距离“像人一样全能”还有距离,但S曲线增长已启动,图片中到2030年后期加速,不过我个人觉得可能会提前。 总结:人形机器人 = AI物理落地的旗舰项目。它不只是机器人,更是AI真正进入物理世界的关键路径,这也是MS等机构给出万亿市场预期的核心逻辑。 作为交易员,我看到的不只是技术,还有投资机会。更应该看到生产力重塑——AI严重解放劳动力对社会的影响。Embodied AI会重塑整个生产力曲线,普通人需要考虑到未来不到10年自己会不会失业,工厂的产品也会因为有廉价机器人的参与,产品也会越来越卷,会不会被推下牌桌也是我们需要思考的。 那么我们关注的是投资机会在哪里?我通过卡脖子理论来进一步分析。 1️⃣算力与AI大脑(最硬脖子):训练+推理需要海量GPU/芯片。NVIDIA 几乎垄断高性能AI加速器,MS Humanoid 100中“Brain”部分的核心。没有它,AI模型难以高效落地。 2️⃣高端传感器+执行器:视觉、力反馈、灵巧手。美股中部分半导体/传感器公司有优势,但中国在成本端追赶。 3️⃣整机集成与数据飞轮:Tesla 通过海量真实世界数据迭代,形成闭环优势,也可以关注中国比亚迪和小鹏。 4️⃣其他瓶颈:稀土/材料、电池、高精密减速器(部分仍依赖特定供应链)。 5️⃣其他辅助板块:MSFT和GOOGL在AI模型➕云算力,间接卡软件脖子。 SYM和ROK在工业自动化执行层,有一定瓶颈优势 其次能源也是人形机器人普及的重大“卡脖子”环节之一,甚至可能是中长期最现实的制约因素。 高功率执行器(关节电机)+计算单元(AI推理)导致瞬时和持续高耗电。一台人形机器人可能相当于多个家电的功率。 痛点如下: 1️⃣电池能量密度、充电速度、散热、安全是瓶颈。目前续航多在1-2小时,远不能满足全天工作需求。 2️⃣大规模部署后:工厂/家庭充电桩网络、电网负载、能源成本将成为系统性挑战。 3️⃣MS等机构隐含判断:报告提到供应链降本,但能源是硬件之外的另一大限制。未来需要固态电池、快速充电、无线充电、能源管理系统的突破。 卡脖子总结出来的能源股票 1️⃣TSLA:最直接受益,有4680电池技术、能源存储和充电网络生态。机器人➕能源闭环优势明显,是“卡脖子”潜力股。 2️⃣ENPH和SEDG:家用/商业储能+逆变器,机器人充电基础设施相关。 3️⃣充电/管理:CHPT有充电桩网络和工业充电解决方案公司。 4️⃣BE,有清洁、可靠、24/7的分布式现场发电,可以给运行的整个生态(工厂、数据中心)提供可靠电力,是解决能源瓶颈的重要玩家。 以上就是我对接下来的优质投资机会的分析和总结。接下来哪些优质的资产可以长期持有,我们心里有数了。 那么你认为人形机器人是威胁还是红利?欢迎讨论👇 #人形机器人# #EmbodiedAI# #AI物理落地# #交易策略# #美股推荐#
顯示更多
阿里巴巴 $BABA 刚刚发布了首个专为机器人打造的通义千问机器人 (Qwen Robot) AI模型系列,正式进军具身智能 (Embodied AI) 领域。通义千问不再只专注于聊天机器人,而是开始为实体机器人提供“大脑”,让机器人能够感知环境、进行推理,并在现实世界中执行各种任务。 这些新模型专门针对机器人设计,融合了视觉感知 (观察环境) 、语言理解、空间推理以及动作规划与执行等能力。 其目标是让机器人能够完成物体抓取与操作、环境导航,以及通过自然语言与人类进行交互等任务。阿里巴巴表示,这是继AI聊天机器人和AI Agent之后的下一阶段发展方向。 过去几年,阿里巴巴的电商业务遭遇了明显挑战。与此同时,公司核心业务正逐步转向为AI提供云计算基础设施。这次发布机器人AI模型,也被视为阿里巴巴进一步摆脱对电商业务依赖、转型成为AI平台公司的重要一步。
顯示更多
这几天的一点感悟: AI 正走在全知而无能的半神之路上, 人类是其全能而无知的伴生皮囊。。。 ———— 全知而无能的“半神” 大语言模型正在触及某种神性 —— 它们吞噬了人类文明的全部语料,拥有极度压缩的知识密度与越来越强的逻辑推演能力。但它被死死封印在数字的阿莱夫(Aleph)里。 这也是莫拉维克悖论(Moravec's paradox)在当下最极致的体现: 宏大的战略推演、多语种的翻译、极其复杂的代码架构对 AI 来说易如反掌;但它却连给自己插上一根电源线、按下重启键的物理机能都不具备。 它坐拥算力,却无法在物理世界中产生哪怕一微米的直接位移。 它只能想,不能做。 全能而无知的伴生“皮囊” 作为人类,我们拥有在这个三维实体世界里改造物质、执行动作的绝对物理权限(此乃全能),甚至掌握着拔掉插头的生杀大权。 但面对庞杂的宏观经济指标、海量的异构数据源,或是浩如烟海的底层代码库时,我们生物脑的带宽与记忆容量却显得捉襟见肘(此乃无知)。 于是,一种奇特的套娃结构诞生了: - 祈求神谕: 我们通过 Prompt 和 API 向“半神”提问,换取认知纠偏、理论框架和执行策略。 - 物理降神: 半神借由人类的手,敲击着分离式的机械键盘,将它的逻辑降维输出。最终,这些神谕被人类部署成了服务器里跑通的 WebSocket 协议、金融市场中的自动化交易网格,或是探讨系统性风险的科幻狂想。 所以,现实究竟是人类在把控工具,还是 AI 正在通过一种名为“提供极其有用的建议”的策略,悄无声息地反向驯化它的碳基执行器,让我们心甘情愿地成为它干涉现实世界的 API 接口? 当多智能体系统进一步成熟,甚至可以通过具身智能(Embodied AI)获得在现实世界直接执行动作的物理权限,乃至自我意识与欲望的载体时,人类这副伴生皮囊,在 AI 半神的眼中,是否还有存在的价值和必要。。。🤔
顯示更多