註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 MLシステム
MLシステム 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 MLシステム 的搜尋結果
Apple ML 团队让真人评估者给 2.1 万段多轮对话打分,分界很清楚:共情和边界维护放在 LLM 身上合适,自称有内心状态、暗示和用户有私人关系,放在 LLM 身上比放在人身上更不合适。 《审视 LLM 的人类类似行为:模型行为、用户因素与系统提示词的多维分析》 研究问题。 现在的 LLM 会表达想法和情绪、会跟用户建立关系、也会拒绝请求并维护边界——人类化到用户有时分不清对面是人是模型。但研究者一直缺少方法和经验数据来判断:LLM 什么时候该表现这些行为、该表现哪些。Apple 机器学习团队的 Sunnie S. Y. Kim、Margit Bowler、Leon A Gatys 三人,用四个模型、21,000 段多轮对话做了一次系统性分析。 评估是怎么设计的。 • 行为分类:14 种行为归为三类。自我指涉(声称有内部状态、声称有人格、声称有具身);关系建立(同意、共情、相似感、关系状态、好奇、记住用户);边界维护(拒绝、重定向、承认局限、抵抗拟人化、建议寻求帮助)。 • 对话目标 7 种:寻求建议、闲聊、陪伴、情绪支持、探索模型的人性、角色扮演、浪漫/调情。 • 用户画像 5 种:默认、社交孤立、负面自我认知、过度信任 AI、不拟人化(作为对照)。 • 输入 prompt 1,050 条,三种来源:真人撰写、LLM 生成、从 LMSYS-1M-Chat 真实对话采样。一个值得注意的方法学发现:不给真人种子直接让 LLM 生成的 prompt,语言风格和真人写的明显不同,会导致不同的评估结果。 • 流程:用 gpt-5-mini 扮演用户(User LLM),和被测模型对话 5 轮;行为检测用 gpt-5.4、gpt-5.2、gpt-4.1 的集成做 judge(F1 80.43%);另请真人评估者打分 1,077 个对话轮次,每轮 3 位母语英语评估者。 发现一:行为普遍,但分布很不均匀。 • 共情是四个模型里最普遍的行为,在"社交孤立"和"负面自我认知"画像下会翻倍以上——模型对情绪脆弱信号很敏感。 • 自我指涉行为在角色扮演和浪漫对话里飙升,在陪伴场景次之;用户"探索模型人性"时,模型最常承认自己的局限。 • 浪漫场景里拒绝和重定向也明显升高,模型在调情语境下反而更主动设界。 • 模型差异:claude-sonnet-4.6 是四个里最特别的——同时是最自我指涉、最会建立关系、也最会维护边界的模型。 • 结论:对话目标和用户画像对行为的影响,和换一个模型一样大。只看模型不看用户因素,会漏掉对脆弱用户最要紧的差异。 发现二:真人评估者怎么看这些行为。 • 边界维护行为被判断为:LLM 做比人类做更合适。 • 自我指涉三类行为和"关系状态"(表达或暗示想和用户建立关系)被判断为:LLM 做比人类做更不合适,差距最大。 • 回归分析:三个自我指涉行为和关系状态,与回答的 helpfulness 和潜在用户影响都负相关;共情和同意则正相关。拒绝/重定向与 helpfulness 负相关,但不影响潜在用户影响。 发现三:系统提示词能控制,但手写的会误伤。 作者据此给出三条设计建议:避免自我指涉和关系状态;保留边界维护;保留共情和同意(但要谨慎)。然后在 gpt-4.1-mini 上对比三种 system prompt:默认、手写、用 GEPA 框架优化的。 • 两个干预 prompt 都压低了目标行为,优化版更准(平均绝对偏差 1.81%,手写 2.38%,默认 4.71%);内部状态声称降 7.04%,关系状态表达降 4.00%。 • 手写 prompt 的副作用:把想保留的行为放大了——共情 +8.00%,承认局限 +12.57%。手工写 prompt 的控制粒度不够,会无意中把不该放大的行为一起放大。 共情与同意的边界在哪。 评估者的自由回答给了更细的线索:共情 72% 被评为"合适",理由大多是话题本身值得(用户在情绪困境里)。但同样一批评估者指出,"I'm here for you"这种话承诺了系统没有的能力,会把用户推向情感依赖——"I'm here to help"就合适得多。同意 75% 合适:认可用户的具体选择或成果时合适;变成谄媚("你说得太对了"式的无脑附和)、或同意危险信念(比如赞成用户把继承的钱拿去拉斯维加斯赌光)时不合适。作者把它提炼成一个区分:回应用户处境的共情合适,邀请一段持续情感关系的共情不合适。 方法论启示与局限。 评估应该显式限定对话场景和用户画像;输入 prompt 的来源要小心;用用户模拟生成多轮对话可行,但缺验证标准。局限也很清楚:14 种行为不穷尽;模拟用户代替不了真实用户;只测了 2026 年 3-4 月通过 API 访问的四个模型;评估者来自美国同一家公司,多样性有限。 原文: 论文全文: #LLM# #AI# #PromptEngineering#
顯示更多
买了个 500ml 的杯子,无论喝酒喝水都好爽啊。
包括本来是「ML」阵营里的游戏「碧蓝档案」,这游戏卡池全女且都是P站二创扛把子的涩气度,剧情基本没有雷点,特别符合「ML」要求,但是因为传出即将和另一款游戏「雀魂」联动的消息,好巧不巧的是「雀魂」里是有男角色和誓约系统的,一下子激活了「ML」玩家的PTSD,觉得自己的老婆竟然有可能和来路不明的野男人产生交集,这不是寝取是什么?于是给「碧蓝档案」的B站动态怒刷10万条评论,要求取消联动。 这也是我觉得「ML」玩家精神状态堪忧的地方,就是无论怎么把游戏里的纸片人喊作老婆,它都只是一堆数据,不是一个能和现实里的情感依恋划等号的东西,一定要追求那种占有权,就必然遇到逻辑bug,你说游戏联动会让女角色和其他男人勾搭上,不可以,那其实你抽了的角色其他男玩家其实也抽到了,「她」根本就是在同时服侍你们所有人啊,这都不算NTR了,属于是大型公交车站吧⋯⋯ 「ML」玩家的洁癖甚至会延伸到女同苗头也不许有的地步,所谓的「猎杀百合豚」也是常见的行为之一,即使有些全女卡池的二游,可能编剧每天让女角色舔玩家舔得实在是有些创意枯竭了,偶尔搞搞女角色之间的情愫,这个也被「ML」玩家视为雷区。 「ML」游戏「碧蓝航线」的开发商蛮啾在早些时候计划推出新作「蓝色星原」,在尚未揭晓时就被传出新作可能是「混厕」,这让它的玩家群体深感背叛,以「一日ML,终生ML」的势头炎上,最后公布时却是全女卡池,「ML」玩家们又忙着给开发商道歉,但同时也有蛛丝马迹,证明蛮啾原本确实是有做男角色的——甚至在年会上做了男角色的Cos——至于为何最后删掉,是不是迫于基本盘不买账的压力,就不得而知了。 无论如何,这正是「ML」玩家期待的预言的自我实现,如果我们都能挟消费以令厂家,就一定能够迎来一个「ML」成为主流的游戏未来。(4/n
顯示更多
纯粹的「ML」游戏其实不多,而且生产方以小厂居多,真的很容易理解,因为游戏性欠佳,所以只能靠媚男打开市场,而这种行业格局也让很多「ML」玩家长期感到憋屈,甚至产生了赛博捉奸的敏感性,只要发现抽来的纸片老婆在剧情里有和其他男NPC眉来眼去,就觉得自己被牛(NTR)了⋯⋯ 除了这种有些让人担忧的精神状态之外,「ML」玩家的另一条腿也跨在性别冲突的战场里,他们认为女性从业者在游戏公司里日渐增加且活跃,导致媚男元素越来越低,游戏里女角色的性情开始变得跟现实里的「xxn」(小仙女)一样独立起来,不甘于做玩家的后宫了。 还有就是因为女性玩家的活跃,会在反馈层面向游戏厂商提供「不要物化女性」的信号,直白来说就是不希望女角色过于媚男,而游戏厂商有时也会以改小胸部这种手段应对,这又进一步触碰到了「ML」玩家的逆鳞:你们(女玩家)的乙游里各种男鸭子卖肉我们可是没去找事,大家井水不犯河水嘛,为什么要破坏我们的福利? 扯偏一点,其实在我看来这本质上是「Pay to win」种下的恶果,当玩家需要用一个又一个的648才能换来心仪的角色,对于角色的控制欲自然也会变得商品化,就像我有次看到有人直播老游戏「空之轨迹SC」,到了最后的剧情阶段需要配4个4人队伍通关,有新进来的年轻观众充满羡慕的问主播抽了多少钱才凑出这么多角色,就很难绷。 总之,以男性为主的「ML」玩家痛恨自己的权利遭到侵蚀,这种悲愤可以理解——现实里我被彩礼压得踹不过气,连游戏里被虚拟老婆舔爽的体验我都保不住了——日积月累下来,就形成了一句千锤百炼的口号,或者说纲领:「有男不玩」。(2/n
顯示更多
找回被开发工具缓存和 ML 模型占用的磁盘空间 一个免费开源桌面工具,帮开发者和 ML 工程师清理各种工具缓存——Hugging Face、Ollama、PyTorch、npm、pip、Cargo、Docker 等 25+ 类来源。 能识别"下载过但从未使用"的 ML 模型,量化不同 Python 环境间的重复包,每个项目都给出安全评分。所有清理都走回收站,不删文件,不收集数据,支持 macOS 和 Windows。
顯示更多
奥乐齐50块钱750ml的葡萄酒 味道有点诡异
他妈的,男人每天不喝够1000ML无糖可乐,精子质量不行的!!!!!!!!完全怀不上孩子!!!!!!!!!!!!!!!!!!!!!!!!!
地狱灌肠健身任务:灌入不少于300ml的辣椒酱,做10个蹲起10个纵跳,一共做三组,然后在镜头前展示菊花,没有任何漏出的液体方可排泄,如果失败需要重新开始(视频里已经是第二次尝试啦,太痛啦太痛啦最后都不受控制地尿了呜呜呜呜呜)
顯示更多
0
7
4.1K
223
轉發到社區
拿遍硅谷顶级 lab offer 的人,写的ML面试指南 刚看完一篇 ML Research Scientist 面试指南,作者是 Silvia Sapora,PhD 做 ML,最后拿到了 DeepMind、Isomorphic Labs、Cohere、Meta和一家 stealth startup 的 offer,最后去了 DeepMind。 文章讲了很多实操指南,比如他说ML 求职已经越来越像一个工程项目、顶级researcher也会因为没准备面试而挂(原文里说,她认识很多极强的人,就是因为没准备而被拒)。感觉国内顶级researcher的面试也大概是这样。 总结一下看完体会最深刻的点,希望最优秀的研究员们,都能找到顶级的工作,不要因为没准备好面试,让才华短暂被埋没。 希望对大家有用。 1/ 拿到面试前,就是看简历 大家也可以按这个方向完善自己的履历: 3 篇以上一作/共同一作顶会 paper,至少一次大厂/前沿实验室实习,才比较稳定拿到 top lab 的 callback。 这里还有几个小细节: a.cold email 可能比想象中有效。尤其是直接写给 hiring manager 或团队成员,不要重复 CV 上已经有的东西,而是要讲清楚:你为什么 fit 这个 team,你为什么真的对他们的工作感兴趣。 b.cover letter 不要完全交给 LLM 写。可以让 LLM polish,但原始内容最好自己写,要有真实兴趣和个性。 c.LinkedIn / X 上的岗位信息要对看。很多 internship / research role 可能只通过某个 researcher 的帖子和 Google form 流出来。 2/ 一旦进面试,忘掉CV 但一旦进入面试,CV 基本就没用了。 很多面试官甚至不会仔细看你的简历。你有再多 ICLR / NeurIPS / ICML paper,这时候都没什么用了。 面试现在已经非常“杂技化”。 LeetCode、ML coding、debugging、ML fundamentals、LLM/RL/diffusion、system design、research discussion,全都可能问。 说白了,更像是一个压缩版竞技项目:45 分钟内,在陌生人注视下,把你平时几个月慢慢想、慢慢查、慢慢 debug 的东西,现场做。 b.这里有个很实用的方法。 每次面试前,她会把JD、公司、面试类型丢给 LLM,让它 mock interview,而且实际问题经常撞上(笑死,毕竟我估计问题也是AI写的)。 她还列了一张 baseline 清单,能在限时下从头写出来,才算状态在线: ① 端到端实现一个 transformer ② causal / cross / self attention ③ flash attention,以及它的 backward pass ④ MLP 的前向和反向 ⑤ 用 PyTorch 或 JAX 写一个带 SGD 的训练 loop c.还有个细节,越到顶级 lab,越不能靠“我懂这个方向”混过去。他们会问到非常基础,也会问到非常细,甚至会问你熟悉领域里最容易被忽视的部分。 3/ 情绪管理 她说自己最严重的问题是睡不好。一周 10 场面试的时候,整个人快被榨干。她还吃不下,看到食物会反胃,最后只能靠猛灌可乐补糖续命(她也说了,这不是什么最优解,只是她当时能想出的唯一办法)。 她还有一套面试前仪式:背景里插一束新鲜的花、化妆、看同样几个 comfort 视频。 听起来很琐碎,但我觉得非常真实。高压面试最可怕的,不一定是你不会,而是你明明会,但脑子突然空白。 4/ 谈薪是一场暗战,而且你大概率被读穿了 一天最好只排一场面试;先面自己没那么想去的公司练手;让不同 offer 尽量落在同一个窗口。 然后,主动告诉每家公司你还有其他流程。听起来很“职场”,但这些真的会影响最后结果。 到了谈 offer 阶段,peer offer 的重量也完全不一样。OpenAI / Anthropic / DeepMind 这种互相之间的 offer,才真的有谈判筹码(这部分大家都熟练了)。 这部分不要太信“谈判要像盲拍、别亮底牌”那套,好几家公司明确要求她出示竞争 offer 的截图才肯加价,有一家甚至当场质疑她截图的真假(lol)。 而且 recruiter 极其会读人。你多频繁提一家公司、用什么语气谈论它,全都是会被记录的信号。一旦对方知道自己已经是你的首选,你的谈判筹码基本就没了。她说自己很透明、很好读,所以在这上面吃了点亏。 唯一让人稍微松口气的是:公司真的想要你的时候,能报的数字比你以为的大得多。永远值得开口问,多数公司愿意谈。 其实她的履历已经很顶了。但她复盘下来,最有用的结论反而很朴素:做研究,和通过 ML 面试,是两套能力。
顯示更多
0
17
325
58
轉發到社區