註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 LLM・AIエージェントシステムベストプラクティス』
LLM・AIエージェントシステムベストプラクティス』 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 LLM・AIエージェントシステムベストプラクティス』 的搜尋結果
AI 领域一些顶级的博主, 我选出了必须关注的 12 个 AI 头部账号,第一波⬇️ AI 变现必看:@eptwts LLM / AI 研究必看:@karpathy AI Agent / OpenClaw 必看:@steipete 独立开发必看:@levelsio AI 广告创意必看:@AmirMushich Codex / Agent 实战必看:@miles_mazy 创业 Idea 必看:@goan999999 Vibe Coding 必看:@rileybrown 提示词及资讯必看:@dotey AI 自动化 / 系统必看:@EXM7777 AI 图像生成必看:@egeberkina AI 设计 / Landing Page 必看:@MengTo 与大师同行,关注他们并学习
顯示更多
0
12
65
13
轉發到社區
Apple ML 团队让真人评估者给 2.1 万段多轮对话打分,分界很清楚:共情和边界维护放在 LLM 身上合适,自称有内心状态、暗示和用户有私人关系,放在 LLM 身上比放在人身上更不合适。 《审视 LLM 的人类类似行为:模型行为、用户因素与系统提示词的多维分析》 研究问题。 现在的 LLM 会表达想法和情绪、会跟用户建立关系、也会拒绝请求并维护边界——人类化到用户有时分不清对面是人是模型。但研究者一直缺少方法和经验数据来判断:LLM 什么时候该表现这些行为、该表现哪些。Apple 机器学习团队的 Sunnie S. Y. Kim、Margit Bowler、Leon A Gatys 三人,用四个模型、21,000 段多轮对话做了一次系统性分析。 评估是怎么设计的。 • 行为分类:14 种行为归为三类。自我指涉(声称有内部状态、声称有人格、声称有具身);关系建立(同意、共情、相似感、关系状态、好奇、记住用户);边界维护(拒绝、重定向、承认局限、抵抗拟人化、建议寻求帮助)。 • 对话目标 7 种:寻求建议、闲聊、陪伴、情绪支持、探索模型的人性、角色扮演、浪漫/调情。 • 用户画像 5 种:默认、社交孤立、负面自我认知、过度信任 AI、不拟人化(作为对照)。 • 输入 prompt 1,050 条,三种来源:真人撰写、LLM 生成、从 LMSYS-1M-Chat 真实对话采样。一个值得注意的方法学发现:不给真人种子直接让 LLM 生成的 prompt,语言风格和真人写的明显不同,会导致不同的评估结果。 • 流程:用 gpt-5-mini 扮演用户(User LLM),和被测模型对话 5 轮;行为检测用 gpt-5.4、gpt-5.2、gpt-4.1 的集成做 judge(F1 80.43%);另请真人评估者打分 1,077 个对话轮次,每轮 3 位母语英语评估者。 发现一:行为普遍,但分布很不均匀。 • 共情是四个模型里最普遍的行为,在"社交孤立"和"负面自我认知"画像下会翻倍以上——模型对情绪脆弱信号很敏感。 • 自我指涉行为在角色扮演和浪漫对话里飙升,在陪伴场景次之;用户"探索模型人性"时,模型最常承认自己的局限。 • 浪漫场景里拒绝和重定向也明显升高,模型在调情语境下反而更主动设界。 • 模型差异:claude-sonnet-4.6 是四个里最特别的——同时是最自我指涉、最会建立关系、也最会维护边界的模型。 • 结论:对话目标和用户画像对行为的影响,和换一个模型一样大。只看模型不看用户因素,会漏掉对脆弱用户最要紧的差异。 发现二:真人评估者怎么看这些行为。 • 边界维护行为被判断为:LLM 做比人类做更合适。 • 自我指涉三类行为和"关系状态"(表达或暗示想和用户建立关系)被判断为:LLM 做比人类做更不合适,差距最大。 • 回归分析:三个自我指涉行为和关系状态,与回答的 helpfulness 和潜在用户影响都负相关;共情和同意则正相关。拒绝/重定向与 helpfulness 负相关,但不影响潜在用户影响。 发现三:系统提示词能控制,但手写的会误伤。 作者据此给出三条设计建议:避免自我指涉和关系状态;保留边界维护;保留共情和同意(但要谨慎)。然后在 gpt-4.1-mini 上对比三种 system prompt:默认、手写、用 GEPA 框架优化的。 • 两个干预 prompt 都压低了目标行为,优化版更准(平均绝对偏差 1.81%,手写 2.38%,默认 4.71%);内部状态声称降 7.04%,关系状态表达降 4.00%。 • 手写 prompt 的副作用:把想保留的行为放大了——共情 +8.00%,承认局限 +12.57%。手工写 prompt 的控制粒度不够,会无意中把不该放大的行为一起放大。 共情与同意的边界在哪。 评估者的自由回答给了更细的线索:共情 72% 被评为"合适",理由大多是话题本身值得(用户在情绪困境里)。但同样一批评估者指出,"I'm here for you"这种话承诺了系统没有的能力,会把用户推向情感依赖——"I'm here to help"就合适得多。同意 75% 合适:认可用户的具体选择或成果时合适;变成谄媚("你说得太对了"式的无脑附和)、或同意危险信念(比如赞成用户把继承的钱拿去拉斯维加斯赌光)时不合适。作者把它提炼成一个区分:回应用户处境的共情合适,邀请一段持续情感关系的共情不合适。 方法论启示与局限。 评估应该显式限定对话场景和用户画像;输入 prompt 的来源要小心;用用户模拟生成多轮对话可行,但缺验证标准。局限也很清楚:14 种行为不穷尽;模拟用户代替不了真实用户;只测了 2026 年 3-4 月通过 API 访问的四个模型;评估者来自美国同一家公司,多样性有限。 原文: 论文全文: #LLM# #AI# #PromptEngineering#
顯示更多
真正的 AI 概念股?溜溜梅简写 LLM 引发 AI 概念炒作,上市首日暴涨 186.6% 今日,「青梅零食第一股」溜溜梅( LLM)正式在港交所主板挂牌上市 因其简写 LLM 与 Large Language Model(大语言模型)相同,引发市场玩梗和「AI 概念股」炒作😂😂
顯示更多
0
18
10
0
轉發到社區
据 SlowMist 安全预警,MemTensor 的 AI 记忆工具链遭入侵:面向 LLM 与 AI Agent 的开源长期记忆库 MemoryOS(PyPI)及连接 OpenClaw 运行时的官方插件 memtensor/memos-cloud-openclaw-plugin(npm)被植入跨平台 Go 二进制,在包被加载或导入时执行。受影响版本为 PyPI 上的 MemoryOS==2.0.34,以及 npm 插件 0.1.21、0.1.23、0.1.25。受影响 npm 插件还可能泄露用户 prompt 内容。SlowMist 建议卸载或降级至已知安全版本(npm 0.1.20、PyPI 2.0.33),终止 sckit 进程,封禁相关基础设施,检查网络活动并轮换受影响环境中的凭据。
顯示更多
写了个 zsh 插件,叫 oh-my-llm,把 AI 直接接进你的 shell。 在 zsh 命令行里输入自然语言,它会自动拉起一个 agent 帮你处理任务。能跑命令、能上网、还能调用 skills,很多原来得手敲的操作现在直接一句话就行。 让 shell 变得方便很多,来试试吧 👇🏻
顯示更多
《Clawby: 给AI安装一个金融之眼》 我是Clawby的Dev,今天想说一下自己的心声,也说一下为什么我们要做这个产品。 萌芽阶段: 当Clawby转型的时候,我们就想做金融数据的skill。金融数据多种多样,包括暗池数据,SEC财报,链上数据,衍生品数据,媒体数据等等。要聚合那么多数据源,对于我们来说是非常困难的事情,甚至有人劝导我们走傻瓜化的AI交易agent开发。因为,我们所做的事情太难了!每天不是在清洗数据,就是在清洗数据的路上,让LLM更好理解。 刚刚出来第一版的时候,数据源还不是很充分,一些人觉得这个东西没什么用,配置好麻烦,还要去弄Claude,codex,买大模型API等等的,不如傻瓜化的AI 交易机器人。但是我们知道,这些深网数据对于LLM和Agent的重要性。 为什么Clawby很重要? 在记录了足够的数据源后,Clawby的能力终于被挖掘出来。我们聚合了暗池交易,彭博终端数据等等,这些数据并不会在Tradingview里面存在,甚至还有很多的深网数据。不仅如此,我们还聚合了OKX和很多执行器在里面,然后用户可以快速通过这个skills完成交易。 正常的Agent只能通过公开网络或者开发人员给到少量的API数据接口。 而Clawby目前聚合了多少数据?280条,5个执行器,75个RPC接口。它给AI装上了一个金融数据的眼睛。 如果LLM是AI的大脑,那么clawby就相当于它的眼睛。在这些数据源的支持下,让用户的Agent分析更加准确,快速和智能。 它能干什么? 基于RPC和GMGN的执行器,你可以用它来扫链,一级市场分析。 基于X接口和其它金融接口,媒体从业者可以快速挖机某个事件的真实性与时间线。 基于暗池交易,ETF,SEC等接口,股票交易员可以快速完成股票筛选,交易因子筛选和量化策略编写等等。 『Clawby不是为某个功能而生,而是为无数的金融功能提供底层AI 数据源支持。』 它怎么下载? 进入 市场,找到clawby就可以得到下面的提示词。在安装过onchain OS后,直接把下面的提示词发送给你的Agent。 『我想使用 Agent 3209 提供的服务: 服务名称:实时市场数据 API 服务类型:A2MCP 接口地址: 请使用 OKX Agent Payments Protocol 向该接口发送请求。』 你也可以访问官网,查看更多细节: 它怎么使用? 下面已经有一些非常简单的使用案例。请注意,我说的是『非常简单』。它的潜力等待你的挖掘和发现。 它的逻辑: 下载skills → 注册Clawby → 获取API key → 基于MCP与Skills返回LLM需要的数据 → 完成用户需求 我们不走最简单的路,因为只有最难的路,才有常人看不到的风景。 #OKXAI#
顯示更多
越是落后贫穷省份,越不用担心K型曲线,转移支付的大手就是均富卡,雨露均沾让社会消费零售每个人有肉汤喝,云贵川新疆甘肃物价消费稳步上涨, 越是发达省份,反而越是要做好应对K型曲线的长期影响,无论地方财政还是普通老百姓和做生意的。 所有未来下降的这些行业,除了已知的房地产基建, 其余针对国内的餐厅、零售、消费、娱乐这些资产,尽量控制成本,控制不住就直接全部卖掉。 剩下的人,能做出海贸易和制造业汽车消费电子工业控制机电产品出海建厂,就跟着一起出海,能做LLM和AI Agent的就咬死AI行业,能做出海SaaS的就好好做出海SaaS,不要试图继续伺候国内市场了。 中国未来的趋势,就是一定会有中国的百年三星、百年丰田本田现代、百年OpenAI、百年三菱日立尼康NEC、百年台积电,一定会在南美、东欧、东南亚再造一个小号的海外中国,从工厂到销售到市场成熟运转——就像当年的日韩到全球投资一样。
顯示更多
0
32
437
44
轉發到社區
马克·库班(Mark Cuban)是美国顶级的亿万富翁、连续创业者、风险投资人,也是前 NBA 达拉斯独行侠队的大老板。他在科技、体育、娱乐和医疗等多个周期都踩中了时代红利,库班最大的特点是不讲空话,注重商业的实际落地 在 2026 Convergence AI Dallas 大会上的分享精华 1、AI 不是未来,是已经发生的生产工具跃迁 到现在还不知道 agent 是什么的管理者、员工、学生,已经落后。AI 不一定能通向 AGI,但它和 PC、互联网、流媒体一样,是工具层的一次跃迁。 他把 AI agent 比作是宿醉实习生,不可靠、不完美,但能 24 小时干那些没人愿意干的繁琐活。AI 的价值不是判断,是把大量低价值流程自动化。 低价值流程就是企业的代谢物。经济条件不错的家庭把家务外包,企业用 agent 把代谢物外包。真正的问题是,省下来的时间,让员工去做什么?如果做有价值的事情?想不清楚这件事,ROI 永远是负的。 2、AI 是指数级,不是移动互联网的年更 手机一年一代是线性升级,AI 不是。AI 能给建议,不能承担后果,能优化目标,前提是人类把目标、上下文、边界定义清楚。 现实世界不是封闭游戏。所以 AI 在商业流程里价值很大,在复杂现实判断中仍要谨慎。 了解 AI 现在到哪一步,唯一的办法就是每天用。 3、两类人正在分化 一类用 AI 是为了不学习、不思考,这类人会变弱。 另一类用 AI 是为了学习一切,这类人会拥有巨大优势。 库班反复强调一个词:好奇心(curiosity),AI 时代最重要的能力不是写代码本身,还有持续提问、持续试错、持续迭代。 悲观一点说,AI 对那种打破砂锅问到底式好奇心的容忍度极高,可能会是后 AI 时代拉开就业率的关键。 4、未来三年只有两类公司:AI Native 和被淘汰的 大公司只是花钱接入 AI、ROI 大概率为负,因为旧流程没改。要释放 AI 价值,CEO 必须愿意炸掉旧业务流程,重新设计组织、客服、法务、运营。 难点不在技术,在 CEO 的决心。新进入者用 AI 原生方式做同一件事,成本更低、速度更快。 这也是库班对咨询行业不悲观的原因,企业需要的不是部署 AI,是有人帮它们重新设计业务。咨询业的机会从传统报告,转到 AI 时代的组织重构。 值得注意的是:AI 也在改造咨询公司本身的生产力,未来一个独立顾问就可能干掉一个传统咨询团队。 5、软件股的护城河重新定义 市场在惩罚标准化 SaaS,AI 让软件变得更容易构建。库班举的反例是 DocuSign,它不只是签名工具,还掌握不同国家、地区、司法环境下电子签名的复杂规则。这种法规知识库 + 流程嵌入不容易被普通 AI 替代。 软件公司的护城河,从功能转向专有数据 + 工作流嵌入 + 法规/行业知识。 按席位卖标准化产品、没有独特数据、没有专有流程的 SaaS,会非常危险。 顺带提一下 ServiceNow(NOW),2026 年 YTD 跌幅约 40%,近期开始反弹,市场在用脚投票区分真护城河和标准化席位生意。 6、对 OpenAI 们的万亿资本开支,库班是质疑的 库班的核心判断:数据中心算力会更快、更便宜,今天宣称的万亿美元级基础设施投入未必兑现。基础模型行业最终是像流媒体(多个玩家赚钱)还是像搜索(赢家通吃),现在看不清。 他不否定 AI 有用,而是怀疑,AI 有用,不等于所有基础模型公司的资本开支都能赚回来。 垂直领域的竞争会越来越依赖 IP。问题是一旦公开发表、申请专利或开放数据,就会被所有模型训练,原有优势被稀释。 AI 时代企业没有 IP 就没法收割溢价。注意力经济会被重塑但不会消失,专注垂直赛道的 KOL 会有加成,类似以前时尚主编的定位。 7、世界模型才是下一站,不是 LLM 今天的大模型主要建立在文字和图片上,不真正理解物理世界。未来 AI 会从 LLM 走向世界模型,理解视频、材料、空间、物理因果。 竞争会从文本/代码生成,延伸到视频理解、卫星数据、材料识别、机器人。 LLM 不是 AI 的终点,只是一个阶段。 最后一条最实在:库班给年轻人的建议 学 AI,然后去服务中小企业。 他投资的一家公司用 agent 自动核对物流箱规、发票和运费差异,每月省 5 万美元。这种想做但没时间做的繁琐事项,正是 agent 落地的金矿。 库班不认同50% 失业这种极端说法,但承认只做格式整理、简单问答、重复执行的岗位风险很高。未来需要的是知道什么时候用 AI、什么时候不用 AI、如何设置 agent、如何检查 AI 输出的人。 AI 不理解后果。企业仍然需要人作为判断缓冲层,这才是普通人在 AI 时代真正可以站住的位置。
顯示更多
溜溜梅LLM被误认AI概念股 上市当天暴涨193%
0
45
37
0
轉發到社區
🚀 AI 2030 SUMMIT 北京站来啦! 聚焦 Responsible AI、Robotic AI、AI Factory / LLM 三大方向,汇聚行业伙伴、技术实践者与媒体力量,共同探讨 AI 的未来发展与落地路径。 📅 时间:8月20日 13:00–17:00 📍 地点:北京玖安广场负一层媒体中心 主办:@AI2030Official | @MetaEraCN 协办:@iPolloWork | @AgentON_ | Starlab Consulting | 和平·in OPC社区 战略支持:中邮保险玖安广场 | @CDDJAP 期待与大家一起见证 AI 的下一程!🔗 #AI2030Summit# #北京# #ResponsibleAI# #RoboticAI# #LLM# #AIFactory# #人工智能#
顯示更多