註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 CUA-S1
CUA-S1 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 CUA-S1 的搜尋結果
Cua开源多模态操作模型:轻量模型辅助决策 开源4B参数模型Cua-S1-4B-0.2,专门通过识别屏幕画面和任务目标来直接执行电脑操作。该模型在真实系统环境中通过任务完成奖励进行强化学习训练,无需依赖软件底层的无障碍结构。在168项GUI基准测试中,其任务完成率达到92.9%,大幅超过未训练基线模型的60.1%。 模型:
顯示更多
cua 的这个鼠标 drive 看起来很难在 background tab 运行啊
终于让 ZCode 用上 Computer Use 了 给 ZCode 安装了 Cua 这个插件,以下草稿来自 @Zai_org ZCode + @trycua Cua 对 Chrome 的直接操作。 把开源 Computer Use 接进 ZCode,agent 现在能真正操作 macOS:截图、读无障碍树、点击、打字。绕开 Apple Events 权限死结,改走 CGEvent + Accessibility API。 它刚自己算了 7×6=42,又开了 Chrome 导航到微博和 X——就是发这条的浏览器。GUI 四十年都是给人设计的接口,现在正变成 agent 也能直接操作的界面。
顯示更多
换句话说,对于闭源信息,有没有足够好用的本地虚拟机 + computer use 的工具可以做本地 mcp 链接到第一层 harness(codex/cc)感觉这是个没有信息安全问题同时又能兼顾效率与 SOTA 模型的路子。不知道有没有人用 cua + 本地虚拟机的方式来做类似的东西
顯示更多
读知乎回答有感,浅谈一下后训练 benchmark Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。 AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。 现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。 为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
顯示更多
0
42
310
35
轉發到社區