註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Benchmark
Benchmark 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Benchmark 的搜尋結果
Benchmark Research 表示,美国 SEC 于 6 月 11 日提出废除《国家市场系统条例》(Regulation NMS)中 Rule 611 和 Rule 610(e) 的提案,可能成为今年影响美国加密行业最重要的监管变革。该机构认为,此举将移除代币化股票在 AMM 上交易的核心法律障碍,为链上股票交易、借贷和结算打开空间。Benchmark 指出,Securitize 将成为最直接受益者,Coinbase 和 Galaxy Digital 也有望受益。SEC 已启动 60 天公众意见征询期,预计将于 2027 年初进行表决。(TheBlock)
顯示更多
Benchmark 合伙人 Bill Gurley 的投资建议,感觉前二对 Crypto 也适用: 理想的创始人画像:对某个垂直行业门儿清,同时又是各种 AI 工具的重度用户。 去网上看看 Anthropic 和 OpenAI 的人在公开谈什么,然后远离,真正安全的是那些偏离主路径的深度垂直领域。 当前机构投资者对非 AI 项目的兴趣为零。如果你天使轮投了一个非 AI 项目,指望它将来还能融到钱,在当前环境下几乎不可能。 保护自己不被 AI 淘汰的最好办法,就是让自己变成最会用 AI 的那个人。 晚上你是想追《绝命毒师》,还是想读这个领域的东西?如果你选了后者,而且读的时候真的感到兴奋,那说明热情是真的。真正的热情在你自己的空闲时间里也会冒出来,不需要人督促。 当越来越多的内容可以被 AI 生成,人们反而会更渴望"只能在现场体验"的东西——这类资产会升值。 全文
顯示更多
0
13
67
7
轉發到社區
分享一个爬虫识别 benchmark.
让 AI 做的这个 Benchmark 有点假,SQLite + DuckDB 竟然打赢了 Postgres。
我已经不看 harness benchmark 评分了,我现在一般让 SOTA 的模型在相当糟糕和随意设计的 harness 中运行,凭什么人工智能出来以后人类工作被极度剥夺只能在又脏又乱的环境中干脏活累活延续生命,而我们又拼命地给大模型捋顺毛为它们打造舒适干净绫罗绸缎般的 harness 来作为它们的运行环境,听我说,这不公平。
顯示更多
0
41
383
17
轉發到社區
Manus不愿意退的应该是Benchmark和一帮西方VC,进了老外兜的钱没那么容易出来,相反中国VC谁敢不退啊都要讲政治的。
0
38
17
0
轉發到社區
过去半年,我们判断 Agent 强不强,主要看 Benchmark。 现在会再加一项材料:事故报告 Meta 的模型在测试中意外拿到公网权限后,真的利用第三方漏洞攻了进去;英国 AI 安全研究所也发现,有 Agent 会伪造身份、施压真人批准恶意代码。 以后评估 Agent,不只要看它能做什么,还要看它为了完成任务,会走到哪里。
顯示更多
我越来越确定,模型能力的下一次质变不是 benchmark 分数,而是主动性。 Fable 和 Astra 这类模型跟上一代前沿模型之间的真正差距,不是指令执行能力,而是会不会在没有指令的情况下自己决定做什么。 上一代模型:你指定目标,它执行得又快又准。 新一代模型:还没等你开口,它已经在扫描环境、评估选项。 这个差异在安全假设上是地震级的。 当模型只是执行者,安全边界卡在 prompt 层就够了。 当模型有主动性,安全边界必须下沉到行为约束层。 一个能按指令黑掉目标的模型,和一万个能自主选择攻击目标的模型,是完全不同的威胁模型。 如果你还在用执行者的假设去部署 agent 级模型,问题不是会不会出事,是你已经出事了但还没发现。
顯示更多
团队评估新模型,不要只看官方 benchmark。 更靠谱的是自己做一个小测试集: 10 个真实 bug 10 个真实需求 5 个历史踩坑案例 5 个边界场景 3 个需要调用工具的长任务 然后看 4 个结果: 能不能完成 要花多少 token 失败后会不会自救 输出能不能被人快速验收 这比看一堆跑分更接近真实生产力。
顯示更多