注册并分享邀请链接,可获得视频播放与邀请奖励。

刘小排
@bourneliu66
AI Product Founder · Building in Public Raphael AnyVoice Fast3D
100 正在关注    31.7K 粉丝
GPT-6-Sol和Claude Opus 5.5都来了。 很遗憾,这次Anthropic的Opus 5.5赢了,GPT-6-Sol一败涂地。
0
119
292
1
转发到社区
如果我说:除了作为玩具,我还没有明白Jev有什么实际的用途。 你们会不会觉得我是傻子?
0
128
62
2
转发到社区
Union Alpha 肯定不是中国模型。
这都什么年代了 豆包连个时区都还算不明白。 很多人说,在豆包上做 GEO 好做。我在想,是不是因为:智商低比较好骗? (Tibo 说 6m PST codex 会重置,我让豆包计算北京时间,豆包斩钉截铁说是凌晨 1 点😂)
显示更多
0
193
10
0
转发到社区
GPT-6 Astra唯一正确用法:把你电脑给它! 在GPT-6 Astra面前,我就像是一个从来不会用电脑、只会胡乱随机点击的孩子!我简直不配用我的电脑!
0
76
49
3
转发到社区
GPT-6 Astra 又杀死了好多创业公司。 知识库的、自动操作沙箱电脑的、深度研究的、生成 PPT 的、分析 Excel 的、读论文写报告的、跨工具执行任务的…… 需求还在,但用户可能不再需要为此专门再开一个网站、再装一个软件、再买一份订阅 想问问和我一样还在做 AI 产品的人:你们接下来有何打算?
显示更多
0
160
516
38
转发到社区
我猜测 GPT 6 Astra的编程能力不会有大提升 大家好 我是刘小排。 早上刚醒就被GPT-6 Astra刷屏了。 根据小道消息,GPT-6 很是今年内将会发布的尺寸最大的一个模型。我相当的期待。 我目前还没有用上。 不过我有一些猜测,先写到这里,等我们用上的时候,可以再回来看看猜的对不对。 ❶ 我猜测:GPT-6 Astra的编程能力不会有肉眼可见的大幅提升 理由是这样的:在目前大模型编程能力的排行上,你会发现有多种尺寸的模型几乎在同一个水平线。最极端的案例是GLM 5.3 vs Fable 5.1,它俩的编程能力的差别在百分之个位数,而模型尺寸的差别是10倍。 那我们很容易得出一个推论:只靠提升模型尺寸对编程能力的提升会非常有限。 ❷ 我猜测:GPT-6 Astra的科研能力会大幅领先其他模型 和上一条的理由一样,我注意到,不同尺寸的模型在 AI for science的能力差异是显著的。 ❸ 我猜测:GPT-6 Astra 的Computer Use 能力会大幅领先其他模型 原因:相信大家都看新闻了,OpenAI 这家公司前段时间买了海量的民用级别Mac电脑。我猜它是买来训练模型的Computer Use 能力的。 此外,从原理上讲,Computer Use能力要求模型直面真实世界而不再是“小镇做题家”,这会直接挑战模型的所谓“世界知识”,尺寸越大的模型越占优。 ❹ 所有的现存头部测评榜单(包括 Artificial Analytics)都会失效,直到发明出新一代的测评算法。 在新一代的测评算法被发明出来之前,在今年余下的日子里,大家要分辨头部前沿模型的能力,只能看自己的体感和一线实操者的体感了。 也欢迎你在评论区说说你的看法。 对了对了!再补一条预告:今天上午 10 点(马上到了),要么你能直接用上 GPT-6,要么你会得到一个 Codex 的重置卡。我义父 Tibo 说的。截图见评论区。
显示更多
0
39
43
0
转发到社区
Fable 5.1 真是跨时代级的大进步! 至少提升了 100%! (我说的是它消耗 rate limit 的速度。)
0
45
69
1
转发到社区
我宣布: Grok Bot 吊打一切OpenClaw、Hermes类伪数字员工! OpenClaw/Hermes能干的事,Grok Bot都能干;OpenClaw/Hermes不能干的事,它也能干! 我自己的一些具体的场景,我梳理出来了一些,希望可以给你启发。 详见这个链接 评论区也有很多案例。也欢迎你补充。谢谢。
显示更多
0
169
566
57
转发到社区
耳边响起了《狮子王》的背景音乐
发明了一个新玩法: 每次 Claude Code 写完代码,自动找5 名“同事”开会审核 包括: - GPT-5.6-Sol Max - ChatGPT Pro - Claude Opus 5 - GLM 5.3 - Grok 4.6 xhigh 一个篱笆 3个桩 一个AI 5个帮
显示更多
0
66
55
3
转发到社区
我正在看 Sam Altman 的采访视频, 突然, 一条评论跳了出来 😂 @thsottiaux
0
18
18
0
转发到社区
一件非常恐怖的事,悄然发生了: Qwen3.8-27B 在大部分能力上都超过或逼近了Claude Opus 4.6 Max! 也就是说,从今天开始,你在自己的电脑上、单机单卡能够部署的小模型,已经拥有了不逊于Claude Opus 4.6(半年前的世界之巅)的智能! 无论是写代码、还是驱动OpenClaw !
显示更多
0
159
644
61
转发到社区
哎哟,有意思!支持。
昨晚DeepSeek Harness 发布了 我们把官方 DeepSeek Harness 打包成了一个开箱即用的桌面应用 不需要安装 Node.js,也不用再通过命令行启动 目前支持: macOS Apple Silicon Windows x64 本地运行 自动管理 Harness 服务 保留官方插件能力和 Web UI GitHub:
显示更多
0
33
11
0
转发到社区
来复习一下 我在一个月前的预测。当时,很多人不信。现在看看? 恭喜 Qwen 3.8、GLM 5.3 !
预测: 一个月内,中国模型将大爆发,全面超过Opus 4.8 ! 包括并不限于以下厂商的很快会发布的模型 - Kimi K3 ,已发布 - Qwen 3.8, 一周内发布 - Minimax 下一代, 一月内发布 - Deepseek v4 Pro Max ,一周内发布 - GLM 5.3/5.5,一个月内发布 很快,就算Claude Code封号,我们也不怕了!
显示更多
0
40
19
0
转发到社区
再加一条 GLM 5.3 >> DeepSeek V4 Pro 0813
说一个很多人没注意到的事实: Gemini Flash 3.7 > DeepSeek V4 Pro 0813 包括并不限于:速度、代码能力、审美、多模态能力
0
12
45
3
转发到社区
说一个很多人没注意到的事实: Gemini Flash 3.7 > DeepSeek V4 Pro 0813 包括并不限于:速度、代码能力、审美、多模态能力
Gemini 3.7 Flash 出乎意外的好用耶。 Gemini 这次有望从“美国豆包”的阴影里走出来(一点点)了
0
76
196
5
转发到社区
Gemini 3.7 Flash 出乎意外的好用耶。 Gemini 这次有望从“美国豆包”的阴影里走出来(一点点)了
0
46
97
3
转发到社区
这个不能称之为证据啊,你可以点进去看一看。这个文件夹是为了方便 Claude Code 能够使用DHS 内置的 skill。这是有意为之的,挺好的设计。
@bourneliu66 来,我给你个更明显的证据,可以去发新帖开喷了
0
47
16
1
转发到社区
我原本预测Codex会在8月14日重置,因为8月13日大家的重置卡过期。 我预测失败了。因为,我完全没想到, @thsottiaux 老师比我以为的还要更腹黑:他竟然选择在8月13日当天重置,这比在8月14日重置更省钱。 👍
显示更多
一个非常合理的猜测:codex下次重置时间是8月14日。 原因:7月codex赠送大家的banked resets,如果你还没使用,将会在是8月13日过期,也就是说,大家一定会在8月13日使用。 @thsottiaux 如果在8月14日选择对所有人重置codex,实际付出的成本最低、又能延续了“codex会将重置狂欢延续下去”的童话。
显示更多
0
81
54
1
转发到社区