注册并分享邀请链接,可获得视频播放与邀请奖励。

Yanhua
@yanhua1010
AI、Agent前沿与实战,出海赚美金 Reddit 讨论中发现产品机会 📮:yhaiwang1027@gmail.com
865 正在关注    36.6K 粉丝
卧槽??一个不到 2B、能本地部署的小模型,给真实 Issue 做分类,跟 JEV 的结果居然这么接近? 最近 JEV 的玩法看了不少,给邮件分类、给 Agent 选工具。这类需求太常见了,我就想知道这张工单该分给谁、下一步该调用哪个工具,真不用每次都给我写一篇分析。 所以这次我把 JEV 和 This That 都接进 Pi,直接拉了 OpenAI Codex 仓库的 30 条真实 Issue,让它们现场做题。 用户是在报 Bug、提功能需求,还是问怎么用?问题出在登录、界面、执行还是会话? 同一份内容、同一组选项,每条做两项判断,两边各发 60 次请求。 跑完一看:JEV 用了 23.5 秒,This That 用了 25.6 秒。30 条里,28 条的两项判断完全一样,两边都没出现请求失败。 速度这轮还是 JEV 快一点。但 This That 只有 18.8 亿参数,权重约 3.76GB,而且能下载到自己机器上跑。这个结果真让我想继续折腾一下了。 它的用法也很干脆:把问题和选项给进去,一次计算直接返回选择和概率。程序拿到结果就能接着往下走,不用再从一大段回答里抠出一个“是”或者“否”。 更实用的是本地部署。客户工单、内部文档、还没发布的产品资料,这些东西只是想分个类,也不一定愿意全部发到外面的 API。 This That 支持 NVIDIA GPU、Apple Silicon 和 CPU,可以把这一步判断留在自己的设备上。做 Agent 的人,手里又多了一个能自己控制的小工具。 这次我跑的是 API 对比,本地性能还没测。28/30 是两个模型判断一致,也不等于准确率,这两个口径先说清楚。 完整录屏放上面。做客服分流、邮件分类、Agent 工具选择的,直接拿一批自己业务里的真实数据试试,比盯着榜单猜有用。 模型和权重: 免费体验地址:
显示更多
都是 Fable 5,放进 Claude Code,成本接近 Pi 的两倍。成功率只多了 1.1 个百分点。 看着有点难以置信。 Arena 发布的这项 HarnessTax 研究,把 7 个模型分别接进 Claude Code、Codex CLI 和 Pi,跑了两套编程测试。 其中,SWE-bench Lite 抽样测试上,Fable 5 的结果是: Claude Code:成功率 97.8%,平均每次尝试 $1.33。 Pi:成功率 96.7%,平均每次尝试 $0.67。 更有意思的是,两边平均都跑了 15 轮左右。Claude Code 并没有多干多少轮,但每轮花的钱不一样。 不过这里算的是 API 成本,跟订阅费是两回事。Claude 订阅里的额度,A➗也不让你随便拿去接第三方 harness。 其他模型的 harness,我一直推荐 Pi。就我自己的使用来说,目前还是它最均衡。 完整测评报告👇
显示更多
B站UP主都开始卷开源了! 8 月 13 日,2个UP主做的插件杀进了DSH插件榜一和榜三。 一个是“colleague-skill”,现在已经升级为“dot-skill”,把一个人的工作经验沉淀成可复用的 AI Skill; 一个是“OpenBiliClaw”,把跨平台内容发现做成本地优先的 Agent。 它们的共同点是:内容创作者不只是在 B 站讲 AI,而是把自己的观察和需求,做成可以安装、Fork、继续迭代的开源项目。 内容在 B 站被看见,项目在 GitHub 被沉淀,最后装进 DSH 里运行。 这也许是内容创作者正在出现的一种新形态。
显示更多
0
9
77
14
转发到社区
B站UP主都开始卷开源了! 8 月 13 日,2个UP主做的插件杀进了DSH插件榜一和榜三。 一个是“colleague-skill”,现在已经升级为“dot-skill”,把一个人的工作经验沉淀成可复用的 AI Skill; 一个是“OpenBiliClaw”,把跨平台内容发现做成本地优先的 Agent。 它们的共同点是:内容创作者不只是在 B 站讲 AI,而是把自己的观察和需求,做成可以安装、Fork、继续迭代的开源项目。 内容在 B 站被看见,项目在 GitHub 被沉淀,最后装进 DSH 里运行。 这也许是内容创作者正在出现的一种新形态。
显示更多
0
9
77
14
转发到社区
从benchmark看,Qwen3.8 已经追平甚至超越了Claude Opus 4.6 Max的水平🎉 是不是每次看到模型测评的各种benchmark都一头雾水? 我整理了一份常用工程向benchmark术语词典,覆盖代码/软件工程、通用Agent、专业领域等22项评测,帮你快速搞懂每个分数到底在测什么:
显示更多
We promised open weights for Qwen3.8. Now, time to meet them! 🎉 ⚡ Qwen3.8-27B: - A native multimodal dense model. With just 27B parameters, it outperforms Qwen3.7-Plus overall and shines in real-world coding & office workflows. - 262K native context, easily extendable to 1M tokens via YaRN. - Built for builders. Highly efficient, high-quality, and licensed under Apache 2.0. 🚀 The open weights for Qwen3.8-2.4T-A95B (Max-level) have also been released recently. Whether you're shipping lightweight applications with Qwen3.8-27B locally or building agents with Qwen3.8-2.4T-A95B, they're yours now! Download, deploy, and build something we haven't imagined yet. 👀👇 - Hugging Face: - ModelScope:
显示更多
DSH生态从发布就已经开始疯狂生长了…… 一位大二休学的00后直接把官方 DeepSeek Harness 打包成了一个开箱即用的桌面应用,不需要复杂的环境配置、命令行启动。
显示更多
dsh desktop上线一天已经1.8k star啦! 感谢大家的喜欢 昨晚又一夜没睡 插件市场即将上线 手机端也在开发了 项目地址:
显示更多
新鲜出炉 Deepseek harness教程,使用DeepSeek v4 pro max 做了个手把手教程。 👉 DeepSeek Harness原理与实现:从零到一实现一个 AI Agent 🌍在线学习: 🔗仓库地址:
显示更多
0
22
231
43
转发到社区
授人以鱼不如授人以渔! 推荐一个超好用的 Skill,特别适合各种模型对比场景。 用它快速生成了 GLM-5.3 vs DeepSeek-V4-Pro 的完整对比 HTML,交互清晰、一目了然,真的太方便了🔥
显示更多
Introducing GLM-5.3: Built to Code. Ready for Cyber Defense. - Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model - A major leap in cybersecurity, setting a new standard among open models Tech Blog:
显示更多
我敢说,现在90%的人已经区分不了黑鲸鱼和蓝鲸鱼🐳的区别了。 估摸着接下来会有一大批鲸鱼变种哈哈哈。
新鲜出炉 Deepseek harness教程,使用DeepSeek v4 pro max 做了个手把手教程。 👉 DeepSeek Harness原理与实现:从零到一实现一个 AI Agent 🌍在线学习: 🔗仓库地址:
显示更多
AI时代如何做好产品? 跟dsh反着来就行了。
0
11
22
1
转发到社区
DSH (DeepSeek Harness)开源,属于开发者的集体狂欢。 上线不到24h,已经突破5w star🌟
新鲜出炉 Deepseek harness教程,使用DeepSeek v4 pro max 做了个手把手教程。 👉 DeepSeek Harness原理与实现:从零到一实现一个 AI Agent 🌍在线学习: 🔗仓库地址:
显示更多
新鲜出炉 Deepseek harness教程,使用DeepSeek v4 pro max 做了个手把手教程。 👉 DeepSeek Harness原理与实现:从零到一实现一个 AI Agent 🌍在线学习: 🔗仓库地址:
显示更多
0
22
231
43
转发到社区
卧槽,grok 4.6 一个简单任务就消耗了7%,thinking level还是medium。 真的需要加钱了哈哈🤣
0
15
13
0
转发到社区
每次模型发布都是自媒体的狂欢。 但不必fomo,deepseek + pi 依然是目前你能用到的、综合性价比最高的组合。
🎉🎉今日福利:manus 1.6和1.6 lite agent限时免费。 另外,如果你是manus重度用户,记得在2026年8月23日 8:00之前备份数据。
grok bot的竞品不是codex,hermes这类agent,更准确说的是manus。 所以,manus的含金量还在上升。
Introducing Grok Bot, now in early beta. Bots are AI teammates that do real work for you. They sign in to your tools, use them just like you do, and come back with finished work.
显示更多
一个人走得快,一群人走的远。 跟着hz老师跟大家一起学习出海,继续找词、上站吧。
大家线下一起多交流,即使是网站出海的同一个环节,每个人自己注意到的好方法,也会有一些忽略的地方,大家一起交流碰撞,补齐自己缺失的短板,吸收一些新的方法,共同成长,期待大家都做大做强。
显示更多
一个几百行的 CLAUDE[.]md,可能正在把你的 Claude 越调越傻。 再叠加 Superpowers 这类重型工作流: Token 消耗越来越高,响应越来越慢,模型还经常抓不住重点。 你以为自己在做 Context Engineering,实际上可能是在制造 Context Pollution。 把下面这段发给 Claude,让它自己检查一下👇
显示更多
美国想赢这场 AI 战争,开放权重可能是绕不开的底牌。 最近 Kimi K3 的表现,已经证明了这条路线的价值。 英伟达 CEO Jensen Huang 在X 第一条推文,就分享了 NVIDIA、Meta、Microsoft 等 25 家机构联署的 Open Weights 公开信。 老黄眼光够毒,这下压力给到 Dario 了。
显示更多
For my first post, I’m sharing a letter @NVIDIA signed on why open models matter. AI will transform every industry, power every company, and be built by every country. Open models strengthen safety and cybersecurity, accelerate innovation and diffusion, and enable sovereignty. The world needs both frontier closed models and frontier open models.
显示更多
国内开发者做出海,最烦的往往不是产品,而是收款。 我目前自己的产品就在用 Creem,今天它又更新了两个关键能力: 1. 支持支付宝 2. 支付链接可以直接嵌入网站 不用先搞定 Stripe,不用为了收款注册一堆东西,就能更快开始卖产品。
显示更多
0
59
346
40
转发到社区