注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 实战反馈
实战反馈 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 实战反馈 的推特
“宾馆空调还是太冷了,三个人一起😴刚刚好!” 咨询教学或观看更多学员精彩实战案例请关注👇 推特主号👉:@nange9111 🔥全网最高效约炮教学,导师一对一实战指导,包学会包约到🔥 #约炮教学# #3P# #实战反馈#
显示更多
0
0
66
284
转发到社区
“天气太热了,欲望都被热没了!”—— 只能和妹妹一起看看电视,吃吃西瓜,早早睡了! 咨询教学或观看更多学员精彩实战案例请关注👇 推特主号👉:@nange9111 电报群✈️: 🔥全网最高效约炮教学,导师一对一实战指导,包学会包约到🔥 #约炮教学# #实战指导# #实战反馈# #思维提升#
显示更多
0
1
205
1.6K
转发到社区
【新课预告】用户想要,用户得到!这一期的 Loop Engineering + Codex 的课程太太太好玩了! 1. 用户提出想要接入seedream5.0的反馈,开发者后台收到后,切换任务状态和设定目标 2. Agent 会通过自动化,每隔30min扫描需要开发的工作 3. Agent 会通过 Loop Engineering + worktree 实现目标开发、测试全流程 4. 管理员在对应worktree测试通过后,切换状态到待上线 5. Agent 自动完成项目上线 下午录制,过两天剪辑完发布到我的连载AI编程实战课中,欢迎大家学起来!
显示更多
我看了一下@ycombinator 今年的项目,基本上都是 1. FDE/Router + Vertical Application: 模型router → 针对某个具体场景做优化 → 接入业务 workflow → 用数据反馈继续优化。 初创公司卖模型,初创公司都是中转站。 2. Router + LLM Optimization / Infra: 跟上一类不一样,这种是解决大模型调用本身的问题:routing、cost、latency、eval、observability、prompt optimization、fine-tuning、inference 等。 比如说 @WorkWeave 这个产品,他们说自己是AI to understand and then route engineering work。最开始的产品更像是 AI-native engineering analytics:接 GitHub / PR / Claude / Cursor 等工程数据,然后用模型分析: 工程师到底完成了多少工作 哪部分代码是 AI 写的 AI coding tools 有没有真正提高 productivity AI 花了多少钱、ROI 怎么样 哪些任务 AI 做得好、哪些做得不好 后面他们这个方向跑到最后发现还是需要模型聚合能力,他们就往一个中转站走了,然后发布了weave router。 他们分析 各种企业的Claude Code workload 后称,大约 60–70% requests 是比较简单的 completion,这些任务用便宜的 open-source model 可以做到相近效果,而成本可能只有约 1/40。 Coding request → Weave classifier/router → 判断任务难度 → 选择模型。 所以拆解一下这家公司就是做Router + Vertical Coding 场景,Weave 这种模式比单纯做一个LLM中转站 Router 更值得借鉴,先找到一个 token spend 巨大、任务高度重复、而且不同任务对模型能力要求差异巨大的 vertical,尤其是coding场景,然后做它的 intelligent routing layer。 所以我感觉年初做中转站的经验虽然没有给我个人带来什么经济收益,但是确实积累了很多实战技能,比如说如何从零到一搭建中转站,如何做FDE,挨个建群解决用户的api问题,比如我自己搭画布接seedance。 往后来看这种经验太值钱了,以后的ai startup都会是这个形态。
显示更多
0
10
58
3
转发到社区
推荐这篇文章。一个 agent 评测系统被自己的评分骗了整整一周——两个标准在互相拉扯,总分却看起来正常。 Similarweb 的高级 AI 工程师 Liora Korni 在 7 月 29 日 LangChain 博客上分享了一篇实战文章:如何评估一个生成长篇研究报告的 agent 系统。文章的价值不在方法论本身——LLM-as-judge 和 rubric 都不是新概念——而在他们把评估当作产品架构的一部分来做的具体教训。 两种输出,两种评估方式 Similarweb Data Studio 是一个 agent 系统:用户用自然语言提问,agent 规划、调用数据工具、检索数字、写出答案。它要处理两类完全不同的输出: 普通对话:聚焦问题,答案形状可预期。评估方法简单——golden answer + semantic judge 判断"是否表达了同样的意思"。 深度研究报告:长文输出,包含来源、解读、建议、风险提示和叙事结构。同一问题可能有多种好的答案。Golden answer 不适用——匹配 gold answer 只会奖励相似性而不是质量。 Rubric 方案 深度研究报告的评估用 rubric prompts:每个质量维度有自己的评分锚点。例如 source_integration 标准: • 0.0:纯粹依赖单一数据 API,无外部上下文 • 0.3:模糊引用"行业报告"但不点名 • 0.8:引用多个带名称、日期、数字的来源 • 1.0:广泛使用归因明确、融入叙事的来源 每个维度返回分数 + 解释 + 差距说明。不只是一个数字。 除此之外还加了 faithfulness check:每个声明是否真的来自检索数据?还是 agent 夸大了来源支持的内容? 最贵的教训:花了整整一周跟自己的评估打架 文章里最值得读的部分:一次 prompt 的小改动让总体评分下降。 他们花了一周反复 revert、调整、re-run。报告每次看起来都很好,但数一直在说不。最后有人打开逐标准评论才发现——新版报告引用了更多来源(提高了 source breadth),但这些来源都是模糊的(拉低了 attribution)。两个标准互相拉扯,总分隐藏了冲突。 修复了评分锚点后(从"引用更多来源"改为"引用命名、可验证的来源"),同一个报告的分数从 0.7 降到了 0.3,数值终于匹配了评论一直在说的东西。 核心教训:一个校准错误的评估比没有评估更糟糕,因为它给你虚假的信心。 最终的评估循环 1. 从假设开始 2. 跑一个小评估获取信号 3. 检查反馈评论和 traces 4. 跑完整 benchmark 并重复 5. 与 baseline 或 A/B 输出对比 6. 决定合并、迭代还是重新校准 原文: #AgentEvaluation# #LLMasJudge# #LangSmith#
显示更多
不花一分钱也能把计算机系的课补齐,这套免费路线按顺序学,比报培训班还系统。 1️⃣ 先用 CS50 建立全局认知。 哈佛这门公开课是公认的最好入门课,从 C 讲到 Python、Web,跟完你会系统性理解编程,不需要一上来就抠语法。 2️⃣ 再上 The Odin Project 真正动手写。 它带你从零搭出能跑的全栈项目,边做边学,卡住很正常,这一步就是逼你踩坑、建立工程手感。 3️⃣ 想边做边攒证书就配 freeCodeCamp。 几千道交互式练习加实战项目,写代码立刻有反馈,适合维持手感和补练习量。 4️⃣ 打基础别跳过 它给了一份「自学计算机科学」的硬核书单和课程清单,算法、操作系统、网络这些底子按它列的顺序补,决定你能走多远。 5️⃣ 最后用 对照查缺。 前端、后端、DevOps 各方向的技能路线图都画好了,照着勾一遍就知道自己还差哪块。
显示更多
招聘实习生啦! 方向是:视频内容制作+ Vibe Coding。 我们一起工作,相关经验我都会尽量倾囊相授。 1. 主要负责 A. 体验最新AI 产品,挖掘有趣功能、使用场景 B. 协助视频选题、脚本撰写和录制素材 C. Vibe Coding 做网页、demo、工具,把想法快速落地 2. 最重要的 3 个能力 - 拥抱 AI 和Vibe Coding:愿意用 AI 做demo、工具、内容素材 - 主动性强:不只是等任务,主动提想法、推进。 - 做事有回应,做之前先确认,中间有问题及时提出,做完及时反馈。 3.我能提供 - 高强度接触最新AI 产品和真实项目 - 自媒体增长和视频内容制作实战经验 - AI 产品开发经验 - 实习薪资 - cover ai产品订阅费 4. 报名方式: 直接X后台私信 或者 邮箱:hello@creatos.io 请在私信或邮件中提到下面几个点: - 简单介绍你的经历:学校/专业/过往实习/做过的项目都可以 - 做过的内容链接:文字贴/图文/视频皆可,没有则跳过 - 做过的网页、产品或开源项目链接:没有则跳过 - 目前使用AI做哪一方面的工作? - 为什么想申请这个实习? - 其他任何的补充。 注:100%远程
显示更多
0
65
97
5
转发到社区
为什么很多人把币安@binancezh当 “安全选项” 随着几家平台的退出市场,群里聊问资产安全的人也多了不少 很多人选币安,不是盲目信头部名气,是它有几项可验证的安全支撑,全都公开可查,看完你就明白了! 🟨第一是储备金机制: 这是中心化平台的底线,之前爆雷的平台,基本都栽在挪用用户资产、不敢公开完整储备上 币安是行业较早落地链上储备金证明的头部平台,BTC、ETH、USDT 这类核心资产储备率长期超 100%,用户每一份资产都有真实币种对应 每个人都能通过默克尔树自行验证持仓是否在储备池中,链上数据不可篡改,没有造假空间,官网也一直公开储备地址和持仓快照,随时可以核对 币安储备金官方链接: 🟨第二是 SAFU 用户保护基金: 这不是空头承诺,是经过实战检验的 基金 2018 年设立,从平台手续费里抽取 10% 持续注入,峰值规模超 10 亿美元,单独存放于冷钱包,不参与日常经营 2019 年平台遭遇黑客攻击,损失折合四千多万美元,最终全部动用 SAFU 基金全额赔付,用户没有承担任何损失 有过实打实的赔付先例,比多少安全宣传都有说服力 🟨第三是全球合规布局: 和 “加密平台都躲监管” 的刻板印象不同,币安这些年一直在主动拿牌,迪拜、拉美、亚洲多地都持有正式运营资质 此前与美国监管达成和解,缴纳罚金并接受合规监察,本质是选择接受约束,而非一走了之 监管覆盖的范围越广,违规跑路的法律成本就越高,对用户也多了一层制度保障 🟨第四是体量与生态的稳定壁垒: 目前币安注册用户超 3.2 亿,现货交易量长期稳居全球第一,还有规模庞大的 BNB Chain @BNBCHAIN公链生态,本身已经是行业基础设施 平台利益和整个行业深度绑定,一旦出问题,最先毁掉的是自己最核心的资产,代价极高 冷热钱包分离、多重签名、第三方安全审计这些,都属于头部平台的基础配置,就不展开了 🟨第五是核心团队的公开度: 行业里有些平台的核心团队平时很少公开露面,用户和平台之间总隔着一层 币安这边就不太一样,核心管理团队一直保持高频公开亮相,全球各地的行业峰会、线下活动都能看到他们的身影 像大家再熟悉不过的一姐@heyibinance,sisi @sisibinance丫丫@yayabinance等核心负责人,也长期活跃在社交平台和各类用户社群里,很多用户反馈的问题都能得到及时响应,整个团队始终处在公众视野当中 对中心化平台来说,核心团队越公开、越深度参与行业和社区事务,长期经营的意愿就越明确,用户也始终有顺畅的沟通反馈渠道,基本不会出现突然联系不上的情况 当然也不是说它就绝对零风险,所有中心化平台本质都存在信任成本 以上这些只是公开可核实的事实,大家选平台时,可以拿这些标准自行比对 在这个行业里,资产安全永远是第一位的,稳始终比短期噱头重要,也希望各位 builder 都能找到适配自身节奏的平台与生态,踏实做事,稳步前行! @cz_binance @moonkimbinance @pearbinance
显示更多
0
83
97
4
转发到社区
大使计划正在成为 AI 时代 GTM 的核心策略之一。 最近观察到越来越多项目开始启动大使计划,这不是偶然——当付费流量的边际效率下降、当用户越来越只相信”人”而不是”广告”,由真实用户组成的信任网络,就成了新阶段最珍贵的分发资产。 我们团队从 2025 年上半年开始,跟合作方一起设计并推进大使计划,就效果而言,我们通过大使计划: 1/ 为某交易产品带来累计近 20 亿美金的交易量; 2/ 为某 AI 产品带来每月近百万曝光,整体 CPM 相较其过往投放下降约 60%。 但这套打法并不是简单粗暴地“招募+管理”能跑出来的。大使计划的每一个环节,都会直接影响最终的运营结果。 以下是我们在实战中总结出来的四个关键点: 1/ 先建品牌,再启动大使计划 大使某种程度上是项目的“兼职成员”。要吸引到认真负责且有影响力的大使,本质是让他们感受到——这个产品值得推、这个团队值得跟、“我成为其中一员”这件事本身能带来身份价值。 如果项目本身还没有建立起品牌,大使招募会同时面临高质量候选人不来,来的人也难匹配理想画像。 大使计划不是品牌建设的替代品,而是品牌基础上的放大器。放大器只在有信号可放大的时候有意义。 2/ 大使筛选:信任 > 数据 Marketing 的核心是构建信任,而不仅仅是采买曝光。这也是大使计划相较于一次性投放的根本差异——持续在场的信任累积,远比一次性曝光更能转化成用户决策。 因而在招募大使时,大使的粉丝数、流量数据这些“表面指标”,重要性远低于”他是否真的信任这个产品和团队”。 只有构建起信任,双向的正循环才能持续跑起来。 举个我们合作过的例子:一位大使只有几百个关注者,但在跟项目团队深度交流后,真的认可产品价值,从此持续参与建设。最终这位大使为产品带来了显著的关注和用户增长,自己也在这个过程中获得了远超预期的回报。 3/ 理解大使的真实诉求 经济回报,毫无疑问是大部分大使的核心动机,但在钱之外,大使们其他的诉求反而更重要,比如: - 身份认同感:“我是这个正在崛起的项目的早期成员” - 学习机会:“我在这个圈子里能接触到最前沿的信息和人” - 资源积累:“参与这件事本身,让我成为一个更值得被联系的人” 顶级项目的大使计划,从来不只是“付钱换传播”,而是构建一个让参与者能持续获得成长的生态。 4/ 主动引导,双向助力 大使计划里最容易被忽视的一点是:项目方也需要为大使的成功负责。 这意味着项目方要主动思考如何帮助大使更容易地达成好的曝光和转化? 具体动作比如: - 提供高质量的内容素材(研究报告、数据图表、可编辑模板) - 协助大使举办本地社区活动(提供预算、SOP、物料) - 根据大使反馈优化产品功能(比如加更方便追踪的分享链接、专属身份标识) 大使的每一次输出效果,都会反过来决定他愿不愿意继续做下去。 ———— 坦白说,过去几年,“大使计划”在很多社区里的形象并不好。 在很多人的印象里,它约等于“项目方用低成本来 PUA 社区成员干活”。所以那些真正有能力、对项目看好的社区成员,反而对大使计划保持距离。 这是一种可惜的错配,最应该成为大使的人,被这个词的负面印象挡在了门外。 但我们相信,越来越多的项目方会开始重新认真对待大使计划,把它从“低成本的宣传方式”升级为“信任驱动的增长的重要环节”,并给到大使真实的支持和尊重。 大使计划需要精细化的设计、持续的运营和耐心。但一旦跑通,信任和增长的飞轮就会越转越快,那种复利效应,是任何付费投放都难以换的。 ———— 最后配图分享下跟我们团队合作推进大使计划的客户反馈。 如果有对大使计划合作感兴趣的朋友,也欢迎跟我们团队 @JELabs2024 一起交流探讨~
显示更多
0
50
43
1
转发到社区
27B小模型挑战Fable 5? 还成功了? 劲爆消息, 在 Iterative-Contextual-Refinements 这个框架的加持下, Qwen3.6-27B 跑分超过了 Anthropic Fable5! 真的不是做梦吗? 还是跑分没输过, 实战没赢过? 于是赶紧看了一下这个框架, 发现设计的很有启发性, 能学到很多东西, 给大家详细讲下. 这个框架主要提升的是软件性能优化, 即如何才能让代码性能更高. 大家如果还记得我那个 vector-db-bench, 给大模型提供了火焰图, perf, 各种测试 tool_call 让大模型自己迭代去优化代码性能. 而这个框架更进了一步, 它瞄准了小模型的最核心弱点, 参数量不足导致的"脑残", 即小模型更容易长上下文衰退或陷入局部最优. 于是这个框架出手了, 先针对技术方案, 它搞了个BFS探索模式, 在写代码的 plan 过程, 让小模型自己提出多种解决方案, 比如写个字符串匹配, 小模型直接搞了个O(N^2)的暴力搜索, 而这一步它的Agent会让小模型思考, 你能想到哪些可能的解决方案? 于是就拓展了小模型的视野, KMP, 滑动窗口等技术方案没准就出来了. 然后就是写代码的过程中使用的DFS模式, 它会借助Agent让小模型借助代码性能测试工具不断跑分, 然后让小模型反思, 有哪些性能热点可以优化, 然后进行优化. 最后, 他还有个统筹全局的路由, 不但负责在BFS/DFS过程中选取最佳的技术方案, 而且还会在DFS过程中, 总结模型优化过程中面临的问题, 再反馈到BFS过程, 告诉模型, 需要注意xxx优化是有价值的, xxx优化面临xxx问题. 从而形成优化闭环, 解决掉模型陷入死胡同不断仰卧起坐的问题. 最后, 在框架加持下, Qwen3.6-27B 在 CGRE 测试得到了95.5分, 成功超越了 Fable5(Mythos) 的94.1分! 我只能说这真的是 Agentic 工程的胜利了! 不要模型写的不好就无脑怪模型, 也要看看是不是Agent本身有问题. 那么代价是什么呢? 当然就AI硬通货是 token 了, 这个框架正是用了25-40x的token消耗完成了这一壮举. 值得学习. 框架: 论文: #mythos# #fable5#
显示更多
0
75
547
65
转发到社区