註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 越尾圭
越尾圭 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 越尾圭 的搜尋結果
她平时那副清冷/乖巧/高冷/文静的样子,真的骗到太多人了。 结果一到床上/一被按住手腕,整个人就像突然坏掉的瓷娃娃—— - 腰细得一只手就能圈住,偏偏臀又翘又肉,往后一顶就是满手炸裂的软弹 - 腿明明那么长那么直,一掰开却抖得不成样子,脚趾都绷得发白 - 最要命的是那张脸:越是想忍、越是咬着唇不叫出声,眼尾就越红,泪痣像被水泡过一样发亮 - 声音也反差到犯规,平时说话轻得像羽毛,失控的时候却又细又哑,带着点哭腔的“不行了…真的不行了…”听得人头皮发麻 紧是真紧,裹得人想骂脏话的那种紧。 但她越紧越往里吸,像要把人整个吞进去还不肯松口,里面又热又软又湿,抽一下都能听见黏腻的水声。
顯示更多
0
0
45.8K
5.4K
轉發到社區
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
顯示更多
0
46
33
2
轉發到社區
很多人聊天聊到最后 对方越来越冷淡 根本不是因为你不有趣 而是你从头到尾 都只想着自己要回什么 对方在分享人生 你却只忙着回覆讯息 这种聊天方式 再聊100天都不会有感觉 真正有吸引力的聊天 从来不是你多会讲话 而是 你有没有让对方觉得 「你懂我」 你知道什么叫互惠式的自我揭露吗 简单讲就是 对方愿意分享一点自己 你也愿意交换一点人生 而不是像面试一样 一直丢问题 也不是像推销员一样 拼命展示自己 比方说女生跟你讲 她最近在重听周杰伦 很多男生只会回 喔我也很喜欢啊 然后直接把话聊死 但真正会聊天的人 会去接住对方的情绪跟回忆 你第一次听周杰伦是哪一首 以前会不会用MP3偷听歌 学生时期有没有哪首歌陪你很久 因为聊天真正厉害的地方 从来不是话题本身 而是你能不能透过话题 走进对方的人生 像我自己以前国小的时候 朋友借我一张周杰伦的CD 那时候回家还偷偷锁房门听 觉得自己超帅 现在回头看 根本中二到不行 但你会发现 当你开始分享自己的故事 对方也会慢慢开始卸下防备 因为人跟人之间的亲密感 不是靠查户口建立的 是靠 「我愿意让你认识真正的我」 很多人聊天会句点 不是因为嘴笨 而是他只想把话讲完 没有想让对方参与进来 真正会让人上瘾的聊天 不是幽默 不是套路 也不是秒回 而是你们聊着聊着 突然发现 原来彼此的人生里 有那么多相似的情绪跟回忆 聊天的底层逻辑只有一句话 不要急着让对方喜欢你 先让对方 愿意走进你的世界
顯示更多
说下地支,神龙不见神尾说明辰本身就是阴晴不定变化莫测,你仔细观察带有辰的人会发现他们强势但很情绪化。 虽然大部分人都很讨厌丑这个地支,但不得不承认丑其实富有爱心且是本性善良的群体。 还有一个很愿意照顾周围人的是戌,善良而忠诚。 子和寅一样事业心很强,子通常中年开始运势好晚年安乐。 地支卯越多内心藏着的秘密越多,男生有卯还代表他可能很会伪装 带有巳的人属于外冷内热,心思细腻尤其是女生带巳身上会有种神秘感,很吸引人。
顯示更多
女权博主“来杯姬尾酒”被曝光已经不是第一次,带头冲锋体制内的警察队伍了,早在上个月就写过一篇小作文曝光海底捞事件,被跨省约谈冲上了热搜。 因为有媒体在背后推波助澜,这件事没有个最终结果,没想到仅仅时隔一个月,又又又发生了这件“禁烟事件”。 篇篇小作文, 月月登热搜, 拳拳冲警方, 事事怼体制。 多名男博主认为,早就该给予严惩,否则类似的事情只会越来越多。 陈哥认为还是在等子弹飞一会,事情越闹越大,官方肯定会出后续回应的,
顯示更多
0
28
260
11
轉發到社區
今天每个群都在聊了,故事越听是越牛逼,大家可以去看一下他的故事。 非常纯粹的热爱,我真的很喜欢这种从头到尾不谈钱的故事。人们在传播这个故事的时候,没有一个人说他赚了多少钱,只是热爱,从零到一,赢得胜利。
顯示更多
从来不看摩托赛事的我,今天被这张图刷屏了。。。 竞速运动拉出这种距离,我只在博尔特上看到过,牛逼。
0
26
120
6
轉發到社區
为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 微博VibeLab AI 创意赛收官了,一共有 2500 多件原创作品,2.4 亿多话题阅读。很荣幸这次是评委一员,有机会翻看了不少优秀的参赛作品,也转发了其中一部分。 一个直观的感受就是软件开发这种事情,不再需要专业人士了,普通人也能 Vibe 一个工具出来。 所以借这个机会,整理总结一下:为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 一、写代码这件事,门槛和成本都降下来了 写代码以前是程序员的专利,想写个工具,别说学语言框架,搭个环境都费劲的要死,随便一个环境都能把你卡住,像我这样写程序得有很多年的,换个不熟悉的语言,一样也搞不定。 现在借助 AI Agent,门槛一降再降,现在你只要有一个 Agent,会打字或者会语音,都能指挥 Agent 帮你写一个 App 出来。写代码这件事,从以前需要专业技能,到现在变成了语言表达能力。 我自己身上都有明显变化,从以前对 Vibe Coding 的嗤之以鼻,到现在“真香”,每天都大量的在指挥 Agent 帮我写代码。 二、以前的软件,满足不了长尾需求 长尾理论说的是,需求分布是一条长长的尾巴:头部是大多数人共有的需求,尾巴上是无数小众的、个性化的需求。传统软件只能做头部,因为为少量用户单独开发功能,成本上是不合算的。 而且,就算你有个好想法,也很难传递到开发者那里。想象一下一个普通用户的需求要经过的链条: 用户反馈 → 产品经理收集筛选 → 转化成需求文档 → 设计师出设计稿 → 程序员做系统设计 → 编码 → 测试 → 运维部署 每一环都在过滤、都在排优先级。最终大部分普通用户的需求,都被筛选掉了,软件最终只能取最大公约数,做绝大部分人都需要的那部分。 结果就是,市面上的软件很多,但每个人都有一堆“要是能这样就好了”的小需求,从来没有被满足过。 这次 VibeLab 里我印象很深的一个作品是 @机器旁白 做的 SiaoCut 。起因是他看到我做的 BaoCut,很喜欢“转写、像改文稿一样编辑、AI 处理、人工审阅、导出”串成一条工作流的思路,但 BaoCut 只支持 macOS,他是 Windows 用户。放在以前,他只能等我哪天有空做个 Windows 版,或者就此作罢。现在他自己和 AI 一起做了一个,而且不是简单复刻,还在这个过程中想清楚了自己关心的问题:AI 进入剪辑流程后,应该拿到多少数据,能替创作者决定到哪一步。 这就是长尾需求被满足的样子:不需要等别人来做,有需求的人自己就能把它做出来! 三、Vibe Coding 让成本变低、链条变短 所以以前那种长长的从需求到交付的链条,现在可以缩成简单的几步: 有个想法,让 AI 去设计、制作、部署。 甚至于很多需求根本不需要做成一个有界面的产品。 比如你想每天自动整理某个表格里的待办,或者每周追踪最新的 AI 资讯,这些事让 AI Agent 帮你写个脚本,再让它自己定时调用就行了。 比如 @张铁蕾 开源的 Bridgic Agent 就是这样的作品:输入 /build,描述你的目标,它自己去探路、生成、验证,遇到需要你判断的地方再来问你。做出来的不是一次性跑完的任务,而是可以长期运行、随时修改的工作流。 还有一种更轻的做法:把你的操作流程、经验和偏好写成 Agent Skill,就像一份告诉 AI 怎么做某类事的说明文档,那么以后 Agent 就能按照 Skill 的说明帮你把很多繁琐的事情变成自动化半自动化的操作,大幅提升你的效率。 现在随着 Agent Computer Use(操作电脑)的能力增强,你甚至可以让 AI 观察你操作一遍,然后它自己能把它你的操作录制成 Skill。不需要界面、不用部署,但它确实能替你干活。 四、模型和智能体的能力,一直在变强 现在普通人也能 Vibe Coding,还有一个重要原因是模型能力在变强。 回头看这几年的变化: 最初,像 GitHub Copilot 只能做代码补全,你写一半它提示后半段; 然后,它能根据描述生成一段完整的代码; 后来, Claude Code 能自己在项目里探索,读文件、找上下文,把一个功能完整实现; 现在,主流 Agent 都已经能做设计、写代码,还能帮你操作电脑,打开浏览器自己验证做出来的东西对不对。 模型每上一个台阶,普通人做工具的难度就降一截。VibeLab 期间正好赶上 Kimi K3 发布,很快就有创作者拿它做体检报告工具、做斗地主游戏,还有人把 Claude Code、Qoder、GLM、Kimi K3 混着用。 由此也可以看得出越来越多的人已经不再把 AI 当聊天机器人了,能配合 Agent 把 AI 当干活的工具。 五、变化的还有“做工具”这件事本身的心态 看作品的时候我还注意到一点:很多作品不追求改变世界这种宏大的事,就是想先解决一个具体麻烦。比如说工作流太碎、长辈不听劝、拍照没人帮、看不懂热点,作品的起点都是这样一个一个具体的痛点。 最初微博在设定大赛规则的时候,把赛道拆进职场、生活、视觉、微博这些具体场景,现在看来还挺有道理的,因为这确实能激发人 Vibe 的冲动,想去用 AI 解决生活中的问题。 其实这次参赛的作品也不都是工具。@世界第一裹凉皮 把 32657 位诗人、933857 首诗做成了一个三维宇宙 ;@德里克文 的「华夏博物志」把全国博物馆收进一幅可以点开的中国画 ;@海辛Hyacinth 把三星堆&金沙文物变成了互动场景 。这些作品看起来似乎不像工具那么实用,但让我们看到 Vibe Coding 不只是提效,也可以服务于文化和审美。 以前想做这样的东西,需要一个团队,现在一个人,不需要会写程序,有自己的想法加上 AI 就可以试试看。 最后,如果你也想自己搓一个工具,我的一点建议: 从写一个 Agent Skill 开始。 这是成本最低的方式:不用部署,不用界面,把你希望 AI 帮你做的某类事情写清楚就行。做一次,发现哪里不对,改一改,很快就能用起来。 顺便推荐下我的书《图解 Skill》,也是不错的 Skill 入门书籍。 如果要做网页或者 App,不用一上来就让 AI 把整个东西做完。 建议分步走: 1. 先和 AI 一起讨论需求,把你想要什么说清楚,让它复述一遍,确认理解一致。 2. 先做原型。也就是用模拟数据,只看长什么样、怎么操作,不接真实逻辑。原型的好处是改起来成本低,修改容易,就算推翻重来都很快。 3. 再做 MVP(最小可行产品),只做一个最核心的功能,先做一个小的能跑的东西出来。 4. 再慢慢迭代,有了 MVP 了,能跑起来了,就可以慢慢迭代,一次加一个小功能,AI 能处理的过来,你也验收的过来,日积月累,慢慢会变成成熟的软件。 做完一定要验收。 从头到尾按一个真实用户的路径试一遍,AI 说做完验收完不一定靠谱,还得自己上手用用。 注意安全。 涉及钱、隐私、账号权限的东西要格外小心,拿不准的地方去找专业人士问一下。就像 SiaoCut 的作者给 AI 划定了边界:AI 只拿到任务所需的文本和时间戳,不碰原始媒体,处理完只生成待审建议,最终由人决定。这样的思路值得借鉴。 最后说一句,做出来之后,发出来。 这次 VibeLab 里不少作品原本只是作者电脑里的一个 Demo,发到微博之后被讨论、被转发,有的还上了热搜。对于自己动手做东西的人来说,“作品被看见”是最好激励,也是下一次迭代的开始。
顯示更多
中國的洪澇看起來越來越嚴重,有時候我都懷疑,是因為我們這些反共的人,內心巴不得看到天災人禍不斷,希望中國人終於受不了起義革命,所以把這些洪水的新聞,不斷地放大,自己在內心想像共產中國的天災頻率加大,但事實並不是如此?也許中國這麼大,中國本來就是到處可能有洪澇,我不知道,因為所有中國的數據都不可靠,也許連共產黨高層自己都不知道,到底天災有沒有變多。 但我們知道的是最近幾年的夏天溫度不斷地升高(誰可以去把輪船用油的硫加回去嗎?),溫度高,下雨多,那也是一個科學上可以支持的事實,所以我們先把人禍放一旁,也許中國的洪澇問題,是天氣的責任。但這個雨下大的問題,全世界都在發生,連紐約地鐵這幾年也都一直淹,中國的鄰居,也有這個下雨的問題,但怎麼對付這個頻率變多的天災,就變成了人禍的問題。治水是一個問題,救災是另一個問題,災後重建則又是另一個問題,在完全不透明的共產黨黨國體制下,三個問題有解嗎?誰在負責?進度如何?不知道,通通不知道。中國人,你們為什麼不生氣? 也許救災考驗的是領導的能力,領導的能力在僵化的中央集權下,變得極為關鍵,但習近平碰什麼,什麼就失敗,足球?雄安?經濟?股市?房市?現在他又去碰AI,看起來又要完蛋了。所以水患的問題,中國人要自求多福,但我不解的是,如果共產黨可以在2008年,把錢灑出去,搞鐵路基建,搞房地產投資,硬是把景氣拉了起來,為什麼現在景氣困難,同時治水基建如此缺乏,共產黨怎麼不灑錢搞城市治水工程?蓋新水庫、疏通河道、廣建下水道、開闢蓄水池,不都是像蓋鐵路基建一樣,既可以提高就業,又可以解決水患問題,為什麼不大搞特搞一下? 無能可能是一個原因,但很可能共產黨真沒錢了。 在習近平打房前,房地產的投資是一個老鼠會騙局,我一直很不可思議中國人買預售屋是要先供房貸的。產權都沒拿到,房子都還沒開始蓋,中國人就在繳錢,這是什麼瘋狂的制度?最後開發商倒了,房子爛尾了,買家還要繼續付錢給銀行,全世界沒有一個國家是這樣坑買家的。然後成千上萬的爛尾樓,政府也沒有出來解決,難以計數的房奴,沒拿到房,還欠銀行錢,公道討都討不回來,真是豈有此理。但這也表示了,當初房市旺的時候,出錢的是銀行,不是開發商,甚至也不是地方政府,地方政府賣地拿一次錢,就沒了,錢到哪裡去了,不知道,但不是進了房市。中央政府管利率,但不管貸款實質,現在四大銀行的呆帳率只有1.2%,我信都不敢信,爛尾樓跳樓的那些屋主,銀行都不敢打成呆帳,大概還繼續掛在帳上。 中央沒有出錢刺激房市,只是靠銀行借貸的管道,把中國人的儲蓄轉成房地產放貸,恆大和一大堆的地產商倒了,爛尾樓的屋主停供了,銀行的爛帳,公開看到的就已經是2012年的4~5倍,更何況還有藏起來了,銀行嚇都嚇死,本都快保不住了,怎麼敢投資治水基建? 但共產黨當初不是花大錢蓋高鐵?不是有錢嗎?為什麼現在不花了?一樣,共產黨靠的是銀行和地方政府,不是用借的,就是用股權投資在高鐵的建設,這些和爛尾樓的房子也差不多,投資都像打水漂,因為高鐵入不敷出。銀行現在沒錢,地方政府沒地可賣,找誰來投資比高鐵更沒有收益的治水建設? 共產黨只剩一條路可以搞治水基建,那就是中央政府編列預算。但中國政府稅收就這麼多,你是要花在軍隊,還是要花在醫保,花在幹部退休金,還是要花在習近平的好大喜功?不知道,但治水基建,既看不到,又吃不到,別浪費了。不是可以印鈔票嗎?這一點共產黨倒是挺機靈,搞通膨來害自己嗎?不如好好地管好輿論、刪除貼文、封鎖消息,歲月靜好,速度比較快,效果比較好。
顯示更多
你有没有发现一个特别讽刺的真相? 越焦虑的中年人,越爱干两件事:学英语、泡健身房。 可笑吗? 其实他们心里比谁都清楚。 这两件事,零风险、不出错、门槛极低。 最适合用来自我感动,最适合用来骗自己。 流一身汗、背几个单词, 瞬间就产生一种巨大的幻觉: 我没有废掉,我还在努力,我还有救。 可我今天要撕开所有中年人的遮羞布: 这不是自律,这是逃避。彻头彻尾的懦弱逃避。 你根本不敢直面真正的问题。 你只是找了一件看起来很积极、很正能量的事, 麻痹自己的大脑,糊弄自己的人生。 用廉价的忙碌, 掩盖自己原地踏步、一事无成的狼狈。 人间很残酷。 能真正让人脱胎换骨、阶层跃迁的,从来不是健身,不是读书,不是学英语。 只有一件事,能救成年人的命:研究搞钱。 搞钱,是这个世界最真实、最残忍的修行。 它会逼着你撕下善良的滤镜,看清社会的底层规则: 谁掌握话语权? 财富往哪里流动? 人性到底有多现实? 机会藏在谁的手里? 越早看透人性和利益, 你越能活得体面,越不被生活肆意拿捏、反复摩擦。 真的,别再装清高了。 谈钱一点都不俗。 最俗的是那群满嘴理想情怀, 银行卡余额却只有三位数的窝囊人。 送你一句戳骨的真话: 钱,是成年人认知唯一的成绩单。 你赚不到钱, 根本不是你不够勤快、不够吃苦。 是你看不懂这个世界的游戏规则。是你认知太低。 你赚到的每一分钱, 都是你看透规则、读懂人性的奖赏。 你亏掉的每一分钱, 都是你认知浅薄、盲目天真交的学费。 绝大多数人活得累,不是输在懒惰。 是输在盲目努力,自我感动。 健身可以练出肌肉线条, 学英语可以背下零散单词, 这些都能装点你的朋友圈。 但唯独搞钱, 能撕碎你的幼稚、治愈你的自卑、逼着你快速成长。 能让你真正脱胎换骨,重新活一次。
顯示更多
看到 Nature 说中国论文共同通讯作者越来越多,我第一反应其实很熟悉。 现在很多大团队、交叉方向论文,作者列表越来越长,通讯作者后面的小信封也越来越多。文章顺利发表时,这看起来像合作、资源整合和共同贡献。 可一旦数据被质疑,问题马上被分化: 这张图谁做的? 原始数据谁看过? 统计方法谁确认过? 最后结论谁能从头讲清楚? 共同通讯本身没有问题。科研越来越复杂,材料、医学、算法、临床、统计,本来就需要多人协作。 真正让人担心的是,作者越多,责任越容易分散。 每个人都觉得自己只负责一块,文章整体由别人把关;每个人都挂了通讯,却没人真正把关键数据从头到尾核过一遍。 最后最清楚数据的,往往是学生和年轻科研人员。 所以作者贡献表不该只是投稿系统里的模板文字。它是在论文出问题时,别人判断责任从哪里开始的线索。 共同通讯可以共同分享成果,但责任最好别一起分享。
顯示更多