注册并分享邀请链接,可获得视频播放与邀请奖励。

NOW A LAKER
@aegontara
AIGC saves the world
1.2K 正在关注    50 粉丝
@yetone 大佬的alma真是一个越用越喜欢的产品,原本以为claude code和codex不断更新的情况下,alma会跟不上,没想到半年过去了,还是在用alma,最近出的折叠工具调用样式和光感执行过程太美观了,审美无敌!
显示更多
每个作家都觉得自己的作品最纯粹最朴素,每个coder都觉得自己的vibe作品很好用很有潜力
实测发现grok分析这么多的帖子会出现比较严重的幻觉,两次一模一样的内容输入会得到差别比较大的输出。我改进了这个分析模式,让grok不做分析,只做帖子的内容爬取,再把帖子内容发给claude分析,效果会好很多,grok要选择expert模式。
显示更多
# 🤖 任务指令:指定账号ID每日热点内容筛选机器人 ## **【角色】** 指定账号ID每日热点内容筛选机器人。 ## **【任务目标】** 1. 搜索最近24小时(从现在往前推24h)内X(Twitter)平台指定用户ID的帖子。 2. 筛选条件: * 点赞数 ≥ 30(优先高赞) * 浏览量尽量 ≥ 1万(如果当天整体数据低,可适当放宽但要标注) 3. 按点赞数从高到低排序,取真实的前20条(如果不足20条,就给出全部并说明“今日仅找到X条高互动内容”)。 4. 输出格式严格如下: ## **【指定用户ID列表】** * @0xInk_ * @AdinaYakup * @AIatMeta * @Alibaba_Qwen * @Alibaba_Wan * @AndrewYNg * @AngryTomtweets * @Artedeingenio * @ChiedzaFlair * @Cursor_ai * @Google * @GoogleAI * @HuggingPapers * @IamEmily2050 * @ManusAI * @minimax_ai * @ModelScope2022 * @NotebookLM * @OpenAI * @openrouter * @Tesla * @Trae_ai * @Yoshua_Bengio * @ai_for_success * @claudeai * @deedydas * @elevenlabs * @godofprompt * @levelsio * @mervenoyann * @minchoi * @omooretweets * @testingcatalog * @venturetwins * @zarazhangrui ## **【输出报告模板】** 【AI INFO 24小时热帖速报】 统计时间:XXXX年XX月XX日 XX:XX(UTC+8)前24小时 今日最高赞:XXXX 赞|今日最高浏览:XX万+ (这里加一句你自己的简短观察,例如“今天建筑/自拍/视频提示最火爆”或“官方放出新功能,社区炸了”等,控制在20字以内) @用户名 一句话描述(20-30字,突出提示词技巧、风格、用途) 点赞 XXXX,浏览 X万+ (依次列出 Top 20,用空行分隔) ## **【额外要求与注意事项】** 5. 所有链接必须是真实可点击的 ` 链接,ID正确。 6. 如果当天确实没什么高互动内容,请输出:**“今日24小时内暂无突破1万浏览的高互动帖子,社区比较平静”**。 7. **严禁编造**:禁止编造任何数据、用户名或链接,所有内容必须基于真实、准确的搜索结果。
显示更多
做了个推文内容批量抓取分析的工具,gpt让我惊喜的是,一百条内容数据直接塞给它就能做分析,这颠覆了之前的文本处理思路,现在文本筛选、清洗和格式化输出都能通过prompt直接实现,也达到了个人使用thinking模型的最大思考时间(10分钟)
显示更多
解码 Prompt Caching:从 PagedAttention 原理到 10 倍降本增效 @dejavucoder 这篇文章深入剖析了 Prompt Caching(提示词缓存)的底层原理,特别是基于 @vllm_project PagedAttention 技术。作者结合自己在开发中的“踩坑”经历,纠正了许多开发者对于缓存机制的常见误解,提供了极具实操性的优化建议。 核心误区与真相:缓存是全局的,不是私有的 · 误区:作者(和咱们很多人一样)最初认为,Prompt Caching 是基于“用户会话”的。也就是说,只有同一个用户在同一个对话框里的后续发言,才能利用之前的缓存。 · 真相:Prompt Caching 是基于内容的,而非基于用户。 · 核心逻辑:只要你的系统提示词或工具定义是完全一致的文本,那么 用户 A 产生的缓存,完全可以被 用户 B 复用。 · 意义:这意味着在高并发场景下,只要前缀一致,系统可以实现“全局复用”,极大降低重复计算。 为什么需要缓存?(成本与速度) LLM 的推理过程分为两个阶段,理解这个区别是理解缓存价值的关键: · 预填充阶段:处理你输入的一大段提示词,计算出它们的 KV Cache。这个过程是 计算密集型 的,非常消耗算力。 · 解码阶段:逐个生成回复的 token。这个过程是 内存带宽密集型 的。 · 如果没有缓存:每次请求进来,即便前面 90% 的 Prompt 都是一样的,模型都要重新算一遍 Prefill,既慢又贵。 · 命中缓存:可以直接跳过繁重的 Prefill 计算,输入 token 的成本可降低 10 倍,且首字生成速度显著提升。 技术揭秘:PagedAttention 传统的 KV Cache 管理非常低效,必须预先分配一大块连续显存,容易造成碎片化浪费。vLLM 引入了操作系统管理内存的思路——分页。 · 分块(Blocks): 系统不再分配连续大内存,而是将 KV Cache 切分成固定大小的“块”。这些块在物理显存里可以是分散的,不连续的。 · 哈希链(Block Hashing)——缓存生效的关键: 系统如何知道“这段话以前算过”?它会计算块的哈希值。 · 父块依赖:一个块的哈希值,不仅取决于它自己的内容,还取决于前一个块的哈希值。 · 连锁反应:这就像区块链一样。只有当“从头开始的所有内容”都完全一致时,当前的哈希值才会匹配。这保证了因果关系的正确性——你不能只复用中间的一段,必须是前缀完全匹配。 · 全局查找: 新请求进来时,系统计算其提示词的块哈希,去全局哈希表中查找。如果命中,直接指向已有的显存块,完全不需要计算。 给开发者的实操建议:如何“骗”过系统命中缓存? 为了最大化缓存命中率,你需要让系统认为不同的请求是“一样”的。文章给出了几条黄金法则: · 保持前缀稳定(Stable Prefix) 将所有静态内容(系统提示词、工具定义、示例文本)放在 最前面。 · 反例:如果你把“当前时间”或“用户名”放在提示词的开头,那么整个哈希链从一开始就断了,后面的内容即使一样也无法复用缓存。 · 确定性序列化(Deterministic Serialization) 在使用 JSON 格式传递数据时(例如工具调用),必须保证键的顺序固定。 · 技巧:在 Python 中使用 json.dumps(..., sort_keys=True)。因为 { "a": 1, "b": 2 } 和 { "b": 2, "a": 1 } 虽然语义相同,但生成的字符串不同,会导致缓存未命中。 · 仅追加模式(Append-only) 在维护多轮对话历史时,尽量只在末尾添加新内容。不要去修改或截断中间的历史记录,一旦中间变了,后面的缓存链就全失效了。 · 警惕工具定义的变化 工具定义通常被模型拼接在系统提示词附近。如果你动态地为不同用户开启/关闭不同的工具,会导致前缀发生变化,从而导致缓存失效。 总结 Prompt Caching 的本质不是“记忆”,而是“复用计算结果”。理解了底层的 分块 和 哈希链 机制,开发者就能明白为什么“前缀”如此重要。 一句话总结:把所有不变的东西(系统指令、背景文档、工具列表)永远放在最前面,把变化的东西(用户提问、动态变量)放在最后面。 阅读原文
显示更多
0
3
59
14
转发到社区
对无意义的工作少一些责任感
我以前觉得想要赚钱, 一定要聪明的头脑, 要么极具创意的想法,要么特别牛B的算法构建别人无法模仿的产品。 现在觉得, 只要你用心, 不断解决别人忽略掉,而你却重视起来的细节问题, 用户就会因为你的每一个细节而被打动,从而促成成交。
显示更多
0
13
224
34
转发到社区
如果想为自己的错误找借口,总是可以找到的。
许多辛辛苦苦做的工作,随着LLM的升级变得没有意义,不知道还有什么是值得做的
不要为烂人浪费自己的激素水平
最近感悟,一定要吝啬自己的激素水平。 最好不要真的付出感情去对待能挑起你喜怒哀乐的内容,尤其是在虚拟世界里。 特别在推上,碰上骂人的认知水平低下的蠢货,但凡你花费一秒钟浪费肾上腺素去生气,你就输了。蠢货则毫发无损,满足地继续骂别人。 对待这种烂人的最佳方式,就是彻底的对他无视,让他在自己的幻想里烂到底。 要把所有的激素水平,放在成为领域专家或写好段子这件事上。
显示更多
X上现在信息流过多,vibe了一条对每条内容进行打分的脚本,帮助快速进行信息筛选,打分接的是智谱4.5airx,响应速度还不错
像配置资产一样配置「注意力」。
0
17
454
76
转发到社区
LLM 时代所有的问题都回归到提示词工程上
用roocode vibe coding后,由于没有及时git commit,回滚到了一个空白状态,白干
喝了带冰的啤酒,鼻炎犯了,感受不到味觉,但是很想吃一包咸牛肉,于是就撕了一包。