註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 LLM評価
LLM評価 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 LLM評価 的搜尋結果
Trading agents 很火,期权交易员用它对改善交易逻辑会有帮助吗?看龙虾怎么说。 龙虾:看了,给你一个直评: **TradingAgents 是什么** 多Agent协作的LLM交易框架,模拟真实交易公司分工:基本面分析师、情绪分析师、新闻分析师、技术分析师 → 多空研究员辩论 → 交易员 → 风控 → 基金经理决策。基于LangGraph,支持GPT/Gemini/Claude/DeepSeek/GLM等多种LLM。 **能装吗?** 能。`pip install .` 或 Docker,要求Python 3.13。咱服务器上可以直接clone装。API Key方面,你已经有DeepSeek和智谱GLM的key,直接能用。 **对改善交易逻辑有帮助吗?** 坦率说,**有限**。原因: 1. **目标市场不匹配** — 它是美股单股分析框架(Alpha Vantage数据、StockTwits/Reddit情绪),你的核心是加密期权+A股期权,数据源和交易逻辑完全不同 2. **它做的是"分析→决策",你做的是"定价→对冲"** — 它输出买/卖/持有建议,你需要的IV期限结构、希腊字母、deltaPA对冲、波动率交易,它根本不涉及 3. **LLM交易决策的实际效果存疑** — 论文是学术研究,实盘表现不确定。多Agent辩论听起来酷,但对期权交易员来说,不如一个好的波动率模型 4. **成本问题** — 每次分析调多次LLM,token消耗不小,产出的却只是方向性判断 **可能有点用的地方:** - 它的新闻分析师/情绪分析师模块,思路可借鉴,融入你的Deribit信号推送 - 如果你以后做美股个股期权,它的基本面+情绪分析框架有参考价值 - 多Agent协作的架构设计(LangGraph)值得学习 **我的建议:不装,但看看源码。** 特别是它的情绪分析流程和研究员辩论机制,可以提取有用思路融入现有工具链。要不要我把几个关键模块的代码拉下来看看? 好,源码全看完了。给你一份提炼: --- **架构全景** ``` 4个分析师(并行) → 多空辩论(Bull/Bear N轮) → 研究经理(裁判)  → 交易员(具体提案) → 风控辩论(激进/保守/中性N轮) → 基金经理(终裁) ``` **值得借鉴的3个设计** 1️⃣ **多空辩论机制** — Bull/Bear各自拿到全部分析师报告,交替反驳,N轮后由Research Manager做裁判。这种结构化对抗能逼LLM暴露论据弱点,比单次生成可靠。 2️⃣ **情绪分析师的三源融合** — Yahoo新闻(机构框架) + StockTwits(散户情绪标签) + Reddit(社区讨论),三源预取注入prompt,不让LLM自己调工具(避免幻觉)。输出要求写明牛熊比、跨源分歧、催化剂。这个思路可以移植到加密市场:替换成CoinTelegraph新闻 + Twitter/X + LunarCrush。 3️⃣ **决策记忆+反思** — 每次决策存档,下次同标的开跑时自动取回历史决策,计算实际收益和alpha,让LLM写一段反思注入Portfolio Manager的prompt。这种"闭环学习"设计比纯前向推理好。 **对我们没用的部分** - 数据源全是美股(Alpha Vantage/YFinance/StockTwits/Reddit),加密市场用不上 - 决策输出是Buy/Hold/Sell方向判断,完全没有希腊字母/波动率/对冲的概念 - 风控辩论还是方向性的(激进vs保守),不是量化的VaR/压力测试 - 结构化输出用的Pydantic schema,评分只有5档(Buy/Overweight/Hold/Underweight/Sell),太粗 **可落地的改进思路** 对于Deribit信号推送,可以参考它的情绪分析流程: - 加密新闻(CoinDesk/CoinTelegraph) → 情绪打分 - Twitter/BTC相关讨论 → 散户情绪 - 链上数据(大额转账/交易所净流入) → 鲸鱼动向 - 三源融合后输出一个综合情绪分数,作为Deribit日报的补充维度 核心就三句话: - **三源融合**:新闻(事件)+社交(散户)+链上(鲸鱼),看分歧比看一致值钱 - **预取注入**:数据先拉好再喂LLM,不让它自己调工具 - **散户情绪是反指**:社交极端乐观=警惕顶部,链上数据通常比新闻早12-48h
顯示更多
2023 年,Meta 首席 AI 科學家楊立昆給當時的 LLM 熱潮潑了一盆冷水。 他指出 LLM 有根本性的缺陷:沒有持久記憶、無法從單一經驗學習、缺乏對物理世界的理解。本質上,它只是在做「下一個 token 的預測」。 從學術的角度看,他說得完全正確。 直到今天,LLM 的底層架構依然沒有變。它依然是一具每次啟動都空空如也的統計引擎。 但在三年的工程演進後,我們發現了一個讓科學家尷尬的事實:學術上的根本缺陷,工程上不一定要正面解決,繞過去一樣能起飛。 楊立昆主張要走「世界模型」的路線,讓 AI 像人一樣建立對物理規律的理解。他認為 Scaling Law(規模定律)有天花板,LLM 光靠堆算力不能產生真正的智慧。 但工程界用兩件事回應了他: 第一,資本的暴力美學。過去三年,人類往算力砸錢的瘋狂程度,讓模型規模產生的「湧現」直接蓋過了架構的粗糙。 第二,系統性的外掛補丁。模型記不住?掛上向量資料庫。模型理解不夠?接上 Vision 和工具。 這就是工程學最迷人的地方:解決問題不需要追求「本質的優雅」。 楊立昆在研究神經元的排列,而工程師在研究如何把這個「不完美的大腦」裝進一個強大的「機械外骨骼」裡。 楊立昆對 LLM 的核心批評,是他認為 Pattern Matching(模式匹配)不算真正的學習。 但如果這種模式匹配的複雜度足以模擬出文明的所有邏輯,那「學習本身到底是什麼模式」還重要嗎? 飛機與鳥的飛行原理完全不同。飛機沒有羽毛、不會拍翅膀,但在它飛得更高、更遠、更穩定的那一刻,它到底「算不算在飛」已經不重要了。 但繞過去的,跟真的解決,是兩回事。 只要底層架構沒變,楊立昆講的那些缺陷就真實存在。記憶是外掛的,不是原生的。就像義肢,裝上去能走能跑,但它跟真正的腿就是不一樣。你不能假裝它不存在。 所以雖然 AI 已經很強了,推理、寫作、寫程式,很多事做得比大部分人好,但它每次都是一個全新的大腦。沒有連續的意識,沒有累積的經驗。它所有的「記憶」、「理解」、「偏好」,全部來自你這次塞給它的上下文。 如果你去看 OpenClaw 最近的 repo 更新,你會發現記憶管理佔了很大的篇幅。怎麼讓 AI 在對話之間記住該記住的東西。 他們最近推的 QMD,把關鍵字搜尋跟語意搜尋混在一起用,就是為了解決一個問題:你三天前跟 AI 聊過的東西,它下次怎麼找得回來。 模型本身的能力會繼續進步,但只要底層是 LLM,記憶管理就是一個繞不開的大山。 用工程的角度來說,就是 Context Engineering 的重要程度,會逐漸超過模型本身。 你怎麼管理每次丟給模型的那包上下文,決定了 AI 能幫你做到什麼程度。哪些資訊該放、哪些不該放。什麼時候該砍掉重來、什麼時候該接著繼續。不同對話之間的記憶怎麼同步、怎麼取捨。 我自己每天都在處理這個問題。 舉個例子,我的 OpenClaw Agent KAI,它常常在多個頻道處理不同任務,但它們的記憶不是即時同步的。只要 還沒更新,它們就不知道彼此剛做了什麼。 所以我常常要幫它做認知同步。譬如告訴 A 分身,B 分身目前正在做什麼,然後要求 B 把做的東西整理好傳過去。或者更簡單一點,直接叫 A 去讀另一個 Discord 頻道最近兩小時的對話,讓它自己同步 B 的工作內容。 這種「認知斷裂」的現象,只要你常用 AI,一定會有很強烈的感覺。 從人格化的角度看,你會覺得它們是同一個人。但事實上,它們只是共享同一份記憶。只要記憶沒有同步,它們就是不同的人。 我現在花比較多時間在學這一塊。譬如今天 KAI 就教了我,如果讓 Claude Code 的 Opus 4.6 從外部調用 GPT 5.3-Codex,用 MCP 跟 coding-agent skill 的差異是什麼。 KAI 告訴我,差異的核心在於:中間過程要不要進主 context。 用 MCP 調用 Codex,每一個 tool call 都走 MCP 協議。Codex 過程中的每一個 turn,讀檔、改檔、跑測試、報錯、retry,全部以 tool result 的形式灌回 Opus 的 context。一個 coding task 可能產生幾十個 turn,跑完之後 Opus 的 context window 已經被中間過程塞滿了,後面每一 turn 都要重送這些垃圾。這就是 context 污染。 而 coding-agent skill 的設計完全不同。它把整個 coding task 交給一個獨立的 sub-agent,這個 sub-agent 在自己的 context 裡完成所有中間過程。跑完之後,回傳給 Opus 的是一個精簡的 handoff summary:改了哪些檔案、測試跑過了沒、有沒有殘留問題。中間那幾十個 turn 的掙扎,Opus 完全不需要知道。 同樣一件事,兩種做法,Opus 的 context 乾淨程度天差地遠。 所以同一個模型,不同的人用,產出可以差十倍。 人與人之間原本的能力差距,已經沒那麼重要了。你的學歷、你的年資、你寫程式的底子,這些東西的權重正在被 AI 快速壓縮。 取而代之的,是你怎麼使用 AI。這件事的精度,才是現在真正決定產出的變數。 你理不理解它的記憶是怎麼運作的。你知不知道什麼時候該砍掉 context 重來、什麼時候該讓它接著跑。你能不能在對的時間,把對的資訊塞進那個 context window。 這些東西有一個名字,叫 Context Engineering。 它不是什麼高深的學問,但它是所有想把 AI 用好的人,都應該深入研究的東西。
顯示更多
0
51
980
166
轉發到社區
AdventureX 2026正式落幕了。今天从早上9点到下午3点,满场跑评审了46个项目。每个项目5分钟路演时间,选手们普遍都不够用,从立项的思考,到产品的实现路径,再到未来的计划,3天时间,大家整体完成度还是挺高的,都是年轻人熬夜肝出来的成果。 我评审的选手最小的只有9岁(已经退学在游戏公司实习),最大的有10年创业经验。其中不少初中生、高中生。有几点感触: 1.不少选手都很注意从身边人实际的痛点和需求出发设计产品; 2.软硬件结合的产品挺多,智能戒指、机械臂、机器狗等,还有很多3D打印出来的产品。 3.海外浓度提高了,评审了来自德国、美国、俄罗斯等国都选手,有些是在国内做交换生,有些是网上检索到活动,旅行加比赛。我评审的两组海外选手都不约而同选择了机器狗,分别解决医院和机场两个场景的用户引导和接送需求。 4.有些应用天马行空,有点抽象,但学生群体,玩中学也是成长。 5.有选手说之前的构思最后发现实现不了,临时改了项目,也算是极短时间模拟创业的真实体验了。 指引者(评委)群有朋友看我评了46个项目,开玩笑说看到“销冠”了😂今天真的已经燃尽了,咖啡加茶喝的到家感到心慌。
顯示更多
0
11
20
0
轉發到社區
一天迁移 5000 万行 Ruby 代码,抵一个团队两个多月。这是 Anthropic 新旗舰 Claude Fable 5 干的。又慢又贵,但能啃硬骨头。它从今天起免费 13 天(6/10–6/22)。下面这些看完再上手,别浪费窗口。 1/ 它是什么:Fable 5 就是 Mythos 5 加了一道更严的安全护栏,底层性能一样。100 万 token 上下文,单次输出 128K,知识截止 2026 年 1 月,模型串 claude-fable-5。现在对所有人开放的最强公开旗舰,不过还是 preview。 2/ 跑分:SWE-Bench Pro 80.3%。Opus 4.8 才 69.2%,GPT 5.5 是 58.6%,Gemini 3.1 Pro 54.2%。三篇实测都印证同一条规律:任务越长越复杂,它领先越多。主场是大活,不是改一行代码。 3/ 真实战绩,是生产不是 demo。Stripe 一天跑完 5000 万行全库迁移。Datasette Agent 做完既定目标,还顺手发现并修掉了底层 LLM 库的 4 个 bug。@Mnilax 揪出 Opus 数月没看见的 bug,某钱包解析器 9 个,另一项目 4 个。都是得把整个文件握在工作记忆里才看得见的那种。 4/ 视觉这块被低估了。它能只凭截图重建一个 Web 应用的源码。能用纯像素 harness 从头通关《宝可梦 火红》,没有地图,也没有状态解析。《杀戮尖塔》记忆实验里比 Opus 4.8 多进步 3 倍。截图转代码、图表转数字,这部分值回票价。 5/ 价格:输入 $10、输出 $50 每百万 token,正好是 Opus 的 2 倍。Simon 实测一天烧了 $110.42,其中 89.9% 砸在一个 Agent 项目上。重活吃掉绝大部分预算,这才是它该干的事。喂它琐事,只会烧光额度还零结果。 6/ 用法变了,这条最重要。旧的「逐个喂小活、全程握方向盘」会把它锚在过时模式上。官方四条建议:直接交超出旧模型边界的大活;effort 默认拉 xhigh 或 high;重写旧 skill 和 CLAUDE.md;从「派任务」转向「给目标」,说清楚完成长什么样、怎么验证。 7/ 核心方法论:别再逐字 prompt,给它两类循环。一句话配方是「给模型一个评估指标,让它爬坡」。一类是自纠错内循环,给 rubric,让它跑、收反馈、自我修正。一类是跨 session 记忆外循环,让它自己管上下文。Claude Code 里对应 /goal,CMA 的 Outcomes 会自动 spawn 一个 grader 子智能体打分。 8/ 一个反直觉的点:别让模型自评自己的输出,效果差。换成独立上下文窗口里的 verifier 子智能体来打分。 9/ 记忆的五步:fail 记录错误,investigate 搞清原因,verify 变成已验证事实,distill 提炼规则,consult 直接查规则而不是重推。三代模型恰好卡在不同台阶。Sonnet 4.6 停在第 1 步。Opus 4.7 停在第 3 步,验证覆盖率中位只有 17% 左右。Fable 5 走完全程,最强一次到 73%。 10/ 最硬的一个数:Parameter Golf 挑战里,Fable 5 对训练 pipeline 的改进大约是 Opus 4.7 的 6 倍。行为差异也值得说。它敢押注结构性大改,扛过一次量化回退,最后冲到最大收益,作者说它像敢走高方差路径的研究者。Opus 4.7 拿到首胜后就只重复低方差的老套路。 11/ 一定要懂的护栏机制,叫静默回退。命中网络安全、生物化学、蒸馏这三类,请求会被悄悄回退给较弱的 Opus 4.8。大约 5% 触发,95% 以上的会话从不碰到。API 新增了「命中护栏」通知,把它当路由信息看就行:被标记的活,其实是 Opus 在答。也要留意误报,某个 benchmark 70% 的提示被 flag,Rust 里的 unsafe {}、公开生物数据都可能误触。 12/ 该用还是别用。该用:跨文件重构、全库迁移、长上下文审计、截图重建源码,以及需要跨 session 记忆复利的连续任务。配置上 effort 拉 xhigh,开持久记忆,给它目标加 rubric 让它自驱。别用:改一行、总结邮件这种短确定性活,Opus 或 Sonnet 更便宜;上面三类被标记的活;还有对延迟和成本敏感的交互场景。 13/ 现在就做一件事:13 天里,把你最值钱、最高 effort、一直不敢交出去的大活先排进来。再送你一条能直接套的审代码 prompt:「以从未见过这套代码的资深工程师视角审查整库,别加功能别为品味重构,只找真正的错误:竞态、吞掉的异常、掩盖失败的类型强转、死配置、只在 happy path 成立的假设。每条给出文件行号、原因、影响范围和最小安全修复。」 你打算拿这 13 天先啃哪块硬活?
顯示更多
转自雪球 《"整个市场就是一笔交易",Steve Eisman 2026年看空AI全记录》 昨天聊了Michael Burry,《大空头》原型之一。今天聊另一个,Steve Eisman,他们在2008年通过做空次贷危机声名鹊起。 他2026年也在看空AI。但说法跟Burry不太一样,他更直,更狠。 今年6月初英伟达财报后,Burry加倍做空NVDA,Eisman说了句让很多人松口气的话:"现在做空还为时过早。"整个上半年他一边看戏一边磨刀,到7月终于亮出了自己的判断——比Burry的"千刀万剐"更直白,也更让人后背发凉。 "整个市场就是一笔交易" 7月27日,CNBC《Squawk Box》上,Eisman把话砸在桌上:"这完全是一笔交易。literally就一笔。" 他用60/40组合拆给大家看。 股票端,标普500里信息技术占37%,通信服务占9%,加上亚马逊和特斯拉,超过一半跟科技和AI绑在一起。债券端更邪乎——五大AI超大规模厂商2025年底只占存量投资级公司债的3%,到2026年5月,已经吞了当年新发行量的15%以上。高收益债那边,这个数字从1%飙到41%。 你以为在分散。其实全仓押AI。60/40?名存实亡。 "人们要么想买AI,要么什么都不想买" 同一天,Eisman爆了个操作——清仓Alphabet,持了很多年的那种。 "我持有谷歌的时间久到记不清了,"他说,"但我想降低AI敞口。" 他卖完之后,Alphabet从5月18日的高点408.61美元跌到7月24日的319.74美元,跌了20%。7月23日单日跌7.1%——公司刚把2026年cap指引提到1950到2050亿,市场直接拿脚投票。 卖了谷歌,他没买防御股。 "我没有买高露洁,我没有买高乐氏。我持有现金。" 为什么?"人们要么想买AI,要么不想买AI,但没有人会从AI撤出来去买高乐氏。" 翻译一下:所有人的注意力被AI吸干了。其他东西暂时没人看。他坐在一堆现金上,等。 四层警告,一层比一层狠 第一层:只要任何一家超大规模厂商削减AI capex,美股会"直线下跌"。整个市场的估值已经建在"capex永远涨"这个前提上。前提松了,骨牌倒。 第二层:LLM没有护城河。Eisman公开质疑——这些烧了几千亿的大模型公司,到底有什么可持续优势?用户随时在ChatGPT、Gemini、Claude之间切来切去,免费的。定价权?不存在的。 第三层:中国模型比西方便宜五倍,因为开源。价格战一旦真打,西方大模型的商业化路径会变得更窄。"我不知道这个问题的答案,"Eisman说,"但我认为其他人也不知道。" 第四层:哪怕买高盛、摩根士丹利——投行的靓丽业绩来自AI融资业务。AI已经渗进美国经济的每个缝里。今年一半的增长来自AI。如果AI没跑出来,市场会"大规模回调"。 他还做了两件事 6月27日,他拿SpaceX开涮。营收190亿,跟家乐氏(卖Froot Loops麦片的)差不多,估值是人家100倍以上。招股书里写着要去小行星采矿。"这literally是科幻剧。"他补了一句,Palantir"才"50倍营收,已经显得离谱了。 4月30日,他披露做空FICO。信用评分那家公司。FICO这么多年提价500%,"得罪了信贷圈的每一个人"。竞争对手VantageScore拿政府支持杀进来,房贷承销收费只有FICO的5%。披露当天FICO跌7.3%,到7月底已经跌了43%。 他和Burry的区别 俩人都在看空AI。节奏不一样。 Burry给了时间表和价格目标:NVDA从215砸向110以下,SOXX从640砸向330,2027年1月到期前。 Eisman不预测时点。他就说一件事:如果AI不成功,损失会很大。现在做空还太早,但那个方向没错。 Burry拿手术刀解剖。Eisman坐场边等尸体浮上来。 同一个赌局 把俩人放一起看。Burry从微观ROIC搭到中观会计搭到宏观叙事最后落到影子银行——精密得像财务模型。Eisman只捅一刀:整个市场就一笔交易,散不了,一旦散就是直线下跌。 Burry说:泡沫会碎,2027年前。Eisman说:碎不碎我不知道,但如果碎了,没人跑得掉。 那句最刺耳的话再说一遍:"人们要么想买AI,要么什么都不想买。" 当一个市场被压缩到只剩一个选项,那不是投资。 20260806/农夫股市瞎评录
顯示更多
LLM 推理、工具执行、上下文记忆,三件都是往前走的部件,没有一件管在哪儿多跑一圈、在哪儿收手。 智能体的毛病往往是把力气用反了:最该反复打磨的地方一遍过,早该收手的地方一圈圈空跑,Token 全烧在那里。
顯示更多
LLM workflow从出来的第一天,我就说,这玩意儿给企业用绝对必死无疑,跟low code和no code一样,属于民办三本文科宝妈的意淫幻想。 典型就是,设置一个自以为挺有用的场景,一堆人跟个大傻逼似的,忙活设计,玩连连看,反复测试,跟个胡闹厨房一样, 做完美滋滋地跟团队炫耀,大面积推广, 用了一周之后发现,哎,缺少了功能ABCDEFG,其中ABCD和EFG还矛盾,如果要完善LLM workflow的这些缺失功能,那就要完完全全重新写一套。 这时候这些民办三本文科宝妈的脑子直接烧了,因为要满足接下来层出不断需求,就要每周时时刻刻重写,而这对于他们人均边牧一样的产品设计和coding能力,是绝对做不到的。 这些人连python写一个从1加到100都费劲,让他们持续维护一个不断推翻、不断重新设计、不断连连看的LLM workflow,比让他们学会正确写一个feature requirement document还难。 于是整个团队出现了五六个LLM workflow之后,彻底失去维护能力,持续烂尾,又回到了人肉办公处理的时代。
顯示更多
0
67
183
9
轉發到社區
LLM 几乎可以重构所有 App 业务的今天,真的有一种回到十几年前移动互联网刚爆发时的感觉。每天都在灵感井喷:这个东西可以重做一遍,那个产品也可以重新做一遍,过去很多因为成本太高做不了的东西,现在一个人加几个 Agent 就能开干。但和十几年前最大的区别是——那时候创业者面对的还是一片相对蛮荒的新大陆。现在你旁边站着一群大厂。他们有用户、有流量、有数据、有渠道,还有成熟到可怕的中台和弹药库。你今天灵光一闪想到的功能,他们可能明天就能塞进现有产品里。所以这一轮 AI 创业最刺激的地方,不只是机会多。而是机会和威胁,几乎同时到达。
顯示更多
LLM token 是思维的卡路里。