註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 multimodal27
multimodal27 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 multimodal27 的搜尋結果
我为什么反复强调VLM(multimodal,多模态)是死路一条,世界模型更是臭狗屎。 一个最简单的第一性原理,100k tokens文字的信息量,远远高于图片,更远远远远高于视频,这些量文字形式能解决一些超级复杂完备的问题,而对于VLM输入图片,信息极其稀疏,能解决的问题基本约等于狗几把。 如果人类在1T~10T的VLM Agent能解决一个难度为X的问题, 那么同等模型下,对应纯文字LLM Agent给足上下文、memory、wiki、信息,全部以pure text和structured data形式准备好,并且通过text/bash/cli/api/mcp形式获取信息,那么这个LLM Agent一定能解决难度为1000X的问题。 等到VLM强大到让一个VLM Agent解决难度为1000X的问题的时候,LLM Agent已经可以解决(1000^2) * X难度的问题了。 就这么简单一个道理,绝大多数人根本想不明白。
顯示更多
0
64
150
13
轉發到社區
AI模型市场会走向垄断吗?MiniMax 创始人闫俊杰认为不会。他表示,首先,AI将分化出多个垂直赛道,各自都会有自己的领导者。其次,AI的应用形态正越来越多地向Multimodal和Multi-Agent方向发展,而不是由单一模型包揽一切。第三,越来越多的开源模型正在迅速追赶闭源模型,两者之间的差距正不断缩小。
顯示更多
把一千篇真实论文丢给三个模型做摘要,同一份语料、同一份 prompt:DeepSeek 的 Flash 跑完全部只花 $3.99,Claude 的 Haiku 花了 $35.76。 《年度 AI 论文:2025–2026 年的关键研究》 一年 1,000 篇论文的图鉴,外加一个成本实验。 是 Hassan El Mghari(GitHub 上的 Nutlope,Together AI 生态的知名开源开发者,做过 roomGPT、SmartPDFs 等热门项目)做的「年度 AI 论文」站点:2025 年 8 月 4 日到 2026 年 8 月 4 日这一年的 1,000 篇论文,每篇都有摘要,可按实验室、主题、月份浏览。整个项目的起点其实是个成本实验:把这一年的论文全部摘要完,要花多少钱? 基准结论:同一份输入,三个模型差了 8.95 倍。 语料合计 30,681 页、1.027 亿字符。三个模型拿到完全相同的提取文本、prompt、分块方式和输出合同,关闭 reasoning,各跑一遍: • DeepSeek V4 Flash:合计 $3.99,每篇约 $0.004 • GPT-5.6 Luna:合计 $6.00,每篇约 $0.006 • Claude Haiku 4.5:合计 $35.76,每篇约 $0.036(8.95×) 费用按官方报价的 token 用量计算,价格冻结在 2026 年 8 月 5 日;只统计成功完成的摘要,失败重跑不计入。 方法论可复现。 语料从 8,262 个候选(Hugging Face Daily Papers + OpenAI、Anthropic、DeepSeek、MiniMax、Moonshot AI 的官方论文)按 arXiv ID 去重,冻结成恰好 1,000 篇;放得进上下文预算的整篇一次读完,超长的走 50,000 字符的 map-reduce,不静默截断。作者明确说这是成本对比,不是质量排名——没有引入 LLM judge 打分。 图鉴本身也好看。 按实验室(OpenAI、Anthropic、Moonshot AI、DeepSeek、MiniMax、 275 篇、Reasoning 177 篇、Video 164 篇、Multimodal 144 篇、Systems 143 篇、Robotics 59 篇)、月份浏览;trending 和 most cited 两个榜单(Qwen3-VL 1,802 次引用、DINOv3 1,216 次、InternVL3.5 1,212 次)。再叠上 18 篇 Together AI 官方论文,共 1,018 篇。 适合想快速补完这一年 AI 研究的人,以及要批量处理 PDF 摘要、想先估成本的工程团队。全流程开源在 GitHub(Nutlope/1kpapers),语料清单、抽取画像、逐篇费用都能自己复现。 原文: #AI论文# #成本基准# #LLM#
顯示更多