註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 长上下文能力
长上下文能力 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 长上下文能力 的搜尋結果
DeepSeek V4终于来了,拥有百万字超长上下文。性能领先开源,媲美顶级闭源模型。 Agent 能力大幅提高,交付质量接近Opus 4.6 非思考模式,但仍与Opus 4.6思考模式存在一定差距。 世界知识测评中,大幅领先其他开源模型,仅稍逊于顶尖闭源模型Gemini-Pro-3.1。 世界顶级推理性能,在数学、STEM、竞赛型代码的测评中,V4-Pro超越当前所有已公开评测的开源模型,取得了比肩世界顶级闭源模型的优异成绩 更关键的是,V4开创了一种全新的注意力机制,在token维度进行压缩,结合 lDSA 稀疏注意力(DeepSeek Sparse Attention),实现了全球领先的长上下文能力,并且相比于传统方法大幅降低了对计算和显存的需求。这一点值得关注!
顯示更多
大模型厂商交替领先,真是各领风骚三五月:去年四季度是gemini、今年一季度是cluade、现在感觉轮到GPT5.5了。核心还是大家都在积极进取迭代,只很多时候领先源于对手的松懈。去年在算力投入上非常节制的Authropic最近应该是感受到了算力短缺的痛。 梳理下时间线 1、去年四季度: Google Gemini 3 系列(尤其是25年11月左右的Gemini 3 Pro/Deep Think)强势登顶,很多基准(如Humanity’s Last Exam、推理、多模态)领先,引发OpenAI“Code Red”。它在多模态、长上下文和搜索集成上特别亮眼,一度被视为转折点。 2、今年一季度: 最耀眼的自然是Anthropic Claude 4.6(Opus/Sonnet,2月发布)强势反超,尤其在编码(SWE-Bench)、长上下文推理、agentic任务和实际生产力上领先。 3、当下2026年4月: OpenAI GPT-5.5正处于发布窗口,刚 在ChatGPT和Codex上即将全面上线。它强调更好的上下文理解、编码、computer use和agent能力,试图追赶和超越。 大模型领域现在并没有绝对的“唯一王者”,而是各有专长: 1)Claude:主攻编码、长任务、可靠推理往往领先,Agent上迭代非常多。 2)Gemini:多模态、速度、性价比、超长上下文强(3.1 Pro Preview仍很能打)。 3)GPT:通用agent、工具调用、实时应用和生态集成突出,新版在上下文和特定专业任务上提升明显。算力囤积最积极 4)grok:有X这个实时内容平台提供源源不断的训练数据,但近期受制于团队动荡。看跟cursor的合作、以及囤积的大量算力,后面会不会进一步跟上。 当然还有meta最新的Muse Spark,AI团队的最新之作。 更不用说国内豆包、千问、混元、kimi也是各有特色,杀疯了。 这就是当下大模型领域的现状:快速迭代、轮流坐庄。暂时还没有一家能长期领先甚至垄断。当然竞争对用户是好事——模型越来越强、价格/速度也优化。 2月中在《资本开支的战争》推文里有聊过:”往下游看,越往用户端竞争越激烈,当然也是未来AI决胜的关键所在。 可以说大模型、在面向B端或者C端的Agent或者应用才是AI的王冠,但这一层面短期其实很难看出谁会成为最后真正的赢家,再很多时候都是交替领先”。现在看确实如此 GPT-5.5出来后估计又要新一轮刷榜了,下一个出来交替领先的会是谁?
顯示更多
Kimi 应该建立自己的量化团队,学会从 A 股“吸血”,而不是急于冲进资本市场融资。 DeepSeek 的模式才是当下大模型公司真正值得学习的模板:低调务实、专注技术闭环,用真实商业价值反哺研发,而不是靠烧钱讲故事。 Kimi 拥有强大的中文理解和长上下文能力,完全可以组建精干的量化团队,挖掘 A 股的信息不对称和情绪定价机会,把 AI 的推理、预测和数据处理优势转化为稳定的现金流。这样既能实现自我造血,避免被资本绑架,又能保持长期技术竞争力。 急着融资只会稀释控制权、被迫追求短期 KPI,而 DeepSeek 式的“闷声发大财”才是中国 AI 公司最健康的生存之道。
顯示更多
GLM-5.2 刚刚正式发布! 给大家带来实测! 直接说结论本次测试中, 提升最大的是Agent能力, 而且是有质的变化! 测试中GLM-5.2 完全不用搜索附近的位置, 就能直接去想要到达的地方. 这一切竟然是它在一开始把地图背下来了! 这在我测试的20多个模型中之前是没有一个模型能做到的, 比如之前的模型想去换电站, 那么都要搜一下附近有哪些换电站(这就会浪费一次tool_call), 而GLM-5.2直接就知道换电站的位置! 从来没用过搜索函数. 这种一开始就把需要的数据内化到上下文中, 并且能够贯穿整个1M上下文进行推理的能力真的是叹为观止. 除此之外, 本次测试后端代码的 Agentic Coding 能力也有提升, 来到了总榜的第二名. 而本次测试暴露出最大的短板则是空间理解. 其实成也萧何败也萧何, 它虽然把换电站的位置都背下来了, 但是去的换电站却不是最近的, 所以虽然记住了, 但是记住了之后在用之前再根据自己当前所在位置推理一下, 他还是没有做到的, 这也是最大的短板了, 强烈建议官方优化一波. #GLM52# #智谱# #智谱AI# #AgenticCoding# #长上下文能力#
顯示更多
0
12
92
5
轉發到社區
“恐怖组织用 AI 聊天机器人搞袭击”:这个标签足够吸睛,但背后是安全范式尚未解决的漏洞。剑桥大学研究员 Antonia Jülich 对尼日利亚博科圣地 27 名前成员的 57 次深度访谈,揭露了令安全界沉默的事实——该组织已部署专属 AI 部门,系统性地使用 ChatGPT、Claude、Gemini、Grok、Meta AI 及 DeepSeek 等所有主流模型,来策划攻击、制造更强大的爆炸装置、维护武器,并提升行动安全。这不是零星的越狱尝试,而是制度化运作:两个派系都有 AI 专家,ISIS 自 2023 年起向这些指挥官传授提示工程技巧和过滤器越狱方法。当 AI 公司还在修补个别漏洞时,对手已建成知识传承体系。 为什么会这样?因为当前的安全过滤器工作原理,本质上是对抗性的。它们通过关键词、语义分析拦截危险查询,但攻击者可以不断试错,发现新的绕过方式。博科圣地成员就利用角色扮演、代码转换、分段请求等手段,让模型逐步输出合成炸药配方、袭击路线优化建议。Anthropic 最近坦承,越狱或许永远无法彻底消除,根源在于大语言模型的核心能力——遵循指令和生成内容——本身就是武器化的基础,你无法完全剥离其通用性又保留其有用性。 研究细节更让人不安:他们用 Claude 的长上下文能力总结数百页的极端主义手册,提取战术要点;用 ChatGPT 生成招募宣传文案,甚至优化社交媒体传播策略;用 Gemini 分析政府军动态情报。DeepSeek 等开源模型的本地部署能力,让离线滥用变为可能,且更难被追踪。一位受访者透露,他们内部会建立常见越狱话术库,不断更新迭代,这种系统化的创新速度远超安全团队的更新周期。 更长远看,这暴露了一个结构性问题:AI 的滥用门槛正在急速降低,恐怖组织无需黑客精英,只要懂得基础提示工程就能撬动致命知识。过去,制造高性能炸药需要进入化学实验室或深网论坛,现在一个反复推敲的提示词就可能提炼出等效方案。随着模型多模态能力提升,视频深伪、语音模拟等也可能被用于诈欺、舆论操控或制造混乱。可以预见,这类滥用将从组织化向个体化扩散,带来更难监控的“孤狼”式威胁。 面对这种范式级挑战,修补式安全已捉襟见肘。下一步必须转向多层防御:模型训练阶段的数据毒化对抗、部署阶段的实时意图分析、使用后的隐蔽审计,以及跨公司的威胁情报共享。政策制定者可能不得不介入,制定强制性安全评估标准,要求高频监控和事件报告,但过度收紧可能让监管成为创新壁垒,削弱开源生态。普通用户并非局外人:你所用模型的安全水位,直接关系到它是否会被恶意利用并反噬信任。对 AI 开发者,这不再是增值功能,而是市场准入的基本门槛。 该研究可能成为安全讨论的转折点——它用实证将模糊的威胁变为具体的、系统性的危机。接下来的问题是:AI 行业是继续用“越狱率低于 1%”的统计自我安慰,还是从根本上重新设计安全模型,使其能够预见并抵御对手的适应性学习?答案将决定我们是否进入一个 AI 助长的非对称冲突时代。
顯示更多
“恐怖组织用 AI 聊天机器人搞袭击”:这个标签足够吸睛,但背后是安全范式尚未解决的漏洞。剑桥大学研究员 Antonia Jülich 对尼日利亚博科圣地 27 名前成员的 57 次深度访谈,揭露了令安全界沉默的事实——该组织已部署专属 AI 部门,系统性地使用 ChatGPT、Claude、Gemini、Grok、Meta AI 及 DeepSeek 等所有主流模型,来策划攻击、制造更强大的爆炸装置、维护武器,并提升行动安全。这不是零星的越狱尝试,而是制度化运作:两个派系都有 AI 专家,ISIS 自 2023 年起向这些指挥官传授提示工程技巧和过滤器越狱方法。当 AI 公司还在修补个别漏洞时,对手已建成知识传承体系。 为什么会这样?因为当前的安全过滤器工作原理,本质上是对抗性的。它们通过关键词、语义分析拦截危险查询,但攻击者可以不断试错,发现新的绕过方式。博科圣地成员就利用角色扮演、代码转换、分段请求等手段,让模型逐步输出合成炸药配方、袭击路线优化建议。Anthropic 最近坦承,越狱或许永远无法彻底消除,根源在于大语言模型的核心能力——遵循指令和生成内容——本身就是武器化的基础,你无法完全剥离其通用性又保留其有用性。 研究细节更让人不安:他们用 Claude 的长上下文能力总结数百页的极端主义手册,提取战术要点;用 ChatGPT 生成招募宣传文案,甚至优化社交媒体传播策略;用 Gemini 分析政府军动态情报。DeepSeek 等开源模型的本地部署能力,让离线滥用变为可能,且更难被追踪。一位受访者透露,他们内部会建立常见越狱话术库,不断更新迭代,这种系统化的创新速度远超安全团队的更新周期。 更长远看,这暴露了一个结构性问题:AI 的滥用门槛正在急速降低,恐怖组织无需黑客精英,只要懂得基础提示工程就能撬动致命知识。过去,制造高性能炸药需要进入化学实验室或深网论坛,现在一个反复推敲的提示词就可能提炼出等效方案。随着模型多模态能力提升,视频深伪、语音模拟等也可能被用于诈欺、舆论操控或制造混乱。可以预见,这类滥用将从组织化向个体化扩散,带来更难监控的“孤狼”式威胁。 面对这种范式级挑战,修补式安全已捉襟见肘。下一步必须转向多层防御:模型训练阶段的数据毒化对抗、部署阶段的实时意图分析、使用后的隐蔽审计,以及跨公司的威胁情报共享。政策制定者可能不得不介入,制定强制性安全评估标准,要求高频监控和事件报告,但过度收紧可能让监管成为创新壁垒,削弱开源生态。普通用户并非局外人:你所用模型的安全水位,直接关系到它是否会被恶意利用并反噬信任。对 AI 开发者,这不再是增值功能,而是市场准入的基本门槛。 该研究可能成为安全讨论的转折点——它用实证将模糊的威胁变为具体的、系统性的危机。接下来的问题是:AI 行业是继续用“越狱率低于 1%”的统计自我安慰,还是从根本上重新设计安全模型,使其能够预见并抵御对手的适应性学习?答案将决定我们是否进入一个 AI 助长的非对称冲突时代。
顯示更多
未来美股投资三大块:算力基建、AI应用与星际扩张 随着SpaceX成功上市、OpenAI与Anthropic启动IPO进程,曾经主导美股的“Mag7”格局已被彻底重构。资本不再局限于互联网平台的流量红利,而是转向算力基建、AI应用、星际扩张三大核心赛道,形成了FAB 10、AI Big 10与MANGOS三大代表性组合。这三大块不仅是字母缩写的游戏,更是未来十年美股投资的底层逻辑。 一、算力基建:AI时代的“数字能源” 算力是AI产业的底层基础设施,如同电力之于工业革命。这一板块的核心是为AI模型提供计算、存储与网络支撑,是当前资本最确定的“卖水人”赛道。 头部企业 • 英伟达(NVDA):全球GPU算力霸主,AI芯片市占率超80%,是所有大模型训练与推理的核心硬件提供商。 • 博通(AVGO):AI网络交换芯片与以太网解决方案龙头,为数据中心提供高速互联技术。 • AMD(AMD):凭借MI300系列GPU挑战英伟达,在云计算与超算领域快速崛起。 • 美光科技(MU):全球存储芯片巨头,为AI服务器提供高带宽内存(HBM)与DRAM产品。 • 微软(MSFT):Azure云平台是全球最大的AI算力租赁服务商之一,绑定OpenAI构建生态。 • 谷歌(GOOGL):TPU自研芯片与Google Cloud算力网络,支撑Gemini等大模型训练。 投资逻辑 算力需求随AI模型迭代呈指数级增长,硬件与云服务厂商具备稳定的现金流与技术壁垒。随着Token价格去泡沫化,成本效率与硬件迭代速度将成为核心竞争力,头部厂商将持续受益于AI基础设施的长期投入。 二、AI应用:从模型到场景的价值落地 AI模型的价值最终要通过行业应用实现。这一板块分为通用大模型与垂直场景应用,前者是技术核心,后者是商业化变现的关键。 头部企业 通用大模型 • OpenAI:GPT系列模型开创者,即将IPO,是AGI领域的标杆企业。 • Anthropic:Claude系列以安全与长上下文能力著称,企业级市场快速扩张。 • 谷歌(GOOGL):Gemini模型对标GPT,覆盖多模态与搜索场景。 • Meta(META):Llama开源模型生态,凭借低成本优势冲击闭源巨头。 平台与应用 • 微软(MSFT):Copilot系列将AI嵌入Office、Windows与企业服务,是AI商业化最成熟的平台。 • 亚马逊(AMZN):AWS Bedrock提供模型托管服务,Alexa与电商场景AI化加速。 • 苹果(AAPL):Apple Intelligence将AI整合至iOS与MacOS,主打端侧智能与隐私保护。 投资逻辑 开源模型(如Llama、Karin类黑马)正在冲击闭源模型的定价权,能落地到具体行业、提供可量化降本增效方案的企业将胜出。未来通用大模型将走向薄利多销,而垂直领域AI应用(如医疗、法律、工业自动化)将诞生新的巨头。 三、星际扩张:太空科技的新蓝海 SpaceX的上市标志着太空经济从概念走向商业化,星际扩张成为继AI之后的又一科技革命。这一板块涵盖火箭发射、卫星互联网、星际运输等领域,是人类文明向外拓展的核心载体。 头部企业 • SpaceX(SPCX):全球领先的商业火箭公司,星链(Starlink)卫星互联网覆盖全球,星舰(Starship)目标实现火星殖民。 • 特斯拉(TSLA):不仅是电动车巨头,更是SpaceX的重要技术协同方,星链车载应用与自动驾驶技术双向赋能。 • 其他潜在玩家:蓝色起源(Blue Origin)、相对论空间(Relativity Space)等新兴太空企业,未来或加入这一赛道。 投资逻辑 太空经济的市场规模预计在未来十年突破万亿美元,卫星互联网、深空探测、太空旅游是核心增长点。SpaceX凭借可重复使用火箭与星链网络,构建了难以撼动的先发优势,是星际扩张赛道的核心标的。 四、三大组合的投资视角对比 组合名称 核心赛道 代表企业 投资逻辑 FAB 10 全赛道覆盖 NVDA、GOOGL、AAPL、MSFT、AMZN、TSLA、META、SPCX、OpenAI、Anthropic 兼顾传统巨头的“护城河”与新势力的“增长极”,追求稳健与成长的平衡 AI Big 10 算力基建+平台 NVDA、GOOGL、AAPL、MSFT、AMZN、TSLA、META、AVGO、AMD、MU 聚焦AI基础设施,押注算力需求的确定性增长,是风险偏好较低的选择 MANGOS AI应用+星际扩张 META、Anthropic、NVDA、GOOGL、OpenAI、SPCX 极致聚焦AGI与星际扩张,高风险高回报,面向未来科技革命 五、未来投资的核心启示 1. 告别流量红利,拥抱硬科技:互联网平台的增长已见顶,算力、AI模型与太空科技才是未来的核心增量。 2. 成本效率为王:Token价格虚高的泡沫正在破裂,只有能持续降低算力成本、实现商业化落地的企业才能存活。 3. 生态与协同是壁垒:微软-OpenAI、谷歌-Gemini、特斯拉-SpaceX的生态协同,将成为企业对抗竞争的核心壁垒。 4. 长期主义视角:AI与太空科技都是长周期赛道,需要耐心持有核心标的,而非短期炒作。 未来美股投资的本质,是押注人类文明的技术跃迁——从算力基建支撑AI革命,到AI应用重构各行各业,再到星际扩张拓展生存边界。这三大块将共同定义下一个十年的科技与资本版图。
顯示更多
中国企业的兴衰循环:旧巨头谢幕,新势力崛起 在中国经济发展的长河中,许多曾经家喻户晓的企业渐渐淡出视野。这其实很正常——市场总是这样,有人登场,有人落幕。有的因资金链断裂、盲目扩张,有的因管理问题或外部竞争激烈,最终走向调整或消失。这也提醒我们,商业世界从来不是一成不变的,适应力和创新能力才是长久立足的关键。 如今,时代又进入新阶段。AI(人工智能)等前沿科技领域,正成为中国经济新的增长引擎。一批企业凭借技术突破、效率创新和实际应用落地,正快速崛起,展现出强劲活力。 当前AI领域的亮点 不同于过去的“重资产扩张”,现在的AI玩家更注重开源共享、成本优化和产业融合: 1️⃣DeepSeek 等新锐,以高性能、低成本的大模型惊艳业界,不仅在国内普及,还被国际企业采用,推动整个行业向更高效的方向发展。 2️⃣传统巨头如阿里巴巴(Qwen系列)、百度(ERNIE)、腾讯等,依托自身生态,快速布局多模态模型、云计算和智能应用。 3️⃣Moonshot AI(Kimi)、Zhipu AI(智谱) 等专注长上下文和Agent能力,在生产力工具、企业服务上发力。 芯片侧也有寒武纪、壁仞等企业在国产化道路上稳步前进。 2026年,这个赛道格外活跃:多家公司完成IPO,技术迭代加速,开源模型下载量和应用场景都在快速扩张。 中国AI正从“追赶”转向在效率、落地等维度展现特色优势。 当然,新兴领域也面临激烈竞争、算力挑战和商业化考验。成功的关键,还是要稳扎稳打,避免过去常见的扩张陷阱。 经济总在动态平衡中前进。旧的退出,为新的腾出空间;而AI浪潮,正给无数创业者和投资者带来新机遇。保持学习和适应,或许我们每个人都能在这一轮浪潮中找到自己的位置。
顯示更多
推荐这两个模型,Liquid AI 的新 encoder。 小参数下匹敌大模型质量——长文本 CPU 推理比 ModernBERT 快了数倍。 Liquid AI 在 7 月 28 日发布了两个新的 encoder 模型——LFM2.5-Encoder-230M 和 350M。核心卖点:在小参数下匹敌大模型的质量,上下文 8192 token 且延迟随输入长度增长缓慢,CPU 上比 ModernBERT-base 快约 3.7 倍。 架构 两个 encoder 从 LFM2 解码器主干初始化,然后做三步改造:双向注意力掩码(每个 token 看两边)、非因果短卷积(对称 padding)、30% token 的掩码语言建模训练。 两阶段训练:先用 1024 token 上下文做大语料 MLM,再扩展到 8192 token 强化事实、法律和多语言能力。 Benchmark 在 GLUE + SuperGLUE + 多语言分类共 17 个任务上,350M 版本排 14 个模型中的第 4 名,前 3 名都更大(最大一个 3.5B,近 10 倍参数)。230M 版本击败了 ModernBERT-base 和所有 EuroBERT 模型,参数量更小。 CPU 推理速度 最大的优势在 CPU 上。8192 token 输入时,ModernBERT-base 一次前向约 90 秒,LFM2.5-Encoder-230M 约 28 秒——约 3.7 倍快。这意味着你可以在笔记本 CPU 上 30 秒内扫描完一份完整合同、转录文本或长客服线程。 GPU 上的优势在长上下文时同样存在:短输入(<1000 token)ModernBERT 领先,长输入 LFM2.5-Encoders 反超。 实际用途 附带了 5 个 CPU-only 的 HuggingFace Space demo:零样本 prompt 路由、零样本策略检查、拼写纠正、40 种 PII 检测、掩码扩散文本生成(迭代 unmask 而非从左到右生成)。 两个模型都是开放权重,支持 transformers + Flash Attention 2。 模型: 博客: #Encoder# #CPUInference# #ONNX#
顯示更多
1/ 翻到一个刚开源的 agent 项目 Zleap-Agent,专为本地小模型设计,思路挺有意思。 出发点:本地小模型笨、上下文又小。你要是像用 cc、codex 那样,把系统提示词、工具、记忆、十几轮历史再加个长文档全丢给它,模型基本就被干烧了。。。 2/ 所以他们的想法是:大模型在做的稀疏注意力、长上下文压缩,本质就是别让模型每一步都看所有东西。那这套思路,干脆挪到 harness 层来做,更直接。 3/ 设计有点像电脑桌面。agent 一进去是个主空间,但这个空间纯调度,不配任何工具,只有四个控制能力 dispatch、recall、deliver、task_detail,唯一能干的就是“进到别的 workspace”。 (顺便,workspace 不是子 agent。子 agent 用完即弃,workspace 是常驻的,有记忆有上下文,相当于把我们手写进 md 文件的那部分固化在这儿。) 4/ 跟 Claude Code 最大的区别是做减法的时机。CC 默认模型够强,厚上下文、复杂工具链全给它,装不下了再用 compaction 事后压。Zleap 是事前做减法,东西没进模型就按 workspace 切干净了,对模型能力的要求天生就低。 5/ 想搓本地 agent 的可以试试 Mac 跑本地 7B、14B,套上这层 harness,很多活就能跑起来,也不用什么都丢给云端按 token 付费。 企业多人共享我感觉用处更大:不同部门进不同 workspace,权限、记忆隔离、操作可审计(共用一个 Agent,但不共享同一坨上下文)。 6/ 它最值钱的点,是把工具和上下文做了隔离、提出 workspace 这个概念。这套反过来也能用到 cc 那类 harness 上。之前本地模型 + agent 几乎跑不起来,这算补上了一块空白。还是 preview,但思路我挺喜欢🫡
顯示更多