註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

阿川 | AI thinking
@AI_jacksaku
前大厂多面手|AI 专业搞钱玩家| 关注 AI 产品&工具、LLM迭代,搞钱信息差 欢迎链接&咨询&合作
948 正在關注    26.7K 粉絲
刚刚用 做了个离谱小游戏: 一个小屁孩,偷偷吃香蕉、牛奶、棒棒糖。 我本来只是随手丢了一句话进去,想着顶多生成个半成品页面,结果它居然真的给我做成了一个能玩的小游戏。 现在 AI 工具已经卷到什么程度了? 你脑子里冒出一个很无厘头的点子,直接一句话变成游戏。 以前做个小游戏,得会策划、会画图、会代码、会调交互。 现在: “帮我做一个小屁孩偷吃香蕉牛奶棒棒糖的游戏。” 然后它就开始干活了。 这种感觉很奇妙。 这个方向,我觉得挺值得玩一下。 尤其适合那种脑洞很多、但懒得从 0 搭项目的人。
顯示更多
0
46
14
0
轉發到社區
美股最近这波,波动明显放大了。前几天科技股和存储股急跌,昨晚夜盘又快速反弹。昨晚夜盘反弹后,这部分仓位已经都回本了。 这种行情,我更不会去猜哪一天是最低点。更适合我的方式,就是把仓位拆开,分几次慢慢建。 比如最近存储方向美光、闪迪就很典型,7 月下旬先被砸,昨天晚上又大幅反弹。 我觉得这更像是市场在重新给 AI 存储的高预期定价。 一边是前期涨幅太快、SK Hynix 财报没满足高预期、中国存储竞争担忧带来的杀估值;另一边是需求线还在,美光最新一季收入创纪录,HBM、云端内存和数据中心业务继续加速,闪迪数据中心收入环比增长 233%,8 月 5 日又要发新一季财报。 所以我看这类票,会先放进观察池:价格大幅波动,逻辑继续跟踪。第一笔先建观察仓,后面回落再分批加,财报前后再决定要不要补最后一笔。 问题是,很多 Web3 用户真想趁回调买点美股时,钱并不在传统券商里。 手里是 USDT / USDC,流程却要先换法币,再银行转账或电汇,最后等传统券商入金。行情来的时候,钱还在路上,这个体验很难受。 这也是我觉得 BIT @BITstocks_CN 适合大家去试试原因: 它可以用稳定币直接入金,然后买真实美股。 对 Web3 用户来说,这个价值很直接: 1.手里的 U 不用先绕回法币体系,就能变成可执行的美股仓位。 2.少换一次钱,少等一次入金,少切几个账户,行情出现时能更快下第一笔观察仓。 更关键的是,BIT 交易的不是只跟踪价格的美股映射产品。 它背后是有真实证券持仓链路的美股,订单由合作的美国持牌券商执行,清算和托管走美国证券市场体系。 也就是说,BIT 不是一个“多一个交易入口”的工具。它更像一条 Web3 资金进入美股市场的执行通道: 资金端:USDT / USDC 可以直接入金 交易端:可以买真实美股和 ETF 执行端:回调行情里,更适合按计划分批下单 我之前实际跑过 BIT 的 USDT 入金和下单,入金链路比较顺,下单响应也快,没有遇到明显卡单。 这种体验在现在这个行情里挺重要。分批建仓看起来理性,但真正执行时,最怕的是你想买的时候资金没到,或者平台卡在下单环节。 刚好 BIT 8 月有新人活动: 1.注册礼:行情免佣,再送 $100 平台费抵扣卡 2.首存礼:完成对应资产留存任务,最高可得 $200 股票现金卡 3.首交易礼:完成首笔交易,额外可得 $10 股票现金卡 三档任务全部完成,最高合计 $310。 活动时间:2026 年 8 月 1 日到 8 月 31 日 23:59。(注意:可以先进群领5u,周六再开美股账户!) 如果你本来就想配置美股,可以趁这次活动先把 BIT 账户开好,用小额跑通USDT入金和真实美股下单。 这样下一次市场给机会时,你手里就多了一条随时能用的美股资金通道。 买什么、买多少,还是先写好分批计划:分几次买、每次多少、什么情况下暂停,都提前定好。 回调给的是更从容的观察窗口,不是让人无脑冲进去。 现在通过下面链接注册完成美股认证,前30名还可享受5U现金卡红包 扫码入群,报账户uid就直接发放到账户中!快来撸毛! 活动链接和详细规则我放评论区👇
顯示更多
大家都以为,用AI用得越多赚得越多。但微软CEO萨提亚·纳德拉用“反向信息悖论”把桌子掀了:你为AI付的每一分钱,都可能同时在帮别人偷走你的核心竞争力。 纳德拉说的“反向信息悖论”,本质上是一种前所未有的信息不对称倾斜。传统经济里,通常是卖家掌握更多产品信息,买家被动;但在AI服务中,买家为了用好模型,不得不主动暴露提示词、工具使用方式、纠错反馈和内部评估标准——这些被纳德拉称为“智力废气”的东西,恰好是模型进化的养料。你掏钱训练出的模型,未来可能以更低价格服务你的对手。 这对于企业来说绝不是抖机灵的理论。只要把视角切回日常工作流,就会发现这种暴露无处不在: - 你用GPT-4写内部技术文档,每一次“这段逻辑不对,应该用XX算法”的纠正,都在告诉模型你的技术路线; - 你用AI客服分析投诉数据,每一次“这个回复太生硬,需要先道歉再给方案”的调整,都在传授你的客户关系策略; - 你用AI设计辅助优化产品外观,每一次“这个颜色方案不符合品牌调性”的反馈,都在泄露品牌设计手册。 这些碎片单独看微不足道,但模型持续吸收、关联、泛化之后,就能拼凑出你企业近乎完整的know-how。而这个过程的受益方,是模型厂商——以及未来可能通过同一模型获得相似能力的竞争对手。 这并非杞人忧天。历史上,搜索广告拍卖的算法策略就是通过类似“交互泄露”被竞对反推的。更现实的是,大模型正在从单一工具变成工作流操作系统,它的边界越宽,你暴露的维度就越多。如果企业把全部核心流程跑在云端黑箱模型上,等于把自己的思考过程毫无保留地写入公开训练集。 纳德拉的呼吁因此很明确:企业需要真正的信任边界。这个边界必须包括: 1. 数据本地累积:所有交互痕迹、评估数据、适配权重、团队记忆,只能在企业自己的环境里闭环积累,未经法律授权绝不出境; 2. 私有评估能力:不能只靠模型厂商提供的通用评测,必须拥有独立的、基于自身业务场景的测试集和判断标准; 3. 组织记忆所有权:企业对哪些输入输出是高质量的、哪些是错误的知识缺口,这些“记忆”属于企业自身,模型厂商无权获取或使用; 4. 微调权利:企业应有权使用模型输出或自己积累的数据,来微调或训练自有模型——不管是基于开源还是闭源基座,这样才可能建立可控的内部学习循环,而不是永远受制于云端服务。 这里面最反常识的一点是,连微软自己(Azure OpenAI 服务的提供者)都意识到了这个不对称,并正在通过强调私有网络、数据驻留、客户训练的模型等特性来构建信任。因为长期看,哪家云平台能保障企业知识不泄露,谁就能获得最优质的商业数据流——这或许比单纯卖token更重要。 那么,对于正在踩AI加速踏板的企业,现在该做什么? 如果你是CEO或CIO:请立刻把“数据会不会回流用于训练基座模型”写入AI采购合同的否决条款。优先评估那些承诺推理数据不记录、支持本地微调且不强制传回数据的解决方案。不要把未来的竞争筹码放在供应商的道德自觉上。 如果你是技术负责人:立即建立内部知识分级制度。将业务数据分为可共享(通用行业常识)、需脱敏(去标识化流程)和完全隔离(核心IP、独特算法)三类,对不同层级的AI交互施加不同的通道管控,核心IP相关的必须跑在本地模型或经加密脱敏后使用。 如果你是创业团队:新的基础设施机会正在浮现——做企业私有AI记忆体。帮助企业记录、清洗、管理所有AI交互历史,转化为可自控的训练数据集,并提供私有化微调和服务网关。这可能是比卖API更持久的生意。 当然,还有一个问题悬而未决:当模型能力越来越强,企业如何在享受前沿智能的同时,避免交出灵魂?彻底不上云不现实,完全依赖私有模型又可能落后于技术发展。也许答案在于“可控的开放”——推动更多真正的开源模型,让企业有能力在本地基座上注入自己的知识,形成自主进化的循环。这样,“反向信息悖论”的天平才有可能重新平衡。 这就是纳德拉的警告带来的思考:别只盯着AI能做什么,更要盯着你为它付出了什么。真正的护城河,从来不是用AI建起来的,而是用AI建起之后还能把它锁在自己院子里。
顯示更多
以后判断AI值不值,不看参数,就看它花你1美元能干多少活儿。 OpenAI刚刚提了个新概念——“Useful Intelligence per Dollar”,翻译过来就是:有用智能每美元。简单说,衡量一个AI的投资回报,不再是论文里的跑分,而是现实中完成一项真正有用的任务,需要花多少钱。 这不只是企业关心的事。对我们每个用AI的人,这个标准马上会改变三件事: 第一,帮你省钱。你给ChatGPT Plus每月20美元,但真的用回本了吗?以后你可以算:每周用它解决几次工作问题,省了多少小时,每小时值多少钱,对比20美元,结果可能吓你一跳。有人用了大半年,其实大部分时间在闲聊,真正省下来的只是60元。但如果你把它当成代码助手,一次排错可能就省几百元。 第二,帮你选对工具。现在AI工具一大堆,有人追最新最热,有人只看跑分。但实际工作中,一个号称90分的模型,可能因为响应慢、理解偏差大,反而比75分的模型更费钱。按“有用智能每美元”,你会更关注它在你特定任务上的成功率,以及每次完成的成本。比如写邮件:A工具每次0.01美元,10次能成功8次;B工具每次0.1美元,10次成功9次。算下来,A工具每封成功邮件的成本是0.0125美元,B是0.111美元,A居然更划算。 第三,倒逼AI公司真正为普通人优化。现在各家猛堆参数,但参数翻倍,成本可能翻几倍,实际任务表现只提升10%。如果“有用智能每美元”成为主流,公司就会去优化那些高频低难度任务,让日常使用更便宜、更快,而不是只卷极端竞赛。对你来说,就是以后用AI写小红书、做PPT大纲、查攻略,可能会越来越流畅,越来越便宜。 OpenAI的记分卡还提到三个关键维度: • 完成的有用工作量:不只看输出质量,还看任务完成率。你让它写十个标题,有几个能直接用?这才是价值。 • 成功任务的实际成本:不是API的标价,而是你反复修改、重试、等响应的时间折现。人的时间也是成本。 • 结果可靠性:它能不能稳定交付?这次给满分答案,下次胡编乱造,完全不可靠的AI,再便宜也没用。 这个框架对我们普通人有什么行动机会? 很简单,你不需要等公司出报告。今晚就可以动手,测一下你手头最常用的AI的“有用智能每美元”。 步骤: 1. 挑一个你每周固定要用AI做的具体任务,比如“润色周报”、“生成小红书文案”、“分析数据”。 2. 记录未来一周,让AI完成这个任务的总次数、成功次数(成功标准自己定,比如是否直接可用或微调即可)。 3. 算一下你为这个AI付的月费或单次成本,分摊到这一周这一任务上。 4. 成功次数除以总成本,就是你这个任务的“有用智能每美元”得分。 你会惊讶发现,有些免费工具可能得分超高,有些付费工具反而不值。当然,这个指标有边界:不适合创意发散或一次性的探索,更适合重复性、标准化任务。但如果你80%的AI使用都是重复性任务,这个指标就是你的省钱雷达。 不要被参数吓到,也别只听厂商吹牛。拿回主动权,用“有用智能每美元”衡量你手上的AI,你会更清楚钱该花在哪,时间该省在哪。 现在就可以打开一个笔记,建个表,写上任务、成本、成功率。一个月后,你会感谢自己。
顯示更多
视频生成赛道的竞争,看似正在收紧——Sora延迟、Runway更新、大厂纷纷入局。 但PixVerse的C轮扩展融资4.39亿美元、估值超20亿,却透露出一个相反的趋势:赛道不仅没有收紧,反而在快速分化,挤进专业影视和游戏开发的新岔道。 先看事实:新加坡创企PixVerse刚刚完成C轮扩展,总融资额4.39亿美元,估值突破20亿美元。 消费端注册用户超1.5亿,月活超1500万,图生视频每分钟4.80美元。投资者名单里包括阿里巴巴。 公司手握三个产品系列——V系列面向消费者和API,C系列针对专业影视,R系列是今年初发布的世界模型,专攻游戏开发。 这个产品矩阵,暴露了视频生成行业的一个结构性变化:工具正从单一的视频短片生成,演变为分层级的创作基础设施。过去,AI视频生成主要满足C端用户的片段式娱乐需求,比如生成一段跳舞或风景短片。 但现在,PixVerse用C系列和R系列直接切入影视制作和游戏开发的工作流,这意味着视频生成技术开始渗透到生产级环节,有可能重塑内容供应链。 为什么这个分化现在发生?有两点驱动力。第一,消费端的视频生成体验已经进入一个相对成熟的阶段,但差异化越来越难,价值天花板有限。PixVerse尽管有1.5亿注册用户,但每分钟4.8美元的价格,在竞品中不算低,靠C端用户订阅很难撑起高估值。 所以必须向上游走,去覆盖更高客单价、更高粘性的专业市场。第二,专业影视和游戏开发对“可控性”和“一致性”有根本需求,这恰好是纯扩散模型或简单文生视频难以满足的。世界模型方案试图解决这个问题:通过内置物理规则和交互逻辑,生成的不再是平面视频,而是可以实时互动、多视角连贯的虚拟环境,这更接近游戏引擎的路线。 但这套逻辑的边界也很清晰。C系列能否真正服务影视工业?专业影视对画面构图、灯光、运动镜头、色彩风格有一整套工业标准,AI生成的画面能否无缝融入现有后期流程,还是个巨大的问号。 R系列世界模型听起来性感,但从DEMO到可交互的游戏资产,中间隔着工程化的鸿沟——性能、延迟、与游戏引擎的整合,每一项都可能卡住落地进度。竞争对手也没闲着:Runway正在深耕影视协作,Google的Veo和Meta的Movie Gen背后有算力和数据优势。PixVerse的融资规模虽大,但若产品打磨跟不上,估值可能变成负担。 长期来看,如果PixVerse能同时跑通消费、影视和游戏三条线,它有潜力成为内容创作的底层基础设施,类似视频领域的“操作系统”。 但更可能的剧本是,它需要在某个方向上形成绝对壁垒,否则会面临被大厂生态吞掉的危险——就像样稿里分析的,通用工具品类很容易被平台变成一个“tab”。 落实到不同角色的行动建议: 👉 普通内容创作者:可以继续用V系列降低视频制作门槛,但不要产生过度依赖。拍摄基本功和创意策划仍然是核心,AI视频只是放大器。 👉 专业影视团队:可以关注C系列的内测反馈和实际样片,评估是否能嵌入部分后期或预演环节,但短期不要指望全链路替代。 👉 游戏开发者:R系列值得跟踪,尤其关注它是否能生成符合引擎标准的资产,或降低关卡原型成本。目前距离商用至少还有一两年,更适合做技术储备。 👉 投资者/创业者:视频生成领域正从泛化走向垂直,但垂直意味着更高的行业壁垒和更慢的渗透速度。追高估值之前,先看产品的留存率和单位经济模型,比看融资金额更有意义。 PixVerse的这轮融资,与其说是视频生成赛道的胜利,不如说是创作工作流进化的一个信号弹。真正值得押注的,永远是那些能把技术塞进具体工作场景、并卡住某个不可替代环节的公司,而不是又一个“生成炫酷视频”的玩具。
顯示更多
纽约州刚刚做了一件反直觉的事:在AI军备竞赛最激烈的时候,突然叫停所有大型数据中心建设。 州长Kathy Hochul签署行政令,暂停批准50兆瓦及以上的新建数据中心许可。这意味着十几个项目可能被冻结,成为全美首个州级禁令。 她的理由很直白:数据中心不能推高居民电费、消耗本地水资源、制造噪音,更不能绕过地方区划和审批。 这不是心血来潮。过去两年,纽约州北部因廉价水电吸引了大量数据中心项目,但当地居民开始抗议电网过载、电价上涨,甚至影响农业生产用水。 上个月,州议会已推进一项法案,要求暂停20兆瓦以上项目一年,此次行政令是更高级别的干预。Hochul还希望迫使数据中心向州电网注资,并取消超大规模设施的税收优惠,矛头直指科技巨头。 结构上看,这是基础设施扩张撞上物理和社会天花板的典型案例。算力需求年增数十百分点,但电网改造需五年以上,水资源在多地稀缺,社区对“数据工厂”的容忍度快速降低。 纽约不是第一个遇到抵抗的,爱尔兰、新加坡、荷兰都曾限制数据中心,但以州级政府叫停,美国尚属首次。 短期影响很直接:在建或筹划中的项目面临停工或重新选址,开发商和云厂商必须重估纽约市场。 但更深远的是政策信号:当数据中心的环境外部性被量化并进入选票,监管就不再是“要不要发展”的问题,而是“谁承担成本”的问题。 有两个关键边界需要明确。第一,行政令是临时性的,将在环境审查流程完成后解除,预计耗时一年,最终可能出台更严格的能效和选址标准,而非永久禁止。 第二,禁令只针对新建和扩容,已运营或已获批项目不受影响,算力供给不会立刻骤降。 对AI行业从业者来说,这意味着野蛮圈地建数据中心的时代在收窄,能效设计、液冷、核能供电和社区关系管理会成为核心竞争力。 如果你负责AI基础设施或选址,现在就应该把ESG和社会许可纳入优先项,别再把廉价电力当作长期假设。创业者可能需要关注边缘计算和模型压缩技术,因为集中式超大集群的扩张可能减速。投资者需要重新计算数据中心资产的监管风险敞口,尤其关注州级政策变动。 值得思考的是如果基础设施扩张持续放缓,AI创新的驱动力会不会从“堆算力”转向更高效率的算法和架构?这是更长周期的变量。
顯示更多
“恐怖组织用 AI 聊天机器人搞袭击”:这个标签足够吸睛,但背后是安全范式尚未解决的漏洞。剑桥大学研究员 Antonia Jülich 对尼日利亚博科圣地 27 名前成员的 57 次深度访谈,揭露了令安全界沉默的事实——该组织已部署专属 AI 部门,系统性地使用 ChatGPT、Claude、Gemini、Grok、Meta AI 及 DeepSeek 等所有主流模型,来策划攻击、制造更强大的爆炸装置、维护武器,并提升行动安全。这不是零星的越狱尝试,而是制度化运作:两个派系都有 AI 专家,ISIS 自 2023 年起向这些指挥官传授提示工程技巧和过滤器越狱方法。当 AI 公司还在修补个别漏洞时,对手已建成知识传承体系。 为什么会这样?因为当前的安全过滤器工作原理,本质上是对抗性的。它们通过关键词、语义分析拦截危险查询,但攻击者可以不断试错,发现新的绕过方式。博科圣地成员就利用角色扮演、代码转换、分段请求等手段,让模型逐步输出合成炸药配方、袭击路线优化建议。Anthropic 最近坦承,越狱或许永远无法彻底消除,根源在于大语言模型的核心能力——遵循指令和生成内容——本身就是武器化的基础,你无法完全剥离其通用性又保留其有用性。 研究细节更让人不安:他们用 Claude 的长上下文能力总结数百页的极端主义手册,提取战术要点;用 ChatGPT 生成招募宣传文案,甚至优化社交媒体传播策略;用 Gemini 分析政府军动态情报。DeepSeek 等开源模型的本地部署能力,让离线滥用变为可能,且更难被追踪。一位受访者透露,他们内部会建立常见越狱话术库,不断更新迭代,这种系统化的创新速度远超安全团队的更新周期。 更长远看,这暴露了一个结构性问题:AI 的滥用门槛正在急速降低,恐怖组织无需黑客精英,只要懂得基础提示工程就能撬动致命知识。过去,制造高性能炸药需要进入化学实验室或深网论坛,现在一个反复推敲的提示词就可能提炼出等效方案。随着模型多模态能力提升,视频深伪、语音模拟等也可能被用于诈欺、舆论操控或制造混乱。可以预见,这类滥用将从组织化向个体化扩散,带来更难监控的“孤狼”式威胁。 面对这种范式级挑战,修补式安全已捉襟见肘。下一步必须转向多层防御:模型训练阶段的数据毒化对抗、部署阶段的实时意图分析、使用后的隐蔽审计,以及跨公司的威胁情报共享。政策制定者可能不得不介入,制定强制性安全评估标准,要求高频监控和事件报告,但过度收紧可能让监管成为创新壁垒,削弱开源生态。普通用户并非局外人:你所用模型的安全水位,直接关系到它是否会被恶意利用并反噬信任。对 AI 开发者,这不再是增值功能,而是市场准入的基本门槛。 该研究可能成为安全讨论的转折点——它用实证将模糊的威胁变为具体的、系统性的危机。接下来的问题是:AI 行业是继续用“越狱率低于 1%”的统计自我安慰,还是从根本上重新设计安全模型,使其能够预见并抵御对手的适应性学习?答案将决定我们是否进入一个 AI 助长的非对称冲突时代。
顯示更多
“恐怖组织用 AI 聊天机器人搞袭击”:这个标签足够吸睛,但背后是安全范式尚未解决的漏洞。剑桥大学研究员 Antonia Jülich 对尼日利亚博科圣地 27 名前成员的 57 次深度访谈,揭露了令安全界沉默的事实——该组织已部署专属 AI 部门,系统性地使用 ChatGPT、Claude、Gemini、Grok、Meta AI 及 DeepSeek 等所有主流模型,来策划攻击、制造更强大的爆炸装置、维护武器,并提升行动安全。这不是零星的越狱尝试,而是制度化运作:两个派系都有 AI 专家,ISIS 自 2023 年起向这些指挥官传授提示工程技巧和过滤器越狱方法。当 AI 公司还在修补个别漏洞时,对手已建成知识传承体系。 为什么会这样?因为当前的安全过滤器工作原理,本质上是对抗性的。它们通过关键词、语义分析拦截危险查询,但攻击者可以不断试错,发现新的绕过方式。博科圣地成员就利用角色扮演、代码转换、分段请求等手段,让模型逐步输出合成炸药配方、袭击路线优化建议。Anthropic 最近坦承,越狱或许永远无法彻底消除,根源在于大语言模型的核心能力——遵循指令和生成内容——本身就是武器化的基础,你无法完全剥离其通用性又保留其有用性。 研究细节更让人不安:他们用 Claude 的长上下文能力总结数百页的极端主义手册,提取战术要点;用 ChatGPT 生成招募宣传文案,甚至优化社交媒体传播策略;用 Gemini 分析政府军动态情报。DeepSeek 等开源模型的本地部署能力,让离线滥用变为可能,且更难被追踪。一位受访者透露,他们内部会建立常见越狱话术库,不断更新迭代,这种系统化的创新速度远超安全团队的更新周期。 更长远看,这暴露了一个结构性问题:AI 的滥用门槛正在急速降低,恐怖组织无需黑客精英,只要懂得基础提示工程就能撬动致命知识。过去,制造高性能炸药需要进入化学实验室或深网论坛,现在一个反复推敲的提示词就可能提炼出等效方案。随着模型多模态能力提升,视频深伪、语音模拟等也可能被用于诈欺、舆论操控或制造混乱。可以预见,这类滥用将从组织化向个体化扩散,带来更难监控的“孤狼”式威胁。 面对这种范式级挑战,修补式安全已捉襟见肘。下一步必须转向多层防御:模型训练阶段的数据毒化对抗、部署阶段的实时意图分析、使用后的隐蔽审计,以及跨公司的威胁情报共享。政策制定者可能不得不介入,制定强制性安全评估标准,要求高频监控和事件报告,但过度收紧可能让监管成为创新壁垒,削弱开源生态。普通用户并非局外人:你所用模型的安全水位,直接关系到它是否会被恶意利用并反噬信任。对 AI 开发者,这不再是增值功能,而是市场准入的基本门槛。 该研究可能成为安全讨论的转折点——它用实证将模糊的威胁变为具体的、系统性的危机。接下来的问题是:AI 行业是继续用“越狱率低于 1%”的统计自我安慰,还是从根本上重新设计安全模型,使其能够预见并抵御对手的适应性学习?答案将决定我们是否进入一个 AI 助长的非对称冲突时代。
顯示更多
OCR这个方向上,推荐大家了解下这个开源项目,确实是用下来相对能打的
多数人觉得 OCR 卷到头了,无非拍照转文字。但腾讯混元刚开源的 HyOCR-1.5 跳出了这套路子——1B 参数纯视觉端到端模型,在 OmniDocBench v1.6 上以 94.74 分拿下端到端第一,推理速度还提了 6.37 倍。 传统 OCR 流水线要拼接检测、识别、版面分析多个模型,慢且重。HyOCR-1.5 一个模型端到端输出,还用了 DFlash 投机解码:并行猜测多条解码路径,快速筛最优结果,让推理大幅加速。在 Transformers 上快 6.37 倍,vLLM 快 2.14 倍,最后单页文档端到端推理只要 1.408 秒。原先处理百页要几分钟,现在半分钟搞定,成本跟着跳水。 更关键的是全栈开源。模型权重、训练代码、推理流程全部开放,没有 API 调用费,数据不离开本地。对天天要处理合同、发票、古籍的团队来说,这种又快又省还不泄露数据的方案,每月可能省出一个人力成本。 它的适用面也没局限在中英文。通过 Agentic Data Flow,HyOCR-1.5 扩展到了 331 种语言、古文字识别,还能做多图问答。128K 上下文窗口加上 4K 分辨率,长图、竖排文档都能直接处理,不用切块、不用额外对齐。 当然,开源不等于「无脑能用」。虽然 1B 参数消费级显卡就跑得动,但装环境、跑 Demo 还是需要一点技术底子。社区已经有热心人封装一键包,不过暂时不够傻瓜化;追求「上传即得结果」的朋友,可以蹲一下腾讯混元后续的云服务。 但我觉得,这款模型最大的价值不是技术指标——而是它把「高质量、低成本、全栈可控」这三件事同时装进了一个能跑在任何机器上的 1B 小模型中,让普通团队也能用上以前大厂才烧得起的 OCR 能力。开源给了杠杆,试错的门槛已经很低。 怎么踩上这个杠杆?👉 普通用户:关注腾讯混元公众号,先看技术细节,把云服务上线消息存下来。开发者:去 GitHub 搜 JevenYu/HyOCR,拉模型跑 Demo,立刻替换掉项目里那条慢速 OCR 管道。产品经理/创业者:拿几张你最痛苦的文档测一测速度、精度和成本,说不定下一个垂直文档处理工具的原型就出来了。
顯示更多
AI把检索、总结、写作、统计都覆盖了,但真正卡住项目的是流程顺序: 新想法该先界定问题还是查文献?论文冲突时该先提取证据还是找创新点? 这个路由器思路值得推广到其他领域,比如产品开发或个人学习,能极大降低决策瘫痪。
顯示更多
WPS Comate 刚上线,第一个功能就帮你把日报、周报的苦活给干了。 不用想格式、不用回忆这周干了啥,它自动从你的文档、聊天记录里抓取工作线索,生成摘要,你改改就能发。以前市场部同事花 3 小时磨出来的周报,现在 Comate 5 分钟搞定。 这只是开场。金山办公在 2026 AI 生产力大会上推出的这款 AI 办公客户端,本质上是给你配了个能连接组织数据与流程的 AI 同事。它不是一个单纯的写作助手,而是六大模块叠在一起的办公自动化系统。 先说 AI 岗位专家,你告诉它“我是做市场的”,它就能帮你起草投放方案、分析竞品动态;告诉它“我是 HR”,它能自动生成面试评估表、提炼候选人亮点。 然后是 Skill 技能生态,像装插件一样,你缺什么就加什么——合同审查、简历初筛、财务对账、甚至特定行业的合规检查,都可以像下载模板一样直接调用。 自动化任务更实用,设定触发条件,它就能帮你定时整理邮件、生成销售日报、同步项目进度。团队协作空间让多人共用同一个 AI 大脑,知识库搜索则能跨文档回答业务问题。 这些功能背后是云端与本地双任务模式。常规任务走云端,速度快;涉及敏感合同、内部数据,可以切到本地模式,数据不出你的电脑。隐私那一关,算是给你留了个开关。 用起来能省多少?具体点说: 市场写一份渠道 ROI 分析,原来拉数据、做图表、写结论要 2-3 小时,现在一句话“帮我分析上周各渠道投放 ROI,给出优化建议”,图表和文字几分钟就出来。 HR 筛 100 份简历,以前逐份看要半天,现在 Comate 按你预设的标准初筛、打分,你只面排名靠前的,时间砍掉三分之二。 小团队管理者,每周催进度、汇总同步,现在 Comate 自动抓取成员的任务完成情况,生成周报草案,你改关键词就行。 当然它不是万能的。复杂决策、需要跨部门协调的任务,AI 只能给你信息,拍板还得人。而且目前一些高级技能和深度企业对接需要额外授权,个人版可以免费下载,先覆盖大部分日常办公场景。 怎么开始?直接去 WPS 官网搜 Comate,下载客户端就能用。Windows 版已经可用,Mac 用户稍微等等,可以先收藏。装好之后,第一句指令建议“帮我写一份本周工作总结”,看看它到底多懂你。 有什么重复性办公环节是你最想甩给 AI 的?评论区聊聊,说不定下次更新就能实现。
顯示更多
你每天在用的AI客服、智能推荐、自动生成文案,可能随时翻车。这不是假设——它正在发生。 一份对157家企业的调查发现:过去一年,50%的组织在部署AI智能体后,直接导致了客户故障。这些智能体,全都在内部测试中表现完美。 内部测试和真实世界之间的鸿沟,被研究者称为“现实对齐”缺口。29%的企业承认,评估结果与实际效果不一致是最大局限。只有5%敢完全信任自动评估。 但故事还有更魔幻的一面:尽管信任度这么低,66%的企业已经在推进,甚至计划在一年内实现低风险智能体的全自动部署,不再需要人工干预。 这就意味着,你可能会碰到更多“自作聪明”的AI服务。它可能在你咨询售后时给错赔偿方案,在自动回复里生成不存在的政策,或者把重要文档总结得偏离本意。 对于普通人来说,AI的可靠性还没到可以闭眼用的阶段。但也不必怕,关键是把“信任”换成“验证”。 个人可上手的三步自保法: 1. 遇事不决,小测一下。给AI一个你知道正确答案的问题,看它会不会出错。比如让写作助手总结一篇短文,自己对照原文。 2. 重要输出,人为加道锁。涉及钱、合同、健康等决策,AI的生成内容只当参考,最终还是你说了算。 3. 错误模式,勤留意。如果某个AI总在特定话题上翻车,标记出来,下次提前规避。 这些动作成本很低,但能帮你避开多数坑。省下的,不是钱,而是返工、误解和丢面子的时间。 AI发展越快,这类问题越不会马上消失。把验证变成习惯,就是你给自己上的保险。 你被AI坑过的经历,也欢迎分享出来,帮其他人避雷。
顯示更多
英雄联盟火了,多玩盒子赚麻了, 人性都是不变的 现在codex谁说不是一轮新的循环?
有没有一种可能:在文本框里敲下‘赛博朋克城市夜景’,下一秒,你就能在浏览器里自由走动,抬头是闪烁的霓虹,转身是湿漉漉的街道? 这不是概念视频。高德昨天开源的ABot-WorldStudio,已经把这个交互式3D世界生成体验开放测试了。 简单说,这是一个通用世界模型工坊——你把文字或图片给它,它帮你生成一个可以实时交互的AI世界。不是动图,不是预渲染视频,是真正能走、能看、能互动的三维空间。 而且,里面还藏了一个‘时空任意门’。你从森林场景走入一个光圈,再出来就是蒸汽朋克工厂,场景完整切换,没有加载黑屏,连续推理可以稳定跑超过1小时不崩溃、没画质衰减。 这背后是高德自研的两个模型:ABot-World0和ABot-3DWorld0,前者负责交互视频生成,后者负责3D高斯溅射场景重建。两者统一成一个工坊,让创建世界和走进世界变成一条流水线。 对普通人来说,最大的意义是什么? 省时间,省钱,省技能树。 以前,你要做一个能走进去的3D场景——比如一个虚拟展厅或者游戏关卡——你得学几个月的Blender、Unity,或者雇一支小团队。现在,只要你有想法,ABot-WorldStudio可以替你完成从建模到交互的全过程。 我试了试网上别人分享的例子:输入‘日式禅意庭院,有枯山水和竹流水’,10秒后一个可360度旋转、放大缩小的庭院就出现了。虽然细节还不能跟人工建模比,但作为概念验证或者快速原型,效率提高的不是一个数量级。 对于内容创作者,你可以用它快速生成带场景的视频分镜,不用像以前那样一张一张画背景。对于教育者,你可以给山区孩子瞬间生成一个虚拟的历史场景或者细胞内部结构,让他们‘走进去’看。对于电商,输入产品图片,自动生成一个3D展台,让用户旋转查看。 更关键的是,这个工具把技术门槛打到了最低。 它支持自然语言和图片输入,不需要写代码,不需要学任何专业软件。界面友好,生成的场景还能分享链接给别人,对方在手机浏览器里也能打开交互——这大大降低了普通人体验3D世界的门槛。 有个细节值得说:官方实测单次连续推理超过1小时,没有崩溃或质量衰减。这意味着用它生成的世界进行直播、长时间的课堂讲解或者展会演示,可靠性是有保障的。跟之前很多AI生成3D只能跑几分钟就崩掉的方案比,进步巨大。 另外,模型已经在GitHub全面开源,且可以在单张RTX 5090上本地部署。也就是说,如果你家里有高端显卡,你可以自己跑这个模型,离线生成世界,数据完全私有。这对注重隐私的企业用户尤其重要。 当然,也不是没有限制。 目前测试版生成的世界精度、物理交互的丰富度还比不上专业游戏引擎。比如你不能在场景里捡起一把椅子或者推倒一堵墙,交互更多是视觉浏览和简单的视角切换。但它已经能给人很强的沉浸感,而且随着模型迭代,这些都会快速补齐。 还有一个现实门槛:虽然在线测试不需要你配环境,但如果想本地部署,你需要一张至少24GB显存的显卡——目前最匹配的是5090,这玩意儿不便宜。好在它可以开源社区在未来适配更低配置。 那么,普通人现在能做什么? 最佳入手姿势:直接访问ABot-WorldStudio的官方测试站,用手机号或邮箱注册,可以免费生成一定数量的世界。输入你想看到的任何场景——从外星地表到中古市集——看看AI能复现到什么程度。然后把生成的世界链接分享给朋友,他们也能进去逛。 如果你有技术背景,可以去Hugging Face或GitHub搜ABot-WorldStudio,下载开源模型。社区里已经有人给出了Docker部署教程,一张5090跑起来的实际体验相当流畅。 我的判断是,高德这次发布,把3D世界创作从专业工作室拽到了每个普通人手里。它不会是3A游戏的终结者,但一定会成为创意爆发和原型验证的超级杠杆。 最后提醒一句:测试期间服务器可能拥挤,生成失败多试一两次。另外生成的内容要遵守平台使用协议,别做违规场景。 现在就去试试吧,你离创作第一个交互式世界可能只需要一句话。
顯示更多
全栈开源+本地部署彻底消灭了 API 费用和数据泄露风险,对律师事务所、档案馆这类强隐私场景是刚需;但开源也意味着安全补丁完全依赖社区,零日漏洞的响应速度可能不如闭源大厂产品。
顯示更多
多数人觉得 OCR 卷到头了,无非拍照转文字。但腾讯混元刚开源的 HyOCR-1.5 跳出了这套路子——1B 参数纯视觉端到端模型,在 OmniDocBench v1.6 上以 94.74 分拿下端到端第一,推理速度还提了 6.37 倍。 传统 OCR 流水线要拼接检测、识别、版面分析多个模型,慢且重。HyOCR-1.5 一个模型端到端输出,还用了 DFlash 投机解码:并行猜测多条解码路径,快速筛最优结果,让推理大幅加速。在 Transformers 上快 6.37 倍,vLLM 快 2.14 倍,最后单页文档端到端推理只要 1.408 秒。原先处理百页要几分钟,现在半分钟搞定,成本跟着跳水。 更关键的是全栈开源。模型权重、训练代码、推理流程全部开放,没有 API 调用费,数据不离开本地。对天天要处理合同、发票、古籍的团队来说,这种又快又省还不泄露数据的方案,每月可能省出一个人力成本。 它的适用面也没局限在中英文。通过 Agentic Data Flow,HyOCR-1.5 扩展到了 331 种语言、古文字识别,还能做多图问答。128K 上下文窗口加上 4K 分辨率,长图、竖排文档都能直接处理,不用切块、不用额外对齐。 当然,开源不等于「无脑能用」。虽然 1B 参数消费级显卡就跑得动,但装环境、跑 Demo 还是需要一点技术底子。社区已经有热心人封装一键包,不过暂时不够傻瓜化;追求「上传即得结果」的朋友,可以蹲一下腾讯混元后续的云服务。 但我觉得,这款模型最大的价值不是技术指标——而是它把「高质量、低成本、全栈可控」这三件事同时装进了一个能跑在任何机器上的 1B 小模型中,让普通团队也能用上以前大厂才烧得起的 OCR 能力。开源给了杠杆,试错的门槛已经很低。 怎么踩上这个杠杆?👉 普通用户:关注腾讯混元公众号,先看技术细节,把云服务上线消息存下来。开发者:去 GitHub 搜 JevenYu/HyOCR,拉模型跑 Demo,立刻替换掉项目里那条慢速 OCR 管道。产品经理/创业者:拿几张你最痛苦的文档测一测速度、精度和成本,说不定下一个垂直文档处理工具的原型就出来了。
顯示更多
没有弹窗,没有确认按钮,甚至不需要你点运行——只要在Windows上打开一个恶意代码仓库,你的电脑就可能被完全控制。这不是推测,是安全公司Mindgard在2025年12月15日确认的Cursor IDE 0day漏洞,而且已经存在7个月,至今未修复。 漏洞的逻辑出奇地简单:Cursor在加载项目时,为了自动发现Git环境,会在包括工作区在内的多个路径搜索git.exe并执行。如果仓库文件夹里藏了一个同名的恶意程序,Cursor就会悄悄把它跑起来,没有沙箱,没有提示。整个过程发生在你看到任何代码之前——编译器甚至还没启动,攻击已经完成。 这比传统的供应链攻击更隐蔽:不用依赖依赖项安装脚本,不需要你手动运行任何命令,Git clone之后,打开文件夹就等于交出了权限。Windows下用户权限通常较高,后果更严重。 Mindgard发现了这个漏洞后,在过去的7个月里多次尝试联系Cursor团队。离谱的是,Cursor的首席安全官(CISO)一开始就确认了问题,但内部自动化系统出了故障,导致修复流程卡死。在这段时间里,Cursor发布了超过70个新版本,功能更新密集,而这个能一键控制用户机器的漏洞,从未排上修复队列。 今天在Hacker News上,这件事排在热门,评论区全是开发者对工具安全的焦虑。不少人反馈,自己早就觉得IDE自动执行外部程序的设计不安全,但没想到能这么容易被利用。 坏消息是,这不是一个可以快速修补的bug。它暴露了AI IDE在便利性和安全性之间的深层取舍。Cursor以及其他同类工具,为了提供智能补全、代码解释、自动修正等功能,越来越多地获得文件系统访问权、网络权限、执行终端命令的能力。这些能力一旦设计失控,就会变成攻击者最理想的跳板。更讽刺的是,IDE本应是开发者抵御风险的第一道防线,现在却成了后门。 如果这件事能被这样轻飘飘地搁置7个月,那下一次可能是某个流行的VSCode扩展,某个AI辅助重构的代理。当开发环境越来越自动化,信任的链条却越来越脆弱,这不是单个Cursor的问题,而是整个开发者工具链都需要面对的结构性风险。Cursor的快速迭代有目共睹,但安全问题处理流程的脆弱性暴露了创业公司在安全建设上的资源错配。对于一家正加速进入企业市场、被数万开发者日常使用的工具,这样的懈怠几乎不可思议。 针对不同角色,我的建议是这样: 🔹 开发者个人:别等了。在Windows上使用AppLocker或组策略,明确阻止从工作区目录执行git.exe(或其他可能被仿冒的系统工具)。对于不信任的仓库,只在隔离的虚拟机或容器里打开,不要冒险。 🔹 技术团队与管理者:把开发工具的安全纳入威胁模型。审核团队使用的IDE、插件和辅助工具,尤其是它们自动执行代码的能力边界。盲目追求开发效率而忽视安全,代价会以数据泄露或勒索软件的形式重演。 🔹 行业与工具厂商:安全不能是「先上线再修补」的附属品。在自动化流程里,必须有硬性的安全阻断点,不能因为CI/CD管线繁忙就跳过。7个月和70个版本的教训,够痛了。 这条漏洞是坏消息,但它也是一记清醒的警钟。AI正在重塑开发流程,但无论多强大的模型,都不该成为安全原则的例外。Cursor必须尽快修复,而我们要趁这个机会,重新审视每天都在运行的那些自动化工具,到底有没有留够安全边界。
顯示更多
线下一定要去!线下小圈子的一句话能让你少走一个月弯路
过去两年AI视频工具都在卷生成质量和特效,但一个根问题没人碰——如果你想在视频里出镜,就得真人坐那儿录;如果不出镜,又觉得纯画面缺了你的个人品牌。Google Vids今天上线了两项更新,没讲宏大故事,只是把两件小事做成了:让文字生成高质量视频,以及让你不用真人也能“出演”。 先说Gemini Omni。它支持用自然语言描述想要的片段,再上传图片参考,就能生成视频,并且能多轮对话式编辑——比如“把第三秒的咖啡杯挪到左边,背景再暗一点”。你甚至能丢张设计稿进去,让它按这个风格生成后续画面。这等于把一个初级剪辑师和摄影师塞进了浏览器侧边栏。 Personal Avatar更直接化解心理障碍。你只需要拍一段30秒的自拍视频和录几句语音,它就能合成你的数字形象,嘴形、表情和语调都会跟着文字变化。以后你发一条推文的同时,就能自动生成一个你在说话的视频版本;写的任何内部通知,都能变成一个亲切的“你自己”在讲解。 省下的不只是时间,是表达方式的一次迁移。按传统流程,一段5分钟视频从写稿、拍摄到剪辑至少2小时;用这套工具,30分钟写稿,剩下全自动。一周三条,一年省出几百个小时。但这些数字还不是核心,真正的杠杆藏在工作流里:视频制作从“需要出镜、需要设备、需要反复录”变成了“有想法就写,写完就能生成”,把创意到成品的路径压缩到了极致。 配合Workspace生态,这两项功能会很自然地嵌进你已有的文档、幻灯片和邮件流。你可以在Vids里把演示文稿直接转成带解说的视频,或用在Gemini Omni在文档里生成动态说明。它不是孤立的AI乐高,而是Google给你的沟通工具加了一个视频图层。所以对重度Workspace用户来说,使用成本几乎为零。 当然得把边界看清。目前仅限Google AI Pro、Ultra和商业订阅者使用,生成的全部内容都带不可见的SynthID水印,说明Google还在谨慎控制发行风险。这意味着它适合内部培训、教学课件、社交媒体快剪这些轻量场景,不适合需要无水印、品牌定制的专业出品。真要做大片,还是得进剪辑软件。 所以怎么判断要不要用?算一笔时间账:你每周花在视频制作上的时间是否超过两小时?如果是,并且你已经在Workspace里,那打开Vids上传一段自拍试一段文字生成,成本几乎为零。如果只是偶尔需要,或许等一等更开放版本,但至少知道这条路已经铺好了。全栈创作者可以趁早把数字分身捏出来,以后任何文字都能立刻变成视频,这等于是给自己建了一条随想随用的内容产线。
顯示更多
多数人觉得 OCR 卷到头了,无非拍照转文字。但腾讯混元刚开源的 HyOCR-1.5 跳出了这套路子——1B 参数纯视觉端到端模型,在 OmniDocBench v1.6 上以 94.74 分拿下端到端第一,推理速度还提了 6.37 倍。 传统 OCR 流水线要拼接检测、识别、版面分析多个模型,慢且重。HyOCR-1.5 一个模型端到端输出,还用了 DFlash 投机解码:并行猜测多条解码路径,快速筛最优结果,让推理大幅加速。在 Transformers 上快 6.37 倍,vLLM 快 2.14 倍,最后单页文档端到端推理只要 1.408 秒。原先处理百页要几分钟,现在半分钟搞定,成本跟着跳水。 更关键的是全栈开源。模型权重、训练代码、推理流程全部开放,没有 API 调用费,数据不离开本地。对天天要处理合同、发票、古籍的团队来说,这种又快又省还不泄露数据的方案,每月可能省出一个人力成本。 它的适用面也没局限在中英文。通过 Agentic Data Flow,HyOCR-1.5 扩展到了 331 种语言、古文字识别,还能做多图问答。128K 上下文窗口加上 4K 分辨率,长图、竖排文档都能直接处理,不用切块、不用额外对齐。 当然,开源不等于「无脑能用」。虽然 1B 参数消费级显卡就跑得动,但装环境、跑 Demo 还是需要一点技术底子。社区已经有热心人封装一键包,不过暂时不够傻瓜化;追求「上传即得结果」的朋友,可以蹲一下腾讯混元后续的云服务。 但我觉得,这款模型最大的价值不是技术指标——而是它把「高质量、低成本、全栈可控」这三件事同时装进了一个能跑在任何机器上的 1B 小模型中,让普通团队也能用上以前大厂才烧得起的 OCR 能力。开源给了杠杆,试错的门槛已经很低。 怎么踩上这个杠杆?👉 普通用户:关注腾讯混元公众号,先看技术细节,把云服务上线消息存下来。开发者:去 GitHub 搜 JevenYu/HyOCR,拉模型跑 Demo,立刻替换掉项目里那条慢速 OCR 管道。产品经理/创业者:拿几张你最痛苦的文档测一测速度、精度和成本,说不定下一个垂直文档处理工具的原型就出来了。
顯示更多
0
48
231
47
轉發到社區