注册并分享邀请链接,可获得视频播放与邀请奖励。

数字生命卡兹克
@Khazix0918
愿我们永远对世界保持好奇。 公众号:数字生命卡兹克 AI热点网站AIHOT:
178 正在关注    66.7K 粉丝
嫌AIHOT每次在后台加信源太麻烦了。 于是,花了10分钟用Agent手搓了一个小插件,只要我点击关注X账号,就会自动弹出弹窗,然后选择是否加入到AIHOT的监控信源里面去,是加入精选组还是加入氛围组。 我选择了之后,就会把这个任务发送到我家里的Mac Mini的Codex上,通过加信源监控skill自动完成分类、评级、回测、补抓等等。。。 也可以直接在某个网页打开,把某个网页加入到监控信源里以后自动爬取。 Agent时代,真的是懒逼最好的时代。
显示更多
0
91
33
0
转发到社区
把我们公众号这两年的数据跑了一个用户兴趣的定量分析。 结果发现Prompt相关的选题效果,至今依然是遥遥领先。。。
0
108
151
13
转发到社区
完了,DeepSeek也要涨价了.... 别啊...
0
190
293
9
转发到社区
这个写作Skill刚刚又小幅迭代了一版,一些AI味比较重的禁用词在一些写作能力一般的模型上面出现的概率会更小了,同时禁止了一些同义句映射的问题。 开源这个Skill呢,其实也就是希望帮助那些不会表达的人,能借助这个东西辅助自己进行一些创作和表达。 它当然不能替代那些真情实感的,真正有活人味的东西。就像我们没有办法用AI来替代自己的思想一样。 开源地址: 希望对大家有用。
显示更多
0
64
222
37
转发到社区
今天,Qwen3.8-Max正式版,终于发布了。 2.4T,又一个国产巨无霸,单次激活95B,100万上下文。 开源模型,终于全面迈入了2T时代。 今天体验了一下,综合能力大概跟Kimi K3在同一个档位,互有胜负,你要硬说谁更好一点吧,我感觉从日常的任务和开发观感上,已经很难进行区分了。 但是Qwen3.8-Max的优点就在于,价格低很多,以及推理速度非常的快,$2/百万输入、$6/百万输出,是Opus 5的30%的价格,K3的50%左右。 前几天DeepSeek V4 Flash的斩杀线的梗我相信很多人都看过了,在长程Agent这种海量烧Token的场景下,有时候,差不多的性能,我比你便宜,那我就是好。 Qwen的Token Plan目前价格还有优惠,可以随便买,而且这次口碑确实不错,就怕后面也涨价,我自己也买了一个季卡先囤着了。 然后呢,这次Qwen3.8-Max的前端很强,网页结构、视觉层级、组件细节和动效都做得不错,在后端和长程任务上也不错。 但是最让我意外的,居然是写作能力。 这两年,所有模型都在疯狂特化Coding和Agent。 然后我们现在就看到一个很奇葩的现象,大家的Coding和Agent能力疯狂进步,然后写作疯狂倒退,甚至现在我做内容创作的白月光,还是很久以前的Claude Opus 4.6,但是可惜的是,Claude把我封了。 我的白月光也没有了。 但是这一次,Qwen3.8-Max,居然意外地保住了语言上的感觉。 让我感觉,写作能力居然出乎意料的还不错? 它能理解语气、节奏和留白,在语感上虽然有时候也有黑话,但是比较少,可以通过Skill的限制全部去除掉,居然让我有了一种,用Opus 4.6的感觉。 Qwen3.8-Max,意外的居然是个综合水桶。 虽然我也不想天天来回摇摆,但是事实就摆在这,新就是好,新就是棒。 现在,对于觉得绝大多数人来说,Qwen3.8-Max,可能就是最近一段时间的首选了。 真的是,各家的模型,现在都是独领风骚十几天。。。 Qwen3.8-Max下周正式开源。 但是还有一个彩蛋,是我开心的想要跳起来的。 除了2.4T的这个大模型,Qwen还会开源一个供开发者们本地部署的小模型Qwen3.8-27B。 千问终于想起了,两年前,他们是怎么让整个社区为之沸腾的。 旗舰模型,决定一家公司的高度。 小模型,决定一个生态的宽度。 如果他们只开源那个2.4T的,千问我觉得还是只能叫千问。 但是他们居然还要再开源一个27B的,那没啥可说的了。 我愿称之为。 义父。 2年前的那个曾经的千问。 他们好像,又回来了。
显示更多
📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub: - Real work, real results: Production-quality deliverables across hundreds of professions. - Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. - Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction. 💰Pricing: Input: $2.0 / M tokens Output: $6.0 / M tokens Implicit Caching: $0.25 / M tokens Start building with Qwen3.8-Max! 🚀 📖 Blog: ✅ Qwen Studio: ⚡ API:
显示更多
0
95
88
6
转发到社区
坏菜了,呼叫义父 @thsottiaux ,这个世界需要义父,再不重置天才就要陨落了。
0
139
159
0
转发到社区
等了好久,DeepSeek V4的正式版终于来了。 可惜,来的还是DeepSeek-V4-Flash,V4 Pro正式版还得继续等。 但我看到消息的第一反应,还有很开心的。 因为V4 Flash对我现在的生活,反而比V4 Pro还要重要。 这次,DeepSeek V4 Flash它的模型结构和参数规模完全没变,只重新做了后训练,但是强了特别多。 Terminal Bench 2.1从61.8涨到了82.7。 DeepSWE从7.3涨到了54.4。 DSBench-FullStack从37.0涨到了68.7。 官方列出的九项Agent测试里,它已经全部超过了V4 Pro Preview。 同时还原生支持Responses API,专门针对Codex进行了适配。 讲真,DeepSeek这次在后训练上,应该是憋了个大的。 但如果让我非常坦率地评价,DeepSeek V4 Flash在最顶级的Coding和Agent任务里,跟GPT-5.6 Sol、Claude Opus 5、Kimi K3这些最强模型,依然会有巨大的差距。 复杂项目的架构设计、长时间自主执行、充满意外的多步任务,我大概率还是会优先把最强的模型挂上去。 这没什么可避讳的。 但模型真正进入生产环境以后,能力上限只是一部分。 还有一个经常被低估到离谱的指标: 你到底用不用得起。 这也是我为什么反而更期待Flash。 我自己的AIHOT,现在每天差不多要抓一万条新闻。 这些新闻进来以后,要做结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并等等,还有一大堆后续判断。 最后才回到真正的精选打分环节那一步。 这里面绝大多数环节,都需要AI介入。 有些流程复杂到甚至需要Agent自己调用工具、检查结果、决定下一步。 一万条新闻,乘上一大串处理链路,最后就是一个极其恐怖的调用量。 按照我现在的调用规模,每个月大概API的消耗量在1000多人民币,你要是换成我常用的那些顶级模型,成本至少得翻十倍以上。 但DeepSeek V4 Flash就很适合干这个。 智能水平在中上等,却又便宜得离谱。 WorkBuddy里也是一样。 真正难到天上的任务,大家可以接K3。 可绝大多数日常任务,DeepSeek V4 Flash已经完全能处理,而且单次只消耗0.06积分。 行业当然需要那些一次跑通世界级难题的顶级模型。 可这个世界上更多的真实需求,是每天重复一万次、十万次、上百万次的普通任务。 当智能贵得像奢侈品时,大家只能偶尔体验。 当智能便宜到像水电一样时,它才会真正流进每一家公司、每一条流水线和每一个普通人的生活里。 所以我很多时候,真的挺感谢DeepSeek。 这才是真正的,智能平权。
显示更多
🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We’ve massively upgraded its Agent capabilities—benchmark scores are now far surpassing the V4-Pro-Preview. Check out the massive performance leap below! 👇 🔷 The official V4-Flash now natively supports the Responses API format and is fully adapted for Codex! Check out the configuration details in our official API docs:
显示更多
0
99
166
5
转发到社区
傻逼Claude,我活了半年的号也没了。 再见,从此以后拉黑。 时代变了,再也不是非你不可的时代了。 GPT+Kimi,比你还能打,傻逼。
0
376
1.2K
19
转发到社区
今天,阿里Agent时代的希望,千问办公。 在被大家爆料了很久之后,终于在今天早上开始很低调的开始内测了。 QoderWork、悟空、MuleRun三条Agent线,全部收拢整合,统一成一个产品,千问办公,由钉钉新任CEO陈宇森牵头。 网址在此: 曾经,整个阿里被压缩进千问,而如今,又再一次被压缩进千问办公。 而且,压缩的更深、更广、业务可能会更多。 办公赛道,WorkAgent赛道,就是AI应用时代大家绝对不可能放弃的超级战场。而且Agent对传统办公的冲击,我觉得比绝大多数人想象的可能更深更广,空间更大。 曾经我说过,在我的理解里,办公产品大概分三代。 第一代Office,本地装软件,活自己干。 第二代云协同,比如钉钉,就是多人一起干,但活还是你的。 前两代的商业逻辑是一样的,做好一个产品,所有人用同一套东西。 而这一代完全不同。 以前卖的是一个固定的产品,现在卖的是一种智能。 这种智能帮你造最适合你自己场景的工具,你搓出来的东西天然就是为你定做的,不存在什么功能用不上或者缺了你想要的。 而且国内,SaaS真的就是碎得一塌糊涂,而这件事,过去一直被当成国内SaaS的病。 但现在,反倒成了通用Agent的机会,因为一个能自己造工具的东西,最擅长处理的恰恰就是长尾和不标准。 所以从这个点就能看出来,为什么是钉钉的陈宇森来带队做这个事了。 目前客户端版本和钉钉版本已经上线,未来还会有网页版,三端一致。 钉钉在侧边栏上,可以直接处理群聊、日程、待办和企业里的各种工作。 体验了一下,功能比较全,基本该有的功能全都有,做的非常全面。 有个好玩的是,它可以生成HTML,而且,连域名、数据库和托管都一起给你做好了,过去Agent做出一个网页,后面还有部署、买域名、接数据库这一长串门槛,对普通用户非常不友好,现在,直接千问办公一站式解决。 这个核心,还是业务线太广了。 上面有Qwen模型,中有阿里云、百炼等等,下有钉钉里沉淀了很多年的组织关系、消息、文档、流程和权限。 我一直觉得,Work Agent最终拼的其实是四件事。 模型决定智力,业务广度决定能力,企业数据决定它可否可用,组织身份和权限决定安全下限。 阿里恰好是国内少数能把这些所有要素,同时凑齐的公司。 从今天开始,每一个人打开电脑的第一个念头,可能都会慢慢从我要用什么工具变成我要让谁帮我干这件事。 这个转变一旦发生。 就再也回不去了。
显示更多
0
51
73
7
转发到社区
忽然有一种莫名的爽感,今天就是删删删删删删...
时代变了,过去那么多的规则、约束、文档,感觉现在只会让模型的推理效率和效果变得越来越垃圾,Anthropic说的确实对。 今天决定直接大幅重构所有的文档和规则,清空重写。。。 从此思路不再是用规则约束模型指望它一次写对,而是在前期交给模型更多的思考空间更多的注意力,把更多的限制,加在测试侧,用测试来限制一切。 文档和规则,真的要退环境了。
显示更多
0
58
71
0
转发到社区
时代变了,过去那么多的规则、约束、文档,感觉现在只会让模型的推理效率和效果变得越来越垃圾,Anthropic说的确实对。 今天决定直接大幅重构所有的文档和规则,清空重写。。。 从此思路不再是用规则约束模型指望它一次写对,而是在前期交给模型更多的思考空间更多的注意力,把更多的限制,加在测试侧,用测试来限制一切。 文档和规则,真的要退环境了。
显示更多
0
100
254
7
转发到社区
聊聊字节Seed的这个科学家计划。 今天,字节跳动Seed发布了一个很有意思的计划,叫Seed STEM科学家计划。 这大概率是未来的一种行业趋势了。 不知道大家还有没有印象,Seed之前发起了一个Edge研究计划,主要探索一些长期重要的课题,然后呢,今天他们又发起了STEM计划,准备邀请100位前沿科学领域的研究者,到Seed和AI团队一起工作,首期6个月。 需要的科学家的方向,也基本都是数学、物理、化学、生物、材料学等等。 他们可以以科学家顾问的身份加入,也可以直接以博士实习生的身份加入,Seed会提供充足的算力资源、共同用AI进行大规模的科研研究,还有很有竞争力的薪酬。 前几天我其实也写过一篇文章: 就是今年的AI行业有个很奇特的现象,原本一大群分布在各个学科里的巨佬,正在加入Anthropic。 诺贝尔化学奖得主John Jumper,经济学家Chad Jones,哲学家Harvey Lederman等等等等。 而且这帮人不止是去做AI的,更是希望去到Anthropic,来用最先进的模型,进行AI加速科研,从而进行更前沿的探索,做出更大的突破的。 当时我在那篇文章里,写了一句话。 AI,正在变成所有学科的公共地基。 以前大家聊AI公司,想到的全是模型、算法、算力和工程师。 接下来,顶级AI实验室里会出现越来越多物理学家、化学家、生物学家,甚至哲学家、经济学家。 因为前沿模型继续往上走,光靠AI研究者自己已经不够了。 蛋白质结构预测需要化学家,量子计算模拟需要物理学家,AI安全对齐需要哲学家,经济影响评估需要经济学家。 反过来,这些学科各自积累了几十年甚至上百年的难题,也能发现AI给了他们一个前所未有的杠杆。 今天Seed这个计划也来了,我越来越确信,这会成为接下来AI行业非常明显的趋势。 AI这个行业的边界,可能正在消失。 AI会进入药物研发、材料、物理等等,进入每一个还存在大量未知问题的地方,进行重大的创新和科研突破。 也许,也不会再有那么泾渭分明的AI行业。 每一个行业,都会重新长出一层AI。 未来,最重要的AI突破,很多可能也根本不会被叫作AI突破。 它会被叫作一款新药、一种新材料、一个新定理,或者人类第一次理解的某条自然规律。 我们脚踩大地,翱翔天空,为了灿烂的银河而战。 这可能才是AI对我们这个时代最大的影响。 科研大爆炸。 同时也是。 人类黄金时代的前夜。
显示更多
0
46
77
9
转发到社区
AIHOT的月活突破了60万,我也终于把AIHOT优化到,敢发在X上给大家安利一下我自己做的这个小破东西的时候了。 这玩意也几乎代表了我自己做了三年AI内容,对AI领域资讯的品味。 谁能想到,这个看着小小的AI资讯站,背后的后端逻辑有这么复杂呢,数百个信源5分钟级别的抓取 - 数据清洗 - 结构化 - 预筛 - 精选 - 聚类 - 展示,这还只是大流程,这流程里面,大模型介入的地方就有不下10个了。。。 如果是每个大块里面的细节流程,光一个聚类算法的工程化我感觉我都可以写好几篇万字长文来分享了,更别提最核心的精选了。真的,最近5年的关于新闻聚类的论文全扒了一遍,没有一个结构能达到我的准确性要求的,最后是花了无数个日夜回测了不知道多少轮的数据,又不知道标了多少的数据,硬生生自己造的。 任何东西想把它做好,真的感觉,花费的心力不是一丁点两点。 网址在此: 这可能是当今无论是对人类、还是对Agent,都是体验最好的AI资讯网站了。 而且我也承诺,永久免费,因为我也不靠这玩意挣钱,主要,还是太喜欢做产品了,也太喜欢看到自己的产品被别人喜欢了。 希望。 能对大家有用就好。 (PS:还有好多好多新功能还在开发中,希望大家再给我点时间...)
显示更多
0
247
918
137
转发到社区
天才又一次陨落了,周六才重置了,千省万省还是不够用。 这几周每天都在Coding,真的感觉,所有的模型在做大活的对比上,还是Fable 5好啊。 Fable 5就像一个隐世的天才,出手就是绝杀。 GPT-5.6 Sol更像是一个被规训的不敢犯错的高级牛马。 不过有一个例外,就是GPT-5.6 Sol Ultra,这玩意就感觉是一群心智未开的Agent小朋友手牵手,约好时间一起在你的代码里疯狂拉屎。
显示更多
0
137
199
7
转发到社区
这就是用GPT-5.6 Sol Ultra 烧了20亿token烧出来的科研探索...🤡🤡🤡 我他妈的... 这是拿19亿token去打斗地主了吗
0
140
214
4
转发到社区
为了让AIHOT的聚类更准一点,只能自己干标注了。。。 所有的工作干到底层,怎么最后都是给Agent干标注呢...
0
99
77
1
转发到社区
啊?开着GPT-5.6 Sol Ultra干个AIHOT的聚类工程任务,因为发现现在市面上SOTA的论文效果也不是很好,于是让它自己去做知识图谱和数学层面的底层突破,目标希望能在聚类算法上达到SOTA。 然后,跑了6个小时,直接给我还剩92%的Codex周额度蹬完了...尼玛???
显示更多
0
117
130
5
转发到社区
可能很多人不知道,其实现在做代码Review最牛逼的,是ChatGPT网页版上的GPT-5.6 Sol Pro模式。 其Review水平和深度,让Fable 5都甘拜下风。。。
显示更多
0
208
962
79
转发到社区
这下成大预言家了。。。
兄弟们听我的,最重要的事,先去Kimi上买个Coding Plan,然后用上K3,这可能是目前国内现在最好的模型。。。 不过我对国内算力都比较担忧,感觉再过两天,这玩意也会跟GLM一样直接买不到了。 先氪了再说。。。
显示更多
0
76
129
2
转发到社区