註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

九原客
@9hills
喜欢一切美好的事物。目前聚焦在大模型领域。
1.2K 正在關注    27.6K 粉絲
AI for Work 在很多企业内部很微妙。 用通用智能体(Hermes、WorkBuddy 之类)配上 DeepSeek-V4-Pro 模型,可以优化很多重复性的劳动。 但据我观察,和程序员们非常积极的燃烧 Token 提效促进自我淘汰不一样。传统的财务、行政等岗位,有些企业存在一种很有意思的现象:给 IT 部门提很复杂的智能体含 UI 需求,主打一个难落地。 但是实际上有些人会悄悄使用。🤔 或许这也是一种生存智慧。
顯示更多
关于Agent 中的 mcp vs cli,以前激进的看法是认为cli会替换掉mcp。 但是实际感触下来,对于常见的客户端(比如git),CLI 表现完美。 但是封装的自定义CLI,表现的稳定性不如mcp/结构化工具,我觉得原因主要是后者的强结构性导致的。 而且mcp 有比较标准的企业级鉴权解决方案,后续估计还是并行。
顯示更多
0
20
49
2
轉發到社區
Agent in Channel 多人群聊其实有很多交互问题,有没有好的开源项目? 也期待早日用到Claude Tag,看看他们是怎么设计的。 目前我知道的只有 raft build的blog讨论过这个问题:
顯示更多
0
42
90
9
轉發到社區
开源必须赢!再次为唐老师和智谱( 在某些人在用所谓的“AI 威胁论”以及“安全恐慌”来包装技术壁垒的时候,智谱选择了一条更难,但也更值得尊重的路:把能力开源出来,把信任交给开发者,研究者和产业生态! 这和Dario那种老是皱着眉,不断放大恐惧,努力把“安全”叙事变成自己大模型公司护城河的做法完全不一样。。。 真正自信的技术公司,不应该靠制造神秘和恐慌来证明自己有多强,而是敢于把模型,工具和能力释放出来,让更多人使用,验证,改进和建设。 在笔者看来,开源不是简单的免费给别人用,而是一种技术自信。它意味着你相信生态的力量,也相信开发者的创造力,最终大家都相信AI不应该只掌握在少数闭源巨头手里。 所以,必须为唐老师和智谱点赞:没有用制造恐惧来定义AI,而是用开放去推动AI的进展。 这才是真正值得尊重的中国AI路线。
顯示更多
0
51
75
9
轉發到社區
大家现在能叫出一串名字:DeepSeek,千问,Kimi,混元,星火,文心一言…… 感觉好像就是ChatGPT一出来,中国本土公司一夜之间全冒出来了。但其实根本不是那么回事。 如果画一张中国大模型的技术族谱,你会发现几条主线: 第一条主线和智源研究院有关。 北京智源人工智能研究院(BAAI)成立于2018年11月。它不是一家普通的公司,而是在科技部和北京市政府的支持下,由清华、北大、中科院这些顶尖高校和科技企业共同发起的非营利研究机构。它不为赚钱,专为死磕AI领域最硬核、最原始的创新,目标直指大模型、世界模型和通用人工智能这些星辰大海。 智源研究院2021年牵头搞出了“悟道”系列大模型,成了后来中国大模型江湖的技术土壤。现在,它又开始折腾“悟界”系列,想让AI不仅懂文字图片,还能看懂物理世界,更进一步帮科学家研究生命科学。 智源手里还有两张王牌: 🔹 智源大会:这是它每年组局的全球AI顶级聚会,大牛学者和行业大佬都会来,现场发布一堆前沿成果和年度趋势预测,基本是国内AI圈的风向标。 🔹 人才生态:它最厉害的一招,是把清华、北大、中科院这些顶级学术力量揉在一起,打破体制的围墙,搞出一个自由开放的交流平台。 在笔者看来,现在的智源更多扮演的角色像是一个播火者,不造产品,只管把火种点燃,然后递到整个产业手里。 如果把智源研究院看作是一棵树的根,顺着根往上看,会分出三条枝干: 一条是CPM(清华大学牵头的超大规模预训练模型)。2020年11月14日,智源研究院和清华大学研究团队联合发布了以中文为核心的大规模预训练语言模型CPM-LM,参数规模达26 亿,预训练中文数据规模100 GB。CPM这条线往下长出了OpenBMB开源社区,再后来就有了现在大家在端侧玩得比较多的MiniCPM模型。 另一条是“悟道”系列,它直接孕育了GLM这个技术路线,然后孵化出了现在商业化最成功的智谱AI,就是那个ChatGLM背后的大佬。 还有一条叫M6,是阿里达摩院跟智源一起捣鼓的多模态大模型,这条线一路往下,就演化成了今天的通义千问Qwen。 现在市面上竞争得你死我活的大模型产品,追根溯源,技术底气有一大半都能对上这个谱系。 为什么智源研究院这么牛?因为它当时把国内最核心的大模型人才和最前沿的技术路线全给聚到一块儿了。智源,清华,北大这三家,基本上构成了一个铁三角,就像美国那边的OpenAI,DeepMind配上斯坦福,伯克利一样,人才和想法在这个生态里来回流动,碰撞出来的火花,就把早期的底座给搭好了。 第二条主线是百度,属于典型的“起了个大早,赶了个完集”。 早在AI这个词还没流行的2013年,李彦宏就亲自挂帅,成立了百度深度学习研究院,这是全球第一个把“深度学习”直接挂在企业研究院招牌上的。 紧接着2014年,百度在硅谷设立人工智能实验室,请来了吴恩达当首席科学家,全力推动“百度大脑”。更有意思的是,现在AI圈如日中天的Anthropic创始人Dario Amodei,当时就在那个组里研究语音识别和模型扩展。他还把Jim Fan招了进来做实习生。 2017年底,百度硅谷团队干了一件大事,发了一篇论文叫《Deep Learning Scaling Is Predictable, Empirically》,第一次系统性地证明了Scaling Law在机器翻译、语言建模、图像和语音上都管用。可惜当时没引起太大轰动,但金子总会发光,它后来成了大模型研究的基石。2019年OpenAI那篇著名的Scaling Law论文,参考文献里就明明白白引用了这篇百度论文的作者Joel Hestness的后续研究。 时间来到2019年,百度正式发布了开创性的知识增强语义模型ERNIE 1.0。这个模型厉害在于,它不只看无结构的原始数据,还把百度多年积累的大规模知识图谱给融合进去了,一出来就刷新了多种中文NLP任务,直接对标BERT。年底更是迅速迭代到了ERNIE 2.0,搞了持续学习语义理解框架,中英文任务上全面超越了业界主流模型。 第三条主线是科大讯飞。 源头可以一直追到1999年,当时还在中科大读博的刘庆峰,和导师王仁华教授一起,依托中科大创立了科大讯飞的前身。讯飞从中文语音起家,但它在AI大模型上的布局,可以追溯到2014年。 那年,讯飞首次提出“讯飞超脑计划”。这个计划是个战略转弯信号,标志着讯飞不再只盯着智能语音,而是要向更难的认知智能和机器学习全面进军。 到了2019年10月份,讯飞被美国商务部加入了禁运名单,决定启动“国产化AI算力底座”建设。这为后来大模型的自主训练,提前备好了算力粮草。 说到这儿,笔者插一段亲身见闻。 这其中的很长一段时间笔者还在某大厂工作,业务跟英伟达是直接竞争关系,所以能亲眼看到百度和讯飞在英伟达生态圈里有多重。重到什么程度呢?当时CUDA软件栈里好多奇怪的Bug,都是百度和讯飞的工程师先踩到,然后和英伟达一起联手修掉的。从这点就能看出来,这两家当时在AI工程化上走得还是比较前沿的。 如果说ChatGPT像一把火,那么他一下子把整个中国大模型产业给点爆了,商业化了,出圈了,但烧起来的那些柴,是在2020年前就一批批已经被产业的大拿们码好了的。 因为,在那之前,这些人已经闷头干了不少事: 🔹 完整的大规模预训练体系搭起来了,知道大模型该怎么训了; 🔹 积累了部分中文高质量语料,不再是拿英文随便翻译翻译就完事; 🔹 千亿,万亿参数的超大模型真刀真枪跑通了,验证了工程上走得通; 🔹 部分搭建了国产化AI算力底座,踩了很多坑; 🔹 多模态路线也摸着石头探索了; 🔹 各种开源社区,像OpenBMB,也建起来了。 这些工作,在那些个安静的前夜,的确没有马上变成赚大钱的产品,但它们实实在在化作了土壤。后来智谱AI的崛起,通义千问的迭代,百度的文心,DeepSeek的惊艳,讯飞的星火,到字节的豆包,腾讯的混元,小而强的面壁MiniCPM,全都是从这片土壤里长出来的庄稼。 中国大模型产业的爆发,扳机是ChatGPT扣动的;但中国大模型技术的种子,是早在2020年前,由智源研究院,百度,科大讯飞,以及清华,北大,中科大和一批有远见的科技企业,一起亲手种下去的。
顯示更多
0
106
761
154
轉發到社區
最好的coding workflow skills,没有之一。
Announcing mattpocock/skills v1 - Achieved a 63% reduction in token cost for skill descriptions - Split skills into model-invocable and user-invocable skills, adding /codebase-design, /domain-modeling, and /grilling - (UPDATED) /writing-great-skills - rewritten from the ground up, encoding my skill-writing best practices - (UPDATED) /diagnose -> /diagnosing-bugs - now model-invocable, awesome for fixing hard bugs - (NEW) /ask-matt: a router skill that teaches you how all the engineering skills work together
顯示更多
0
18
363
37
轉發到社區
还是亲历者来说说历史吧。中国最早的大模型研究基本上与智源研究院有关。第一个正式发布的大模型是智源研究院支持清华刘知远团队的清源CPM(2020年11月,26亿参数) ,后来演变为OpenBMB,现在还是最好的端侧模型之一。然后就是智源研究院牵头,唐杰老师挂帅的悟道1.0模型系列(2021年3月),其中就包括GLM的最早期版本(GLM论文通信作者是唐杰和杨植麟)。 其他比较早期的工作,百度是Ernie 3.0(2021年7月);阿里M6(2021年3月)是与唐杰团队合作的(林俊旸是第一作者,唐和当时在阿里的杨红霞是通信作者),后来演变为Qwen。华为盘古有两个版本,一个是华为云田奇与杨植麟团队合作,一个出自诺亚方舟实验室,但都没有持续。 可能有遗漏的,大家可以补充。
顯示更多
晚上刷到余承东在华为发布会上说盘古是国内第一个大模型,我还真去翻了一下时间线。 PanGu-α 论文是 2021 年 4 月 26 日发的,标题和摘要里已经写了 Large-scale Pretrained Language Models,最高 200B 参数,而百度的 ERNIE 3.0 是 2021 年 7 月 5 日,时间上确实晚了一步。 当然,放到全球看,GPT-3 早在 2020 年就已经把 175B 参数和 few-shot/in-context learning 打出来了,所以「全球都不知道大模型」更像是老余发布会惯用的夸张表达。 但如果只看国内早期中文大模型路线,盘古这波确实有资格说自己起得很早。 发布会上老余宣布 openPangu 2.0 要从 6 月 30 日起陆续开源,最高 505B 总参数、512K 上下文。 老余这次把盘古大模型又重新推到台前,真正的悬念已经变成:当年的「早」,这次能不能变成今天的「强」。
顯示更多
0
59
355
60
轉發到社區
GLM5.2 今天开源了。 各家云服务商应该已经或者即将提供服务,因为架构上没啥变化,只需要部署一下。 作为前zhipu max 老会员,对他家订阅服务的商业决策不太认同,还是用别家的套餐吧。
顯示更多
0
55
122
2
轉發到社區
gpt-image-2用来翻译论文图片挺好的,完美复刻
所谓的 API 蒸馏 因为必然是off-policy 的,主要是用于大规模合成 SFT 指令集用于RL前的冷启动阶段。 有帮助,但是只靠SFT无法制造出第一梯队的前沿模型。每家模型必须自建大规模的 RL 基础设施。 但是合成 SFT 指令集这件事上,我相信必然会利用某些外部强模型生成一些。
顯示更多
This paper shows that knowledge transfer is hard even under perfect conditions and model access, yet it is randomly used as an argument against what i was saying about distillation. Actually it is a good read to understand why API distillation can't work, and you can just fine tune for specific style/patterns or very narrow domain knowledge *at best*.
顯示更多
0
12
26
2
轉發到社區
下午Codex频繁触发这个警告,任务就会自动中断。即使设置了Goal,也会中止。
0
33
16
1
轉發到社區
现在比较难的是怎么评估模型。 我一直在想自己沉淀一些 Agent 长程任务 benchmark,但是成本很高啊。
GLM 5.2 vs Kimi k2.7 vs Claude Opus 4.8 应朋友们的要求 GLM 5.2 一起测了吧 ,还是用的“AI合同审查”项目的PRD来构建 模型 构建时长 步数 5h额度 代码质量 GLM 5.2 106分钟 251 113% 83 Kimi k2.7 60分钟 429 120% 75 Opus 4.8 35分钟 164 50% 86 GLM 5.2 思考深度和时长怎么感觉和Qwen 3.7 、DeepSeek 一样 又深 又长 意图识别和指令遵循做的也不错 整体质量确实没有让人失望,但给到Opus 4.7有点过誉了 ,我体验在 4.6 和 4.7 之间 你通过数据也能看到,同样的任务 GLM 花了比Opus 4.8 3倍的时长 不管是算力的问题导致的 还是还是模型 这官方真的要好好优化 GLM 5.2 算是班级里的尖子生 开源现在排#1# 确实 好了 就分享到这里 有新的惊喜发现再来分享
顯示更多
0
47
32
1
轉發到社區
准备猛猛的测试 GLM-5.2
GLM-5.2 on KingBench (3). Thoughts: The model has superb taste. It is greater at UX than UI. The code is always very clean. It is great at One-shot wonders. I asked it to fine-tune a whole local model and it did it in 30mins! This is just a great model to use all-round. 1/n
顯示更多
0
40
24
0
轉發到社區
linux input-mapper 配置:
D100H 配置成功,成为 Vibe 神器! Win/macOS 有官方软件,Linux 下可以用input-remapper 配置映射。 那个大旋钮按下去手感不太好,就没有配置,其他的键位如图。
顯示更多
弄了一个小玩具,感觉会成为vibe神器。 今晚该睡了,明天搞它。
A社也算是求仁得仁了,这件事可能会是一个转折点。 如果强模型因为无法上市导致无法获得收入,那么商业行为就会让研发前沿大模型无利可图。 也就是说上限锁死了?利好盘古啊!
顯示更多
给 Dario 一个建议,模仿当年前辈把PGP 源代码运到美国国外的案例。 当时为了绕过加密技术管制,他们把PGP源码印了900页纸质书运到国外。这是因为一旦源代码印到书内,就受第一修正案(言论自由)的保护。 A社可以把几TB的模型也印出来,在国外另起炉灶。
顯示更多
0
60
575
20
轉發到社區
让你们炒作 AI 安全,天天吹牛吹到别人信了吧。
The US government, citing national security authorities, has issued an export control directive to suspend all access to Fable 5 and Mythos 5 by any foreign national, whether inside or outside the United States, including foreign national Anthropic employees. The net effect of this order is that we must abruptly disable Fable 5 and Mythos 5 for all our customers to ensure compliance. Access to all other Claude models is not affected. We apologize for this disruption to our customers. We believe this is a misunderstanding and are working to restore access as soon as possible. Read our full statement:
顯示更多
取消 OpenCode Go $10 美金订阅,主力模型 DeepSeek-V4-Pro 官方确定不会降价到和 DeepSeek 一致,这样相当于最多只有7折左右优惠,还有各种限额和月度消费。 直接使用 DeepSeek 官方 API 。
顯示更多
0
36
275
4
轉發到社區