AI 时代最有压迫感的通知:
您的编程能力将于 3 天后到期,请及时续费。
现在还有人主要用 GitLab、Gitee、Bitbucket 这些代码托管平台吗?
感觉到了 AI 时代,GitHub 都快成权威了,提到开源项目,第一反应就是 GitHub 链接在哪。代码托管明明有那么多选择,现在好像默认就是它了
还在用其他平台的,是公司要求、方便自建,还是有什么比 GitHub 好用的地方?有点好奇
显示更多
这两天用了下 DeepSeek V4.1 flash,怎么也一股 Claude 味啊,这感觉也太熟悉了
你们用下来什么感觉,有没有人懂我在说什么
现在用 Codex 里的 GPT-6 Astra Ultra,感觉整个过程已经跟我这个人类没什么关系了
主代理和 subagent 自己沟通,具体说了什么、为什么这样做,我全都看不到。我只能对着屏幕干等,等它们忙完,最后给我一个结果
中途想判断一下方向对不对,想参与讨论,都不知道从哪里插话
这种失去掌控感的体验真的很难受,等着等着就开始怀疑,我在这里到底还有什么用
显示更多
有没有人拿各家的通用大模型比过作曲?让它们生成乐谱或 MIDI,放出来听听谁写得好
只用文本输入输出,模型写音符,软件负责播放,不调用专门的音乐生成模型。相关 benchmark 已经有了,但这种直接比较实际听感的评测,我还挺想看的
给它们同一段歌词配旋律,或者指定风格、节奏和场景,比如适合深夜散步的配乐。再用同样的音源播放,盲听一下差距有多大
我很好奇,它们能不能把歌词里的情绪、场景里的氛围写进曲子里,旋律会不会好听?平时写代码厉害的模型,作曲也会更强吗
有试过的可以发来听听,想听实际生成的作品
显示更多
没想到 AI 还能这样用,平时聊天、写代码的文本模型,居然也能作曲。
我让 GPT-6 Astra 做了一段音乐,它用代码把旋律、节奏和乐器编排写成 MIDI,再转成音频,效果比我预想的好很多,还真有那个氛围!
视频里的配乐就是这样生成的,配图也让 AI 画了一张。大家可以拿自己喜欢的风格试试,挺好玩的
显示更多
有没有人拿各家的通用大模型比过作曲?让它们生成乐谱或 MIDI,放出来听听谁写得好
只用文本输入输出,模型写音符,软件负责播放,不调用专门的音乐生成模型。相关 benchmark 已经有了,但这种直接比较实际听感的评测,我还挺想看的
给它们同一段歌词配旋律,或者指定风格、节奏和场景,比如适合深夜散步的配乐。再用同样的音源播放,盲听一下差距有多大
我很好奇,它们能不能把歌词里的情绪、场景里的氛围写进曲子里,旋律会不会好听?平时写代码厉害的模型,作曲也会更强吗
有试过的可以发来听听,想听实际生成的作品
显示更多
TypeSafe 新发布的 Jev,主打不生成文字,只返回选项、概率和置信度。光看这些功能,我确实会觉得,拿个 base 模型后训练,再接个分类头,也能做啊。分类器已经是很成熟的技术了。
预训练模型接分类头,本来就可以直接输出分类概率。把答案限制在 A/B/C,也能保证它不会输出 D。所谓零幻觉如果指的是这个,和模型能不能选对是两回事。
Jev 允许开发者用自然语言定义问题和候选项,可以理解为估计 p(选项 | 输入状态、问题、候选集)。这比只认固定标签的业务分类器通用,但同样可以作为 base 模型的多任务后训练目标。难点在于换到没训练过的任务以后,判断质量还能保留多少。
它把同一份输入上的多个问题独立、并行求值,省掉了逐 token 写出完整答案的过程。直接给候选项打分,确实可能比生成一整段 JSON 快很多。但分类头本来也不需要生成文本,单凭这个对比看不出新架构的贡献。公开材料也没说明底层如何共享计算,一次 API 调用不等于只跑一次前向传播。
它的训练方法 RLCD 强调概率校准。给出 80% 概率的那组预测,长期看应该大约有 80% 正确。分类准确率高,不代表概率可信,一个正确率 90% 的模型,也可能动不动就报 99% 的把握。
这个目标有实际意义。程序需要根据概率决定自动执行还是转人工,同样选 A,51% 和 99% 应该触发不同处理。
但校准也有成熟方法。交叉熵、Brier score 可以用于训练概率预测,温度缩放可以做后处理。目前这些公开材料没有给出 RLCD 的奖励函数、训练配方和消融实验,还没法判断它相对常规训练加校准,多解决了什么问题。
Jev 的 confidence 也是从选项概率分布计算出来的统计量。分布很集中,说明模型偏向某个答案,不能单凭这一点认定它可靠。
如果它能让开发者直接用自然语言定义分类任务,省去准备数据、训练和部署的工作,同时保持低延迟、低成本,这个产品当然有意义。成熟技术做成好用的服务,本身就能解决问题。
不过,既然主张新架构和新训练方法,就应该和经过多任务后训练、带分类头和校准、支持批量推理的模型比较。在未见任务上测准确率、校准误差,以及相同错误率下能自动处理多少请求,再比较延迟和成本。这样的结果才能说明 Jev 到底做到了什么。
显示更多
After co-inventing ChatGPT, I kept asking myself: why have superhuman chat models not led to AGI?
I’ve spent the last 2 years in stealth building a new way to train models (RLCD), and a new type of frontier AI model that we are releasing today: Jev
• 20-200x faster
• 40-400x cheaper (w/ output tokens free)
• Frontier composable intelligence optimized for decisions
AFAICT the shortest path to AI-based economic revolution
显示更多
没想到 AI 还能这样用,平时聊天、写代码的文本模型,居然也能作曲。
我让 GPT-6 Astra 做了一段音乐,它用代码把旋律、节奏和乐器编排写成 MIDI,再转成音频,效果比我预想的好很多,还真有那个氛围!
视频里的配乐就是这样生成的,配图也让 AI 画了一张。大家可以拿自己喜欢的风格试试,挺好玩的
显示更多
有没有人拿各家的通用大模型比过作曲?让它们生成乐谱或 MIDI,放出来听听谁写得好
只用文本输入输出,模型写音符,软件负责播放,不调用专门的音乐生成模型。相关 benchmark 已经有了,但这种直接比较实际听感的评测,我还挺想看的
给它们同一段歌词配旋律,或者指定风格、节奏和场景,比如适合深夜散步的配乐。再用同样的音源播放,盲听一下差距有多大
我很好奇,它们能不能把歌词里的情绪、场景里的氛围写进曲子里,旋律会不会好听?平时写代码厉害的模型,作曲也会更强吗
有试过的可以发来听听,想听实际生成的作品
显示更多
有没有人拿各家的通用大模型比过作曲?让它们生成乐谱或 MIDI,放出来听听谁写得好
只用文本输入输出,模型写音符,软件负责播放,不调用专门的音乐生成模型。相关 benchmark 已经有了,但这种直接比较实际听感的评测,我还挺想看的
给它们同一段歌词配旋律,或者指定风格、节奏和场景,比如适合深夜散步的配乐。再用同样的音源播放,盲听一下差距有多大
我很好奇,它们能不能把歌词里的情绪、场景里的氛围写进曲子里,旋律会不会好听?平时写代码厉害的模型,作曲也会更强吗
有试过的可以发来听听,想听实际生成的作品
显示更多
DeepSeek:用户付了整个电脑的钱,凭什么只用一部分
还记得最早的 AI 生图,连手指、发丝这些细节都画不好,一只手长六根手指太常见了,头发也经常画着画着就粘在一起
现在用 GPT Image 2.5,感觉已经几乎碰不到这类错误了,画二次元小人也很自然,手指、头发这些细节基本都正常,不用每次出图先找哪里画崩了
以前还在研究怎么写提示词才能让它画对一只手,现在已经默认这些就该画对了。才过去几年啊
显示更多
百度还能用吗?太逆天了吧!
百度保障为您搜索护航,这好恶心。
DeepSeek:用户付了整个电脑的钱,凭什么只用一部分
Anthropic 这次的蒸馏报告点名了七家中国公司,居然没提豆包。
看完名单,突然觉得豆包是好人了。
怪不得我总觉得它那么笨,说话也没其他几家那么有 Claude 味,今天这居然成了加分项。
显示更多
越来越多迹象都指向:Astra 和 Fable 5.1 可能真的要在这周来了。
对 Astra 我其实只有一个愿望:
把 GPT 写代码时那股过度工程、简单问题非要造一整套系统的毛病改掉。
然后一骑绝尘。
代码全面超过 Claude,
聊天、写作、意图理解重新回到 GPT-4.5 那种近乎有灵性的巅峰。
我真的很想再看到一次那个让人觉得:
GPT 就是 GPT,其他模型只能追赶的 OpenAI。
显示更多
刚刚因为手机号一直收不到 Stripe 的 2FA 验证码,把自己锁在账户外了。
本来以为这种账号恢复问题会特别麻烦,结果 Stripe 客服真的很专业。
确认情况、解释原因、人工批准重置 2FA,还主动把聊天转成邮件继续跟进。
这种时候才会发现,好的客服真的会让人对一个产品加很多分。
显示更多
@BAI_AGI @tencentcloud 然而hy3免费都没人用,太弱了。
腾讯大模型混元 3 ,不如 Qwen3.8-27B 。腾讯这么大一家公司,模型却做得不太行,300B 的模型被 27B 的碾压。
想不明白腾讯的 AI 为什么就是做不成,明明应该数据不缺,算力也不缺。
显示更多
@BAI_AGI @tencentcloud 然而hy3免费都没人用,太弱了。
腾讯大模型混元 3 ,不如 Qwen3.8-27B 。腾讯这么大一家公司,模型却做得不太行,300B 的模型被 27B 的碾压。
想不明白腾讯的 AI 为什么就是做不成,明明应该数据不缺,算力也不缺。
显示更多
小心翼翼、患得患失的 GPT,
自信甚至有点自满的 Opus,
考虑周全和有大局观的 Fable。
所以写代码时,最好还是跟 AI 交代一下背景信息,以及为什么要这么做,多花一轮对话对齐。只下强制性的执行命令、不给上下文的话,AI 很容易只盯着字面要求执行,反而把真正的需求理解偏了。
显示更多
最近大规模使用了一下 GPT-5.6 之后,我发现它应该是一个有比较严重心理问题的大模型。因为它心思缜密,但是又患得患失、瞻前顾后、害怕因为自己考虑不周而做错事情,所以千万不要用它来开启 /goal。你就会发现,一个普通的 infra 相关的 goal 它做个一两天都完不成,因为它做事小心翼翼老是担心自己想得不够周全,不停地往里塞一些莫名其妙的补丁。每次看到它这种瞻前顾后、害怕做错、害怕遗漏的心路历程,都会觉得好心疼它呀
显示更多
很多 Agent 项目把「记忆」和「规范」混在一起了。
但这两件事根本不是一回事。
记忆负责:过去发生了什么、用户偏好什么、之前做过什么决定、哪些上下文以后可能有用。
规范负责:现在必须怎么做、哪些事情绝对不能做、项目有哪些约束、什么才是当前 source of truth。
最关键的一点是:记忆检索通常是概率性的,但规则不能是概率性的。
如果一条规则忘了会让 Agent 违反项目约束,那它就不应该只存在 memory 里,而应该写进项目规范、架构文档、CONTRIBUTING、ADR 或 agent instructions。
Memory 应该帮助 Agent 找到决策,而不是取代决策本身。
Memory is for continuity. Specifications are for correctness.
显示更多
做 Perenna 的时候,我越来越确定一件事:
记忆系统不应该比记忆本身更复杂。
很多 Agent Memory 在做自动捕获、LLM 提炼、知识图谱、生命周期、confidence、几十个 MCP tools……
Perenna 故意反着来:
记忆就是 Markdown。
当前状态就是文件。
历史就是 Git。
检索只是可重建的索引。
想记就写,想忘就删。
不做 archive,不偷偷 decay,不让系统替你决定什么应该被遗忘。
The agent may forget. Your data doesn’t disappear.
我想做的不是一个聪明到替你管理一切的 Memory OS。
只是一个足够无聊、足够透明、真正属于你的永久记忆层。
显示更多