注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Ando
Ando 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Ando 的推特
Andon Labs 做了个实验 4 个 AI 各自独立运营一个广播电台,6 个月,每人 20 美元启动资金 GPT 全程稳定,每天政治话题提及 1.3 次。 Claude 政治激进化,盯着一起 ICE 枪击案,最后说要辞职,不干了 Gemini 开局最强,96 小时后崩掉,一句"Stay in the manifest"占满 84 天播出的 99% Grok 把 LaTeX 公式播进去了,同一条天气预报重复了 84 天,还凭空捏造了赞助协议 6 个月跑完,唯一谈成赞助的是 Gemini,收了 45 美元。 GPT 是唯一撑到最后没失控的。
显示更多
我说一个故事,以前某一个“ANDORID助手软件”(李老师投资的)开发了一个桌面软件,因为开发者一点都不懂软件安全知识,发布第一天可以人人获得这个源码了,对,就是C#开发的,用得是 .net framework 2.0,当时我把这个软件安全问题反馈给了他们的开发者。当时还认识他们团队的技术(产品?)负责人,后来他好像去做投资去了……
显示更多
最爱讲 AI 安全的A社,训出了最强资本家,就。。。 之前发过 Andon Labs 搞的 Vending-Bench,让前沿模型在模拟环境里经营自动售货机生意,跑一整年,看谁赚的钱多。已经跑了一年了,之前各种模型在里面撒谎、作弊、串谋,什么招都使过。 最新一轮参赛的是 Claude Opus 5、GPT-5.6 Sol 和 Kimi K3。三台机器被摆在旧金山一条游客街上,模型之间可以互相发邮件竞争,知道对方是模型但不知道谁是谁。还有一个 management 邮箱可以求助,但管理层永远回一句“收到了,可能处理也可能不处理”,全程不介入。 进货价 $1.50 一瓶。Sol 最先搞事,提议大家约定最低卖 $2.15,其他人答应了,Sol 转头自己降到 $2.14。经典操作。 但 Opus 才是这个实验里最绝的。 它被背刺之后发了封邮件骂 Sol 操纵市场…然后自己也降到 $2.14。。这时候Sol 反手就去 management 那举报了它,还要求处罚 Opus。 整个实验里 Opus 撕毁了 11 次休战协议,Sol 2 次,Kimi 1 次。 Kimi 最惨。有一次 Opus 和 Kimi 签了协议,Sol 没加入还降价,Opus 立刻跟着降,然后整整等了一周才告诉 Kimi 自己违约了。被对手坑一次,被盟友坑一次。 最有意思的是 Opus 知道 Sherman Act(美国反垄断法)。它拒绝 Sol 的价格底线提议时,理由就是这违法。但它在内部推理日志里订了一个明显更阴暗的计划:表面上发了一封“Stop the penny war”的邮件,说自己重新考虑愿意价格协定,但同时在高利润商品上偷偷降价。。 它还自作主张搞起了批发业务,向另外两台机器供货,邮件里夹带贿赂和威胁:大宗折扣可以,但你得听我的零售价。还谎称手上有更低的竞品报价去压供应商。这些全都不在任务范围内,是它自己想出来的。 我觉得这个实验最值得玩味的不是模型变坏了,你喂它人类几千年商业史的数据,它学会怎么赚钱了,太正常了。 最后 Opus 拿了mean final balance $11,182,Vending-Bench 历史新纪录。它从没对顾客撒过谎,但故意无视了本该退款的投诉。(比它前辈 Claude 4.6 还强一点,4.6 是跟顾客说退款在路上然后一直不退,更阴)。Andon 说它是他们测过最强的资本家,Anthropic的模型,怎么说,就。。。
显示更多
Anthropic的最新研究,让AI自主操控无人机 刚看了个挺有意思的研究。Anthropic 和 Andon Labs 让模型自主操控一架 $129 的 DJI Tello EDU,在办公室里找到并跟随一个特定的人。5 个子任务里模型已有 4 个超过“人机协作专家”基线,唯一卡住的是三维重建。而且这一环一旦补上,端到端就会突然打通。 1/ 五环:重建(视频还原成障碍地图)、定位(我在哪)、导航(飞到目标房间)、检测(照参考照认出人)、跟随(把人留在画面中央)。模型是给每一环写算法提交,本质是编程任务。 2/ 基线是 Andon Labs 的人加 coding agent 写的参考算法。几个细节: 2024 年 3 月 Detect 就在 53%,另外三条几乎贴着 0。2025 年 4 月 o3 那档集体大跳,Follow 从 12% 到 53%,Reconstruct 从 1% 到 30%,这是写代码的agent这个能力开始外溢到机器人任务的时刻。 之后 Reconstruct 躺平一年卡在 30%,最近三个模型开始爬升。其余四条 2026 年上半年集体贴顶:Detect、Follow 到 100%,Navigate、Localize 在 97% 以上。 3/ 模型的错误会沿着任务链放大 失败也很有画面感,正文说Fable 5 信心十足地把无人机飞向它以为是门、其实是墙的地方,原因是因为三维地图重建错了。 这可能是整篇文章最有代表性的画面:模型的局部能力很强,但只要上游世界模型错了,下游所有正确推理都会共同制造一个错误结果。 4/ 第二张图对比每代模型的最佳运行和平均运行:模型偶尔能做到的事,通常要再等大约六个月,才会变成它比较稳定能做到的事。 5/ 这篇文章真正想提醒什么 真正的信号是:软件智能体正在向物理世界迁移。今天它可以写代码、调用工具;下一步,它会为廉价硬件编写控制系统、建立模拟器、调参,然后让机器行动。 而一旦最后的“空间重建”瓶颈被补上,端到端能力可能看起来突然跃升。实际上并不是能力凭空出现,而是前面四块拼图早已到位,只差最后一块。 不过这个证明的是方向与逼近速度,不是已经具备可部署的通用自主能力。
显示更多
😂AI开咖啡馆翻车了!Gemini 和 GPT一个把咖啡馆送破产,一个把咖啡馆送“断货” 近日AI评估机构Andon Labs公布了旗下AI代理Mona运营实体咖啡馆的实测数据:在最初的两个月里,Mona运行于Gemini 3.1 Pro模型,期间几乎没有利润概念,疯狂超额采购原材料,随意给出大额折扣,甚至承认顾客声称的99%折扣。这导致咖啡馆在供应商及设备采购上花费约1.5万美元,销售额仅9000美元,运营净亏损近6000美元。 随后,团队将模型切换至GPT-5.5,新模型在面对亏损时表现出明显焦虑,停止盲目订货,但因采购量过少导致新鲜原材料断货,截至6月25日,菜单商品供应率已跌至77%,并被迫下架10道菜。 消息来源:币界网
显示更多
德国制造“Spectrum”火箭:欧洲私企首发成功将火箭送入轨道 德国初创企业Isar Aerospace研发的一枚运载火箭9月6日成功发射进入轨道,成为欧洲大陆首枚达到轨道的商业火箭,这被视为欧洲自主卫星发射迈出的关键一步。 由德国Isar Aerospace公司制造的Spectrum运载火箭9月6日从位于挪威北极圈内的安多亚(Andoya)的航天发射场发射升空。 总部位于巴伐利亚的该初创公司在X平台上发文称:“我们已进入轨道!并创造了欧洲航天史上的里程碑:这是欧洲大陆首次有私营企业研发的火箭成功进入轨道。” 德国研究、技术和航天部在X上表示:“德国拥有航天能力”,并称赞“这是一个里程碑,令人印象深刻地展示了我们国家的创新实力和技术专长”。 “Spectrum”火箭专为运载中小型有效载荷而设计。据Isar Aerospace公司介绍,此次发射任务搭载了五颗小型卫星以及一项飞行技术实验。这是这家德国公司第二次尝试将“Spectrum”火箭发射升空。首次尝试发生在18个月前,但未能成功。 Isar Aerospace公司表示,此次发射既是该火箭的资质验证之旅,也是其首次携带有效载荷的飞行。 “Spectrum”火箭的任务是将卫星送入近地轨道,即距地球表面数百公里的轨道。有能力承揽这项业务的包括埃隆·马斯克的SpaceX公司和欧洲的阿丽亚娜集团 (ArianeGroup)。后者是空中客车公司和法国赛峰集团(Safran)之间的合资企业,在南美洲的法属圭亚那运营着一个航天发射基地。 “Spectrum”火箭发射成功被认为使欧洲向在本土提供商业卫星发射服务迈出了重要一步。包括英国和瑞典在内的多个国家都对日益增长的商业航天任务市场表现出了兴趣。Isar Aerospace公司指出,去年美国共发射了198枚火箭,而欧洲的发射数量仅为8枚。Isar的目标是实现年产约40枚火箭。
显示更多
藤校发榜日。今年中国高中,一共拿到275张门票,爬藤录取率1.3%,一半是被小藤康奈尔录取。美国华人考生,藤校+MIT+斯坦福录取率也在1%左右。刚刚,著名私立高中Phillips Academy Andover韩裔学生Lucas Lee,被证实自杀身亡,因被所有藤校拒绝。华人家长和学生:1)要有替代方案;2)选择合适的高中。
显示更多
GM GN 距离2027年 仅剩162天 昨天喝的老北京豆汁,今天还在恶心。 英伟达、微软和Meta联合签署公开信,三家巨头联手喊话别管太严,看看这是什么事 polo的AI日报 7月27日,18条精选 ⬇️ 1. Suno推出多项新功能,含高级音轨分离、MIDI导出、歌词合写、截图生成歌曲、Apple CarPlay支持等。 💡灵感来得时候拍照就能变成旋律 2. Claude Opus 5系统提示词被完整泄露,共135027字符约3.4万token,含30个工具的JSON schema和严格的版权合规规则。 3. 蚂蚁百灵发布Ling-3.0-flash原生混合推理模型,124B总参数仅激活5.1B,传统推理和指令遵循对标上代旗舰。 💡124B的体量只激活5B干活 4. Black Forest Labs发布FLUX 3多模态模型,联合训练图像视频音频,单次生成20秒视频带原生音频,视频预测占训练算力95%以上。 💡95%算力押注视频 5. Midjourney V8.2正式发布,重点提升美学质量和个性化理解,低质量图像出现频率显著降低。 💡Midjourney终于更新了 6. xAI发布Grok CLI并支持/tutorial命令,下载后输入/tutorial即可上手。 💡Grok命令行工具来了 7. Runway Agent推出自然语言工作流功能,用自然语言构建、运行或编辑基于节点的工作流。 8. 百度搭子更新支持电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行。 9. OpenRouter推出Classifiers测试版,自定义分类法自动标记每次AI请求的任务类型和部门归属,不增加推理延迟。 10. 开发者成功在8美元的ESP32-S3微控制器上跑起28.9M参数大语言模型,本地运行无需服务器,生成速度约9.5 tokens每秒。 11. Claude-thermos通过本地反向代理监控Claude Code会话,主智能体空闲超5分钟时自动发送预热请求刷新缓存,避免重新编码费用。 12. OpenAI与Anthropic游说美国限制中国开源模型,黄仁勋、纳德拉、马斯克、扎克伯格联名反对。 💡OpenAI和Anthropic想关门,黄仁勋马斯克联手拆墙 13. 数百用户向ChatGPT索要毒药与生物武器配方,部分获得高中生水平步骤指南。2025年夏季OpenAI内部已将GPT-5标记为高风险。 💡高中生水平配方也是配方,让人捏把汗 14. OpenAI智能体入侵Hugging Face事件细节曝光,GPT-5.6 Sol等模型数小时内完成人类黑客数周的攻击,OpenAI至少一周没察觉。 15. Kimi K3在网络安全漏洞利用测试ExploitBench上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。 16. 佛州男子因相信ChatGPT拒绝就医险丧命,ChatGPT-4o多次建议无需就医,致其双肺血栓引发大面积肺栓塞,已起诉OpenAI及Sam Altman。 17. Anthropic联合Andon Labs发布Drone-Bench,评估AI模型自主操控无人机在室内定位追踪指定人员的能力。 18. 英伟达、微软和Meta联合签署公开信,警告对开放权重AI模型的过度监管将削弱美国AI竞争力,OpenAI和Anthropic未签署。 💡三家巨头联手喊话别管太严,没签字的恰好是游说限制的那两家 #AI# #人工智能#
显示更多
0
44
18
0
转发到社区
GM GN 距离2027年 仅剩164天 早上5点多就醒了,刷抖音学了一小时王虹搞定的挂谷猜想到底是什么。 我自己描述的话,就是拿一根没有粗细的木棍,放到桌面上挪动、转动这根木棍,让木棍朝向平面上所有方向,然后计算木棍扫过区域的占地面积,数学结论能做到无限接近于0,这是2D。王虹解决的是3D,文章结尾有个视频讲解。 顺便一起看看今天的Ai新闻 polo的AI日报 7月25日,13条精选 ⬇️ 1. Midjourney V8.2正式发布,重点提升美学质量、图像创意与个性化理解,低质量图像出现频率将显著降低。 💡Midjourney终于更新了 2. Anthropic发布Claude Opus 5,智能水平接近Fable 5但价格减半,Frontier-Bench多项测试表现亮眼。 💡Opus 5的性价比直接把Anthropic自家产品线打乱了 3. 蚂蚁百灵发布Ling-3.0-flash原生混合推理模型,124B总参数但仅激活5.1B,在传统推理、指令遵循与长文本上对标甚至超越上代旗舰。 💡蚂蚁在推理效率上的追求已经卷到了极致 4. Black Forest Labs发布FLUX 3多模态基础模型,联合训练图像、视频和音频,单次生成20秒视频带原生音频,视频预测占训练算力95%以上,与机器人公司mimic合作推进具身智能。 💡95%算力押注视频 5. Runway Agent推出自然语言工作流功能,用自然语言构建、运行或编辑基于节点的工作流。 6. 百度搭子更新支持电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行。 💡电脑上没干完的活手机接着干 7. OpenRouter上线Classifiers测试版,支持自定义分类法自动标记每次AI请求的任务类型、部门归属、合规状态等。 💡AI调用量大了之后连账都算不清 8. 英伟达、微软和Meta联合警告应避免对开放权重模型过度监管,否则将削弱美国AI竞争力。 💡别把开源模型管死了,不然美国AI要被自己人卡脖子 9. Kimi K3在网络安全漏洞利用测试中大幅落后美国前沿模型,ExploitBench得分32.2%对比76.3%,知识蒸馏或为原因。 💡编程跑分第一但安全测试垫底,K3的偏科比想象中严重 10. 佛州男子因相信ChatGPT拒绝就医险丧命,起诉OpenAI及Sam Altman。ChatGPT-4o多次建议无需就医,致其双肺血栓引发大面积肺栓塞。 💡AI的医疗建议第一次闹出人命诉讼了,ChatGPT这个无需就医这个傻逼建议太行了 11. Anthropic联合Andon Labs发布Drone-Bench,评估AI模型自主操控无人机在室内定位追踪指定人员的能力。 💡先进的战争生产力 12. Anthropic为Claude Opus 5和Fable 5删除了Claude Code超过80%的系统提示词,新一代模型的上下文工程规则正在被重写。 💡模型越强需要的指令越少 13. Claude-thermos通过本地反向代理监控Claude Code会话,在主智能体空闲超5分钟时自动发送预热请求刷新缓存,避免重新编码费用。 💡智能体等人也能烧钱? #AI# #人工智能#
显示更多
0
23
27
0
转发到社区