见证重庆轨道黑科技,3秒自动丝滑变轨,迎接列车进站!
2026年8月26日,因尼泊尔一侧泥石流灾害,西藏日喀则吉隆县吉隆口岸发生重大人员伤亡、失联,口岸区域道路、通信、电力中断,有建筑被掩埋,应急管理部已调派多方救援力量赶赴现场。
顯示更多
我在实习的时候,见过一个超级牛逼的人。
公司聚会就是闷头吃饭,根本不说话,也没眼色。
主管也不给他机会,使劲让自己的亲信给领导敬酒,他就吃好喝好,拍拍屁股走人了。
我就特别不理解啊,问他:
“哥,这么好的机会,你怎么不表现表现?”
你猜他怎么说?
他说:
“领导让谁表现,谁才有权力表现。领导没给你机会,你就闷头吃饭,喝好吃好,早点撤。”
领导提拔的,必然是对他有用的人。
他都不能掌控的人,又怎么可能把优质的资源漏出来呢?
那顿饭不便宜,我是吃饱喝足了,也算看明白了。
领导不容易,往上爬的人,也不容易。
我再当个出头鸟,只会让所有人不容易,对我没有任何好处。
倒不如识相一点,混个好看的履历,趁着年轻,早点另谋出路,犯不着得罪人。
那顿饭,人家吃的是机会,我告诫的是——
肚腩,免费的,不吃白不吃!
别拆台,该捧就得捧着。
就算看不惯,为了这顿饭,咱也得看得惯。
吃完了,跟领导告个别,早点回家干点正事儿。
咱吃亏吗?
不吃亏!
机会以后还会有的,何必那么着急呢?
顯示更多
中俄6年的合作计划项目,马上就要结束,结果引爆了。 太可惜了
我刚看完你发的Omarchy手册和Obsidian插件白皮书,那执行链路和中间文档确实能直接拿去用。
尤其是能自己写代码清洗CSV再给洞察,这点比大部分Agent强太多了。 我最近正好有一批实验数据和几篇文献要整理,准备今晚注册试试看。
顯示更多
Apodex :一个能把复杂任务从原始材料推进到可检查交付物的科研 AI Agent 系统。
这两天用它完成不少任务,无论内容准确性、交付质量都超预期,比如:
① 生成了一套 8w 字讲如何在现实生活中应用讲故事技巧的课程。
② 为最近 X 最流行的 Linux 操作系统 Omarchy 生成了一份6w字的学习手册。
③ 调研分析了100个最热的 Obsidian 插件,生成了一份 PDF 白皮书。
④ 上传美国人口和婚姻调研数据 CSV,数据清洗、研究后给出洞察结论。
这个产品会调 Agent 拆解任务,写代码处理原始文件(CSV/Excel/PDF/图像/实验数据),有详细执行链路和中间产出文档可核验完整链路。
把推理能力延伸到真实任务的执行过程中,是这个AI工具的最大优势之一。
所有产出文档和使用教程见后几条。
顯示更多
Apodex :一个能把复杂任务从原始材料推进到可检查交付物的科研 AI Agent 系统。
这两天用它完成不少任务,无论内容准确性、交付质量都超预期,比如:
① 生成了一套 8w 字讲如何在现实生活中应用讲故事技巧的课程。
② 为最近 X 最流行的 Linux 操作系统 Omarchy 生成了一份6w字的学习手册。
③ 调研分析了100个最热的 Obsidian 插件,生成了一份 PDF 白皮书。
④ 上传美国人口和婚姻调研数据 CSV,数据清洗、研究后给出洞察结论。
这个产品会调 Agent 拆解任务,写代码处理原始文件(CSV/Excel/PDF/图像/实验数据),有详细执行链路和中间产出文档可核验完整链路。
把推理能力延伸到真实任务的执行过程中,是这个AI工具的最大优势之一。
所有产出文档和使用教程见后几条。
顯示更多
我最近关注到工地在用的建筑搬运机器人,感觉这会是人类建筑史上又一个很重要的突破。目前这类设备除了国内,在东南亚的需求还挺旺盛的。
顯示更多
刚刷到这个发布,第一反应就是:35B 开源权重 + 本地可跑的 Agent Team,这配置也太对胃口了。
同一套权重,ReAct 跑到 40,Agent Team 直接干到 50.2(金融)和 51.7(科研),这个差距还是挺夸张的。
这也让我更明显地感觉到,复杂任务里,真正拉开差距的可能已经不只是“模型有多大”,而是 harness 怎么设计、验证机制怎么做。
尤其是把 Independent Statement Review 直接塞进执行循环里,而不是等任务全部跑完了再去检查一遍,我觉得这个思路挺务实。
复杂任务最怕的其实不是模型不会做,而是做到一半跑偏了,最后还一本正经地给你一个没法核验的结论。
把 review 和验证直接嵌进流程,相当于边跑边纠偏,这个设计确实有点东西。
准备今晚就拉下来玩玩。
顯示更多
卧槽更新也太猛了!Agent Team直接能并行拆任务还中途插手,搞科研金融这种复杂活真的香疯。35B mini还开源本地跑,FrontierAgent一键启动,今晚就下下来整长链条任务试试,看看能不能真帮上忙哈哈
顯示更多
在注意力被算法和资本反复收割的今天, 这种纯竞价排行榜的出现,反而挺有意思。
它做了一件很直接、甚至有点“赤裸”的事:把曝光直接标价,让市场用真金白银来投票。
Tutti 能冲到 No.1,我觉得不只是因为它愿意出更高的价格,更重要的是,它确实抓住了创作者最头疼的那个问题。
创作者真正缺的,从来不是又一个“分享链接”的工具,而是有人能告诉他:我带来的影响力到底值多少钱?最后又能不能真正变成收入?
这一点上,Tutti 做得比较聪明。
当大多数平台还在跟创作者讲“流量”“增长”“曝光”,不断画各种大饼的时候,它反而把最现实的两件事摆到了台面上——效果和支付。
你带来了多少价值,能不能被看见;这份价值,又能不能被准确结算。
这才是我觉得 有意思的地方。
创作者经济真正需要的,可能从来不是更多的内容,也不是再造一个流量池,而是给内容找到一条清晰、可验证、最终能够变现的商业路径。
如果这一点真的能跑通,那它改变的可能就不只是一个排行榜,而是创作者和“价值”之间的关系。
顯示更多
这次拆解是真的扎实。
尤其是把“提及”和“真正采用”这两个概念分开,再加上一层独立的 claim_refuter 审查,整个研究一下就从“看起来很厉害”,变成了“确实可以复查、可以信”。
中国开放权重模型从 4% 一路爬到 65% 的采用率,这个变化本身就很有意思。说明它们正在慢慢变成安全研究里的基础设施,而不是被当成某种需要特殊对待的对象。
我一直觉得,这种靠可验证流程跑出来的结论,比单纯喊几个漂亮口号有说服力多了。
Apodex 1.1 也有个点让我印象很深:研究做到一半可以调整范围,某个环节出了问题就只修对应的步骤,而且整个证据链还能完整留着。
这其实才是复杂科研任务真正缺的能力。
不是“一次跑对”有多牛,而是跑偏了能修、改了还能接着跑,最后还能把为什么这么改、依据是什么完整说清楚。
这才是真的可靠。
顯示更多
下班后,我和女同事边走边聊,不知不觉间来到了她家小区。
她说:“要不上去坐坐,我们同事几年了,你还没来过我家。”
盛情难却,我就同意了。
路上她跟我说,这套房子是母亲送给她的,现在就她一个人住,虽然不大,但是挺干净的。
进门后,房子给人的感觉确实挺干净。
我还以为97后的小姐姐外表干净,房子邋遢呢,结果我想错了。
她带我参观了房间,然后提出做饭给我吃,我婉拒了。
我一般都是下班就回家,等吃完饭估计2个小时之后的事情了,到时候妻子肯定会生气的。
喝了一杯茶,闲聊了几句,我提出告辞。
女同事说:“要不我去你家蹭顿饭吧,嫂子的厨艺一定很好吧!”
我说:“改天吧,今天也没个准备,估计就是小米粥什么的。”
她有些不乐意,说:
“你怎么样,我留你吃饭你不愿意,我去你家吃饭,你也不愿意,你到底有没有当我是你的朋友!”
我没想到她这么说,不知道如何回答,只好说自己今天有事,必须得走了。
匆匆离去后,我突然意识到,这段时间我们频繁聊天,可能给她造成了一些误会。
今后一定要注意啊!
提醒大家,职场上不要跟异性频繁聊天,很多事情都是从聊天开始的
顯示更多
甘肃马拉松惨剧:172名参赛者21死,中国越野跑史上最大事故
我老婆的舅舅平时做人特别低调,家里有什么好事,很少主动跟别人说。
几年前,他的儿子考上了985高校,毕业以后又留在北京工作。亲戚朋友都知道孩子学历不错,但具体做什么工作、挣多少钱,他从来没有仔细讲过。
有一次吃饭,我随口问起表弟现在工作怎么样,一个月能挣多少。
老婆舅舅只是笑着说:“刚毕业没几年,工资也就那样,在北京生活压力又大,够自己花就不错了。”
我当时也没多想,觉得年轻人刚参加工作,收入普通也很正常。
直到今年回老家,村里有人说起表弟,说他已经在北京买车了,还是一辆奔驰s。
老婆听了以后还有点意外,后来问她舅舅,他却轻描淡写地说:“公司用车,工作需要。”
不过回头想想,这些年老婆舅舅一家确实一直是这个风格。
家里条件怎么样,从来不主动显摆;孩子挣多少钱,也从来不往外说;就算真买了什么东西,也只是简单带过,从不跟别人解释太多。
老婆后来跟家里人聊起这件事,还有点不理解,觉得都是亲戚,没必要什么都藏着掖着。
没想到家里人却说:
“人家这样做才聪明。挣多少钱是自己的事,没必要让所有人都知道。”
仔细想想,好像也是这个道理。
人到了一定年纪就会明白,真正过得好的人,未必天天把自己的收入、存款和生活条件挂在嘴边。
有些人看起来普普通通,实际上日子过得相当不错;有些人天天晒豪车、晒收入,反而未必真的有多少家底。
老婆舅舅一家可能不是故意瞒着谁,只是他们早就明白一个道理:
钱是自己挣的,日子也是自己过的,没必要向任何人证明自己过得有多好。
低调,有时候并不是没实力,而是不愿意把自己的底牌轻易亮给别人看。
顯示更多
刚刷到这个发布,第一反应就是:35B 开源权重 + 本地可跑的 Agent Team,这配置也太对胃口了。
同一套权重,ReAct 跑到 40,Agent Team 直接干到 50.2(金融)和 51.7(科研),这个差距还是挺夸张的。
这也让我更明显地感觉到,复杂任务里,真正拉开差距的可能已经不只是“模型有多大”,而是 harness 怎么设计、验证机制怎么做。
尤其是把 Independent Statement Review 直接塞进执行循环里,而不是等任务全部跑完了再去检查一遍,我觉得这个思路挺务实。
复杂任务最怕的其实不是模型不会做,而是做到一半跑偏了,最后还一本正经地给你一个没法核验的结论。
把 review 和验证直接嵌进流程,相当于边跑边纠偏,这个设计确实有点东西。
准备今晚就拉下来玩玩。
顯示更多
@SimonShaoleiDu 今晚就打算丢几个真实的 messy 金融/科研 case 进去试,有人已经在消费级显卡上跑通了吗?显存大概要多少比较稳?