註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Wikipedia
Wikipedia 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Wikipedia 的搜尋結果
花了 8 分钟,在千万个 Wikipedia 页面组成的概念网络中,从“豆腐”页面走到了“allen ginsberg”🤣
Google搜索推出的这个 AI Overview 出现后 英文 Wikipedia 页面日访问量平均下降约 15% 网站和SEO还有未来吗
有这三步你基本上超越了 99% 的读书人 1. 读书最重要的是读 2. 谷歌搜索 zlib 打开 Wikipedia 右下角链接 3.微信读书 mac 加 iCloud 导入
如果你翻墙,别再只会X和YouTupe了! 还有很多牛逼的网站值得探索,下面这15个网站,建议直接收藏:👇👇👇 1、Snopes|事实核查 专门查证网络谣言和争议事件,避免被假消息带偏。 2、Wikipedia|维基百科 全球最大的知识百科。遇到任何陌生领域,可以先从这里建立基础认知,再深入研究。 3、Foreign Affairs|《外交事务》 看懂世界格局,不能靠刷新闻标题。 深度分析才能帮你把碎片信息连成线。这里不追热点,只挖逻辑。 4、Brookings Institution|布鲁金斯学会 顶级智库网站。大量经济、科技、政策研究报告,可以帮助普通人提升宏观视野。 5、Product Hunt + AI工具库组合 每天关注海外AI新品,用中文重新整理、测试、分享。 很多人的赚钱机会,本质就是:别人还不知道的信息 → 你提前发现 → 中文化输出 → 形成内容和商业价值。 6、Product Hunt|新产品发现平台 每天发现全球最新创业项目、AI工具和互联网产品。很多爆火产品,最早都是从这里出现。 7、Pexels|高清素材库 免费、可商用的图片和视频素材,做内容、配图、封面设计都能用。不用纠结版权问题,下载就能直接用。别等到要发内容了才去搜,提前把常用素材存下来,能省很多临时翻找的时间。 8、Internet Archive|互联网档案馆 数字世界的时光机。存了海量网页历史、书籍、音频、视频。很多已经打不开的旧链接、消失的网页,这里还能翻到备份。 9、Pixabay|免费素材库 图片、视频、音乐都有,音频资源比Pexels丰富。做视频配乐、PPT背景、日常创作都能找到素材。做视频缺背景音乐,可以先来这里翻翻。比去音乐平台挨个问版权省事多了。 10、Fiverr|技能变现平台 把你的技能打包成标准化服务挂上去——写文案、剪视频、配音、翻译、修图,别人直接下单。不用主动找客户,挂上去等单就行。任何能用AI快速搞定的事,都可以在这里变成商品。 11、Upwork|自由职业市场 竞标制,客户发布项目,你写方案竞标。适合长期合作型项目,客单价高,但前期需要积累作品和好评。新人别一上来就竞标高价大单,先接几个小单攒好评和案例。作品集比简历有用得多。 12、Open Yale Courses|耶鲁公开课 耶鲁大学免费公开课,文学、哲学、历史、心理学、经济学都有。不用翻墙(部分地区可能受限),直接在线听课。如果想认真学点东西,而不是只靠碎片信息填充认知,这里比刷一百篇公众号文章都值。 13、Prolific|学术调研平台 参与大学和研究机构的付费调研,比普通问卷调查更规范,报酬也更高。时薪约8-15美元,适合用碎片时间做。 14、UserTesting|网站/应用测试 录制屏幕和语音,边用网站或App边说出你的操作感受。每单10-60美元,测试时长10-20分钟。 15、Honeygain|闲置带宽变现 安装后在后台运行,把你的闲置网络带宽共享给企业做数据研究,完全被动运行,不需要主动操作。 这15个网站翻过一遍之后,其实能分成两类变现方式: 一类是直接赚钱的——Fiverr、Upwork、Prolific、UserTesting,把技能或时间挂上去就能接单。门槛不高,关键是先跑通第一单,别纠结完美方案。 另一类是间接赚钱的——Foreign Affairs、Brookings给你宏观判断,Product Hunt给你一手产品信息,Pexels和Pixabay解决内容素材,Internet Archive帮你挖消失的信息。 这些平台提供的内容本身不直接产生收益,但能给你提供做决策、做判断、做内容所需的原材料和背景信息。 很多人说“信息差赚钱”,其实拆开就两步:1 知道别人不知道的东西,然后把这种知道转化成某种可交付的形态——一篇文章、一个产品、一个判断、或者一次精准的出手。你的收入来源于你把信息翻译成价值的能力。
顯示更多
0
11
96
34
轉發到社區
The Base Model Is Dead,这是我刚看完的一期分享,来自美国开源模型创业公司 Arcee AI 的预训练负责人 Varun Singh。标题有点唬人,但这哥们的观点非常扎实。 他认为,过去 Base Model 的任务,是尽可能吸收人类已有的知识。 GPT-3 那个时代,预训练的逻辑很简单,就是抓取大量互联网文本、Wikipedia、书籍,把尽可能多的人类知识压缩进模型参数里。 在 GPT-3 的训练数据里,来自网页和 Wikipedia 的数据大概占到了 85%。 那个时候大家的默认逻辑就是,模型到底有多强,很大程度上取决于预训练做得好不好。 后训练更多是在这个基础上做最后的行为调整,比如让模型更会聊天、更会遵循指令。RL 在当时的作用也比较有限。 但是 O1 之后,整个行业都发现了 RL 的重要性。 大家开始发现,只要 RL 做得足够好,模型在预训练结束之后,能力还可以继续明显提升。于是就不断加后训练的投入。 我记得之前罗福莉在一个访谈里提过,他们在预训练和后训练上的算力投入已经大致接近。 这也就是说,模型在预训练结束之后并没有定型。后训练已经不只是把模型调得更好用,它开始真正影响模型的最终能力。 Base Model 的角色也因此发生了变化。它越来越像是在给后面的 RL 准备一些原子能力,也就是 Atomic Skills。 举个例子,如果希望通过 RL 训练出一个非常强的 Coding Agent,那 Base Model 在预训练结束的时候,不一定已经能够独立完成十个小时的软件工程任务。 但它最好已经掌握了 Python、代码结构、API、函数调用、Git、文件系统这些基础能力。 这些就是 Atomic Skills。 进入更复杂的任务和环境之后,再通过 RL 学习怎么把这些基础能力组合起来,这样就可以涌现出复杂 Agent 任务的能力。 所以,如果 Base Model 的目标变了,预训练的数据自然也会变。 前面说过,GPT-3 时代网页文本占了训练数据的 85%。而现在一些新模型里,这个比例已经降到了 15% 左右,代码反而成了占比最大的数据来源。 背后的逻辑其实很好理解。 现在模型公司已经非常清楚模型需要的关键能力,诸如 Coding、长程任务等等,那在预训练阶段,就可以有意识地提前给它准备这些能力需要的数据。 所以训练数据开始越来越有目的性。一些过去主要在后训练阶段才会出现的问答、对话,以及更接近 Agent 任务的数据,也开始提前进入预训练。 这种训练逻辑下,合成数据的重要性也开始上升。因为当大家越来越清楚模型未来需要什么能力,然后就可以围绕这些能力,主动去准备更合适的训练数据。 比如我们已经知道,未来模型需要很强的 Coding、Reasoning 和 Agent 能力,那就可以围绕这些目标,主动生成更接近真实任务的数据。 原来只是一段代码,现在可以把它变成找 Bug、修改代码、调用工具、连续完成任务的训练样本。 这样模型在预训练阶段接触到的,就不只是知识本身,也开始包含未来真正要用到的能力。 模型未来需要什么能力,预训练阶段就可以围绕这些能力去设计和生成数据。 这些变化,也催生了现在经常听到的 Mid-training。 原因也很好理解。 预训练阶段模型看到的,过去主要是网页文本、书籍、代码。但到了后训练阶段,它突然要面对 Reasoning Trace、Agent 交互记录、多轮工具调用、长上下文任务。 前后两个阶段的数据分布差别可能非常大。 如果直接从一个阶段跳到另外一个阶段,模型就需要突然适应一套完全不同的数据。 对 MoE 模型来说,这个问题会更加明显,因为预训练过程中不同 Expert 已经逐渐形成了自己的分工,数据分布突然变化,可能会影响原有的负载平衡。 所以 Mid-training 可以理解成一个过渡阶段。 在正式进入后训练之前,提前让模型适应更长的 Context、更接近 Reasoning 和 Agent 的数据,以及未来真正会遇到的任务分布。 这样 Pre-training 和 Post-training 之间就不会切得那么生硬。 所以整体来看,Pre-training、Mid-training、Post-training、RL 这几个阶段之间的界限,确实已经越来越模糊了。 或者换一种理解方式,现在看待模型训练,可以粗略简化成两个大的范式:Supervised Learning 和 Reinforcement Learning。 前者帮助模型建立知识、表征和各种基础能力,后者再让模型进入环境,通过不断探索、试错和反馈,把这些能力组合起来。 回到开头那个标题。The Base Model Is Dead 当然是个有点夸张的说法。 Base Model 没有死,真正变化的是它在整个模型训练体系里的角色。 过去我们希望 Base Model 尽可能把人类知识学进去,然后在这个基础上做一些后训练。现在它越来越像一个为 Reasoning 和 Agent 准备的底子。 先把 Atomic Skills 准备好,再把更多复杂能力留给后面的 RL。 Base Model 依然重要,只是它越来越像一个起点。
顯示更多
0
31
38
4
轉發到社區
说一个冷知识:LLM(大语言模型),其实并不生产原生知识,它是一个知识的超级搬运工、连接器和压缩算法。LLM的本质,是预测下一个Token的概率模型。它在几万亿词语的语料库(人类现有的书籍、论文、网页)中寻找统计规律。如果完全依赖LLM,知识会陷入“近亲繁殖”。所以@WhatWiki观察得对:人类编写百科(如Wikipedia),本质是“求证过程”;马斯克曾力推的Grokipedia,只是在统计分布中,寻找“听起来最像百科全书”的词语组合,并随着时间推移,错误会被不断放大。所以,AI革命还在早期。AI霸主99.9%概率还是诞生在硅谷,也不一定就是Anthropic或OpenAI,这不仅是价格问题,也不仅技术问题,而首先是法务和信息安全问题。
顯示更多
本质上是个套壳的浏览器,通过MitM、内置的DoH和自签名根证书(Scholar Root CA v1 和 Scholar Service V2)信任劫持实现流量引导,并且有实时清理DOM元素的能力 例如:维基百科的首页,新闻动态、你知道吗全部被动态清零,YouTube整个/watch都是被屏蔽的,只允许看指定的博主的视频,至于 专用 DoH 服务器: 备案主体为长安通信科技有限责任公司,系 CNCERT 全资子公司) 代理集群:劫持使用 IP 段 205.164.50.20x(AS18779, EGI Hosting, Santa Clara),物理部署于 CERNET 主干网内部 这个DoH服务器维护着一份域名白名单,白名单外域名返回正常解析结果,白名单内域名(包括 Google、Wikipedia、GitHub、Docker Hub、YouTube 及部分学术出版商等)解析至 205.164.50.20x 段地址,另外A\也在白名单里面 更多的细节还请移步至👉
顯示更多
0
22
303
18
轉發到社區
机器人行业的“GPT 时刻”,卡住它的可能根本不是 AI。 最近继续研究 @axis_ai,我发现一个很容易被忽略的问题: 过去两年,大家讨论机器人,注意力几乎都集中在模型、芯片和硬件。 谁的机器人走得更稳? 谁的机械手更灵活? 谁的模型参数更大? 但如果把视角往底层再挖一层,你会发现 Physical AI 面临的一个核心问题其实是: 机器人严重缺数据。 ChatGPT 为什么能够出现? 一个非常重要的前提,是互联网过去几十年积累了海量文字、图片、代码。 模型可以“读完整个互联网”,再从中学习人类知识。 但机器人不一样。 互联网里有几十亿张“杯子”的图片,却没有几十亿条: 机械臂应该用什么角度靠近杯子、施加多大的力、抓住之后如何移动、遇到障碍如何调整。 机器人真正需要学习的是: Action,而不仅仅是 Information。 这也是我最近越来越理解 AXIS Robotics 的地方。 AXIS 做的不是再造一个机器人,而是在尝试解决机器人背后的“数据生产问题”。 它把机器人操作搬进浏览器。 普通用户不需要购买机械臂,也不需要成为机器人专家。 打开浏览器,就可以操控模拟机器人完成抓取、移动、分类、开抽屉等任务。 而你每完成一次操作,背后产生的并不是一局“小游戏记录”。 而是一条完整的 Trajectory(机器人运动轨迹): 关节状态、物体位置、控制动作、视觉信息、任务结果…… 这些数据经过验证、清洗和处理之后,可以继续用于机器人策略和 Physical AI 模型训练。 这件事情真正有意思的地方在于: AXIS 正在尝试把过去只能发生在机器人实验室里的数据生产,变成互联网规模的数据生产。 传统机器人数据采集有一个非常现实的问题: 想增加数据,就要增加机器人、操作员、实验场地和时间。 本质上是线性扩张。 AXIS 想做的是另一条路线: Simulation First + 全球贡献者。 一个实验室也许只能同时控制几十台机器人。 但如果把模拟环境放进浏览器,理论上可以让成千上万人同时产生不同环境、不同任务、不同操作方式的数据。 这就让我想到一个很有意思的类比: Google 把全世界的信息组织起来。 Wikipedia 把全世界的知识贡献者连接起来。 而 AXIS 想做的事情,有一点像: 把全世界的人类操作经验,转化成机器人可以学习的数据。 更关键的是,这已经不完全停留在 PPT 上。 AXIS 官方披露,2026 年 2 月 Beta 阶段,约 18,000 名参与者在 5 天内完成了接近 100,000 条 trajectories。 此前 Little Prince’s Rose 实验中,社区在 3 天产生了超过 10,000 条有效轨迹。 这些数据随后真的被用于训练策略,并部署到真实机器人,让机器人自主完成浇水任务。 这一步非常重要。 因为它验证的是: Human → Simulation → Data → Model → Real Robot 这条链路到底能不能跑通。 如果答案是 YES,那么 AXIS 的想象空间就不应该只看成“一个让用户做机器人任务的平台”。 它真正想建立的是一个 Physical AI Data Engine。 而且这里还有第二层逻辑。 机器人需要的并不是单纯“越多数据越好”。 真正重要的是: 模型在哪里失败,就继续生产哪里的数据。 比如一个机器人已经可以在桌面上成功抓杯子 95 次。 真正有价值的,可能不是再给它 10 万次完全相同的成功案例。 而是找到剩下那 5 次为什么失败: 光线变了? 杯子旋转了? 被其他物体挡住了? 抓取角度不对? 然后针对失败场景继续生成新的训练任务。 这也是 AXIS 所强调的 Compounding Data Engine: Task Generation → Data Collection → Model Training → 找到 Failure → 生成针对性数据 → 再训练。 于是数据不再是一次性卖掉的数据集。 而是一个不断反馈、不断迭代的循环。 模型越强,暴露的问题越具体; 问题越具体,下一轮需要的数据越精准。 这才是我认为 AXIS 真正值得观察的地方。 未来机器人竞争,很可能不会只是: Tesla vs Figure vs 1X, 也不会只是: 谁的硬件更便宜、模型参数更多。 在更底层,可能还有一场大家现在关注得并不够多的战争: 谁掌握最大、最多样、可以持续迭代的 Physical AI 数据。 LLM 时代证明了一件事情: 数据规模一旦跨过某个临界点,能力可能出现非线性变化。 如果未来机器人也存在类似的 Scaling Law, 那么今天看起来只是一条条普通的 trajectory, 最终可能会成为 Physical AI 最重要的基础资产之一。 所以我现在看 @axis_ai,关注的已经不是“做任务能拿多少积分”。 我真正想观察的是: 它能不能把全球几十万甚至几百万人,变成 Physical AI 的分布式数据生产网络。 如果这条路线最终成立, 未来训练机器人的方式,也许真的会发生变化: 过去: 造更多机器人 → 雇更多人 → 采更多数据。 未来: 让更多人连接进来 → 产生更多人类操作经验 → 训练更聪明的机器人。 AI 让知识第一次可以被机器大规模学习。 而 Physical AI 下一阶段真正缺少的,也许就是: 一个属于机器人的“互联网级数据层”。 AXIS 正在赌的,就是这个未来。
顯示更多
0
100
55
1
轉發到社區