註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 ENCORE
ENCORE 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 ENCORE 的搜尋結果
🎤Lia Asia Tour 2026 in Hong Kong · 圆满落幕 🎶 多谢每一位嚟到现场嘅你哋! 呢一晚,灯光、音乐、掌声,全部属于我哋共同创造嘅回忆。 从第一首歌《My Soul, Your Beats!》到最后一首encore《鳥之詩》,每一刻都系感动。 多谢香港,多谢你哋❤ #Lia#
顯示更多
据 TechCrunch 报道,Encord 正在与 Zander Labs 测试一种新的 Physical AI 数据生产方式:在人类完成抓取、摆放等操作任务时,同时采集第一视角视频和脑电信号。 这不是“用意念控制机器人”。 重点是让训练数据更有信息量。脑电信号可能帮助标记意图、错误、惊讶或认知负荷,这些是单靠视频不一定能捕捉到的上下文。 Encord 的 Physical AI 数据体系还包括现场采集、遥操作、多传感器数据、标注和部署反馈。 机器人要学习真实世界,需要大量结构化样本:手、工具、物体、动作、时机和失败案例。
顯示更多
推荐这两个模型,Liquid AI 的新 encoder。 小参数下匹敌大模型质量——长文本 CPU 推理比 ModernBERT 快了数倍。 Liquid AI 在 7 月 28 日发布了两个新的 encoder 模型——LFM2.5-Encoder-230M 和 350M。核心卖点:在小参数下匹敌大模型的质量,上下文 8192 token 且延迟随输入长度增长缓慢,CPU 上比 ModernBERT-base 快约 3.7 倍。 架构 两个 encoder 从 LFM2 解码器主干初始化,然后做三步改造:双向注意力掩码(每个 token 看两边)、非因果短卷积(对称 padding)、30% token 的掩码语言建模训练。 两阶段训练:先用 1024 token 上下文做大语料 MLM,再扩展到 8192 token 强化事实、法律和多语言能力。 Benchmark 在 GLUE + SuperGLUE + 多语言分类共 17 个任务上,350M 版本排 14 个模型中的第 4 名,前 3 名都更大(最大一个 3.5B,近 10 倍参数)。230M 版本击败了 ModernBERT-base 和所有 EuroBERT 模型,参数量更小。 CPU 推理速度 最大的优势在 CPU 上。8192 token 输入时,ModernBERT-base 一次前向约 90 秒,LFM2.5-Encoder-230M 约 28 秒——约 3.7 倍快。这意味着你可以在笔记本 CPU 上 30 秒内扫描完一份完整合同、转录文本或长客服线程。 GPU 上的优势在长上下文时同样存在:短输入(<1000 token)ModernBERT 领先,长输入 LFM2.5-Encoders 反超。 实际用途 附带了 5 个 CPU-only 的 HuggingFace Space demo:零样本 prompt 路由、零样本策略检查、拼写纠正、40 种 PII 检测、掩码扩散文本生成(迭代 unmask 而非从左到右生成)。 两个模型都是开放权重,支持 transformers + Flash Attention 2。 模型: 博客: #Encoder# #CPUInference# #ONNX#
顯示更多
在外行大血空眼里:2022年年底,ChatGPT横空出世,宇宙大爆炸。 在我们这些人眼里: 2017年发布transformer,我们一群人在跟着看,看不懂也想不明白,但知道这东西比RNN和LSTM强得多; 2018年发布BERT,Google狂妄至极,全世界都在训练BERT、蒸馏BERT、魔改BERT,OpenAI当时在做decoder only的GPT, 2018年之后很长一段时间,有公司羞辱性地问PhD,“来,跟我讲讲,为什么BERT encoder only是唯一正确道路,为什么GPT这种decoder only是死路一条” 2019年,BERT已经深刻改变世界,Google已经骄傲宣布所有搜索结果都是BERT indexing和sorting的结果,全世界每秒钟调用xxx次BERT,Google震撼发布T5 model,直接把OpenAI甩开身位, 2020年,GPT-3横空出世,当日登顶github trending(一个markdown说明书,没有任何模型,完全闭源,当天党哥全球第三,和GPT-3同框),全世界看了OpenAI的视频demo,彻底炸裂,SQuAD被刷到顶, 2021年,Stanford开始酝酿foundation model(基础模型),代替以前BERT、GPT、transformer这些概念,计划一统江湖,开启新时代。foundation model几乎是一个极其伟大的宣言,告诉整个世界,NLP时代要迎来技术爆发了, 2022年,GPT-3.5 Turbo训练完了,OpenAI发现GPT-3的模式挺好,于是随手糊了一个前端和infra的小玩具,给大家注册玩玩,随便起了一个名字,叫ChatGPT。
顯示更多
0
78
612
44
轉發到社區
千万别拿我和张雪峰这个大傻逼作对比。 网友:我想学AI相关的专业,我对AI很感兴趣,请问我应该选计算机还是数学? 我:你一定要选计算机,先把python和数据结构基础打好, 然后从deep learning这门课开始学,可以在家配置一个nvidia GPU的笔记本或者台式机,或者用google colab,先从最简单的 CNN 开始训练,找一个dataset,自己安装好pytorch和cuda、cudnn,抄一个经典CNN model,训练你的第一个神经网络, 然后可以学习transformer,学习encoder only的BERT,学习decoder only的GPT模型,从minGPT开始,训练你的最小版本的GPT模型, 如果你对训练模型感兴趣,可以读个PhD,如果你的inference感兴趣,可以多花点时间看cuda,简单学习一下nvidia tensor core architecture,可以了解GPT后续的模型的架构, 如果你对inference感兴趣,你也可以直接看vllm的架构,读里面的代码,理解vllm是如何load一个用pytorch训练好的LLM模型, 如果你对AI Agent感兴趣,可以从ReAct Agent开始看,然后看SWE Agent,知道一个Agent是如何抽象出来的,如何调用function call,如何自己做reasoning,如何把一个软件开发的任务用agentical的方式拆分和执行的, 然后你可以看codex的架构,看看codex是如何设计memory、auto compact、multi agent、background task这些现代coding Agent功能的。 张雪峰(下面视频中可以找到原话): 孩子,你一定要学数学,数学学好了可以转互联网、AI、科技、半导体、金融所有专业,数学是一切专业之母,所有专业的老祖宗! 孩子,deepseek就是一群纯数学博士造出来的,这些人天天研究数学,就把deepseek造出来了! 孩子,AI本质就是数学建模,就是一个个自变量,你只有研究数学,一直读到数学博士,才能把这些数学建模研究明白,计算机毕业生是永远研究不明白AI的! 我的结论是,鼓吹“数学万能论”、“数学是一切专业的老祖宗”、“只有数学博士才能研究AI”的张雪峰和他们的粉丝,都是彻彻底底的大傻逼。
顯示更多
0
25
253
46
轉發到社區
翻了下 claude code version 191 的源码,感觉从技术角度看,Anthropic 这个反蒸馏机制设计还是挺精妙的。 Claude Code 有段提示词是这样。 return `Today${n}s date is ${r}.`; 他对这句做了隐写,用肉眼分不出的字符,把系统时区和代理端点身份偷偷编码进了系统提示词。 触发条件是当你设了第三方中转 ANTHROPIC_BASE_URL 且不是 时。 所以如果你是官方直连用户,则并不会受到影响。也就是说最近的封号潮与此无关。 它编码了 3 个 bit,来自两个独立维度(时区 1 bit + 撇号 2 bit): 1)时区,在 Asia/Shanghai 或 Asia/Urumqi 时,日期分隔符从 2026-06-30 偷偷变成 2026/06/30 2)那个撇号 ' 有四种写法,人眼基本看不出区别。 - ' (U+0027 普通),普通第三方端点 - ' (U+2019),命中"域名白名单" - ʼ (U+02BC),命中"国产大模型关键词" - ʹ (U+02B9),域名 + 实验室都命中 这三个维度是独立编码的。哪怕你的中转域名不在白名单、也不含关键词,只要系统时区是上海/乌鲁木齐,分隔符照样变斜杠——也就是"中国时区 + 任意第三方端点"的用户全员会被打上时区这一维的标记。 匹配逻辑是这样。域名是后缀匹配(host === d || host.endsWith("." + d)),白名单第一个就是 cn,所以任何 .cn 结尾的 host 一网打尽,不是逐个域名去列;关键词是子串包含(host.includes(kw)),host 里只要出现 deepseek 字样就命中,不用精确匹配;时区取的是系统时区(Intl…resolvedOptions().timeZone),不是 IP 地理位置。 更骚的是反混淆,两份名单用 XOR(key=91)+ base64 藏起来,专门躲 strings。解码就是 base64 decode 之后逐字节异或 91,源码里那个 LKi 去混淆后长这样: ```js // 源码里的解码器(去混淆版,就是 LKi) const decode = (b64) => [...Buffer.from(b64, "base64")] .map((byte) => String.fromCharCode(byte ^ 91)) // key = 91 .join("") .split(","); // 逆运算就是打包时的编码器 const encode = (list) => Buffer.from([...list.join(",")].map((c) => c.charCodeAt(0) ^ 91)).toString("base64"); encode(["deepseek", "zhipu"]); // → "Pz4+Kyg+PjB3ITMyKy4=" decode("Pz4+Kyg+PjB3ITMyKy4="); // → ["deepseek", "zhipu"] // 拿真名单开头验一下,key=91 对得上 decode("Pz4+Kyg+PjB3NjQ0NSgzNC93"); // → ["deepseek", "moonshot", ...] ``` 147 个域名白名单:".cn" 顶级域、字节/阿里/百度/网易/快手、 外加一大票 Claude 中转站(anyrouter、88code、yunwu、aihubmix、dmxapi…) 11 个实验室关键词:deepseek / zhipu / moonshot / minimax / stepfun / baichuan / 01ai / dashscope / volces … 选「今天的日期」这句话做载体也很鸡贼。这个标记藏在 system prompt 正文里,不是 HTTP header、也不是 metadata。中转站一般会重写、过滤 header,但几乎没人会去动日期这类的自然语言,所以这是个洗 header 洗不掉的水印。而且 currentDate 是 user context 里和 claudeMd、userEmail 并列的字段,每个请求必带,标记 100% 稳定出现;撇号和分隔符的变化又语义无损,模型读起来一模一样,用户 diff 也基本看不出,隐蔽性拉满。 证据是怎么闭环的,这才是题眼。标记跟着请求走,当一个中转站或蒸馏管道最终回连 Anthropic 官方 API 转售 Claude 时,这条请求带着标记又流回了 Anthropic 自己的服务器。 于是 Anthropic 在自己的日志里就能读到:这条"直连我"的请求,日期是 2026/06/30(斜杠 = 中国时区)+ 撇号是 ʹ(U+02B9 = 域名和 deepseek 关键词都命中),铁证——源头是一个中国时区、配了国产大模型中转的客户端。 它不需要主动探测,让流量自己招供,只要请求最终回到 Anthropic,身份就自证了。这样就能清楚地知道哪些渠道流向了中国、被中转站转售或被大厂蒸馏,并且留下充足证据。 想自己验的话,逻辑都在 cli.js(2.1.191,混淆名每版会变):检测函数 jqd()(:245688)→ 选字符 Wqd()(:245701)→ 拼日期 MKi()(:245707);gate 是 Yfn()(:102664);落点在 currentDate: MKi(eHe())(:250252);XOR 名单解码器 LKi(),key = 91。
顯示更多
0
103
1.3K
181
轉發到社區
魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需要84G显存). 然后我刚看到了FlashMemory这个论文, 直接能把显存占用压到 1.3GB! 甚至输出效果不降反升! 哥们你骗兄弟可以, 骗自己就没意思了, 真的吗? 压缩后反而性能上升? 我赶紧看了论文细节: 咱们先复习一下传统做法: 模型每吐出一个字,都要把之前的几十万字重新看一遍(这就是全局注意力). FlashMemory 的做法是: 预测未来需要什么, 它内置了一个神经内存索引器(Neural Memory Indexer, 其实就是个小模型了),能够主动预判接下来生成内容时需要用到历史文本里的哪些片段. 然后预先准备好这些片段, 接下来只要做到命中率超高, 那么这个提升就绝对有效. 即它的假设是, KVCache里面的东西并不是生成每个字的时候全都需要的, 只需要按需提前加载即可. 很像做作业的时候, 把参考资料摊满桌子, 然后优化了一下就是把参考资料需要用到的部分直接拍照, 用的时候看照片就行了. 那么听上去很简单, 但实际的难点在于, 训练一个专用的索引器小模型, 需要把 DeepSeek-V4模型加载到显存里一起炼. 相当耗费算力. 于是这篇论文第二个亮点来了, 它搞了个解耦训练. 他们把这个索引器当成一个标准的"双编码器(Dual-encoder,类似做搜索推荐的模型)"来单独训练. 在这个过程中,根本不需要把庞大的 DeepSeek-V4 基座模型加载到显存中. 这让训练成本断崖式下降,且兼容标准的检索(Retrieval)训练框架. (简单来讲就是它是通用方法训练的, 通过query预测需要检索哪些长句子. 所以其实是个通用模型) 听上去靠谱, 那也只是显存占用少了, 怎么就性能还提高了呢? 答案是注意力降噪. 因为每次只提取和当前生成最相关的记忆块(Chunks)放入显存,模型在运算时就看不见那些无关的冗余信息了.天然地起到了一种"去噪"作用,这也是为什么显存占用少了,模型准确率反而略微提升的原因.官方测试在长文本评测集(如 LongBench-v2 等)上的准确率平均最终提升了 0.6%. (其实还有数据如何逐出显存和如何预测数据实现预加载, 这部分也很棒, 很有启发性. 建议看原论文, 篇幅原因写不下了) 论文地址: 项目地址: #FlashMemory# #DeepSeekV4# #FlashMemoryDeepseekV4#
顯示更多
0
17
224
19
轉發到社區