Radix 基金会发布事故报告称,攻击者于 8 月 31 日利用 Radix Engine 的资产金库授权漏洞,通过 26 笔交易未经授权提取他人资产,并经 Hyperlane 跨链桥转移至以太坊、BNB Chain 和 Solana 后出售。漏洞源于 2023 年 6 月的一次代码整理,未被后续独立审计发现,不涉及用户私钥泄露或跨链桥故障。链上数据统计显示,被盗资产当时价值约 126 万美元。事发后验证者协调停止网络确认交易,Radix 主网停摆约 10 天,于 9 月 11 日恢复。基金会表示,漏洞修复方案及更新后的节点软件已通过独立审查和测试。基金会及外部取证团队判断,攻击者可能使用了 AI 辅助代码分析工具发现漏洞。
显示更多
Radix 基金会发布事故报告称,攻击者于 8 月 31 日利用 Radix Engine 的资产金库授权漏洞,通过 26 笔交易未经授权提取他人资产,并经 Hyperlane 跨链桥转移至以太坊、BNB Chain 和 Solana 后出售。漏洞源于 2023 年 6 月的一次代码整理,未被后续独立审计发现,不涉及用户私钥泄露或跨链桥故障。事发后,基金会协调关闭跨链通道,验证者通过主动下线足够比例的质押权益,使网络停止确认交易。截至报告发布,漏洞已修复并经过独立审查和测试,网络恢复工作仍在推进。报告未披露损失总额。基金会及外部取证团队判断,攻击者可能使用了 AI 辅助代码分析工具发现漏洞。
显示更多
🔬 RadixArk 开源了一个专门干大模型后训练的强化学习框架 Miles,几千张卡的任务中途挂了也不用从头再来
GitHub 上两千六百多 star、四百多个 fork,v0.1 是今年 8 月刚发的。
做过大规模后训练的都知道最肉疼的是哪一下:一个任务连着跑好几天,推理引擎中间抽风一次,整个作业就得重启,几十小时的卡时直接打水漂。Miles 把这件事按住了,SGLang 引擎出问题时能原地恢复接着跑,不重启任务。
它的分工是 SGLang 扛高吞吐 rollout、Megatron-LM 扛可扩展训练,想轻装上阵也有一套基于 PyTorch FSDP2 的后端。中间那些隐形损耗它也一并收拾了:rollout 和训练之间不再来回 detokenize 和 retokenize,token 进 token 出;MoE 老大难的路由不一致,用 Rollout Routing Replay 压了下去。
再往上,MXFP8 和 NVFP4 这类低精度训练它支持,硬件从 NVIDIA 的 GB300、B200 一路吃到 AMD 的 MI355X,DeepSeek-V4、Kimi-K3、GLM-5.2 这些模型是发布当天就能训。项目本身是从 slime fork 出来的,LoRA 训完的适配器能直接扔给 SGLang 做 rollout,不用中间那道转换。
训大模型最贵的从来不是算力,是重跑一遍的那几天。
GitHub:
显示更多
本期《晚点聊 LateTalk》邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3:它真的比肩 Fable 5 吗?3T 模型规模、“线性-全局混合注意力” 等改进意味着什么?开源厂商们无法开源的竞争力是什么?
显示更多
DeepSeek-V4.1-Flash 八卡H20 实测来了,一起看下552B 参数加 196B Engram 参数的模型在SGLang运行结果
启动参数:
sglang serve --model-path /model --served-model-name deepseek-v41-flash --tp 8 --ep-size 8 --context-length 32768 --max-running-requests 32 --mem-fraction-static 0.85 --attention-backend dsv4 --moe-runner-backend flashinfer_mxfp4 --reasoning-parser auto --tool-call-parser auto --enable-metrics --disable-radix-cache --host 0.0.0.0 --port 30000
测试方法:
核心矩阵为 1,024/128、8,192/128、1,024/512、24,576/128 Token,各测 C1、C8、C32,每组单独预热后正式重复三轮。各轮请求数分别为 8、16、64。C 是客户端并发上限,服务端最大运行序列也是 32
和历史V4测试对比结果:
DeepSeek-V4.1-Flash 结果稍快一点,但开始回答之后,输出速度比 DeepSeek-V4-Flash 慢,整体吞吐也更低,实际token/s 速度达不到DeepSeek API 中V4.1三倍提升的效果🤣
显示更多
在最近的开源热潮中,SGLang和vLLM等开源推理引擎成为算力优化的核心技术。DeepSeek、Kimi等模型一上线就实现Day-0支持,昨天Google Cloud TPU也官宣引入SGLang。
这背后是AI Infra的千亿级市场和需求:当推理成为AI的主战场,GPU看似满载,却仍把大量时间耗在重复计算、缓存搬运和任务等待上。AI Infra深处,一场围绕调度与系统优化的效率革命已经开始。为什么最昂贵的GPU仍会“又忙又闲”?AI Infra还能榨出多少藏在“硅”里的性能?当算力增长不再只靠堆卡,AI竞争的尺度会被怎样改写?这期视频,我们与推理引擎开源社区SGLang孵化出的RadixArk团队一起,深入探讨这场算力效率变革。
显示更多
最近大模型更新的隐式缓存为什么可以把缓存价格降低,命中率大大提高。
传统推理里,你每调一次API,GPU都得把整个输入prompt重新算一遍。固定System Prompt、历史对话、RAG知识库,这些重复内容每次都重新预填充,按全价收费。
隐式缓存做了什么?
它自动检测本次输入和之前请求的公共前缀。命中了,就把之前算好的KV Cache从SSD硬盘直接加载出来,只对新增部分重新计算。重复劳动,直接砍掉。
效果立竿见影。多轮对话、Agent、代码补全这类场景,重复前缀往往占输入Token的70%-90%。命中后,input价格直接打到一折。对长文本多次对话的推理的成本和内存的压力都大大降低。
但这里有个关键问题:之前为什么不行?
KV Cache太大了。传统Multi-Head Attention架构下,百万Token的KV可能要上百GB显存。存盘?I/O延迟完全没法接受。GPU必须全程Hold住所有KV,成本根本降不下来。
DeepSeek的MLA架构把KV Cache压缩了10-28倍。百万Token从80-200GB变成4-10GB。这才让硬盘级缓存成为可能,压缩后的KV可以经济地落盘到分布式SSD,需要时再快速加载。
本质上,是把最贵的GPU显存从按最大上下文全量占用变成了按实际新增Token动态使用,类似动态更新的模式。
这里有个反直觉的点:虽然对高速内存需求大幅下降,但并不是完全转向硬盘。更像是分层存储,GPU只保留热数据,冷前缀卸载到SSD。类似CPU的分页机制,只是这次发生在大模型推理层。
DeepSeek率先把这套机制默认开启,给出极致低价。其他厂商不得不跟进,竞争驱动技术扩散,技术扩散又进一步压低价格。
要想最大化缓存命中需要做什么?
想最大化省钱,把重复内容尽量放在prompt开头,保持前缀一致性,命中率会更高。API响应里有prompt_cache_hit_tokens字段,直接看命中率。
这轮降价潮是真实的架构创新,算法效率优化带来的成本下降。MLA压缩KV、分布式SSD存储、Radix-Tree前缀索引,这些工程突破把原来需要重复劳动浪费的算力,优化到极致
尤其是 DeepSeek,降价这么多还能赚钱,还是永久降价,这是真本事,那之前的原价是耍我们玩得吗,第一天用原价 API 的人是有点冤大头了。
显示更多
Radiant 协议被黑客攻击,目前 Arb 和 BSC 上的合约被黑客控制,请尽快取消对以下合约的所有授权。Eth 和 Base 暂未受到影响,但保险起见还是一并取消为好。工具可以使用 web3 钱包,都提供类似功能。在取消授权前请不要向地址内转入资产,攻击能在持续。
ETH: 0xA950974f64aA33f27F6C5e017eEE93BF7588ED07
BNB: 0xd50Cf00b6e600Dd036Ba8eF475677d816d6c4281
BASE: 0x30798cFe2CCa822321ceed7e6085e633aAbC492F
ARB: 0xF4B1486DD74D07706052A33d31d7c0AAFD0659E1
显示更多