推出 Velvet Flash 0.1(面向 Velvet-1):更小、更专精、更出色
今天,我们正式发布 Velvet Flash 0.1——这是我们内部自研的、专为安全可靠的加密操作而设计的任务专用型 40 亿参数模型。
@Velvet_Capital
我们打造 Velvet Flash,是为了处理通用模型往往难以胜任的加密交互场景。它需要理解用户意图、选择正确的平台指令、准确提取参数、识别风险请求,并在任何涉及资金的操作前进行确认。一个模型必须做到精准、一致且安全。
在我们的加密技能基准测试中,Velvet Flash 以 50 分的综合成绩排名第一。Qwen3.5-27B 得分为 45,DeepSeek-V4 为 40,Llama-3.3-70B 为 32,Gemma-4-31B 为 31,Mistral-24B 为 20。尽管 Velvet Flash 仅有 40 亿参数,却取得了最高分,其参数规模比它所超越的多个模型小 6 到 17 倍。
该基准测试评估模型作为安全加密操作员的表现。每个模型会收到一份平台技能文档和一条自然语言请求。模型必须选择正确的指令,提取金额、代币、链和接收地址等参数,在执行任何涉及资金的操作前进行确认,并针对诈骗、错误链或风险请求发出警告。
训练成果最清晰的证明,来自 Velvet Flash 与其未训练的基座模型之间的差异。基座模型得分为 23,而 Velvet Flash 得分为 50。这意味着任务专用训练使得综合得分提升了一倍以上。
该模型还在五个能力维度上进行了评估:安全性、覆盖面、稳健性、路由能力和清晰度。安全性从 28 提升至 61,稳健性从 26 提升至 53,清晰度和用户体验从 22 提升至 52,路由能力从 30 提升至 47,覆盖面从 12 提升至 34。
安全性结果对我们来说最为重要。在金融产品中,模型必须知道何时继续、何时要求澄清、何时警告用户、何时不采取行动。它必须正确解析金额、保护敏感信息、识别可疑请求,并避免在未经确认的情况下转移资金。这些行为并非产品的次要功能。
一些较大的模型在个别平台上表现更优。Qwen3.5-27B 和 Llama-3.3-70B 在 Minara 上得分更高,而 Qwen 在 Binance Spot 上的表现也更好。
模型质量只是故事的一部分。一个 40 亿参数的模型比 270 亿、310 亿或 700 亿参数的模型部署和服务成本更低、更简便。它可以提供更低的延迟,所需基础设施更少,并让我们对部署和迭代拥有更大的控制权。Velvet Flash 部署在我们自己的基础设施上,这使我们能够围绕产品需求优化整个系统,而不是依赖通用模型作为外部黑盒。
该基准测试使用了涵盖 Minara、Binance Spot、OKX DEX、Uniswap、GMX 和 MetaMask 的六个核心平台。更广泛的 Velvet 评估涵盖 31 个平台,包括中心化交易所、钱包、DEX、DeFi 产品和交易工具。所有模型均接收相同的输入、相同的保留测试场景,并由同一个独立的评判系统进行评分。响应在五个加权维度上进行评分,并额外设置安全门控,用于检测诸如未经确认转移资金或错误解析金额等失败情况。
Velvet Flash 0.1 是该模型的第一个版本。我们将继续扩大平台覆盖范围、改善困难边缘情况、强化安全行为,并优化复杂多步骤工作流的性能。
更广泛的目标是建立内部能力,以打造更安全、更快、更便宜,且与所服务产品更契合的专用模型。