TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
0xTodd ( thinking )
@0xTodd
热衷研究 | 在
@researchnothing
琢磨策略 | 在
@ebunker_eth
打包区块 | Long BTC, Love the World | NFA
参加 September 2016
3K
フォロー中
72.2K
ファン
0xTodd ( thinking )
@0xTodd
2026.04.29 01:32
其实大模型收“翻译税”的问题,主要还是在于: -训练集对非英文语言的采集比例; -分词器对非英文语言的优化程度。 比方说,同样一段话,A 社 Claude 英文消耗的 token 是 1,中文的话就是 1.7。 说白了,就是他们的分词器优先能把英文识别成高频单词,而中文只能拆得更细、更碎一点(浪费 Token)。 比方说“推特”这个词,低效的分词器就会把它拆成“推”加“特”; 但如果你是针对中文优化过的分词器,它就会直接把“推特”作为一个词整体。 所以说,反过来,如果你用 DeepSeek 或者是 Kimi,他们对于中文语料的采集更多,所以分词器能更高效地把中文拆成单个 token,这样他们就更省钱。 因此,这些国产大模型在处理中文时,消耗的 token 甚至比英文还要更少,还能反向收“翻译补贴”。
もっと見る
0
0
4
18
3
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
101.1K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
New York Post
@nypost
4.2M ファン
吴说区块链
@wublockchain12
181.7K ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
Reuters
@Reuters
26.4M ファン
空空道人
@Kongkongda5882
34.4K ファン
Bloomberg
@business
10.5M ファン
MANTANWEB/毎日キレイ
@mantanweb
69K ファン
billboard
@billboard
16.8M ファン
一劍浣春秋
@chee828
0 ファン
Yahoo!ニュース
@YahooNewsTopics
2.1M ファン