TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
九原客
@9hills
喜欢一切美好的事物。目前聚焦在大模型领域。
가입 February 2010
1.2K
팔로잉 중
27.6K
팬
九原客
@9hills
2026.06.11 23:33
GPT 5.5 还是那么热爱偷懒 注:以下文字由 Typeless 整理。 背景是这样的:我有一个本地 50B 预训练和 SFT 数据处理的任务,其中最关键的有三步: 对 SFT 进行 Chat Template 渲染; 对数据进行 Tokenizer 处理(计算 Token 数量); 数据去重。 这三项任务如果直接用 Python 加上一些默认库,处理速度会比较慢。而且我家里没有分布式环境,只有一台普通的电脑。我希望处理 50 B Tokens(大概有上百 GB )的数据时能很快完成,于是就让 Pi+GPT 帮我写个工具去做处理。 最开始,我让他处理 1 万条数据,花了 40 多秒;我让他优化,处理 10 万条数据时降到了 30 秒。最后我给了他 50 万条(大约 1.5 GB)的数据,要求也优化到 30 秒以内。 前面还好,直到最后处理 50 万条数据时,他发现无论如何都优化不过去了。但他又不想去修改或定制化 Rust 的 Tokenizer 代码,就开始偷懒了: 1. **模糊计数**:他居然把 Token 计数从精确计数改成了模糊计数,直接通过字符数量来估算 Token 数,试图以此绕过 Token 处理的问题。被我发现后,我纠正了他。 2. **利用缓存**:因为我测试时是用同一批数据反复测,他就把之前的结果缓存起来,第二次测的时候速度就飞快。 简直是各种偷懒,好在我让他写了日志。我从日志里发现他的偷懒行为后指正了他,并要求他修改 Rust 代码。 最终,他虽然做了一些修改,但依然没动 Rust 的核心代码,只是做了一些外围调整。比如,原来的 Tokenizer 是返回所有的 Token 列表,但因为我们只需要总数,他改成了只返回数量。这样就避免了大规模的内存拷贝,性能确实提高了很多。此外,他还做了一些并发之类的调整。 总的来说,GPT 的格局很低,你不逼他动,他真的是不想动。这样GPT 应用在loop 里就很难受,你必须给他设置很多规则。
더 보기
0
0
2
37
0
커뮤니티로 전달
인기 있는 사용자
オリコンニュース
@oricon
1.9M 팬
New York Post
@nypost
4.1M 팬
TVer新着
@TVer_info
99.9K 팬
空空道人
@Kongkongda5882
30.6K 팬
브라운더스트2 공식트위터
@BROWNDUST2_KR
21.5K 팬
「승리의 여신: 니케」 x 「P3R」, 「P4G」, 「P5R」 콜라보 진행 중
@NIKKE_kr
79.4K 팬
Girls' Generation
@GirlsGeneration
3.3M 팬
中國新聞社
@CNS1952
547.1K 팬
一劍浣春秋
@chee828
230.9K 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K 팬
吴说区块链
@wublockchain12
180.5K 팬
TPE48
@official_TPE48
11K 팬
乐老爺 #JAV
@HappyLok1157
206.9K 팬
하이라이트(HIGHLIGHT)
@Highlight_AUent
113.7K 팬
i-dle (아이들)
@official_i_dle
2.3M 팬