註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Phoenix Yin
@Phoenixyin13
🇺🇸 04美本 | 计算机科学&认知科学 ⚙️AI, cognition, crypto, and the future of intelligence. ✨相信好奇心驱动。相信人永远可塑。
加入 May 2025
1K 正在關注    17.1K 粉絲
2024年的时候,浙江大学的恩师说的一句话,影响了我这两年所有的阅读内容。 他说,你要去看2022年之前的经典书和经典论文,那是没有被AI数据污染的净土。 品味的答案,持续学习的答案,在那里。 其实的确如此,在2022年生成式AI和LLM大爆发之后,整个互联网的数据生态发生了不可逆的质变。互联网,迅速演变成了AI生成内容的自循环反刍池。 我怀念,没有Token泛滥的膨胀感。 作者写下每一个字,都是在有限的注意力与精力下,对复杂现实进行的极高密度压缩。 毕竟,品味的根基在于第一性原理。科学审美、理论框架、以及对真问题的敏感度几乎全部孕育在那个没有被Synthetic Data掩埋的时代。 后来来到美国之后,和俄亥俄州立大学的老师也探讨过这个问题。 我得到了一个新的认识。 其实,对于AI文本,感觉的强度和实际的密度是两回事。毕竟,AI文本有很强的signature,那几个词、那个三段式、句句都平的节奏所以它的可识别性远高于它的占比。 这里,我想还有个筛选偏差。 就是我能认出来的AI文本,都是写得差的那部分。而被人改过一遍、重写过一遍的,我都很难注意的到、识别的到。 在这个过程中,我认为分布也极不均匀。 从2015年后,SEO内容、自出版、评论区、通稿,基本饱和了。 但浙大的恩师指的是经典书和经典论文,恰好应该算污染最轻的那一类。 其实现在,我觉得恩师低估的是另一个方向。 污染或许不只在语料里,也在写作者身上。 一个2026年的人类作者,泡在被生成文本浸过的语言环境里,写的时候旁边有补全,考核看产量。即使他一个字都不让AI写,句子也已经在往均值上靠拢。 这个东西,日期很难切掉,因为它是从人往回传的,会传进经典的重印、选本、导读和推荐序。也许,在退化的是人类写作的方差,并非机器文本的占比。 2022看似已经是个schelling point,未污染语料正在被定价、被抢购。 所有人都在退守的净土,很快就不是净土。
顯示更多
0
61
304
43
轉發到社區