这是不是现代版的数字知识垄断“焚书”?
AI巨头疯狂大量收购2022年之前出版的旧书、绝版书籍
疯狂扫描之后,直接销毁,目的是为啥?
因为AI生成内容泛滥,内容被污染,由人工创作的“干净语料”突然变为稀缺资源
现状的网络充斥大量AI产出的同质化水文,如果持续抓取这类文本训练模型,会造成模型退化、逻辑混乱灵。
而2022年前印刷的书籍,全部是人类原创、经过编辑校对,是相对稀缺、纯净度相对高的高质量语料。
这些巨头更现实的考虑是:
第一、规避一部分版权风险。按照海外现有判例,企业合法购入实体图书、仅内部提取文字训练,被认定为“合理使用”;比直接爬取电子书,法律纠纷门槛更低。
第二、可以筑建独家数据壁垒。不少冷门专著、地方史料存量稀少,收购销毁之后,同行很难获取同源文本,形成别人拿不到的知识库。
这到底是不是“焚书”,他们应该怎么做才更好?
顯示更多