AWS 可以存储 billions of objects,但不代表你的计算架构应该逐个处理 billions of objects。
很多团队遇到数据量不大,但是处理速度很慢,Glue/Spark成本越来越高
原因可能不是计算资源不足,而是“小文件问题”
优化方向:
合并小文件
转换 Parquet
合理设计 Partition
使用 Iceberg/Delta Lake 管理数据湖
在云上,大规模性能问题很多时候不是机器不够,而可能是架构设计问题
优化AWS,阿里云国际成本,欢迎随时咨询
@DianMirCloud
#
AWS# #
云服务器# #
阿里云国际#