August 25, 2020
Detectando ficheros pequeños Spark
Uno de los mayores problemas de rendimiento que podemos encontrar en los datalakes es tener que mover una enorme cantidad de ficheros pequeños, por el overhead que eso representa en las transacciones. Este post de databricks recomienda https://forums.databricks.com/questions/101/what-is-an-optimal-size-for-file-partitions-using.html que se crearán ficheros de 1GB parquet.
Sin embargo mucha gente no sabe cómo detectar esto. Hace poco estuve jugando con un notebook y usando simplemente las herramientas del dbutils pude clasificar los ficheros que tenía en las entidades del datalake en múltiples categorías, así podría estimar cuántos ficheros había en un rango de tiempo.
Read more