이미 빅데이터 시대를 열었다는 것은 부정할 수 없습니다. 매초 엄청난 양의 정보가 생성됩니다. 의사결정자들이 이 과정에서 귀중한 통찰을 얻을 수 있지만...
데이터 엔지니어로서 아마도 하둡에 대해 들어보셨을 겁니다. 이것은 대규모 데이터 세트의 분산 처리를 위한 가장 인기 있는 프레임워크 중 하나입니다. 다른 프레임워크보다 비용이 적게 들고 더 안전합니다...
데이터 엔지니어로서 ETL(추출-변환-부하)이라는 데이터 통합 방법론을 들어보셨을 겁니다. 이 방법은 꽤 오래전부터 존재해 왔고, 많은 데이터 엔지니어들이 이 방법론을 사용해 왔습니다...
"게으름"이라는 단어가 부정적인 의미를 가지고 있다는 데 거의 이견이 없습니다. 우리는 보통 열심히 일하려 하지 않는 사람을 게으르다고 묘사합니다. 하지만 모든 게으름이 바람직하지 않은 것은 아니며, 때로는 우리가...
빅데이터 세계에 오래 계셨다면, 아마 Parquet 파일에 대해 들어보셨을 겁니다. 심지어 "왜 CSV 파일을 그냥 쓰지 못하지?"라고 생각하며 사용했을 수도 있습니다. 오늘, 저는...
안녕하세요! 제 이름은 지위 첸입니다. 저는 Colorkrew의 풀스택 엔지니어입니다. 데이터 엔지니어링에 대해 배우고 글을 쓰는 것을 좋아합니다. 오늘은 Spark에서의 변화와 행동에 대해 이야기하고자 합니다. 물론이죠,...