詳細検索
아바타

Chen Ziyu

카프카에 대한 간략한 소개

카프카에 대한 간략한 소개

이미 빅데이터 시대를 열었다는 것은 부정할 수 없습니다. 매초 엄청난 양의 정보가 생성됩니다. 의사결정자들이 이 과정에서 귀중한 통찰을 얻을 수 있지만...

MapReduce의 내부 작동 원리에 대한 간략한 소개

MapReduce의 내부 작동 원리에 대한 간략한 소개

데이터 엔지니어로서 아마도 하둡에 대해 들어보셨을 겁니다. 이것은 대규모 데이터 세트의 분산 처리를 위한 가장 인기 있는 프레임워크 중 하나입니다. 다른 프레임워크보다 비용이 적게 들고 더 안전합니다...

ETL vs. ELT: 프로젝트에 가장 적합한 데이터 통합 방법을 선택하세요

ETL vs. ELT: 프로젝트에 가장 적합한 데이터 통합 방법을 선택하세요

데이터 엔지니어로서 ETL(추출-변환-부하)이라는 데이터 통합 방법론을 들어보셨을 겁니다. 이 방법은 꽤 오래전부터 존재해 왔고, 많은 데이터 엔지니어들이 이 방법론을 사용해 왔습니다...

Spark의 게으른 평가에 대해 알아야 할 모든 것

Spark의 게으른 평가에 대해 알아야 할 모든 것

"게으름"이라는 단어가 부정적인 의미를 가지고 있다는 데 거의 이견이 없습니다. 우리는 보통 열심히 일하려 하지 않는 사람을 게으르다고 묘사합니다. 하지만 모든 게으름이 바람직하지 않은 것은 아니며, 때로는 우리가...

파켓 파일: CSV보다 작고 빠른

파켓 파일: CSV보다 작고 빠른

빅데이터 세계에 오래 계셨다면, 아마 Parquet 파일에 대해 들어보셨을 겁니다. 심지어 "왜 CSV 파일을 그냥 쓰지 못하지?"라고 생각하며 사용했을 수도 있습니다. 오늘, 저는...

행동, 좁은 변환, 넓은 변환

행동, 좁은 변환, 넓은 변환

안녕하세요! 제 이름은 지위 첸입니다. 저는 Colorkrew의 풀스택 엔지니어입니다. 데이터 엔지니어링에 대해 배우고 글을 쓰는 것을 좋아합니다. 오늘은 Spark에서의 변화와 행동에 대해 이야기하고자 합니다. 물론이죠,...