詳細検索
アバター

Chen Ziyu

カフカの簡単な紹介

カフカの簡単な紹介

ビッグデータの時代をすでに切り開いたことは否定できません。毎秒膨大な量の情報が生成されています。意思決定者はこの情報から貴重な洞察を得ることができますが...

MapReduceの内部動作の簡単な紹介

MapReduceの内部動作の簡単な紹介

データエンジニアとして、おそらくHadoopについて聞いたことがあるでしょう。これは大規模なデータセットの分散処理に最も人気のあるフレームワークの一つです。他の...

ETLとELT:プロジェクトに最適なデータ統合方法を選ぶ

ETLとELT:プロジェクトに最適なデータ統合方法を選ぶ

データエンジニアとして、おそらくETL(Extract-Transform-Load)と呼ばれるデータ統合手法を聞いたことがあるでしょう。これは以前から存在しており、多くのデータエンジニアがこの手法を使ってきました...

Sparkにおける怠惰な評価について知っておくべきこと

Sparkにおける怠惰な評価について知っておくべきこと

「怠け者」という言葉には否定的な意味合いがあることに異論を唱える人はほとんどいません。私たちは通常、一生懸命働く意欲のない人を怠け者と表現します。しかし、すべての怠惰が望ましくないわけではなく、時には...

パーケットファイル:CSVより小さく高速

パーケットファイル:CSVより小さく高速

ビッグデータの世界に長くいるなら、Parquetファイルについて聞いたことがあるかもしれません。「なぜCSVファイルを使えないのか?」と考えながら使ったことがあるかもしれません。今日、私は...

行動、狭い変換、そして広範囲変換

行動、狭い変換、そして広範囲変換

こんにちは!私の名前は陳紫宇です。Colorkrewのフルスタックエンジニアです。データエンジニアリングについて学び、執筆するのが大好きです。今日はSparkにおける変革とアクションについて話したいと思います。もちろんです,...