データエンジニアリングは、データの収集・保存・変換・配信を担うシステムを設計・構築・運用する実践分野である。分析・ BI ・ ML の下流利用者が、信頼できるデータに低コストでアクセスできる状態を作ることを目的とする。 この分野は、1990 年代の ETL ・オンプレ DWH に始まり、2000 年代の Hadoop を経て、2010 年代後半からクラウド DWH 中心の「モダンデータスタック」へ移った。近年は ELT ・データ品質テストなどソフトウェア工学の実践が持ち込まれ、[[BigQuery の AI と ML 機能の全体像|AI / ML 統合]]も進んでいる。 ## 関連ノート - **[応用]** [[Python のデータフレームにハッシュ差分列を追加する]]: ETL/ELT で差分検出を組み込むデータフレーム処理パターン