전체 글

SMALL
코딩 개발/Date Engineer

[DE 파이프라인 #3] 배치 파이프라인 구축 & 데이터 처리 엔진 비교 (Pandas vs Polars vs PySpark)

안녕하세요! 데이터 엔지니어링 파이프라인 시리즈 3편입니다. [2편]에서는 S3 Bronze 레이어에 Raw 데이터를 파티셔닝하여 안전하게 쌓는 방법에 대해 알아보았습니다.이번 3편에서는 축적된 브론즈 데이터를 주기적으로 정제 및 집계하는 배치 파이프라인(Batch Data Pipeline)을 설계하고, 대표적인 데이터 처리 엔진인 Pandas, Polars, PySpark의 장단점 및 선택 기준을 비교해 보겠습니다.1. 배치 데이터 파이프라인 (Batch Pipeline) 구조배치 파이프라인은 S3 Bronze에 쌓인 Raw 데이터를 일정 주기(예: 매일 00:00)마다 읽어와 정제(Silver)하고 분석용 데이터마트(Gold)로 가공하는 과정입니다. 이 모든 워크플로우는 Apache Airflow에 ..

코딩 개발/Date Engineer

[DE 파이프라인 #2] Log Ingestion & S3 Bronze 데이터 레이크 구축 전략 (CloudWatch/Firehose/Athena)

안녕하세요! 데이터 엔지니어링 파이프라인 구축 시리즈 2편에 오신 것을 환영합니다. [1편]에서는 데이터 엔지니어링 라이프사이클과 k6 + FastAPI 기반 트래픽/로그 제너레이터 구축법을 다루었습니다. 이번 2편에서는 발생된 로그를 안전하게 수집하는 Log Ingestion 파이프라인과 S3 Bronze Layer 파티셔닝, 그리고 AWS Athena를 활용한 서버리스 로그 조회를 알아보겠습니다.1. 데이터 수집(Ingestion)의 4가지 파이프라인 유형데이터가 소스(Source) 시스템에서 발생할 때, 데이터의 성격과 목적에 따라 수집 방식이 크게 4가지로 나뉩니다.┌────────────────────────────────────────────────────────────────────────┐..

코딩 개발/Date Engineer

[DE 파이프라인 #1] 데이터 엔지니어링 라이프사이클 & k6 + FastAPI 트래픽/로그 제너레이터 구축

안녕하세요! 이번 시리즈에서는 데이터 엔지니어링의 전체 생명주기(Lifecycle)를 살펴보고, 실제 데이터가 발생하여 파이프라인을 타고 처리되는 전 과정을 아키텍처와 함께 구축해 보는 포스팅을 진행하고자 합니다. 첫 번째 편에서는 데이터 엔지니어링의 전체 라이프사이클 8가지 요소를 정리하고, 수집 파이프라인을 테스트하기 위한 k6 + ECS Fargate + FastAPI 기반 트래픽/로그 제너레이터(Traffic & Log Generator)를 설계해 보겠습니다.1. 데이터 엔지니어링 라이프사이클 (Data Engineering Lifecycle)데이터 파이프라인을 설계하기 전에 전체 데이터의 흐름을 이해하는 것은 매우 중요합니다. 데이터 엔지니어링 라이프사이클은 크게 6가지 메인 단계와 전 과정을 ..

코딩 개발/AWS

[Steam Insight] EKS, GitOps, AI를 활용한 Steam 데이터 분석 플랫폼 구축기 & 프로젝트 팀 회고

https://github.com/hosose/steam_insight_ci GitHub - hosose/steam_insight_ciContribute to hosose/steam_insight_ci development by creating an account on GitHub.github.comhttps://github.com/hosose/steam_insight_cd GitHub - hosose/steam_insight_cdContribute to hosose/steam_insight_cd development by creating an account on GitHub.github.com Steam Insight 프로젝트를 마치며 팀 차원에서 진행했던 개발 과정, 기술적 도전, 그리고 잘했던 점과..

카테고리 없음

AWS - Terraform기반 Production-Ready 3-Tier 아키텍처 코드 상세 분석 가이드

https://pabeba.tistory.com/304이전 시간에 그냥 장황하게 글을 작성하고... 떠나버렸죠. 저도 열심히 분석하고 글을 다시 써보려고 합니다. 이 글의 목적이 운영 가능한(Production-Ready) 고가용성 인프라 구축에 대한 글이라는 것을 계속 생각하면서 코드를 분석해보아요. 1. 기본 환경 및 변수 정의 파일📄 provider.tfterraform { required_version = ">=1.0" required_providers { aws = { source = "hashicorp/aws" version = "~>6.0" } }}provider "aws" { region = var.region default_tags { tag..

코딩 개발/AWS

AWS - Terraform으로 구축하는 고가용성 멀티 AZ 3-Tier 아키텍처 (Production 환경 V1)

이 글을 시작하기 전 말씀드리고 싶은 것이 있습니다. 저조차도 아직 이 내용이 제대로 이해가 되지 않습니다. 그렇기 때문에 용기 내어 글을 올려봅니다. 왜냐하면 이 글을 작성하면서 이 글을 작성했다는 제 자신이 부끄럽지 않기 위해 더 공부할 예정입니다.그러니 이상한 내용이 있다면 말씀해주세요.ㅎㅎ 오늘은 단일 서버나 단순 VPC 구성을 넘어, 실제 운영(Production) 환경에서 바로 적용할 수 있는 운영 가능한(Production-Ready) 고가용성 인프라 구축 가이드를 작성해 보려고 합니다. 테라폼(Terraform)을 활용해 Multi-AZ(다중 가용 영역) 기반의 3-Tier 웹 아키텍처를 완벽하게 자동화 구축하는 실습을 정리했습니다.1. V1 아키텍처 개요 및 특징우리가 구축할 V1 아키텍..

LIST
호소세
호소세의 개발 블로그