[Airflow] 실패한 테스크를 자동으로 복구하는 Retry 전략

[Airflow] 실패한 태스크를 자동으로 복구하는 Retry 전략

데이터 파이프라인 운영에서 가장 피곤한 일은 새벽에 날아오는 ‘태스크 실패’ 알림입니다. 하지만 모든 실패가 치명적인 결함은 아닙니다. 네트워크 일시 오류, API 레이트 리밋, 일시적인 리소스 부족 등은 **자동 재시도(Retry)**만으로도 충분히 해결될 수 있습니다.

[Airflow] 견고한 파이프라인을 위한 DAG 설계 원칙

Tech - Apache Airflow 견고한 파이프라인을 위한 DAG 설계 원칙

데이터 엔지니어링 실무에서 Airflow를 사용하다 보면, 단순히 “실행이 잘 되는” DAG를 만드는 것을 넘어 “장애에 강하고 유지보수가 쉬운” DAG를 만드는 것이 얼마나 중요한지 깨닫게 됩니다.

잘못 설계된 DAG는 재실행 시 데이터를 중복시키거나, 사소한 실패에도 전체 파이프라인을 마비시키곤 하죠. 오늘은 안정적인 데이터 파이프라인 구축을 위해 반드시 지켜야 할 Airflow DAG 설계 6계명을 정리해 보았습니다.

Apache Airflow의 AWS ECS Executor로 워크플로우 실행하기(2)

AWS ECS Executor로 에어플로우 작업을 실행하기(1)

Airflow에서 ECS Executor 실행기를 통해 워크플로우를 AWS ECS에서 제공하는 서버리스 컨테이너 서비스인 AWS Fargate를 사용하여 작업이 실행되는 동안에만 과금이 되는 효율적이고 안정적인 에어플로우 플랫폼 구축하기