Blog & Articles
Thoughts, learnings, and technical deep dives.
![[DS Blog #27] Nền Tảng Data Science & Machine Learning: Kỹ Thuật Feature Engineering, Đánh Giá Mô Hình Chuyên Sâu & Giải Mã Bộ Tứ Tree-based Models (Random Forest, XGBoost, LightGBM, CatBoost)](/uploads/ai-images/cover-feature-engineering-tree-models.png)
[DS Blog #27] Nền Tảng Data Science & Machine Learning: Kỹ Thuật Feature Engineering, Đánh Giá Mô Hình Chuyên Sâu & Giải Mã Bộ Tứ Tree-based Models (Random Forest, XGBoost, LightGBM, CatBoost)
Mục tiêu bài viết: Làm chủ quy trình xử lý đặc trưng (Feature Engineering & Target Encoding), hiểu sâu sự đánh đổi Bias-Variance Tradeoff, phân biệt bản chất toán học của ROC-AUC vs. PR-AUC trên tập dữ liệu mất cân bằng, so sánh cơ chế hoạt động của 4 thuật toán cây đầu bảng (Random Forest, XGBoost, LightGBM, CatBoost) và tự tin trả lời phỏng vấn vị trí Data Scientist / Machine Learning Engineer.
![[DE & DA Blog #26] Nền Tảng Data Analytics & Phương Pháp Luận A/B Testing Chuyên Sâu: Hypothesis Testing, Sample Size & Các Cạm Bẫy Thống Kê Thực Chiến](/uploads/ai-images/cover-data-analytics-ab-testing.png)
[DE & DA Blog #26] Nền Tảng Data Analytics & Phương Pháp Luận A/B Testing Chuyên Sâu: Hypothesis Testing, Sample Size & Các Cạm Bẫy Thống Kê Thực Chiến
Mục tiêu bài viết: Nắm vững nền tảng thống kê suy luận (Hypothesis Testing, Statistical Power), công thức tính cỡ mẫu (Sample Size & MDE), làm chủ các kỹ thuật thử nghiệm phức tạp (Switchback Testing, Sequential Testing) và nhận diện các cạm bẫy kinh điển (Peaking Problem, Simpson's Paradox, SRM) trong phỏng vấn Data Analytics / Product Data Science.
![[DE Blog #25] Phân Tích Dữ Liệu Đồ Thị Quy Mô Lớn (Graph Data Engineering): Kiến Trúc Graph Databases, Mô Hình Pregel/BSP & Phát Hiện Vòng Gian Lận (Fraud Rings)](/uploads/ai-images/cover-graph-data-engineering.png)
[DE Blog #25] Phân Tích Dữ Liệu Đồ Thị Quy Mô Lớn (Graph Data Engineering): Kiến Trúc Graph Databases, Mô Hình Pregel/BSP & Phát Hiện Vòng Gian Lận (Fraud Rings)
Mục tiêu bài viết: Hiểu sâu cơ chế Index-Free Adjacency của Graph Databases, làm chủ mô hình tính toán đồ thị phân tán Pregel / Bulk Synchronous Parallel (BSP) trên Apache Spark, triển khai các thuật toán PageRank, Connected Components, và thiết kế hệ thống phát hiện đường dây gian lận tài chính (Fraud Ring Detection) trong phỏng vấn System Design.
![[DE Blog #24] Data Engineering Trong Ngành Ride-Hailing & Logistics: Không Gian Địa Lý (Geospatial Indexing: H3 vs. S2), Real-Time Geofencing & Dynamic Surge Pricing](/uploads/ai-images/cover-geospatial-data-engineering.png)
[DE Blog #24] Data Engineering Trong Ngành Ride-Hailing & Logistics: Không Gian Địa Lý (Geospatial Indexing: H3 vs. S2), Real-Time Geofencing & Dynamic Surge Pricing
Mục tiêu bài viết: Hiểu sâu bản chất các hệ thống lưới địa lý phân cấp (Discrete Global Grid Systems - Uber H3, Google S2, Geohash), kỹ thuật tìm kiếm lân cận siêu tốc (K-Ring Spatial Lookup), kiến trúc tính giá cước động thời gian thực (Dynamic Surge Pricing) và phương pháp xử lý dữ liệu GPS quy mô hàng trăm nghìn pings/giây trong phỏng vấn System Design.
![[DE Blog #23] Data Engineering Trong Ngành FinTech & Banking: Kiến Trúc Sổ Cái Kép (Double-Entry Ledger), Đối Soát 3 Bên & Tính Toàn Vẹn Tài Chính Tuyệt Đối](/uploads/ai-images/cover-data-engineering-fintech-ledger.png)
[DE Blog #23] Data Engineering Trong Ngành FinTech & Banking: Kiến Trúc Sổ Cái Kép (Double-Entry Ledger), Đối Soát 3 Bên & Tính Toàn Vẹn Tài Chính Tuyệt Đối
Mục tiêu bài viết: Làm chủ nguyên tắc thiết kế sổ cái kế toán kép (Double-Entry Ledger) chuẩn ngân hàng, hiểu sâu kiến trúc Event-Sourced Ledger bất biến, xây dựng hệ thống đối soát tài chính 3 bên tự động (Automated 3-Way Reconciliation) và tự tin giải quyết các bài toán phỏng vấn kiến trúc FinTech/Banking cấp cao.
![[DE Blog #22] Thiết Kế Nền Tảng IoT Data Platform & Time-Series Analytics: Thuật Toán Nén Gorilla, Downsampling & Lưu Trữ Đa Tầng (Tiered Storage)](/uploads/ai-images/cover-iot-time-series-data-platform.png)
[DE Blog #22] Thiết Kế Nền Tảng IoT Data Platform & Time-Series Analytics: Thuật Toán Nén Gorilla, Downsampling & Lưu Trữ Đa Tầng (Tiered Storage)
Mục tiêu bài viết: Làm chủ kiến trúc thu thập và phân tích dữ liệu chuỗi thời gian (Time-Series Data) từ hàng triệu thiết bị IoT / Xe thông minh / Hạ tầng máy chủ, hiểu sâu thuật toán nén đỉnh cao Gorilla (Delta-of-Delta & XOR), kỹ thuật giảm tần suất mẫu (Downsampling) và cách giải quyết bài toán Out-of-order Data trong phỏng vấn System Design.
![[DE Blog #21] Thiết Kế Hệ Thống Ad-Tech & Real-Time Bidding (RTB) Ở Quy Mô Hàng Triệu QPS: Xử Lý Siêu Độ Trễ & Attribution Modeling](/uploads/ai-images/cover-thiet-ke-adtech-rtb.png)
[DE Blog #21] Thiết Kế Hệ Thống Ad-Tech & Real-Time Bidding (RTB) Ở Quy Mô Hàng Triệu QPS: Xử Lý Siêu Độ Trễ & Attribution Modeling
Mục tiêu bài viết: Làm chủ kiến trúc xử lý dữ liệu quảng cáo trực tuyến với lưu lượng hàng triệu truy vấn mỗi giây ($1,000,000+\text{ QPS}$), kỹ thuật Stream-Stream Joins qua nhiều tầng lưu trữ (Two-Tier State Storage), thuật toán quy kết chuyển đổi đa điểm chạm (Multi-Touch Attribution) và giải pháp thiết kế hệ thống Ad-Tech trong phỏng vấn Staff/Lead Data Engineer.
![[DE Blog #20] Cẩm Nang Phỏng Vấn Data Engineer Toàn Diện (Capstone Cheat Sheet): 50 Điểm Chốt Kiến Thức & Chiến Lược Chinh Phục Vòng Phỏng Vấn Big Tech](/uploads/ai-images/cover-phong-van-data-engineer.png)
[DE Blog #20] Cẩm Nang Phỏng Vấn Data Engineer Toàn Diện (Capstone Cheat Sheet): 50 Điểm Chốt Kiến Thức & Chiến Lược Chinh Phục Vòng Phỏng Vấn Big Tech
Mục tiêu bài viết: Tổng hợp và hệ thống hóa toàn bộ các chủ đề cốt lõi của chuỗi 19 bài học trước thành một bản tra cứu nhanh (Quick-Reference Cheat Sheet), ma trận các bài toán đánh đổi kiến trúc (Trade-offs) và bộ câu hỏi phỏng vấn trọng tâm nhất giúp bạn tự tin chinh phục mọi vòng thi tuyển Data Engineer từ Mid đến Senior/Lead.
![[DE Blog #19] Data Reliability Engineering: Thiết Lập SLA/SLO/SLI, Xử Lý Khủng Hoảng Sự Cố Pipeline & Văn Hóa Blameless Post-Mortem](/uploads/ai-images/cover-data-reliability-engineering.png)
[DE Blog #19] Data Reliability Engineering: Thiết Lập SLA/SLO/SLI, Xử Lý Khủng Hoảng Sự Cố Pipeline & Văn Hóa Blameless Post-Mortem
Mục tiêu bài viết: Làm chủ phương pháp thiết lập bộ ba chỉ số SLI/SLO/SLA cho nền tảng dữ liệu, nắm vững quy trình xử lý khủng hoảng sự cố dữ liệu (Data Incident Response), kỹ thuật Backfill an toàn trên hệ thống Production đang chạy và cách trả lời xuất sắc câu hỏi tình huống phỏng vấn "Xử lý sự cố thực tế" theo mô hình STAR.
![[DE Blog #18] Kỹ Thuật Reverse ETL & Operational Analytics: Đưa Dữ Liệu Từ Data Warehouse Trở Lại Ứng Dụng Vận Hành (Data Activation)](/uploads/ai-images/cover-reverse-etl-data-activation.png)
[DE Blog #18] Kỹ Thuật Reverse ETL & Operational Analytics: Đưa Dữ Liệu Từ Data Warehouse Trở Lại Ứng Dụng Vận Hành (Data Activation)
Mục tiêu bài viết: Hiểu rõ khái niệm Operational Analytics, bản chất kỹ thuật của Reverse ETL, cơ chế phát hiện thay đổi (Diff/Incremental Sync), kỹ thuật kiểm soát tốc độ gọi API bên thứ ba (Rate Limiting, Exponential Backoff with Jitter) và cách thiết kế pipeline Data Activation chuẩn doanh nghiệp trong phỏng vấn System Design.
![[DE Blog #17] Chiến Lược Di Chuyển Dữ Liệu Không Gián Đoạn (Zero-Downtime Data Migration): Dual-Write vs. CDC & Hệ Thống Đối Soát Dữ Liệu (Data Reconciliation)](/uploads/ai-images/cover-zero-downtime-data-migration.png)
[DE Blog #17] Chiến Lược Di Chuyển Dữ Liệu Không Gián Đoạn (Zero-Downtime Data Migration): Dual-Write vs. CDC & Hệ Thống Đối Soát Dữ Liệu (Data Reconciliation)
Mục tiêu bài viết: Làm chủ quy trình 5 bước di chuyển cơ sở dữ liệu/kho dữ liệu quy mô hàng chục Terabyte với thời gian gián đoạn bằng 0 (Zero Downtime), phân tích sâu sắc vì sao Dual-Write là Anti-Pattern so với CDC Replication, thiết kế Data Reconciliation Engine để kiểm tra tính toàn vẹn 100% và cơ chế Rollback an toàn trong phỏng vấn Senior Data Engineer.
![[DE Blog #16] Data Engineering Cho Kỷ Nguyên GenAI: Xây Dựng RAG Pipeline Quy Mô Lớn & Giải Mã Vector Databases (HNSW vs. IVFFlat)](/uploads/ai-images/cover-data-engineering-genai-rag.png)
[DE Blog #16] Data Engineering Cho Kỷ Nguyên GenAI: Xây Dựng RAG Pipeline Quy Mô Lớn & Giải Mã Vector Databases (HNSW vs. IVFFlat)
Mục tiêu bài viết: Hiểu rõ vai trò của Data Engineer trong việc xây dựng luồng dữ liệu cho hệ thống GenAI / RAG (Retrieval-Augmented Generation), nắm vững các thuật toán lập chỉ mục Vector (HNSW, IVFFlat, Product Quantization), cơ chế Hybrid Search (Dense + Sparse BM25) và cách xử lý đồng bộ hóa hàng triệu Vector Embeddings từ Data Lakehouse.
![[DE Blog #15] Giải Mã Công Cụ Truy Vấn Phân Tán: Kiến Trúc MPP, Trino (Presto) vs. ClickHouse & Kỹ Thuật Query Federation](/uploads/ai-images/cover-truy-van-phan-tan-mpp.png)
[DE Blog #15] Giải Mã Công Cụ Truy Vấn Phân Tán: Kiến Trúc MPP, Trino (Presto) vs. ClickHouse & Kỹ Thuật Query Federation
Mục tiêu bài viết: Hiểu sâu kiến trúc Massively Parallel Processing (MPP), cơ chế thực thi Vectorized Execution & SIMD, kỹ thuật Query Federation (truy vấn đa nguồn dữ liệu không cần di chuyển data) trên Trino/Presto, so sánh toàn diện với ClickHouse/Spark và tự tin trả lời các câu hỏi phỏng vấn kiến trúc Distributed SQL.
![[DE Blog #14] Thiết Kế Hệ Thống Clickstream Analytics & User Behavior Tracking Ở Quy Mô Petabyte](/uploads/ai-images/cover-thiet-ke-clickstream-analytics.png)
[DE Blog #14] Thiết Kế Hệ Thống Clickstream Analytics & User Behavior Tracking Ở Quy Mô Petabyte
Mục tiêu bài viết: Làm chủ kiến trúc thu thập và xử lý nhật ký hành vi người dùng (Clickstream) ở quy mô hàng tỷ sự kiện/ngày, kỹ thuật phân chia phiên (Sessionization), thuật toán đếm xấp xỉ HyperLogLog (HLL) và kỹ thuật hợp nhất danh tính (Identity Stitching) trong phỏng vấn Data System Design.
![[DE Blog #13] Bảo Mật & Quyền Riêng Tư Dữ Liệu: Triển Khai GDPR/CCPA, PII Anonymization & Xử Lý "Quyền Được Quên" Trong Data Lakehouse](/uploads/ai-images/cover-bao-mat-quyen-rieng-tu.png)
[DE Blog #13] Bảo Mật & Quyền Riêng Tư Dữ Liệu: Triển Khai GDPR/CCPA, PII Anonymization & Xử Lý "Quyền Được Quên" Trong Data Lakehouse
Mục tiêu bài viết: Nắm vững các tiêu chuẩn tuân thủ dữ liệu toàn cầu (GDPR, CCPA, Nghị định 13/2023/NĐ-CP), các kỹ thuật che giấu và mã hóa dữ liệu nhạy cảm (PII Masking, Tokenization, Crypto-Shredding), cách thiết lập Row-Level Security / Column Masking trên Cloud DWH và phương pháp xử lý yêu cầu xóa người dùng trên Data Lake bất biến.
![[DE Blog #12] Cuộc Cách Mạng Kiến Trúc Data Mesh & Data Contracts: Từ Hệ Thống Dữ Liệu Đơn Khối Đến Mô Hình Phân Tán](/uploads/ai-images/cover-data-mesh-data-contracts.png)
[DE Blog #12] Cuộc Cách Mạng Kiến Trúc Data Mesh & Data Contracts: Từ Hệ Thống Dữ Liệu Đơn Khối Đến Mô Hình Phân Tán
Mục tiêu bài viết: Hiểu sâu 4 trụ cột triết lý của Data Mesh (Zhamak Dehghani), cơ chế hoạt động của Data Contracts nhằm chấm dứt tình trạng gãy pipeline do thay đổi schema đột ngột, phân biệt ranh giới giữa Data Platform Team và Domain Teams, và tự tin trả lời các câu hỏi phỏng vấn kiến trúc tổ chức dữ liệu cấp cao.
![[DE Blog #11] Thiết Kế Hệ Thống Phát Hiện Gian Lận Thời Gian Thực (Real-Time Fraud Detection) Với Apache Flink, Stateful Streaming & Feature Store](/uploads/ai-images/cover-real-time-fraud-detection.png)
[DE Blog #11] Thiết Kế Hệ Thống Phát Hiện Gian Lận Thời Gian Thực (Real-Time Fraud Detection) Với Apache Flink, Stateful Streaming & Feature Store
Mục tiêu bài viết: Hiểu sâu kiến trúc xử lý dòng có trạng thái (Stateful Stream Processing) với Apache Flink, cơ chế Checkpointing / Chandy-Lamport thuật toán, vai trò của Feature Store (Online vs. Offline) trong kiến trúc Data/ML và tự tin thiết kế hệ thống Real-Time Fraud Detection
![[DE Blog #10] Quản Trị & Giám Sát Nền Tảng Dữ Liệu: Data Observability, Data Lineage & Chiến Lược FinOps Tối Ưu Chi Phí Cloud](/uploads/ai-images/cover-quan-tri-giam-sat-nen-tang-du-lieu-data-observability-data-lineage-chien-luoc-finops-toi-uu-chi-phi-cloud.png)
[DE Blog #10] Quản Trị & Giám Sát Nền Tảng Dữ Liệu: Data Observability, Data Lineage & Chiến Lược FinOps Tối Ưu Chi Phí Cloud
Mục tiêu bài viết: Làm chủ 5 trụ cột của Data Observability để triệt tiêu Data Downtime, hiểu sâu kiến trúc Data Lineage & Data Governance, nắm vững các chiến lược cắt giảm 30%+ chi phí Cloud Data Warehouse (FinOps) và tự tin trả lời các câu hỏi phỏng vấn cấp độ Senior/Lead.
![[DE Blog #09] Chinh Phục Phỏng Vấn Data System Design: Khung Phương Pháp 4 Bước & Kiến Trúc Lambda vs. Kappa](/uploads/ai-images/cover-chinh-phuc-phong-van-data-system-design.png)
[DE Blog #09] Chinh Phục Phỏng Vấn Data System Design: Khung Phương Pháp 4 Bước & Kiến Trúc Lambda vs. Kappa
Mục tiêu bài viết: Làm chủ khung tư duy 4 bước tiêu chuẩn để giải quyết mọi bài toán Data System Design trong các buổi phỏng vấn cấp cao (Senior/Lead), so sánh bản chất kiến trúc Lambda vs. Kappa và thực hành thiết kế trọn vẹn hệ thống Real-Time Metrics Aggregator.
![[DE Blog #08] Kiến Trúc Data Lakehouse & Cuộc Chiến Table Formats: Delta Lake vs. Apache Iceberg vs. Apache Hudi](/uploads/ai-images/cover-kien-truc-data-lakehouse.png)
[DE Blog #08] Kiến Trúc Data Lakehouse & Cuộc Chiến Table Formats: Delta Lake vs. Apache Iceberg vs. Apache Hudi
Mục tiêu bài viết: Hiểu rõ sự tiến hóa từ Data Warehouse/Data Lake sang Data Lakehouse, cơ chế cung cấp ACID Transactions trên Object Storage (S3/GCS), so sánh chi tiết Copy-on-Write vs. Merge-on-Read, phân tích ưu nhược điểm của 3 Table Formats hàng đầu (Delta Lake, Iceberg, Hudi) và trả lời xuất sắc các câu hỏi phỏng vấn kiến trúc dữ liệu.
![[DE Blog #07] Làm Chủ Xử Lý Dữ Liệu Thời Gian Thực: Kiến Trúc Apache Kafka, Consumer Groups & Exactly-Once Semantics (EOS)](/uploads/ai-images/cover-xu-ly-du-lieu-thoi-gian-thuc-kien-truc-apache-kafka.png)
[DE Blog #07] Làm Chủ Xử Lý Dữ Liệu Thời Gian Thực: Kiến Trúc Apache Kafka, Consumer Groups & Exactly-Once Semantics (EOS)
Mục tiêu bài viết: Hiểu sâu kiến trúc phân tán của Apache Kafka (Brokers, Topics, Partitions, KRaft), các kỹ thuật giúp Kafka đạt tốc độ hàng triệu msg/s (Zero-Copy, Page Cache), cơ chế hoạt động của Consumer Groups và kỹ thuật xử lý Exactly-Once Semantics (EOS) trong phỏng vấn System Design.
![[DE Blog #06] Làm Chủ Xử Lý Dữ Liệu Phân Tán Với Apache Spark: Kiến Trúc, Shuffling & Tối Ưu Hiệu Năng PySpark](/uploads/ai-images/cover-xu-ly-du-lieu-phan-tan-voi-apache-spark.png)
[DE Blog #06] Làm Chủ Xử Lý Dữ Liệu Phân Tán Với Apache Spark: Kiến Trúc, Shuffling & Tối Ưu Hiệu Năng PySpark
Mục tiêu bài viết: Hiểu tường tận kiến trúc phân tán của Apache Spark (Driver, Executors, Catalyst Optimizer), bản chất của Lazy Evaluation, cơ chế Shuffling, kỹ thuật Broadcast Join và cách xử lý triệt để hiện tượng Data Skew trong các buổi phỏng vấn kỹ thuật chuyên sâu.
![[DE Blog #05] Làm Chủ Workflow Orchestration: Kiến Trúc Apache Airflow, DAG Design & Nghệ Thuật Biến Đổi Dữ Liệu Với dbt](/uploads/ai-images/cover-workflow-orchestration-kien-truc-apache-airflow-dag.png)
[DE Blog #05] Làm Chủ Workflow Orchestration: Kiến Trúc Apache Airflow, DAG Design & Nghệ Thuật Biến Đổi Dữ Liệu Với dbt
Mục tiêu bài viết: Hiểu sâu kiến trúc nội bộ của Apache Airflow (Scheduler, Executors, Workers), các khái niệm cốt tử (`logical_date`, `catchup`, `backfill`, `XCom`), cách kết hợp Airflow với dbt để xây dựng data pipeline tự động hóa chuẩn doanh nghiệp và tự tin trả lời phỏng vấn.
![[DE Blog #04] Kiến Trúc Data Pipeline: Cuộc Cách Mạng ETL vs. ELT, Change Data Capture (CDC) & Nguyên Tắc Idempotency](/uploads/ai-images/cover-kien-truc-data-pipeline.png)
[DE Blog #04] Kiến Trúc Data Pipeline: Cuộc Cách Mạng ETL vs. ELT, Change Data Capture (CDC) & Nguyên Tắc Idempotency
Mục tiêu bài viết: Nắm vững sự chuyển dịch kiến trúc từ ETL sang ELT, cơ chế hoạt động của Change Data Capture (CDC) từ database nguồn, kỹ thuật thiết kế pipeline có tính Idempotent (chạy lại an toàn) và cách ghi điểm tuyệt đối trong các buổi phỏng vấn System Design Data Pipeline.
![[DE Blog #03] Giải Mã Định Dạng Tệp Big Data (Parquet, Avro, ORC) & Bản Chất NoSQL / Định Lý CAP](/uploads/ai-images/cover-big-data.png)
[DE Blog #03] Giải Mã Định Dạng Tệp Big Data (Parquet, Avro, ORC) & Bản Chất NoSQL / Định Lý CAP
Mục tiêu bài viết: Nắm vững cấu trúc và cơ chế tối ưu của các định dạng file lưu trữ Big Data (Columnar vs. Row-based), phân loại hệ quản trị NoSQL, hiểu sâu Định lý CAP/PACELC trong hệ thống phân tán và tự tin trả lời các câu hỏi phỏng vấn liên quan.
![[DE Blog #02] Làm Chủ SQL Nâng Cao & Nghệ Thuật Tối Ưu Hóa Truy Vấn Cho Data Engineer](/uploads/ai-images/cover-sql-nang-cao.png)
[DE Blog #02] Làm Chủ SQL Nâng Cao & Nghệ Thuật Tối Ưu Hóa Truy Vấn Cho Data Engineer
Mục tiêu bài viết: Nắm vững các hàm Window Functions nâng cao, cơ chế hoạt động của Index & Kế hoạch thực thi (Execution Plan), tư duy viết truy vấn Sargable và cách xử lý các bài toán SQL phỏng vấn kinh điển.
![[DE Blog #01] Nền Tảng Kiến Trúc Dữ Liệu: Phân Biệt OLTP vs. OLAP & Nghệ Thuật Data Modeling Cho Data Engineer](/uploads/ai-images/cover-oltp-olap.png)
[DE Blog #01] Nền Tảng Kiến Trúc Dữ Liệu: Phân Biệt OLTP vs. OLAP & Nghệ Thuật Data Modeling Cho Data Engineer
Mục tiêu bài viết: Nắm vững sự khác biệt căn bản giữa hệ thống vận hành (OLTP) và hệ thống phân tích (OLAP), phương pháp Dimensional Modeling (Star Schema vs. Snowflake Schema), kỹ thuật quản lý SCD và cách trả lời trọn vẹn các câu hỏi phỏng vấn Data Engineer liên quan.