Data Team Lead · Data Engineering · GenAI 上生產 · 台北
童曉瑜John Tung · Hsiao-Yu Tung
資料工程出身的 Data Lead
十年資料工程,帶過 Data Team 兩年半;近一年半獨立從零交付一套企業級 Data/AI 平台給集團主管、行銷主管與編輯——使用者全是非工程師。最能發揮的地方:用更少的預算做出同樣的結果(接手的資料管線,月成本從 $300 降到不到 $1);讓 AI 真正上線、而且有品質把關(輸出品質一不達標,系統會自動攔下,不會默默變差);以及把技術講成主管與使用者聽得懂、能據以決策的話。
經歷
旺旺中時媒體集團主任資料工程師(Data Lead)
2026.04 – 現在
- 從零打造集團跨平台資料平台:Facebook/Instagram/Threads/YouTube/GA4 端到端 ingestion,34 個 Cloud Run Jobs 錯峰排程寫入 BigQuery(append-only 保留完整歷史),dbt 建模;以 Cloud Scheduler + Cloud Run Jobs 取代 Composer 控成本,dbt source freshness + 帳號級守門 + Cloud Monitoring 抓「job 成功卻沒寫資料」的靜默失敗。
- 接手營收 pipeline 重寫,月成本 $300 → <$1;並交付三個給非工程師的上線產品:集團數位營收儀表板(C-level)、社群成效儀表板(行銷主管/編輯)、月營收一覽表報紙版面 PDF 產製工具。Google 登入 + 三層 ACL,主管在頁面內自助增刪成員,不必找工程師。
- 生成式 AI 上生產,而且有守門:BigQuery AI.GENERATE(Gemini)做留言情緒與貼文主題分類、只依當期數字的接地式 AI 觀點;Vertex 嵌入 + KMEANS 把負評分群命名;留言 RAG 檢索搭每週 LLM-as-judge 評測,品質跌破門檻即讓 job 失敗。編輯台 4 工具 agent 上線:不寫 SQL、強制自檢、成本上限,每週回放評測。
- 建立團隊的治理與交付方式:資料治理盤點、成本歸屬 label、對 IT/維運方的資料存取需求清單、決策紀錄、新人 onboarding 階梯、跨專案知識庫 dd-knowledge、給主管與新進 DE 的專案簡報;為 AI agent 訂 repo 契約層(禁區、驗收指令、守門),讓人與 agent 在同一套規則下協作。
澄映科技Data Team Lead
2023.05 – 2025.10
- 帶領 4 人 Data Team,負責排程、優先序與交付品質;以 Scrum(每日站會、衝刺規劃、回顧)與 Jira/GitLab 運作,並與產品團隊合作把資料自動化成 Superset 儀表板供決策。
- Airflow 資料爬取 ETL(Scrapy → S3/MongoDB)、定時讀取 ElasticSearch 供 AI 自動評論、Telegram 異常告警;建置 Apache Iceberg + Spark 資料湖(Lakehouse)支援分散式分析,以 Docker/makefile 標準化部署讓成員快速起環境。
安璞資訊資料工程師
2022.11 – 2023.04
- Fluentd 地端 → GCP Cloud Storage ETL 自動化、Airflow 每日資料演算、導入 PySpark 分散式處理,並規劃整體資料架構。
痞客邦 PIXNET高級演算法工程師
2021.09 – 2022.11
- GKE 上的 Fluentd 日誌 ETL → Cloud Storage/BigQuery;Search Console API 每日 900 萬筆採集;熱門議題、店家排序與推薦演算法;SEO(Sitemap、JSON-LD)。
替您錄科技軟體工程師
2019.10 – 2021.09
- Ansible 大量部署 Fluentd(GCE + IDC 地端)自動寫入 BigQuery;AWS Data Pipeline 跨雲 ETL;Data Studio 自動化報表;未登入用戶性別預測與客戶演算法(XGBoost/RandomForest/SVM)。
早期經歷國網中心 軟體工程師 · 臺科大 程式設計講師 · 浚鴻數據 資料分析師
2015.10 – 2019.08
- TWCC AI 平台功能驗測與資料市集(CKAN)自動化;Python 資料分析教學;承接政府部門與企業的多個輿情分析專案(爬蟲 → MongoDB → 文字探勘 → 專案報告)。
技能
資料工程
BigQuery · dbt · Cloud Run Jobs + Scheduler · Airflow · PySpark/Spark · Apache Iceberg · Fluentd · Scrapy/Selenium
雲端
GCP(Cloud Run · Secret Manager · Monitoring · GKE · GCE · GCS)· AWS(Data Pipeline · S3)· Azure · 地端 IDC ↔ 雲混合
AI/GenAI
Gemini via BigQuery AI.GENERATE · Vertex 嵌入 + KMEANS · RAG + LLM-as-judge · agent 守門與成本控制 · XGBoost/LightGBM · 中文 NLP
交付與協作
Streamlit(OIDC + ACL)· Superset/Looker Studio · Mann-Kendall/Sen's slope · Docker · Cloud Build/GitHub Actions · Ansible · Scrum · Jira/GitLab · Python · SQL
學歷
國立臺灣科技大學 資訊管理系
博士候選人(2019 取得候選人資格,後轉職場) 2016 – 2019
博士候選人(2019 取得候選人資格,後轉職場) 2016 – 2019
元智大學 資訊管理學系
碩士 · 論文:汽車網路論壇雜訊過濾及口碑探索 2013 – 2015
碩士 · 論文:汽車網路論壇雜訊過濾及口碑探索 2013 – 2015
開南大學 資訊及電子商務學系
學士 2009 – 2013
學士 2009 – 2013