AI Infrastructure & Reliability Engineer(Staff / Lead)
The engineer who makes a small, senior team run faster, steadier, and leaner. 讓整個工程組織跑得更快、更穩、更省的那個人。
關於這個角色
Mlytics 正從 multi-CDN 基礎設施公司,轉型為 AI Decision Intelligence 公司。我們的產品線包括 AI 問答分發系統(Cortex)與智慧調度平台,工程團隊小而資深,用 AI 放大每個人的產出。
這不是傳統的 Platform 職位。 我們不自建內部開發者平台、不設上線審批關卡。你的角色是放大器:建立可靠度機制、掌管 AI 成本、打造讓團隊敢動 legacy 的工程骨架。你定的機制會直接成為全公司的工程標準——而你做的成本優化,會直接出現在公司的損益表上。
你會做什麼
- 設計可靠度標準與 on-call 機制:定義全線上服務(AI 產品與 CDN 調度平台)的可靠度標準與升級機制,讓各團隊能自主運維、你是機制擁有者與最後防線
- 建立 AI 成本治理(FinOps):依 model、tenant、feature 拆解 AI/infra 成本,建立歸因模型與預算可見度,主導跨團隊降本——這條直接影響毛利
- 決定平台架構方向:判斷 adopt vs build 的邊界,優先採用成熟工具與託管服務,讓平台在不擴編的前提下支撐產品成長
- 把 DevEx 制度化:設計共用的部署、觀測、測試骨架(golden path),讓「敢動 legacy」成為團隊常態
- 技術帶領:作為 infra/reliability 領域的技術導師帶方向,把關鍵知識機制化——我們不接受任何系統只活在一個人腦袋裡
- 產品端安全執行:依安全政策與威脅模型,在產品/雲端系統內落地安全控制
我們在找的人
- 8 年以上平台/SRE/雲端工程經驗,曾主導跨團隊的可靠度或平台演進方案
- 設計過 SLO 制度、on-call/升級機制或 golden path 並成功推動採用
- 有 AI/infra 成本治理實務(FinOps、COGS 拆解與降本)
- 熟悉 AWS/GCP、Kubernetes(EKS)生產環境與多雲維運
- 能作為技術導師帶方向;有在難測 legacy 系統中安全演進的實績
加分:LLM 服務維運經驗(推論可靠度、model routing、fallback);Databricks 或大型資料 pipeline 維運;曾在小團隊以自動化取代人力擴編。
你可能不適合,如果你
- 想從零打造一套自己的平台(我們 adopt over build)
- 習慣當上線前的審批關卡(我們要放大器,不要守門員)
- 靠個人記憶與英雄式救火撐系統(我們要機制,不要英雄)
為什麼是現在
- 你的槓桿極大:小而資深的團隊,你定的機制直接成為全公司標準,沒有層層審批
- 成本 = 毛利:你做的 FinOps 不是內部報表,是損益表上看得見的數字
- AI-native 工作方式:我們用 Claude Code 等 AI 工具作為日常開發的一部分,你的產出會被 AI 放大
如何應徵
寄給我們任何能展現你思考方式的東西 — 你設計過的 SLO 制度、推動採用的 golden path、或一段背後有真實數字的降本故事。我們在意的是你做過什麼,不是你用過哪些工具。
📧 [email protected]