仕事内容
メルカリのPlatform Infrastructureチームは、KubernetesプラットフォームとInfrastructure-as-Codeをマネージドサービスとして提供し、エンジニアリングチームが安全かつ迅速にプロダクトを開発できるよう基盤を構築・運用しています。本ポジションでは、GKEクラスターのライフサイクル管理、Terraform IaCの進化、開発者向けセルフサービスツールの構築、オートスケーリングとキャパシティプランニングを担当します。大規模な分散システムとKubernetesの深い知識を活かし、開発者体験の向上とインフラの信頼性・セキュリティを推進するシニアエンジニアを募集しています。
Work Responsibilities
- GKEクラスターのライフサイクル(アップグレード、ノードプール戦略、アドオン管理、キャパシティプランニング、インシデント対応)を共同で担当します。
- Terraform IaC(カスタムモジュール、大規模な移行、CI/CDパイプラインの信頼性)を所有し、進化させます。
- プロダクトチームがリポジトリ、PagerDuty、GitHub Actionsワークフロー、デプロイパイプラインをセルフサービスでプロビジョニングできる「キット」を構築・維持します。
- オートスケーリングとキャパシティを大規模に管理します(Cluster Autoscaler / HPA / VPA、コストを意識した適切なサイジング、マルチリージョン戦略)。
- Goで内部開発者プラットフォームコンポーネント(k8sコントローラー、CLI、内部API、AIエージェントスキル)を開発します。
- オンコールローテーションに参加し、根本原因分析と改善を主導します。
- FinOps、Network、Observability、DBRE、Enablementチームと連携し、信頼性、セキュリティ、開発者体験のイニシアチブを推進します。
Unique Challenges
- マルチテナント規模でのKubernetes運用(数百のマイクロサービスをホストするGKEクラスターのノードプール戦略、アップグレード、ワークロード分離)。
- カスタムコントローラー、アドミッションポリシー、アドオンのオーナーシップ(独自のKubernetesコントローラー、アドミッションWebhook、ポリシーレイヤーの設計と運用)。
- マルチリージョンおよびマルチアーキテクチャのロードマップ(マルチリージョン展開と異なるk8sノードタイプの採用を支援)。
- 開発者体験をSLIとして重視(セルフサービスキットの回帰が組織全体の摩擦につながるため、DXを信頼性シグナルとして捉える)。
- クロスチームオーナーシップ(アプリケーションチーム、クラウドプロバイダー、他のインフラチームとの連携、アーキテクチャ、共有プラットフォーム機能、組織のアラインメントに投資)。
求めるスキル・経験
必須
Mercariのミッションとバリューへの共通の信念
Seniorレベルの、本番環境で大規模な分散システムを運用したエンジニアリング経験
Kubernetesの内部構造(スケジューラー、コントローラー、kubelet、アドミッションWebhook、オートスケーラー、ネットワークポリシー、ワークロードID)に関する深い理解と、マネージドKubernetes環境(GKE、EKS、AKS)のプロダクションオーナーシップ(クラスターアップグレード、インシデントデバッグ、アドオン管理)
大規模なTerraform経験(カスタムモジュールの作成、爆発半径を考慮した移行の実行、ダウンストリームのコンシューマーを壊さずに共有IaCのリファクタリング)
強力なシステム設計と分散システムの基礎(一貫性、レプリケーション、キャパシティプランニング、障害モード)
インフラストラクチャドメインのエンドツーエンドのオーナーシップ(設計、構築、オンコール、インシデント後の改善)の実績
ビジネスレベルの英語力
歓迎
Goを用いたk8sコントローラー、CLI、内部APIの構築経験
ネットワーキングの基礎(TCP/IP、Kubernetesネットワーキング、DNS、HTTP/2、mTLS)
CI/CDプラットフォーム(GitHub Actions、Jenkinsなど)の経験
オートスケーリング/キャパシティプランニングの深い知識(HPA/VPA/Cluster Autoscalerの内部構造、コストを意識したオートスケーリング、適切なサイジング)
内部開発者プラットフォーム(セルフサービスツール、ゴールデンパス、CLI/APIの人間工学)の構築経験
マルチリージョンまたはマルチクラスター運用経験
Elasticsearchまたはその他の検索インフラストラクチャの経験
FinOpsの感覚(クラウド支出の要因とインフラの選択がコストにどう影響するかを理解)
募集要項
- 雇用形態
- 正社員
- 想定年収
- 応相談
- 勤務地
- 東京都 港区
- 出社・リモート
- ハイブリッド / リモート可
- レベル
- リーダー
- 勤務時間
- スーパーフレックス(コアタイムなし)
福利厚生・制度
選考プロセス
- Application screening
- Skill assessment (For engineering positions, you will be asked to complete a skill assessment on HackerRank or GitHub. (The timing of the assessment may coincide with the interview process.))
- Interview (The number of interviews may vary depending on the position.)
- Reference check (We will ask for online references around the timing of the final interview.)
- Offer (Offers will be determined carefully in consideration of the final interview and the reference check.)