仕事内容
メルカリのDatabase Reliability Engineer (DBRE)として、国内最大級のフリマアプリ「メルカリ」のデータベースシステムの信頼性、スケーラビリティ、コスト効率を担います。TiDB Cloudを主軸に、AlloyDB、CloudSQL、Spannerなどマルチエンジン環境での運用・改善を推進。大規模なトラフィックとデータ量を扱うミッションクリティカルな環境で、システムの安定稼働と将来的な成長を支えるソフトウェア開発・運用に貢献します。
業務内容
- システムモニタリング、キャパシティプランニングを実施する。
- パフォーマンス、スケーラビリティの改善に取り組む。
- 障害検知、障害対応を行う。
- CloudSQL(MySQL, PostgreSQL) AlloyDB, TiDB, Spanner や各種ミドルウェアの運用/性能チューニングを行う。
- オペレーションの自動化を実現させるためのソフトウェア開発を行う。
- データベースの利用/運用に関するガイダンスの策定を行う。
組織・チームのミッション
- Mercari Engineering Principlesは、メルカリのエンジニアリング組織における信念や行動の基盤となる共通認識を明文化したもの。
- Mercari Engineering Principlesは、メルカリのMission、Value、Cultureをエンジニアリングの視点から補完する。
- これらのPrinciplesは、長期的に実現しようとする理想的な姿を定義し、メルカリのミッション達成に活用される。
- DBREチームは、メルカリのプロダクションデータベースの信頼性、スケーラビリティ、コスト効率を担う。
- 現在のコアプラットフォームはTiDB Cloudで、99.99%の可用性SLAでアイテム、トランザクション、ユーザーデータを処理している。
- 今後12〜18ヶ月で、AlloyDB、CloudSQL (PostgreSQL/MySQL)、Spannerを追加し、マルチエンジンDBREにスコープを拡大する。
- コスト最適化、自動化、プロダクト・プラットフォームチームとの連携強化を推進する。
開発環境
- 主要なデータベースプラットフォームとしてTiDB Cloud、AlloyDB、CloudSQL (PostgreSQL/MySQL)、Spannerを利用しています。
- CDCおよびストリーミングパイプラインにはDebezium、TiCDC、Kafkaを使用しています。
- Infrastructure-as-CodeにはTerraform、Ansibleを、自動化スクリプトにはGoまたはPythonを使用しています。
- データベースのモニタリング、アラート、SLO/SLIダッシュボードにはDatadog、Grafanaを活用しています。
- DockerやKubernetesの利用経験も歓迎されます。
- nginxやmemcachedなどのミドルウェアの運用経験も歓迎されます。
ユニークなチャレンジ
- 数十テラバイトのデータを保有し、数十万QPSを処理する大規模で重要なDatabaseクラスタを運用する。
- Google Cloud SpannerやGoogle Cloud SQLや TiDB Cloudなども大規模に利用しており、マネージドサービスの最適な利用を推進する役割も担う。
- 多様、大規模、ミッションクリティカルな環境下で、安定性を維持し、将来的なサービスの成長にも対応できる環境の提供に取り組む。
- TiDBをメルカリ規模(数十万QPS、マルチTBデータセット)で99.99% SLAで運用する。
- チームの運用スコープをTiDB中心モデルからマルチエンジンポートフォリオ(AlloyDB、CloudSQL、Spanner)に拡大する。
- 約40〜50%のリアクティブな作業(アラート、オンサポートチケット、DDL操作、インシデント対応)とプロジェクトデリバリーのバランスを取る。
- 信頼性を損なうことなく、増大するデータベースコストの最適化を推進する。
- 日常のチーム同期は主に日本語、チーム間のコラボレーションは英語のバイリンガル環境で作業する。
求めるスキル・経験
必須
メルカリグループおよび各カンパニーのミッションとバリューに共感していただける方
データベースの運用経験、最適なパフォーマンスチューニングの経験 パフォーマンス最適化経験
TCP/IP、HTTPなどのネットワークプロトコルについての基礎知識 TCP/IP
システムのパフォーマンスや信頼性を向上させるのに必要なアプリケーション、ミドルウェアへの機能追加、バグ修正を行うためのプログラミング能力
システムの技術的問題(例:パフォーマンス低下)の原因を発見、解決するための能力
SLI/SLO 設計をはじめとしたSREプラクティスの知識 SRE/信頼性エンジニアリング経験
英語:Independent (CEFR - B2) 必須
歓迎
オンプレミス環境の運用経験
Cloud SpannerやAmazon Aurora等のDBaaSの利用経験 Amazon RDSCloud Spanner
DockerやKubernetesの利用経験 DockerKubernetes
マイクロサービスの開発運用経験 マイクロサービスアーキテクチャ
Datadog の高度な利用経験 Datadog
大規模Webサービスの開発、運用経験
分散コンピューティングに関する知識 分散システム
日本語:Basic (CEFR - B2) 歓迎
募集要項
- 職種
- SRE
- 雇用形態
- 正社員
- 想定年収
- 記載なし
- 勤務地
- 東京都 港区 六本木
- 働き方
- 出社
- 必要経験
- 記載なし
- 勤務時間
- スーパーフレックス(コアタイムなし)
選考プロセス
- 書類選考
- 技術課題 (エンジニアポジションではHackerRankまたはGithubでの技術課題を、エンジニア以外のポジションでは採用ポジションによります(面接タイミングと前後することがあります))
- 面接 (ポジションにより、複数回の面接をお願いします)
- リファレンス (オンライン回答形式のもので、最終選考の前後でお願いします)
- オファー (最終選考とリファレンスの内容より決定されます)