仕事内容
DMM.comのSRE部にて、複数の事業・サービスを横断的に支える信頼性・可用性・運用効率の向上に取り組むチームリーダーを募集します。AI Agentの開発を通した運用改善やサービス信頼性の向上、可観測性の設計・運用、運用の標準化・自動化、コスト最適化の推進が主な業務です。運用データや過去の知見をAIに活用させ、SREのあり方をアップデートする挑戦に貢献できるポジションです。
具体的な業務
- DMMが展開する複数の事業・サービスを横断的に支える信頼性・可用性・運用効率の向上に取り組む
- AI Agentの開発を通した運用改善として、運用データを活用した障害対応・判断支援の自動化やLLMを用いた運用ナレッジの整理・検索・活用を行う
- サービス信頼性の向上として、可用性・パフォーマンス・耐障害性を考慮したシステム設計・改善、障害発生時の原因分析および恒久対応を実施
- 可観測性の設計・運用として、メトリクス/ログ/トレースを含む可観測性全体の設計・改善、監視・アラート設計および運用改善、オブザーバビリティツール基盤の構築・運用を行う
- 運用の標準化・自動化として、手作業に依存しない運用フローの設計・実装、Runbookや運用手順の整備・改善を行う
- コスト最適化の推進として、クラウドリソースの利用状況の可視化、コスト削減施策の立案・実装・全社展開を行う
- 事業部・開発チームと協業し、課題整理・改善提案、共通基盤・共通指針の整備による組織全体の信頼性向上に貢献する
所属している事業部のミッションや体制、業務内容について教えてください。
- SRE部はシステムやサービスの可用性、信頼性、パフォーマンス、スケーラビリティを高めることを目的にしている
- DMMではパブリッククラウドの構築や運用もSRE部が担っている
- DMMには多数のサービスがあり、大規模なものから小規模なものまでチーム体制もバラバラである
- 多数のサービスを横断的に一定の品質まで上げるのがSRE部のミッションの一つである
事業概要
- DMMは動画配信、電子書籍、EC、ゲーム、金融など多様な事業を展開する多角化企業である
- 各事業は独立したスピード感で成長する一方、基盤となるインフラと運用の信頼性が全社の価値提供を支えている
- SRE部はDMMの複数事業を横断して支える専門組織として、サービスの可用性・信頼性・パフォーマンス・コスト最適化を担う
- 共通でメリットが出る部分は特定のプロダクトに閉じず、共通基盤・共通指針を整備することで安定した運用を実現
- 可観測性基盤を中心としたデータに基づく運用や、自動化・標準化による運用負荷の低減に継続的に取り組んできた
- 現在は運用データや知見をAIと組み合わせ、障害対応や意思決定をより再現性の高い形へ進化させる挑戦を進めている
- SRE部のミッションは、事業が安心して挑戦できる土台を提供し続けることであり、技術と運用の両面からDMMの事業成長を支える
ポジションの魅力
- 特定のプロダクトに閉じず、横断的な視点でSREに取り組める
- 可観測性・自動化・コスト最適化といったSREの王道領域をしっかり経験できる
- AI活用は「必須スキル」ではなく、現場課題から自然に使うフェーズである
- 仕組みを作って終わりではなく、全社に広げ、定着させるところまで関われる
募集の背景
- サービス規模の拡大に伴い、DMMのSRE部が向き合う運用課題は年々複雑化している
- 障害対応、オンコール、コスト管理、設定変更の影響把握など、「判断が遅れること自体がリスクになる」場面が増加
- これまで標準化・自動化・可観測性の整備で運用を改善してきたが、次のステップとして運用データや過去の知見をAIに活用させるフェーズに進んでいる
- SREの経験を持つエンジニアがAIを理解し、AIを理解したエンジニアがSREの現場を知ることでしか実現できない取り組みである
- 運用の最前線で課題と向き合いながら、SREのあり方そのものをアップデートしていく仲間を募集している
求めるスキル・経験
必須
Webサービスにおける信頼性・可用性を意識した運用経験 SRE/信頼性エンジニアリング経験
障害や性能劣化に対し、事象の切り分けから恒久対応まで主導した経験 インシデント対応
メトリクス/ログ/トレースを用いた状態把握および原因分析の経験
監視・アラートを運用負荷の観点で設計・改善した経験 SRE/信頼性エンジニアリング経験
運用上の判断や対応を再現可能な形で言語化・定着させた経験 ドキュメンテーション
アプリケーションまたは運用ツールの開発経験 Webアプリケーション開発経験
歓迎
SREまたはそれに準ずる立場での業務経験 SRE/信頼性エンジニアリング経験
クラウド環境における設計・運用・変更管理の経験 インフラ設計・運用経験
Infrastructure as Code を用いた構成管理・運用の体系化 Terraform
可観測性基盤の設計・刷新・改善に関わった経験 可観測性
運用データ(ログ・メトリクス等)を入力としたAI Agentの開発経験 機械学習モデル開発経験
分析・要約・判断支援の仕組みを設計・実装した経験 データ分析経験
APIやSDKを用いて、AIを既存システムや運用フローに組み込んだ経験 ML Ops経験
募集要項
- 職種
- SRE
- 雇用形態
- 正社員
- 想定年収
- 800万〜1500万円
- 勤務地
- 東京都 港区
- 出社・リモート
- ハイブリッド / リモート可
- レベル
- リーダー
- 勤務時間
- フレックスタイム制
- 休日休暇
- 完全週休2日制 / 祝日休み
- 給与の詳細
- みなし残業 月45時間
- 試用期間
- 3ヶ月
福利厚生・制度
選考プロセス
- エントリー
- 面接
- カジュアル面談 (場合により)
ご応募から内定まで約3週間前後