SRE条件を変える閉じる
仕事内容SRE
AI検索プラットフォームの信頼性向上を担うSREポジション。GKEやCloud Runを活用したインフラ基盤の設計・運用、SLI/SLOの導入、パフォーマンスチューニング、可観測性の確立、DevEx向上など、信頼性とパフォーマンスの両立をリードする。グローバル展開(10→100のスケール)に耐えうる基盤構築と、SRE文化の立ち上げに携わる。
担当業務内容
- 信頼性向上・スケーラビリティ確保(Reliability & Infrastructure):40%
- コンテナ基盤の高度化: GKE (Kubernetes) / Cloud Run を活用した、高負荷に耐えうるオートスケーリング基盤の構築と運用。
- SLI/SLOの導入・運用: サービスの信頼性を定義し、エラーバジェットに基づいた運用ルールの策定と、開発チームへの信頼性文化(Reliability Culture)の浸透。
- グローバルインフラ設計: 各国のレイテンシ要件を満たすマルチリージョン構成やCDN戦略、ネットワーク設計の最適化。
- パフォーマンス・エンジニアリング・可観測性(Performance & Observability):40%
- 検索基盤の高速化: Elasticsearchやベクトル検索エンジンのインデックス設計、クエリパフォーマンスのボトルネック特定と解消。
- 分散トレーシングの確立: マイクロサービスとAIモデルを横断するリクエストフローを可視化し、障害発生時の原因特定時間を短縮する。
- コスト最適化 (FinOps): クラウドコストやAIリソース(GPU等)の使用状況を監視し、性能を維持しつつのコスト削減を提案・実行する。
- DevEx向上・チームマネジメント(Developer Experience & Management):20%
- Toil(労苦)の削減:手作業によるオペレーションを自動化し、エンジニアが創造的な作業に集中できる時間を創出する。
- CI/CDパイプラインの進化:テスト自動化、カナリアリリース等のデプロイ戦略を実装し、安全かつ高速なリリースサイクルを実現する。
- 技術共有・育成:SREプラクティスの勉強会実施やコードレビューを通じ、開発メンバーのインフラ・運用スキルの底上げを図る。
仕事のやりがい(面白さ)
- 「AI×検索」という高難易度領域への挑戦: 重いAI処理とミリ秒単位のレスポンスが求められる検索エンジンが混在する環境で、「精度 vs 速度」のトレードオフに対し、インフラやミドルウェアのチューニングで解決策を提示する。
- 大規模グローバルサービスへの成長フェーズ: 月間数千万PV規模かつグローバル展開という、トラフィックが急増するフェーズに立ち会え、スケーラビリティの課題が顕在化する前に手を打ち、システムが安定して成長していく様を支える達成感がある。
- SRE文化の立ち上げ: 専任のSREとしては初期メンバーに近い立ち位置となるため、監視体制の構築や障害対応フローの整備など、自らの手で「組織のSRE文化」をゼロから作り上げる経験が積める。
3~5年後の想定されるキャリアパス
- 全社のインフラ戦略やクラウドアーキテクチャを統括する「プラットフォームエンジニアリングリード / CCoeリード」
- AI/MLシステムの運用・パイプライン構築に特化した「MLOpsエンジニア / AIアーキテクト」
- 特定技術(検索エンジン、K8s、DB等)を極め、技術的な最終意思決定を行う「スペシャリスト / プリンシパルエンジニア」
- エンジニアリング組織の生産性やピープルマネジメントを担う「VPoE / エンジニアリングマネージャー」
業務上の課題
- 「10→100」のスケールに耐えうるアーキテクチャへの刷新: グローバル規模の急激なトラフィック増大に対し、オートスケーリングの最適化やDBのシャーディング、キャッシュ戦略の再設計など、抜本的なスケーラビリティ対策が必要。
- 複雑化するシステムの「可観測性」の確立: AIモデル、検索エンジン、APIが複雑に連携しているため、分散トレーシングやログ分析を高度化し、異常を予兆段階で検知できるレベルまでオブザーバビリティを高めることが急務。
- 開発スピードと安定性のバランス(Error Budgetの運用): 「変更を止める」のではなく、「安全に失敗し、即座に復旧できる」ガードレールをシステム的に構築し、開発速度を落とさずに信頼性を担保する仕組み作りが必要。
募集要項最終確認 8/5
- 雇用形態
- 正社員
- 想定年収
- 700〜1000万円/年
- 勤務地
- 東京都千代田区
- 働き方
- ハイブリッド勤務
- 年間休日
- 124日
- 職種
- SRE
- 経験年数
- 3年以上
- 掲載日
- 7/3
- 最終確認
- 8/5
応募資格(必須)
- パブリッククラウド(GCPまたはAWS)におけるインフラ設計・構築・運用経験(目安:3年以上)
- コンテナ技術(Docker, Kubernetes)を用いた本番環境の運用経験
- Terraform 等のIaCツールを用いたインフラ構成管理の経験
- Webアプリケーションの開発・運用プロセス(CI/CD、バージョン管理)への深い理解
- スクリプト言語(Python, Go, Bash等)を用いた運用自動化の経験
歓迎する経験
- Elasticsearch / Solr 等の検索エンジンの運用・チューニング経験(特に歓迎)
- SLI/SLOの策定・運用や、トイル削減などのSREプラクティスの実践経験
- 大規模トラフィック(高負荷)環境下でのパフォーマンスチューニング経験
- マイクロサービスアーキテクチャにおける可観測性(Distributed Tracing等)の設計・導入経験
- 機械学習パイプライン(MLOps)に関連するインフラ構築経験
待遇・福利厚生
- 割引券
- 契約保養所
求めるスキル・経験
この求人は株式会社ミスミグループ本社の採用ページの掲載内容をもとに構成しています。応募条件の最新情報は募集元をご確認ください。
東京都のSREの求人163件
東京都のSREの求人をすべて見る(163件)募集元の採用ページから応募できます
応募は株式会社ミスミグループ本社の採用ページで受け付けています。このページは採用ページの掲載内容をもとに構成しているため、最新の応募条件は募集元でご確認ください。
この求人と近い条件で探す数字はリンク先ページの掲載件数
この職種で探す
この勤務地で探す
働き方・年収で探す
- 年収700万以上7,493
- 年収800万以上4,276
- 完全週休2日31,016
- 年間休日120日以上27,659
- フレックス19,708