仕事内容
LayerXのバクラク事業は、バックオフィス業務を完全自動化するAIエージェントサービスを展開しており、導入企業やデータ量の増加に伴いデータストア層の課題が複雑化しています。本ポジションでは、SREチームの一員として、バクラクの複数プロダクトを支えるプラットフォームインフラの設計・構築・運用、特にデータストアの信頼性・性能・安全性の向上をリードいただきます。アプリケーションコードまで踏み込んだボトルネックの特定・改善や、データベース構成・運用の標準化、自動化を通じて、開発者体験の向上と事業成長に貢献します。
業務内容
- SREチームの一員として、バクラクの複数プロダクトを支えるプラットフォームインフラの設計・構築・運用に取り組む
- データストアの信頼性・性能・安全性を重点テーマとして、各プロダクト開発チームと協働しながら、課題の発見から設計・実装・運用までをリードする
- 複数プロダクトの基盤となるプラットフォームインフラやCI/CD基盤、新規プロダクト用インフラの設計・構築・運用
- LangfuseやTemporalなど、AIエージェントの実行・評価・オブザーバビリティを支える基盤の設計・運用・信頼性向上
- 月末月初のピークトラフィックや大規模テナントを見据えた負荷試験、キャパシティプランニング、性能限界の早期検知
- 障害を予防し、発生時の影響を最小化するための監視・オブザーバビリティ基盤、SLI/SLO、アラートの設計・改善
- MySQL / Amazon Aurora MySQLやPostgreSQLを中心としたデータストアの信頼性・可用性・性能・スケーラビリティ向上
- スロークエリ、実行計画、ロック、レプリケーション、コネクションなどの分析と、アプリケーションコードまで踏み込んだボトルネックの特定・改善
- 安全なスキーマ変更、データ変更、バージョンアップ、バックアップ/リストア、フェイルオーバーの設計・自動化
- データベース構成や運用の標準化、ガードレール、共通ライブラリ、開発者向けツールの開発
- IaCを前提としたインフラ構築・運用の自動化・効率化、Policy as Codeなどを活用した安全な運用の仕組みづくり
- 開発環境や自動テスト環境の改善、設計レビュー、技術相談、ペアデバッグ、ナレッジ共有
- お客様の重要なデータを守るための、開発環境を含むインフラ全体のセキュリティ設計と実践
- 障害対応やポストモーテムを通じた再発防止策の設計・実装
- テックブログの執筆、カンファレンスやイベントでの登壇・寄稿
ポジションの魅力
- 導入企業・利用者・データ量の増加やAIエージェント機能の拡大により、性能・可用性・運用の課題が継続的に生まれ、改善の成果を実感できる
- インフラやDB設定だけでなく、プロダクションコードやSQL、データモデル、ユーザー体験まで見ながら、本質的なボトルネックを解決できる
- 目の前の障害やクエリを直すだけでなく、標準化、自動化、共通基盤、ガードレールを通じて、複数のプロダクトと開発チームへ成果を広げられる
- DBREとしての専任ロールを整えていく段階であり、取り組むべき課題、責任範囲、技術戦略そのものを形づくれる
- OLTPからデータ基盤まで越境し、プロダクションDBと分析基盤の境界にある複数領域の知識を活かしてシステム全体の信頼性を高められる
- 財務・労務などの重要なデータを安全に扱いながら、開発者が過度な手作業や不安を抱えずに開発・運用できる環境を実現できる
入社後に取り組んでいただきたいテーマ例
- データベースの主要な信頼性・性能リスクの可視化と、優先度をつけた改善ロードマップの策定
- スロークエリ検知から原因分析、修正、検証までの改善サイクルの高速化・自動化
- 安全なスキーマ変更やバージョンアップを、各開発チームが自律的に実施できるガードレールの整備
- 月末月初や大規模テナントの負荷特性を踏まえた、継続的な負荷試験とキャパシティ管理
- データベース障害に関するランブック、設計原則、レビュー基準の整備と横展開
- LangfuseやTemporalなどを含むAIエージェント基盤のSLI/SLO、オブザーバビリティ、障害対応・運用設計の整備
- データエンジニアと協働した、MySQLからSnowflakeまでのデータフローにおけるSLO、データ鮮度、欠損・重複、スキーマ変更影響の可視化
- OLTP側とデータ基盤側の責任分界、障害時の連携方法、設計レビューのチェックポイントの整備
求めるスキル・経験
必須
SREもしくはDevOpsエンジニアとしての経験3年以上 DevOps経験SRE/信頼性エンジニアリング経験
大規模サービスの設計・構築・運用経験 大規模システム設計・運用経験
MySQL / Amazon Aurora MySQL、PostgreSQL、Elasticsearch / OpenSearchなどのミドルウェアにおける、パフォーマンスチューニングや高可用性構成の設計・運用経験 ElasticsearchMySQLOpenSearchPostgreSQL
クエリ、インデックス、実行計画、ロック、トランザクションなどを理解し、性能問題や障害の原因を特定・改善した経験
データストアを含むWebサービスのインフラアーキテクチャを主体的に設計した経験
Conftestなどを利用したPolicy as Codeの実践経験
AWSなどのパブリッククラウドを利用したWebアプリケーションインフラの開発・運用経験 AWSインフラ設計・運用経験
Terraformなどを利用したIaCによるインフラの開発・運用経験 Terraform
Prometheusなどのモニタリングツール、またはDatadogなどのSaaSを利用した監視体制の設計・開発・運用経験 DatadogPrometheus
歓迎
安全なスキーマ変更、データ移行、バージョンアップ、バックアップ/リストア、フェイルオーバーの設計・実施経験
SLI/SLO・SLAの設計・運用経験 SRE/信頼性エンジニアリング経験
AWS、GCP、Azureのうち複数のクラウドを利用した経験 AWSMicrosoft AzureGCP
Webアプリケーションのフロントエンドまたはバックエンドの開発・運用経験
サーバーレスアプリケーションやインフラの開発・運用経験 サーバーレスアーキテクチャ
Langfuse、Temporalなど、AIエージェントやワークフローの実行・評価・監視を支える基盤の開発・運用経験
SnowflakeやCDCなど、プロダクションDBとデータ基盤をつなぐ仕組みの開発・運用経験 データパイプライン運用経験Snowflake
顧客環境を含むサービスに関わる課題を特定し、関係者を巻き込みながら解決に取り組んだ経験
関連スキル
必須
募集要項
- 職種
- SRE
- 雇用形態
- 正社員
- 想定年収
- 記載なし
- 勤務地
- 東京都 中央区 築地1-13-1 銀座松竹スクエア 5階
- 働き方
- リモート中心
- 必要経験
- 3年以上
- 勤務時間
- スーパーフレックス(コアタイムなし)
- 出社・リモート
- オフィス出社頻度はチームの状況により変化します。個別配慮が必要な場合は遠慮なくご相談ください
- 休日休暇
- 完全週休2日制 / 祝日休み
- 試用期間
- 3ヶ月
福利厚生・制度
選考プロセス
- カジュアル面談 (場合により)
- 書類選考
- 一次選考
- 技術課題
- 技術面接
- トライアル入社(1day)
- 最終選考
- 内定・オファー面談
選考意思を確認後、1~3回程度の面接を経て最終面接を実施します。プロセス中に、複数のメンバーにお会いいただくことがあります。原則、オンラインで実施します。ご希望に応じてオフィス見学等オフラインのコミュニケーションを実施します。選考期間は概ね2~5週間程度です。候補者様のご状況によって、最短2日にまとめて実施するなど、希望に沿ったアレンジをすることがあります。リファレンスチェックを最終フェーズにて依頼いたします。2名お願いできる方を準備進めていただけますと幸いです。