仕事内容
本ポジションは、社内向け機械学習プラットフォームと社外向けクラウドサービス双方の開発・運用を担う機械学習プラットフォームエンジニアを募集します。大規模機械学習プラットフォームの機能設計・開発、Kubernetesを活用した分散システム構築、計算資源の有効活用に向けたスケジューラ研究開発など、幅広い領域の先端的な課題に取り組みます。オンプレミスとパブリッククラウドのハイブリッド構成で、HPCとクラウドネイティブの境界領域における経験を積むことができます。必須要件としてGoまたはRustでのソフトウェア開発経験と、Webアプリケーション開発・Linuxサーバ運用・パブリッククラウドを用いたシステム開発運用のいずれかの実務経験が求められます。
業務内容の一例
- 自由度・拡張性・使いやすさのトレードオフを見極めた大規模機械学習プラットフォームの機能設計と開発
- 機械学習ワークフローツール、実験管理ツール、GPU や MN-Core 向け統合開発環境の構築
- Kubernetes 機能を使用した分散キャッシュシステムの開発と運用
- 大規模な機械学習ワークロードの実行をサポートするCI基盤やコンテナイメージレジストリキャッシュの開発
- 複数のテナントが使用する Kubernetes クラスタの権限、ネットワーク等の分離設計と導入
- テナントユーザ向けのモニタリングサービスの開発と運用
- クラスタを使いやすくするためのユーザポータル開発、運用管理システムの開発
- 自動化等による運用効率の改善
- 自動サーバプロビジョニング、パブリッククラウド連携による運用効率化、インフラ健全性の自動診断と保守省力化
- 計算資源(GPU、MN-Core を含む) を有効活用する Kubernetes scheduler の研究開発
- 分散学習で用いられる gang スケジューリングの研究開発
- 多種多様なワークロードをより効率的にクラスタにパッキングをするための研究開発
- マルチテナントにおける公平なスケジューリングのための設計、開発
チームでの働き方
- 関西在住のメンバもおりリモートワークが主体
- オフィスに出社して勤務している方もいる
事業・プロダクト
- PFNのさまざまな研究開発や事業は機械学習やシミュレーションを中心とした膨大な計算量とデータによって支えられている
- 計算基盤は設計から運用までを基本的に自社で行っており、PFNの価値と競争力の源泉となっている
- 先進的なデータセンタ設備、ハードウェア、ソフトウェアの研究開発を実施し、効率のよい大規模な計算基盤とそれを利用するためのサービスを構築・運用している
- 機械学習プラットフォームチームでは研究開発を加速させるため、Kubernetes をはじめとするクラウドネイティブ技術を活用して大規模な機械学習プラットフォームの開発運用に挑戦している
- PFNは社外のお客様向けにクラウドサービスとして PFN 独自の AI プロセッサーである MN-Core シリーズの提供を開始している
- 本ポジションでは社内向けのプラットフォームに加えて、MN-Core シリーズを社外向けのクラウドサービスとして提供するためのプラットフォームの開発・運用にも取り組む
- 社外向けのプラットフォームは社内向けと比較してより厳密なテナント間の分離や高いセキュリティが求められるため、社内向けとは異なる設計の新しいプラットフォームとして開発運用している
本ポジションの魅力
- オンプレミスの大規模な機械学習クラスタで高レイヤから低レイヤまですべてをコントロールする経験ができる
- オンプレミスとパブリッククラウドのハイブリッドな構成でどちらの経験もできる
- HPC(高性能計算) とクラウドネイティブの境界領域というますます重要になる分野の経験ができる
- 外販のクラウドサービスとして Kubernetes ネイティブな機械学習プラットフォームの開発運用を経験できる
- Kubernetes を始めとする OSS コミュニティへの貢献、ミートアップでの登壇が推奨されている
求める人材像
- 様々な分野への関心、新たな技術領域の知見獲得の意欲のある方
- チームを支える圧倒的な強みを持っている方、もしくは、チームを越えた幅広い経験を持っている方
- 同職種・他職種に関わらずリスペクトして一緒に楽しく働ける方
- 強みを活かして、チームメンバと助け合える方
- 誰の持ち物かに関わらず自分事として捉え課題解決を推進できる方
- 様々な専門性を持つ人がいる環境で新しいことを吸収し、楽しめる方
求めるスキル・経験
必須
歓迎
コンピュータ サイエンスまたは関連する技術分野における学位、または関連分野における2年以上の実務経験
クラウドネイティブなアプリケーション・インフラストラクチャ (特に Kubernetes) の実務経験 Kubernetes
大規模な Linux サーバ群の監視・運用技術・自動化・運用省力化技術
大規模計算機システムのパフォーマンス・チューニング技術 パフォーマンス最適化経験
一定規模の商用サービスにおいて、複数のエンジニアを率いてプロダクトの全体設計・開発・オペレーション構築をリードした経験
分散システムに関する知識と経験 分散システム
機械学習・深層学習の基礎知識
OSSへのコントリビューション経験 OSSコントリビューション
複数の関係チームと適切にコミュニケーションを取りプロジェクトをリードできる能力
カンファレンスやミートアップでの登壇経験
募集要項
- 職種
- MLOpsエンジニア
- 雇用形態
- 正社員
- 想定年収
- 応相談
- 勤務地
- 東京都 千代田区
- 出社・リモート
- リモート中心 / リモート可
- 必要経験
- 2年以上
- レベル
- メンバー
- 勤務時間
- 裁量労働制 / 実働8時間
- 休日休暇
- 完全週休2日制 / 祝日休み
- 試用期間
- 3ヶ月