仕事内容
Preferred Networksの機械学習プラットフォームにおいて、Kubernetesクラスタのネットワーク設計、開発、運用を担うエンジニアを募集します。LLM等の大規模機械学習を効率的に行うため、コンテナネットワークからデータセンターネットワークまで幅広い領域の課題に取り組みます。オンプレミスとパブリッククラウドのハイブリッド環境で、GPUや自社開発のMN-Coreが混在する先進的なプラットフォームの構築・運用に携わります。
Job Description / 職務内容
- Preferred Networksの機械学習プラットフォームで用いられるKubernetesクラスタのネットワーク設計、開発、運用を担当します。
- LLM等の大規模機械学習には複数のサーバにまたがる多数のアクセラレータの協調動作が必要であり、ネットワークは重要な分野です。
- 大規模機械学習を効率的に行えるプラットフォーム実現のため、コンテナネットワークやデータセンターネットワークの課題に取り組みます。
- RDMA対応Kubernetesクラスタを構成するためのコンテナネットワークの設計と開発を行います。
- マルチテナント対応に必要なネットワークのアイソレーション方式調査、設計、開発を行います。
- オンプレミスとパブリッククラウドを活用したハイブリッド構成の機械学習プラットフォームの拠点間ネットワークの設計と開発を行います。
- コンテナネットワークの土台となるデータセンターネットワークの設計や将来を見据えた改善方法の検討、改善の実施を行います。
- ネットワークの状態を確認するのに必要なモニタリングシステムの設計と開発を行います。
- 多数のサーバやスイッチからなる機械学習プラットフォームのネットワーク運用を効率化するための自動化を行います。
- オープンソース技術情報や技術動向の調査、ハードウェア・ソフトウェアの動作検証、必要なソフトウェア開発も業務に含まれます。
- 開発したシステムのトラブルシューティングや運用も業務の対象です。
チームでの働き方
- 関西在住のメンバーもおり、リモートワークが主体です。
- オフィスに出社して勤務している方もいます。
- PFNの計算基盤は設計から運用まで自社で行い、PFNの価値と競争力の源泉となっています。
- 先進的なデータセンタ設備、ハードウェア、ソフトウェアの研究開発を実施し、効率のよい大規模計算基盤と利用サービスを構築・運用しています。
- 機械学習プラットフォームチームでは、研究開発加速のためKubernetes等のクラウドネイティブ技術を活用し、大規模機械学習プラットフォームの開発運用に挑戦しています。
- PFNは社外向けにAIプロセッサーMN-Coreシリーズのクラウドサービス提供を開始しており、順次設備とユーザーを拡大しています。
- 本ポジションは社内向けに加え、MN-Coreシリーズを社外向けクラウドサービスとして提供するためのプラットフォーム開発・運用にも取り組みます。
- 社外向けプラットフォームは、社内向けより厳密なテナント間分離と高いセキュリティが求められ、異なる設計の新しいプラットフォームとして開発運用しています。
本ポジションの魅力
- Kubernetesクラスタのネットワークスタックにおいて、コンテナネットワークからデータセンターネットワークまでの幅広い領域の経験ができます。
- GPUと自社開発のMN-Coreという複数のアクセラレータが混在する機械学習プラットフォームという他社にはない環境で先進的なネットワーク課題に取り組めます。
- オンプレミスとパブリッククラウドのハイブリッド環境での経験が得られます。
- バックグラウンドや専門性の異なるメンバーから学びや刺激を受けながら働くことができます。
- Kubernetesを始めとするOSSコミュニティへの貢献、ミートアップやカンファレンスでの外部発表が推奨されています。
Portrait of a person / 求める人材像
- 様々な分野への関心、新たな技術領域の知見獲得の意欲のある方。
- チームを支える圧倒的な強みを持っている方、もしくは、チームを越えた幅広い経験を持っている方。
- 同職種・他職種に関わらずリスペクトして一緒に楽しく働ける方。
- 強みを活かして、チームメンバーと助け合える方。
- 誰の持ち物かに関わらず自分事として捉え課題解決を推進できる方。
- 様々な専門性を持つ人がいる環境で新しいことを吸収し、楽しめる方。
求めるスキル・経験
必須
ソフトウェアの開発経験
ビジネスレベルの日本語能力(JLPT N2 相当)
以下のいずれかを満たすこと
Linuxサーバを用いたシステムの設計、開発、または運用の経験
または
ネットワーク(データセンタ、サービスプロバイダ、エンタープライズのいずれか)の設計、開発、または運用の経験
歓迎
コンピュータ サイエンスまたは関連する技術分野における学位、または関連分野における2年以上の実務経験
機械学習やHPC (High Performance Computing) 向けネットワークの設計、開発、運用の経験 GPU/HPC基盤
CNI plugin をはじめとした Kubernetes クラスタのネットワークに関する知識や運用経験 Kubernetes
ネットワーク関連のソフトウェアの開発経験 (SDN, CNI plugin, プロトコルの実装, ネットワーク自動化など) Ansible
ネットワークシミュレータ/エミュレータを用いたネットワークの検証自動化の経験
Linux のネットワークスタックや eBPF に関する知識や経験 Linux
大規模ネットワークのモニタリングやネットワーク自動化に関する経験 Ansible大規模システム設計・運用経験
オープンソースへのコントリビューションの経験 OSSコントリビューション
関連スキル
開発環境・ツール
募集要項
- 職種
- MLOpsエンジニア
- 雇用形態
- 正社員
- 想定年収
- 応相談
- 勤務地
- 東京都 千代田区
- 出社・リモート
- ハイブリッド / リモート可
- レベル
- メンバー
- 勤務時間
- 裁量労働制 / 実働8時間
- 休日休暇
- 完全週休2日制 / 祝日休み
- 試用期間
- 3ヶ月
福利厚生・制度
選考プロセス
- カジュアル面談 (場合により)