仕事内容
Preferred Networksの機械学習プラットフォームにおいて、深層学習アクセラレータやインターコネクト、大規模分散利用に関わるソフトウェア開発を担当するポジションです。ハードウェアとソフトウェア両面の知見を活かし、プラットフォーム全体のパフォーマンス最適化に取り組みます。オンプレミスとパブリッククラウドのハイブリッド環境で、MN-Coreを含む先進的な計算基盤の開発・運用に携わることができます。
業務内容の一例
- 機械学習プラットフォームのアクセラレータに関連する研究開発を行います。
- GPUが提供する新しい機能をユーザーに提供するための検証と必要な機能開発を行います。
- MN-Coreを利活用するための機能(インテグレーション、設定、監視等)の開発を行います。
- 機械学習プラットフォームのインターコネクトに関連する研究開発を行います。
- ロスレスネットワーク関連機能の検証(PFC, ECN, DCQCN, RoCEv2)を行います。
- 集団通信性能の追求(xCCL, PeerDirect / GPUDirect RDMA, PCI Express, CXL, Ultra Ethernet)を行います。
- 新規ハードウェア調達やMN-Coreチップ、ボードの設計を見据えた議論にも参加します。
- RDMAアプリケーションの開発(UCX, InfiniBand Verbs)を行います。
- 機械学習プラットフォームの大規模分散利用に関連する研究開発を行います。
- MPI on Kubernetesを実現する機能の開発を行います。
- 分散キャッシュシステムをはじめとするデータセット読み込み支援機能の開発を行います。
- ユーザーやシステム管理者による性能プロファイリングを支援する機能の開発を行います。
- プラットフォーム利用者のための各種高速化・性能最適化支援機能の開発を行います。
- 機械学習プラットフォームのハードウェア関連機能の研究開発を行います。
- Kubernetesクラスタ及び計算ノードのプロビジョニング自動化機能の開発を行います。
- システム・ハードウェア健全性の自動診断、アラート、自動復旧機能の開発を行います。
チーム・組織
- 関西在住のメンバーもおり、リモートワークが主体ですがオフィスに出社して勤務する方もいます。
- PFNの計算基盤は設計から運用まで自社で行い、会社の価値と競争力の源泉となっています。
- 先進的なデータセンター設備、ハードウェア、ソフトウェアの研究開発を通じて、効率的な大規模計算基盤とサービスを構築・運用しています。
- 機械学習プラットフォームチームはKubernetesをはじめとするクラウドネイティブ技術を活用し、大規模な機械学習プラットフォームの開発運用に挑戦しています。
- PFN独自のAIプロセッサーであるMN-Coreシリーズを社外向けクラウドサービス「Preferred Computing Platform」として提供しており、そのプラットフォーム開発・運用にも携わります。
- 社外向けプラットフォームは、社内向けと比較して厳密なテナント分離や高いセキュリティが求められるため、異なる設計で開発運用されています。
本ポジションの魅力
- ハードウェアからソフトウェアまで、高性能な機械学習プラットフォームに必要な技術を一気通貫して経験できます。
- MN-CoreやGPUなど深層学習アクセラレータに関連する技術を深掘りできます。
- インターコネクトなど大規模分散学習に関連する技術に携われます。
- データセット読み込み支援など、機械学習をシステムソフトウェアで支える技術を習得できます。
- ユーザーとの距離が近い環境で、実際の機械学習モデル開発業務から発生する様々な課題を解決できます。
- オンプレミスとパブリッククラウドのハイブリッドな環境で多様な経験を積むことができます。
- Kubernetesを始めとするOSSコミュニティへの貢献や、ミートアップ・学会での登壇が推奨されています。
求めるスキル・経験
必須
ビジネスレベルの日本語能力(JLPT N2 相当) 日本語能力試験 N2
以下のいずれかを満たすこと
高性能計算分野(大規模分散学習、ストレージ、ネットワークなど)での経験、もしくは強い興味
または
深層学習アクセラレータの利用・性能最適化経験、もしくは強い興味
または
システムソフトウェアの開発経験、もしくは強い興味
歓迎
コンピュータ サイエンスまたは関連する技術分野における学位、または関連分野における2年以上の実務経験
クラウドネイティブなアプリケーション・インフラストラクチャ (特に Kubernetes) の実務経験 Kubernetes
大規模な Linux サーバ群の監視・運用技術・自動化・運用省力化技術
大規模計算機システムのパフォーマンス・チューニング技術
一定規模の商用サービスにおいて、複数のエンジニアを率いてプロダクトの全体設計・開発・オペレーション構築をリードした経験 システム設計
分散システムに関する知識と経験 分散システム
機械学習・深層学習の知識と経験 機械学習モデル開発経験
OSSへのコントリビューション経験
複数の関係チームと適切にコミュニケーションを取りプロジェクトをリードできる能力
カンファレンスやミートアップでの登壇経験
募集要項
- 職種
- MLOpsエンジニア
- 雇用形態
- 正社員
- 想定年収
- 応相談
- 勤務地
- 東京都 千代田区
- 出社・リモート
- リモート中心 / リモート可
- レベル
- メンバー
- 勤務時間
- 裁量労働制 / 実働8時間
- 休日休暇
- 完全週休2日制 / 祝日休み
- 試用期間
- 3ヶ月