仕事内容
Preferred Networks (PFN) は、大規模言語モデル (LLM) を中心としたマルチモーダルな基盤モデルの開発を進めています。本ポジションは、LLM推論最適化チームの一員として、自社開発LLMを実運用に求められる品質・速度・コストで提供し、PFNのプロダクトやソリューション事業の拡大を技術面から支援します。具体的には、LLMモデルの推論性能向上、推論エンジンの開発、カスタマイズ・デプロイ支援、OSSコミュニティ活動などを担当します。
Job Description
- 大規模言語モデル (LLM) を中心としたマルチモーダルな基盤モデルの開発を進める。
- エンタメ、科学計算、ロボットといった自社事業領域を強化する応用開発や、多様な産業への応用研究を行う。
- 推論最適化チームは、自社開発LLMを実運用に求められる品質・速度・コストで提供し、事業拡大を技術面から支援する。
- LLMモデルの推論性能向上として、量子化・推論エンジンの改善・パフォーマンスチューニングを通じて、出力品質を担保しつつスループット向上やレイテンシ/メモリ使用量削減を行う。
- LLM推論エンジンの開発として、SaaS環境やオンプレミス環境でのサービングに必要な推論エンジンとその周辺機能の開発・インテグレーションを行う。
- LLMのカスタマイズ・デプロイ支援として、案件ごとのニーズに応じたLLMモデルのカスタマイズワークフローやデプロイパイプラインを整備する。
- OSSコミュニティ活動として、vLLMをはじめとするLLM推論エンジンのエコシステムで新機能実装・バグフィックスのアップストリーム対応を行い、関連イベントへの登壇や情報発信も行う。
求めるスキル・経験
必須
コンピュータサイエンスまたは関連する技術分野における学位、または関連分野における実務経験
LLM推論に関連する最先端の技術動向を主体的にキャッチアップし、専門性を深められること
Pythonを使ったソフトウェア開発経験 Python
LLMの学習・推論に関する基本的な知識
チーム内外のメンバーと協働しながら課題解決ができること
英語のドキュメントが抵抗なく読めること
歓迎
CUDAアプリケーションの性能改善やデバッグの経験 パフォーマンス最適化経験
LLM推論エンジンのコア技術(演算のスケジュール制御やKV cacheの管理機構など)の開発経験
LLM推論のパフォーマンス最適化の経験 パフォーマンス最適化経験
データサイエンス関連のOSSへのコントリビューション経験 OSSコントリビューション
GPUクラスタ(k8s等)の利用経験 Kubernetes
MLの学習・評価を行うワークフローフレームワーク(Argo, MLFlow等)の利用経験 Argo CD
ビジネスレベルの英語・日本語コミュニケーション能力 ビジネス英語
募集要項
- 職種
- MLOpsエンジニア
- 雇用形態
- 正社員
- 想定年収
- 応相談
- 勤務地
- 東京都 千代田区
- 出社・リモート
- ハイブリッド / リモート可
- レベル
- メンバー
- 勤務時間
- 裁量労働制 / 実働8時間
- 休日休暇
- 完全週休2日制 / 祝日休み
- 試用期間
- 3ヶ月