仕事内容
MN-Core Lシリーズ向けLLMサービングエンジンの開発に携わるエンジニアを募集しています。LLM推論処理の実行制御やリクエストスケジューリングの実装、KVキャッシュ管理の最適化、ベンチマーク設計、既存推論エンジンの調査などが主な業務です。最先端のLLM推論アクセラレータ向けソフトウェア開発に携わり、ハードウェア開発者と密接に連携しながら、世界最先端のコンピューティング技術を実社会で活用する機会があります。
Job Description / 職務内容
- LLM推論処理における実行制御とリクエストスケジューリングの実装
- 高帯域幅DRAMを最大限に活用しつつ、プレフィックスキャッシュなどの有用な機能をサポートするためのKVキャッシュ管理の最適化
- コンパイラ・ランタイム・ハードウェア開発者との緊密な連携
- 特定のワークロードやユースケースにおけるLLM推論性能を評価するためのベンチマークおよびシミュレーションの設計
- vLLMやSGLangなどの既存推論エンジンに関する調査
- 高性能コンピューティングシステムの設計・活用、量子化などの圧縮技術、下流タスクとの連携テスト、MN-Coreアーキテクチャ自体の設計検討など、より広範なプロジェクトにも関与
事業・プロダクト
- MN-Core™アーキテクチャおよびMN-Core Lシリーズの開発・活用を進めている
- MN-Coreアーキテクチャはコンパイラによる事前スケジューリングを採用し、プロセッサ制御の大部分を最適化
- LシリーズはLLM推論に必要な高帯域幅を実現するため、3D積層DRAM技術を採用
- LLMサービングエンジンは、コンパイラが生成したプログラム、ランタイム環境、DRAM上でのデータ処理を協調させ、超低遅延なLLM推論を実現
What makes this position appealing
- 最先端のLLM推論アクセラレータ向けソフトウェアの開発に携わることができる
- ハードウェア開発者と密接に連携しながら開発を進めることができる環境
- 世界最先端のコンピューティング技術を実社会で活用することに情熱を持つ方にとって理想的な環境
Portrait of a person
- 様々な分野への関心、新たな技術領域の知見獲得の意欲のある方
- 同職種・他職種に関わらずリスペクトして一緒に楽しく働ける方
- 強みを活かして、チームメンバと助け合える方
- 周りの課題に対しても自分事として捉え課題解決を推進できる方
- 様々な専門性を持つ人がいる環境で新しいことを吸収し、楽しめる方
求めるスキル・経験
必須
大学学部レベルのコンピュータサイエンスについての基礎的な理解
新興のLLM推論アクセラレータ技術に対する関心
LLM推論に関する理論的・実践的な知識を有していること
ハードウェア仕様が性能に与える影響を理解できること
様々なワークロードシナリオとそれらが性能に及ぼす影響についての理解
推論最適化に伴う各種トレードオフについての理解 パフォーマンス最適化経験
オープンソースのLLM推論エンジン(vLLM、SGLang、dynamo、llama.cppなど)に精通していること
英語と日本語が混在する環境での業務に柔軟に対応できること
歓迎
OSSのLLM推論エンジン(vLLM、SGLang、llama.cpp、dynamoなど)への貢献経験
LLMのサービス提供に関する実務経験(ローカル環境および大規模環境での運用双方)
LLMサービス提供の主要コンポーネントに関する知識(リクエストスケジューリング、KVキャッシュ管理、プレフィックスキャッシュ処理など)
LLMサービス提供APIに関する知見(/chat/completion、/responses、/messagesなど)
LLM応用技術への関心(コーディング支援エージェントなどの事例) 生成AI活用
ベンチマークテストやシミュレーションを通じたLLM推論性能評価に関する知識 QA・テスト経験
システムエンジニアリングの実務経験(パフォーマンス最適化、プロファイリング、メモリ管理、ストレージ、並行処理などの理解) 分散システムパフォーマンス最適化経験
最新のLLM推論アクセラレータ技術に関する知見
日本語の技術文書/ディスカッションを読み解く能力
募集要項
- 職種
- MLOpsエンジニア
- 雇用形態
- 正社員
- 想定年収
- 応相談
- 勤務地
- 東京都 千代田区
- 出社・リモート
- ハイブリッド / リモート可
- レベル
- メンバー
- 勤務時間
- 裁量労働制 / 実働8時間
- 休日休暇
- 完全週休2日制 / 祝日休み
- 試用期間
- 3ヶ月