機械学習エンジニア条件を変える閉じる
AI Evaluation Scientist
給与
800〜1600万円/年※ 募集要項に記載のレンジ。実額は選考で決まります
- 勤務地
- 東京都新宿区
- 雇用形態
- 正社員
- 働き方
- ハイブリッド勤務
- 年間休日
- 非公開
完全週休2日
仕事内容機械学習エンジニア
JAPAN AIのAIエージェント製品群の品質評価を科学的に担うポジション。評価指標の研究開発、自動評価パイプライン構築、レッドチーミング、統計的実験設計を通じて、LLMやAIエージェントの出力品質を定量評価・改善する。機械学習・統計学・心理測定学の手法を用い、評価そのものを研究対象とする。約200社が利用する本番環境の品質保証を最終防衛線として担う。
Job Description
- 評価指標の研究開発:LLM-as-Judgeのキャリブレーション、報酬モデリング、ベンチマーク設計を実施
- 自動評価パイプラインの設計・構築:研究成果をCI/CDに統合し、スケーラブルな品質ゲートを提供
- レッドチーミングと安全性検証:敵対的テストの自動化とポリシー準拠検証フレームワークを構築
- 統計的実験計画による品質改善:A/Bテストや有意性検定でプロンプト戦略やモデル変更の効果を定量検証
- 評価シグナルを研究開発チームにフィードバックし、モデル改善の複利ループを構築
- 約200社が利用する本番製品の品質を「品質の科学」アプローチで保証
Why You'll Love This Role
- Apple、Anthropic、Scale AIなどが投資する「AI評価科学」を日本企業向けAIの文脈で実践
- ML/DSスキルを「モデル構築」ではなく「モデル評価」に応用し、研究と実装の両方で知的挑戦
- 約200社が利用する本番環境で、構築する評価基盤がリリース品質の最終防衛線となる
- AIエージェント評価科学という新領域をゼロから設計・構築するグリーンフィールドポジション
- 自動レッドチーミングや敵対的テストなどResponsible AIの最前線に関与
- 3年で200人超・9製品に成長したスタートアップで技術的意思決定の裁量が大きい
Key Results (KR/Metrics)
- 評価カバレッジ率(テストケースカバレッジ)
- 回帰検出率(リリース前の品質劣化検出率95%以上)
- 評価パイプライン実行時間(CI/CD内で完了)
- LLM-as-Judgeと人間評価の一致率
- 偽陽性/偽陰性率
- リリース後の安全性インシデント率
Team Structure
- 開発組織は約120名
- Agentic Product Engineer:エージェント機能開発
- Research Engineer:研究開発・モデル改善
- Agent Harness Engineer / Software Engineer (AI Platform):AI実行基盤開発
- Product Manager:プロダクト設計と品質要件定義
募集要項最終確認 8/5
- 雇用形態
- 正社員
- 想定年収
- 800〜1600万円/年
- 勤務地
- 東京都新宿区
- 働き方
- ハイブリッド勤務
- 年間休日
- 非公開
- 職種
- 機械学習エンジニア
- 経験年数
- 3年以上
- 掲載日
- 6/30
- 最終確認
- 8/5
応募資格(必須)
- Master's degree or higher (or equivalent practical experience) in Computer Science, Machine Learning, Statistics, Mathematics, Physics, Psychometrics, or related fields
- 3+ years of practical experience as an ML Engineer, Data Scientist, Research Engineer, or in ML/AI evaluation-related roles
- Deep knowledge of LLM / generative AI evaluation methods (benchmark design, LLM-as-Judge, quantitative output quality measurement, hallucination detection, etc.)
- Practical knowledge of statistics and experimental design (hypothesis testing, A/B testing, confidence intervals, effect sizes, etc.)
- Experience building ML / evaluation pipelines in Python
- Practical experience with machine learning frameworks (PyTorch, JAX, TensorFlow, etc.)
- Experience designing and implementing evaluation metrics (task-specific metric design beyond precision/recall)
- Japanese: Fluent — able to discuss product development without friction
- English: Business level
歓迎する経験
- Publication experience at top ML/NLP conferences (NeurIPS, ICML, ICLR, ACL, EMNLP, etc.)
- Research or implementation experience with reward modeling / preference learning (RLHF, DPO, etc.)
- Experience with LLM-as-Judge calibration and rubric design
- Knowledge or experience in AI safety, Responsible AI, and red teaming
- Experience with benchmark design and validity verification (IRT, construct validity)
- Experience evaluating multi-agent workflows, tool use, and long-context scenarios
- Large-scale data processing experience (Spark / BigQuery, etc.)
- Experience integrating ML / evaluation pipelines into CI/CD
- Ability to read, comprehend, and reproduce research papers
- Technical communication ability in English
待遇・福利厚生
- Refresh Allowance
- シャッフルランチ/ディナー
- 夏季休暇
- 年末年始休暇
- 年次有給休暇
- 従業員持株会
- 慶弔休暇
- 社会保険完備
- 資格取得・英語学習支援
- 部活動手当
求めるスキル・経験
この求人は株式会社ジーニーの採用ページの掲載内容をもとに構成しています。応募条件の最新情報は募集元をご確認ください。
東京都の機械学習エンジニアの求人151件
東京都の機械学習エンジニアの求人をすべて見る(151件)募集元の採用ページから応募できます
応募は株式会社ジーニーの採用ページで受け付けています。このページは採用ページの掲載内容をもとに構成しているため、最新の応募条件は募集元でご確認ください。
この求人と近い条件で探す数字はリンク先ページの掲載件数
この職種で探す
- 機械学習エンジニア178
- 東京都の機械学習エンジニア151
- テック11,429
- データエンジニア343
- AIエンジニア268
この勤務地で探す
働き方・年収で探す
- 年収800万以上4,276
- 年収1000万以上1,213
- 完全週休2日31,016
- フレックス19,708
- 年間休日120日以上27,659
この職種を募集する企業
- 株式会社ジーニー138
- 株式会社日立製作所713
- 渡辺パイプ株式会社535
- パナソニック ホールディングス株式会社500
- 株式会社アインホールディングス470