転職AIログインマイページ求人へ
リサーチサイエンティスト条件を変える閉じる
条件をクリア

AI Evaluation Scientist

株式会社ジーニー

テック 東京都新宿区 企業サイト 掲載 6/30

給与

800〜1600万円/年※ 募集要項に記載のレンジ。実額は選考で決まります

勤務地
東京都新宿区
雇用形態
正社員
働き方
ハイブリッド勤務
年間休日
非公開

完全週休2日

仕事内容リサーチサイエンティスト

AIエージェントの出力品質を科学的に評価する専門組織を新設し、評価メトリクスの研究開発、自動評価パイプラインの構築、レッドチーミング・安全性検証、統計的実験計画に基づく品質改善をリードするポジションです。約200社が本番利用するプロダクトの品質を担保し、LLM-as-Judgeの校正や報酬モデリングなど研究と実装の両面で知的挑戦があります。

募集背景

  1. JAPAN AIはエンタープライズ向けAIエージェント群を急速に拡大している
  2. プロダクトの中核がLLM/マルチエージェントへ移行する中、AI出力の品質・安全性・信頼性を科学的に評価する専門組織を新設する

ミッション

  1. AIの出力品質を科学する—評価手法の研究・開発で、エージェントの信頼性を証明する
  2. LLM/AIエージェントの出力品質を、機械学習・統計学・計量心理学の手法で定量的に評価・改善する
  3. 本ポジションは「テストする人」ではなく「何をもって良いAIとするかを定義し、測定する科学者」

期待する役割について

  1. 評価メトリクスの研究開発—LLM-as-Judgeの校正、報酬モデリング、ベンチマーク設計を通じて品質を科学的に定義する
  2. 自動評価パイプラインの設計・構築—研究成果を本番CI/CDに組み込み、スケーラブルな品質ゲートを実現する
  3. レッドチーミング・安全性検証—adversarial testingの自動化、ポリシー準拠検証フレームワークを構築する
  4. 統計的実験計画に基づく品質改善—A/Bテスト・有意差検定でプロンプト戦略やモデル変更の効果を定量的に検証する
  5. 評価シグナルの研究・開発チームへのフィードバック—モデル改善の複利ループを構築する
  6. 約200社が本番利用するプロダクトの品質を「科学する」アプローチで担保する

このポジションの魅力

  1. Evaluation Scienceの実践—Apple・Anthropic・Scale AI・Google DeepMind等が注力する「AI評価科学」を日本のエンタープライズAIの文脈で実践できる
  2. ML/DSスキルの新しい応用—機械学習・統計学の専門性を「モデル開発」ではなく「モデル評価」に応用する
  3. 品質がプロダクトの信頼を決める—約200社が利用する本番環境で、構築した評価基盤がリリース品質の最後の砦になる
  4. 新設ポジション—AIエージェントの品質評価科学という新しい専門領域をゼロから設計・構築できる
  5. AI安全性の最前線—自動レッドチーミング、adversarial testing、ポリシー準拠検証などResponsible AIの実践に携われる
  6. 急成長環境—設立3年で200名以上の規模、9プロダクト展開のスタートアップで技術的意思決定に大きな裁量を持てる

業務内容

  1. 評価メトリクスの研究開発—LLM-as-Judgeの校正手法の研究・実装、評価ベンチマークの設計・構築・妥当性検証、報酬モデリング/preference learningの評価への応用研究、評価メトリクスの選定・設計、評価セットの設計・構築・メンテナンス
  2. 自動評価パイプラインの設計・構築—スケーラブルな自動評価パイプラインの設計・実装、CI/CDへの評価パイプライン組込みと品質ゲートの構築、エージェント評価ハーネスの設計、評価パイプラインの再現性・信頼性の担保
  3. 安全性・品質検証—自動レッドチーミングの研究・実装、安全性/ポリシー準拠の検証フレームワーク構築、ハルシネーション検出・校正手法の研究・実装、プロンプト/ツール回帰テストの設計・実行
  4. 統計分析・実験設計—統計的実験計画の設計・分析、品質トレンドの可視化・回帰検出の自動化、品質レポート作成と改善提案、評価シグナルの研究・開発チームへのフィードバック

成果責任 (KR/メトリクス)

  1. 評価カバレッジ率(テストケース網羅率)
  2. 回帰検出率(リリース前の品質劣化検出率 ≥ 95%)
  3. 評価パイプライン実行時間(CI/CD内で完了)
  4. LLM-as-Judge と人間評価の一致率
  5. False Positive / Negative 率
  6. 安全性インシデント発生率(リリース後)

チーム体制

  1. 約120名が開発組織に在籍している
  2. AI Evaluation Scientistは品質保証の専門チームとして、Agentic Product Engineer、Research Engineer、Agent Harness Engineer / Software Engineer (AI Platform)、Product Managerと密接に連携する

開発環境

  1. 言語: Python、TypeScript / React / Next.js / NX
  2. 評価/QA: pytest、LangSmith、Weights & Biases、custom eval frameworks
  3. データ: BigQuery、Spark、Pandas
  4. インフラ: GCP、Docker、Terraform
  5. CI/CD: GitHub Actions
  6. ツール: Slack、Confluence、Linear、Google Workspace、GitHub、Notion
  7. AI開発支援: Claude Code MAX Plan、Cursor、ChatGPT、Devin
  8. 作業環境: Mac (Apple Silicon)、デュアルモニタ対応

学習と開発の支援

  1. AIツール利用サポート—JAPAN AI SaaSサービス、Cursor、ChatGPT、ClaudeなどAIツール全般を会社負担で利用可能
  2. 開発ツール支援—利用したい開発ツールが有償である場合、その費用を負担(年3万円まで)
  3. 書籍購入補助—技術書など学習のために利用する書籍を会社費用で購入可能(半期3万円まで)
  4. 語学学習/資格取得支援—日本語や英語の学習プログラムや資格の取得を会社費用で利用可能
  5. リフレッシュ手当—ご自身のリフレッシュのために使用するサービスの費用を負担(月5000円まで)
  6. 家賃手当—該当エリアにお住いの方に家賃手当を支給(月3万円まで)

働き方

  1. ハイブリッド勤務: 週3出社、週2リモート
  2. フレキシブルな勤務時間帯: コアタイムは要相談
  3. 柔軟性: 将来的により柔軟なワークスタイルの検討も可能
完全週休2日

募集要項最終確認 8/5

雇用形態
正社員
想定年収
800〜1600万円/年
勤務地
東京都新宿区
働き方
ハイブリッド勤務
年間休日
非公開
職種
リサーチサイエンティスト
経験年数
3年以上
掲載日
6/30
最終確認
8/5

応募資格(必須)

  • コンピュータサイエンス、ソフトウェア工学、人工知能、機械学習、数学、物理、計量心理学などの関連分野における修士号以上、または同等の実務経験
  • MLエンジニア / DS / リサーチエンジニア / ML評価関連職種の実務経験 3年以上
  • LLM / 生成AIの評価手法に関する深い知識
  • 統計学・実験計画法の実践的知識
  • Pythonでの ML / 評価パイプライン構築経験
  • 機械学習フレームワーク(PyTorch, JAX, TensorFlow等)の実務経験
  • 評価メトリクスの設計・実装経験
  • 言語レベル : いずれか必須 日本語 : Fluent (プロダクト開発において齟齬なく議論を行えるレベル) 英語 : ビジネスレベル

歓迎する経験

  • ML / NLPトップカンファレンス(NeurIPS, ICML, ICLR, ACL, EMNLP等)での論文発表経験
  • 報酬モデリング / preference learning(RLHF, DPO等)の研究・実装経験
  • LLM-as-Judge の校正・rubric設計の経験
  • AI安全性・Responsible AI・レッドチーミングに関する知識・経験
  • ベンチマーク設計・妥当性検証(IRT, construct validity)の経験
  • マルチエージェント・ワークフロー / ツール利用 / ロングコンテキストの評価経験
  • 大規模データ処理(Spark / BigQuery等)の経験
  • CI/CDパイプラインへのML/評価パイプライン組込み経験
  • 論文読解・再現実装の能力
  • 英語での技術コミュニケーション能力

待遇・福利厚生

  • Refresh Allowance
  • シャッフルランチ/ディナー
  • 夏季休暇
  • 年末年始休暇
  • 年次有給休暇
  • 従業員持株会
  • 慶弔休暇
  • 社会保険完備
  • 資格取得・英語学習支援
  • 部活動手当

求めるスキル・経験

DSMLエンジニアPythonPyTorchTensorFlow実験計画法生成AI活用統計解析ACLAI安全性Apache SparkBigQueryCI/CDconstruct validityDPOEMNLPLLM-as-a-JudgeNeurIPSpreference learningResponsible AIRLHFビジネス英語ベンチマーク設計マルチエージェント設計Claude CodeConfluenceCursorDevinDockerGCPGitHubGitHub ActionsGoogle WorkspaceLangSmithLinearMacNext.jsNotionpandaspytestReactSlackTerraformTypeScriptWeights & Biases

この求人は株式会社ジーニー採用ページの掲載内容をもとに構成しています。応募条件の最新情報は募集元をご確認ください。

東京都のリサーチサイエンティストの求人

募集元の採用ページから応募できます

応募は株式会社ジーニーの採用ページで受け付けています。このページは採用ページの掲載内容をもとに構成しているため、最新の応募条件は募集元でご確認ください。

募集元の採用ページを開く
相談募集元で応募する採用ページへ

AI相談