業務委託
東京都 六本木駅
~ 820,000円/月額※平均単価を表示 実際はスキルによります
※平均単価を表示 実際はスキルによりますミッションクリティカルなプロジェクトとして、独自のデータ・ドメインに特化したAIモデル(LLM、音声、画像、動画モデル)の設計・開発をリードする高度AI人材を募集します。 現在、保有するユニークなデータを活用した独自LLMを開発することで、他社優位性を確立することを目指しています。 この戦略的な取り組みを推進するため、AIモデル(LLM、音声、画像、動画モデル)のコア技術を熟知し、モデルSFT、RL、LoRAできるAIエンジニアを求めています。 開発する独自AIモデルのエンジニアとして、研究開発から他チームとのプロダクト化連携まで一気通貫で推進していただきます。 日本最大級のエンタメプラットフォームのデータを活用し、世界に通用する独自のAIモデルを創造する挑戦的なポジションです。 ・独自のAIモデルのアーキテクチャ選定・実装 ・ビジネス要件に応じた評価パイプラインの設計 ・トレーニングデータの収集・作成 ・必要に応じたモデルのトレーニングの実行
機械学習、深層学習または生成AI領域における3年以上の実務経験 PyTorch、TensorFlow、JAXなどを用いたモデル開発経験 Transformer、Diffusion Model、音声モデルなど、生成モデルに関する理解 線形代数、確率統計、最適化など、機械学習の数学的基礎への理解 論文やOSSの実装を調査し、プロトタイプとして再現・検証できる能力 モデルの精度だけでなく、レイテンシ、スループット、GPUメモリ、運用コストを考慮した設計経験 エンジニア、研究者、プロダクトマネージャーなど、複数職種と連携して開発を進めた経験 技術的な不確実性が高い状況において、仮説設定、検証、改善を主体的に進められる能力 以下の専門領域のうち、一つ以上における高度な実務経験を必須とします。 LLM・AIエージェント領域 -GPT、LLaMA、Qwen、Gemma、DeepSeekなど、Transformer系モデルの開発・改良経験 -SFT、LoRA、QLoRA、DPO、RLHFなどを用いたモデル最適化経験 -プロンプトエンジニアリング、コンテキストエンジニアリング、RAGの設計経験 -Tool Calling、Function Calling、MCPなどを利用したAIエージェント開発経験 -会話履歴、長期記憶、検索、外部ツールを組み合わせたシステム設計経験 -LLMの評価データセットおよび自動評価・人手評価基盤の構築経験 -ハルシネーション、安全性、拒否応答、ユーザー意図理解などの品質改善経験 -vLLM、TensorRT-LLM、SGLang、TGIなどを用いた推論最適化経験 日本語LLMに関する経験 -日本語データセットまたは日本語コーパスの構築・前処理経験 -SentencePiece、BPEなど、トークナイザーに関する知識または実装経験 -日本語LLMの品質評価、ベンチマーク設計、エラー分析経験 -日本語特有の表現、文脈、敬語、会話品質を考慮したモデル改善経験 -日本語・英語を含むマルチリンガルモデルの開発または評価経験 音声・リアルタイムVoice-to-Voice領域 -ASR/STT、TTS、音声変換、音声対話システムのいずれかに関する開発経験 -Whisper、Conformer、Wav2Vec、VITS、FastSpeech、Codec Language Modelなどへの理解 -ストリーミング音声認識またはストリーミング音声合成の実装経験 -リアルタイムVoice-to-Voiceシステムの設計・開発経験 -ユーザーの発話中にAIが認識・応答を開始する低遅延処理の設計経験 -全二重音声対話における割り込み、ターンテイキング、発話終了判定の実装経験 -VAD、エコーキャンセリング、ノイズ除去、音声区間検出に関する知識 -WebRTC、WebSocket、gRPC Streamingなどを用いたリアルタイム通信の経験 -TFT/TTFA、音声生成速度、同時接続数を考慮した性能最適化経験 -音声の自然さ、感情、イントネーション、話者性、発音品質の評価・改善経験 画像生成・VLM領域 -Stable Diffusion、SDXL、FLUXなどのDiffusion Modelを用いた画像生成経験 -LoRA、DreamBooth、ControlNet、IP-Adapterなどを用いたモデル調整経験 -ComfyUI、Diffusersなどを利用した画像生成ワークフローの構築経験 -画像生成モデルの学習データ作成、キャプショニング、前処理経験 -プロンプト追従性、画質、一貫性、安全性に関する評価・改善経験 -GPUメモリ最適化、バッチ処理、並列推論、モデル量子化の経験 VLM・画像理解に関する経験 -CLIP、LLaVA、Qwen-VL、Gemini系モデルなど、VLMの開発・利用経験 -画像分類、物体検出、OCR、画像キャプション、Visual Question Answeringの経験 -画像とテキストを組み合わせた検索、推薦、エージェントシステムの設計経験 -VLMの評価データセット、プロンプト、ベンチマークの設計経験 -画像内の人物、商品、背景、構図、表情などを構造化して抽出するシステムの開発経験 動画・アニメーション生成領域 -Text-to-Video、Image-to-Video、Video-to-Videoモデルの開発または利用経験 -Stable Video Diffusion、WAN、HunyuanVideo、CogVideoなどの動画生成モデルへの理解 -キャラクター、人物、背景、衣装などの時間的一貫性を改善した経験 -フレーム間のちらつき、形状崩れ、顔の変化など、動画生成特有の問題への対応経験 -動画生成モデルのファインチューニング、LoRA学習、推論最適化経験 -長時間動画生成、シーン分割、ストーリーボード生成、動画編集パイプラインの設計経験 -GPUを用いた動画生成処理の高速化、並列化、分散実行経験
コンピュータサイエンス、数学、物理、音声処理、画像処理などのPhD、または同等の研究実績 NeurIPS、ICML、ICLR、ACL、EMNLP、CVPR、ICCV、ECCV、ICASSP、Interspeech、SIGGRAPHなどでの論文発表経験 Big Tech、AIスタートアップ、研究機関での生成AI開発経験 OSSモデル、ライブラリまたは研究コミュニティへのコントリビューション経験
WEBサービス
ミッションクリティカルなプロジェクトとして、独自のデータ・ドメインに特化したAIモデル(LLM、音声、画像、動画モデル)の設計・開発をリードする高度AI人材を募集します。 現在、保有するユニークなデータを活用した独自LLMを開発することで、他社優位性を確立することを目指しています。 この戦略的な取り組みを推進するため、AIモデル(LLM、音声、画像、動画モデル)のコア技術を熟知し、モデルSFT、RL、LoRAできるAIエンジニアを求めています。
・OS:Ubuntu Linux ・ミドルウェア:CUDA、Docker ・開発言語:Python ※必要に応じてC++/CUDA、Shell Scriptを使用 ・FW:PyTorch、Hugging Face Transformers/Diffusers 担当領域に応じて、以下のモデル・ツールを利用します。 LLM:LLaMA、Qwen等のTransformer系モデル 音声:Whisper、TTS/Voice-to-Voice関連モデル 画像・VLM:Stable Diffusion、SDXL、VLM関連モデル 動画・アニメーション:Video Diffusion、リップシンク、アバター生成関連モデル ・管理ツール:GitHub、Slack、Jira/Confluence ・その他:JupyterLab、VS Code、Git ・開発マシン:WindowsまたはMac ※モデルの学習・推論は、主にUbuntu LinuxのGPUサーバー上で実施します。
140時間〜180時間
2026/10
約20名
フルリモート
1回
オンライン
あり
なし
2026/08/18 18:20:34
保有するユニークなデータを活用し、他社には真似できない独自のAIモデルを開発できます。 単なる既存技術の応用にとどまらない、真に革新的なAIサービスを社会に送り出せる可能性があります。 サービスへの応用を前提とした開発を進めます。 最先端の技術を追求しつつも、ビジネスに直接貢献する、実用的なAI開発に注力できる環境です。
業務委託
東京都 新宿駅
~ 750,000円/月額

フリーランスエンジニア向けIT案件・求人検索サイト【フリーランスジョブ】
株式会社Hajimari 東京都渋谷区道玄坂一丁目16番10号渋谷DTビル9F
©︎ Hajimari Inc. All Rights Reserved