概要
- Mercury 2.5は、これまでで最も高性能な生産向け言語モデル
- Mercury 2と比べて知能が40%向上し、低レイテンシ・低コストを維持
- 検索、音声、コーディングなどレイテンシ重視のワークロードに最適化
- 新機能として音声・ルーター向けプレビューも同時発表
- 今後さらに大規模な次世代モデルのリリースを予定
Mercury 2.5のリリース概要
- Mercury 2.5 は、これまでで最も高性能な 生産向けLLM
- Mercury 2 からの進化で、 知能が40%向上
- 低レイテンシ・低コスト の特長を維持したまま、品質を大幅に強化
- NVIDIA GPU 上で 1,107トークン/秒 の高速推論
- コンテキスト長260Kトークン 対応
- 価格 は$0.20/100万入力トークン、$0.75/100万出力トークン
- リリース記念価格 :$0.04/100万入力、$0.15/100万出力(80%オフ)
- Tunable reasoning や 並列ツールコール、 スキーマ準拠JSON 生成など新機能搭載
開発と品質向上の背景
- Mercury 2 リリース以降、数千人の開発者と多数のエンタープライズが導入
- 実運用の失敗事例やフィードバックを分析し、 評価・学習プロセスを最適化
- Inception によるNVIDIA AIインフラ活用で、アーキテクチャの成熟を加速
主なユースケースと導入事例
- 検索エージェント・RAGパイプライン
- 1回の検索で多数のモデルコールが発生するが、 高速応答 でユーザー体験を維持
- 大手検索インフラ企業が本番運用
- 音声エージェント・対話型アプリ
- OpenCall のAI電話エージェントで 170ms以下 の応答レイテンシを実現
- P99応答時間が数分から1秒に、P50が0.4秒から0.2秒未満に短縮
- コーディングサブエージェント・アシスタント
- Augment Code が文脈圧縮・モデルルーティング・ツール検索に採用
- 圧縮処理のレイテンシを 82%削減 (150秒→27秒)、コストも 90%削減
- ツール検索の要約も 1秒未満 で返答
新機能:Mercury Voice & Mercury Router プレビュー
- Mercury Voice
- TTFT(Time-To-First-Token)170ms未満 を実現
- 音声エージェント向けに最適化したdLLM
- Mercury Router
- 入力プロンプトを解析し、 最適なモデルに自動ルーティング
- 品質・速度・コストのバランスを自動選択
導入方法とサポート
- Inception API、 Baseten、 OpenRouter 経由で利用可能
- エンタープライズ向けには 専用キャパシティ・オートスケーリング・コンプライアンス対応
- Basetenユーザー は既存セットアップで展開可能
- Y Combinator企業 は$500,000分の導入特典
- 音声用途での評価希望者には ワークロード適合・性能検証サポート を提供
今後の展望
- さらに大規模な 次世代モデル のトレーニングを開始済み
- 能力の飛躍的向上 と 拡散系LLMの速度・効率 を両立予定
- モデル学習・推論・評価・インフラの進歩に注力
- 開発に興味のある人材の 採用も積極的に実施
公式API・無料トライアル・技術ドキュメント など詳細は公式サイト参照