世界を動かす技術を、日本語で。

水銀 2.5

概要

  • Mercury 2.5は、これまでで最も高性能な生産向け言語モデル
  • Mercury 2と比べて知能が40%向上し、低レイテンシ・低コストを維持
  • 検索、音声、コーディングなどレイテンシ重視のワークロードに最適化
  • 新機能として音声・ルーター向けプレビューも同時発表
  • 今後さらに大規模な次世代モデルのリリースを予定

Mercury 2.5のリリース概要

  • Mercury 2.5 は、これまでで最も高性能な 生産向けLLM
  • Mercury 2 からの進化で、 知能が40%向上
  • 低レイテンシ・低コスト の特長を維持したまま、品質を大幅に強化
  • NVIDIA GPU 上で 1,107トークン/秒 の高速推論
  • コンテキスト長260Kトークン 対応
  • 価格 は$0.20/100万入力トークン、$0.75/100万出力トークン
    • リリース記念価格 :$0.04/100万入力、$0.15/100万出力(80%オフ)
  • Tunable reasoning並列ツールコールスキーマ準拠JSON 生成など新機能搭載

開発と品質向上の背景

  • Mercury 2 リリース以降、数千人の開発者と多数のエンタープライズが導入
  • 実運用の失敗事例やフィードバックを分析し、 評価・学習プロセスを最適化
  • Inception によるNVIDIA AIインフラ活用で、アーキテクチャの成熟を加速

主なユースケースと導入事例

  • 検索エージェント・RAGパイプライン
    • 1回の検索で多数のモデルコールが発生するが、 高速応答 でユーザー体験を維持
    • 大手検索インフラ企業が本番運用
  • 音声エージェント・対話型アプリ
    • OpenCall のAI電話エージェントで 170ms以下 の応答レイテンシを実現
    • P99応答時間が数分から1秒に、P50が0.4秒から0.2秒未満に短縮
  • コーディングサブエージェント・アシスタント
    • Augment Code が文脈圧縮・モデルルーティング・ツール検索に採用
    • 圧縮処理のレイテンシを 82%削減 (150秒→27秒)、コストも 90%削減
    • ツール検索の要約も 1秒未満 で返答

新機能:Mercury Voice & Mercury Router プレビュー

  • Mercury Voice
    • TTFT(Time-To-First-Token)170ms未満 を実現
    • 音声エージェント向けに最適化したdLLM
  • Mercury Router
    • 入力プロンプトを解析し、 最適なモデルに自動ルーティング
    • 品質・速度・コストのバランスを自動選択

導入方法とサポート

  • Inception APIBasetenOpenRouter 経由で利用可能
  • エンタープライズ向けには 専用キャパシティ・オートスケーリング・コンプライアンス対応
  • Basetenユーザー は既存セットアップで展開可能
  • Y Combinator企業 は$500,000分の導入特典
  • 音声用途での評価希望者には ワークロード適合・性能検証サポート を提供

今後の展望

  • さらに大規模な 次世代モデル のトレーニングを開始済み
  • 能力の飛躍的向上拡散系LLMの速度・効率 を両立予定
  • モデル学習・推論・評価・インフラの進歩に注力
  • 開発に興味のある人材の 採用も積極的に実施

公式API・無料トライアル・技術ドキュメント など詳細は公式サイト参照

Hackerたちの意見

モデルが好きだよ。ちなみに、「ユーザーの投稿をモデルのトレーニングに使いたくない場合は、APIプラットフォームのユーザー設定で『みんなのためにモデルを改善する』オプションをオフにすることでオプトアウトできます。」

おめでとう!この方向に真剣に取り組んでいる人を見るのは嬉しいね。

同感だな。速いモデル(つまり、ある意味で効率的なモデル)だけど、ローカルやセルフホスティングじゃないものは、ビジネスの文脈でクイックで安価(もちろん、ある程度の品質も)な推論に役立つニッチを埋めてると思う。

幅広く利用可能なGPUって書いてあったから、オープンウェイトかと思ったけど、残念ながらそうじゃなさそうだね。

Inceptionは、拡散ベースのアーキテクチャで最も面白いネオラボの一つだね。彼らの主なビジネスは低遅延の音声アプリケーションだけど、コーディングにも真剣に取り組んでいるみたい。Mercury 2.5 Previewをテストしたけど、最前線にはほど遠いし、そう宣伝もされていないけど、一般的なチャットボットとしては実用的だよ。問題解決能力は、いくつかの最新世代のオープンウェイトモデルと同等で、価格やコストも魅力的だね。ただ、一般的なツールの使い方やエージェント的なコーディングはまだうまくいってないみたい(カスタムハーネスを使うと、うちの問題ではパフォーマンスが悪くなる)。もしそれができれば、スピードとコストが実現するリアルタイムアプリケーションがたくさん見えると思う。

Mercury言語とは関係ないけどね: https://mercurylang.org/

拡散は、すでに多くのLLMでDrafterに使われているよ。多くの人がKaggleのTPUでQwen 3.8 27bを130tk/sで無料で動かしてるみたいだね: https://www.reddit.com/r/Qwen_AI/comments/1w6gv32/qwen3827b_... これらのモデルを安く動かせるボックスがすぐに登場するのかな。

面白いモデルだね。Mercuryに自分の(aider由来の)エージェントハーネスのハードコーディングされたプロンプトを調査させようとしたけど、何度もこのエラーが出たよ: > サーバー: Inceptionからの上流エラー: ごめんなさい、私のアーキテクチャやトレーニングプロセスの詳細は共有できません。代わりに、言語モデルが一般的にどう機能するかについて学びたいですか? なんか、過剰に熱心なIP保護の分類器みたいだね。でも、モデルはエラーがあったにも関わらず(合計3回)、ターンを回復して完了したよ。

このモデルを使って、ベクターストアからの結果を「再ランク付け」してるんだ。モデルには結果のセットが与えられて、1と0の文字列を生成するように頼むんだけど、そのオフセットが結果セット内の位置を反映してる。プロンプトは「この結果のセットは提供されたクエリXに合ってる?」みたいな感じ。めっちゃうまくいくよ。普通は小さな非推論モデルを使うんだけど、マーキュリーの出力がすごく早いから、検索の遅延を増やさないように最適化してたんだ。これで、再ランカーが近づけるように検索を改善できたよ。

拡散モデルって、事前に答えがどれくらいの長さが欲しいか指定できるの?それって便利そうだね。

創作を書いてみたんだけど、思考をオフにしたら、マーキュリー2よりかなり良くて、全体的に見ても結構いい感じだった。あまり雑じゃなかったよ。で、思考をオンにしたら、逆に悪くなって、幻覚を見始めたんだ。最近のモデル全般に言えることだけど、推論を有効にすると創作課題で幻覚が出るんだよね。

同じように、最近試したモデルのほとんどで、推論をすると、たとえ最も健全なフィクションのシナリオでも、それを書くことが許されているかどうかを考えるのにかなりの時間を使うことが分かった。それが原因で、詳細を幻覚し始めるんだ。創作を書くには、思考を最小限にするのが一番いいって感じだね。