世界を動かす技術を、日本語で。

Muse CodeとMuse Spark 1.2

概要

  • Muse Code (beta) は、 Muse Spark 1.2 を搭載した新しいターミナル用コーディングエージェント
  • 大規模で複雑なソフトウェア開発タスクを自動化し、 長時間の作業 や障害時の再開も可能
  • 非同期バックグラウンドエージェント による効率化と低遅延
  • Muse Spark 1.2 はコード生成・デバッグ・ワークフローで大幅進化
  • Muse Code および Meta Model API でグローバルに利用可能

Muse Code (beta) の特徴

  • Muse Spark 1.2 を搭載した最新のターミナルコーディングエージェント
  • macOS および Linux 環境でインストール可能
  • 大規模リポジトリを横断する複雑なソフトウェアエンジニアリングタスクの自動化
    • 変更計画立案
    • コード生成
    • 結果検証
  • 各タスクに対し、複数の 永続的サブエージェント を協調動作させる設計
  • 問題解決の速度・精度向上、ユーザー介入の最小化

Muse Code の非同期バックグラウンドエージェント

  • メインエージェントを補助する 非同期バックグラウンドエージェント の常駐
  • 各セッション中に持続的に稼働し、冗長な情報収集の回避
  • タスクの次のステップを自主的に実行し、必要時のみメインエージェントに報告
  • 長期・多段階タスクでの 低遅延安定性向上

ランタイム設計とイベントログ

  • ローカルイベントログ に全ての操作履歴(モデル呼び出し・ツール実行・承認・編集)を記録
  • 単一の情報源として、 リプレイ完全一致再起動安全性 を実現
  • 障害時でも正確に中断点から再開可能
  • 長時間実行タスクへの対応力

デフォルト搭載スキル

  • /plan :タスクを承認制プランに変換
  • /grill :プランのストレステスト
  • /goal :目標達成に向けた自動進行
  • 例:ホームのフライスルー動画(mp4)を入力し、 ビジュアルに優れたバケーションホームのマーケティング&予約ページ を自動生成

Muse Spark 1.2 の進化点

  • コード生成・複雑なデバッグ・コードベース理解・開発ワークフローの全体的な性能向上
  • コーディングタスクへの 大規模計算リソース投入 と多様なトレーニング環境
  • 一般的なエージェント機能も引き続き高水準

Muse Code との共同トレーニング

  • Muse Spark 1.2Muse Code と共同トレーニング
  • ゴール・圧縮・サブエージェント最適化のためのリジェクションサンプリングとレシピ最適化
  • Muse Code ツールセット統合によるハーネス互換性の最大化

長期的コーディングタスクへの対応

  • リポジトリ全体生成・大規模プロジェクト・自動リサーチなど 長期的タスク への最適化
  • 作業のシーケンス化(プランニング)、ゴールコンディショニング、コンテキスト圧縮による知識保持

自己改善ループ

  • Muse Spark 1.1 による難易度の高いコーディング環境・指示テンプレート生成
  • ソリューションの達成度を評価し、スケーラブルなトレーニングデータセットを構築
  • 複雑な指示への対応精度向上

ケーススタディ:カーネル最適化

  • GPUカーネル の逐次最適化を1,000回以上のツール呼び出し(最大24時間)で実施
  • Muse Code によるエージェント環境で、コード生成・コンパイル・プロファイル・性能改善を反復
  • NVIDIA Hopper GPU 向けKDA・MLAカーネルでベンチマーク
  • FLA Triton実装をベースラインとし、サードパーティカーネルライブラリの直接利用は禁止
  • チャンク並列準備カーネル+逐次インターチャンクスキャン の組み合わせによる性能向上

利用可能性と今後の展望

  • Muse Code および Meta Model APIMuse Spark 1.2 が本日より利用可能
  • 新しいハーネス機能やより強力なモデルの提供予定
  • 開発者コミュニティへの期待と今後の発展

Hackerたちの意見

これはいいリリースだし、Spark 1.1よりもかなり改善されてるね。Grok 4.5と比べても悪くない。最先端ではないけど、しっかりしたリリースだと思う。もっとDeepseek V4 FlashやLunaの価格に対抗できるようにしないと、なかなか動きが出ないんじゃないかな。

データをトレーニング用に共有するのがOKなら、貢献者モードは素晴らしい価格で、$0.10 / $0.20だよ。

https://pbs.twimg.com/media/HO-59jQaoAA_JZ1?format=jpg すごく興味深いのが、安い「貢献者」版があって、「私たちの製品を改善するために使われる」ってこと。これって価格差別なのか、それともデータがそんなに価値があるのか?大体DeepSeek V4 Flashの価格帯だけど、データを使わないプロバイダーからV4を手に入れることもできるよ。

Metaからのサインアップで$20の無料クレジットをもらった人は注意してね。今は「無料クレジットを使っている間、あなたのコンテンツは製品改善に使われる可能性があります」っていう小さな文字が追加されてる。これはmuse-spark-1.1のリリース時にはなかったことだよ。もしMetaがあなたのデータを保持するのを気にしないなら、「貢献者」価格はdeepseek-v4-flashレベルの安さで、現在のmuse-spark API価格の約1/10だよ。データを保持して使われるのがOKなら魅力的だね。

MetaにフィードバックするモデルのAPIコストもかなり安くなってるよ。

彼らはOpen AIの中堅モデルであるTerraと比較することにしたけど、Solじゃなくて、それでもいくつかのベンチマークで負けてる。Opusを残して、ほぼすべてのベンチマークで負けたのは残念だね。改善しようとするのは悪くないけど、なんでマーケティングのゲームをするの?「フロンティアに近い」って言う前に、まずは価格や性能で中国の研究所に勝つという明確な目標を設定して、それを convincingly 示してほしい。準備ができたら、モデルを隠さずにフロンティアについて話しに戻ってきてほしいな。

もうベンチマークは捨てちゃっていいよ。見たやつはどれも偏ってて信頼性が低い。あまり参考になるデータポイントがないね(残念ながら)。

限定的なベンチマークはあまり信じないけど、もしこれがopusにこれほど近いなら、コストが3分の1で済むのはかなりいいね。Terraもかなり手頃だし、Solが全く入ってないのは怪しいって言うのもその通り。

彼らはSolではなくOpen AIの中堅モデルTerraと比較することを選んで、それでもベンチマークで負けてしまった。少しスクロールすると、Solを含むベンチマークがあって、Terra(予想通り)やSpark 1.2を上回っているのがわかる。

現在のOpenRouterのスループット数値(約180 tk/s)を考えると、Lunaみたいにパラメータ数はかなり少ないと思う。君の言ってた中国のラボに関しては、DeepSeek-V4-Flash-0731との比較がもっと適切だと思う。プレゼンテーション的にはちょっと混乱するけど、推論のヒューリスティックを考慮すれば、ある程度はまともな比較になるよ。(理論的には、TTFTが約8秒とかなり高いから、通常よりも大きなバッチサイズでデコード速度を調整してるかもしれないね。)

もしかしたら、Meta Muse 1.2をTerraやOpusレベルのモデルと競わせようとしてるのかも。彼らはSolをその上のレベルだと考えてるんじゃないかな、Fableと一緒に。

Metaは、データを使わせると入力が10倍の割引($0.10 vs. $1.25/Mtok)、出力が20倍の割引($0.20 vs. $4.25/Mtok)を提供してるよ。 https://developer.meta.com/ai/models/muse-spark/

Hacker Newsで議論の続きを見る