世界を動かす技術を、日本語で。

Bonsai 2 27B: 9倍小さなフットプリントでのほぼロスレス圧縮

2026年9月18日原文(prismml.com)

概要

  • Ternary Bonsai 2 27B は、圧倒的な省メモリ・高効率を維持しつつ、推論・コーディング・マルチモーダル能力を大幅強化
  • Qwen3.8 27B ベースで、98.2%の性能維持と9倍以上の圧縮率を両立
  • 262Kトークン文脈長、テキスト+画像入力、 Apache 2.0ライセンス 対応
  • NVIDIA/Appleデバイス で高速動作、省電力性向上
  • ローカルAI活用やAIシステム全体の経済性・設計に大きな影響を与える新展開

Ternary Bonsai 2 27B:次世代ローカルAIモデル

  • Ternary Bonsai 2 27B は、 Qwen3.8 27B を基にした最新・最強のBonsaiモデル
  • 推論、コーディング、ビジョン、エージェント性能の大幅向上
  • {−1, 0, +1} 三値重みFP16グループスケーリング 採用
    • 1重みあたり1.76ビット、モデル全体で 5.9GB の超軽量化
  • 262Kトークン の文脈長、テキスト・画像のマルチモーダル入力対応
  • Apache 2.0ライセンス で公開、商用利用も可能

圧縮と性能維持の両立

  • フル精度モデル比で 9倍以上小型化 しつつ、 98.2% のベンチマーク性能維持
  • ローカルデバイスでの展開を現実的にする圧縮技術
  • コーディングエージェントツール利用長期推論 での高性能維持
    • 小さな誤差が積み重なるタスクでも、フル精度モデルと遜色ない安定性
  • 他の低ビットモデルと比較し、 知能密度(性能/GB) で突出

ベンチマーク結果

  • 総合スコア: 83.9 (Qwen3.8 27Bは85.4)
  • 分野別スコア(Ternary Bonsai 2 27B / Qwen3.8 27B)
    • エージェント&ツール利用: 77.57 / 79.74
    • コーディング: 81.58 / 82.17
    • 指示追従: 82.66 / 81.25
    • 知識&推論: 83.95 / 86.66
    • 数学: 96.57 / 97.06
    • ビジョン: 78.59 / 81.64

高速性・省電力性

  • NVIDIA GeForce RTX 5090 で最大 143トークン/秒
  • Apple M5 Max46.8トークン/秒
  • RTX 40900.714 mWh/トークン (8Bフル精度比で40%省エネ)
  • 高スループットにより、コーディングやマルチモーダルエージェントの応答性向上
  • 省電力化で、バッテリー寿命延長や常時ローカル稼働が現実に

意義と今後の展望

  • フル精度モデルとの性能ギャップを 95%→98%超 まで縮小
  • 事実上「 ロスレス」な低ビットAIの実現
  • ローカル推論だけでなく、 AIシステム全体のコスト・設計 に革命
    • 同じメモリでより大きなモデルを搭載可能
    • サーバーあたりの同時ユーザー数増加
    • 消費電力削減、ハイブリッドAI(ローカル+クラウド)の実現性向上
  • 今後は「 知能密度」がAIモデル選定の重要指標に

プラットフォーム対応・技術詳細

  • NVIDIA GPU(CUDA)Apple(MLX) で動作
  • カスタム低ビットカーネルで高速推論
  • モデル重みは Apache 2.0ライセンス で公開中
  • 圧縮・評価・ベンチマークの詳細は ホワイトペーパー 参照

導入・パートナー募集

  • Bonsaiモデルの アプリケーション最適化推論高速化 の共同開発提案
  • メモリ・レイテンシ・消費電力要件が厳しいAI製品開発者向け支援
  • お問い合わせ: contact@prismml.com

PrismMLについて・採用情報

  • Caltech 研究者発のスタートアップ、 Khosla VenturesCerberusGoogleSamsung 支援
  • ニューラルネットワーク圧縮と性能維持の研究・開発に注力
  • 次世代AI開発に興味ある方は 採用ページ をチェック