Bonsai 2 27B: 9倍小さなフットプリントでのほぼロスレス圧縮
概要
- Ternary Bonsai 2 27B は、圧倒的な省メモリ・高効率を維持しつつ、推論・コーディング・マルチモーダル能力を大幅強化
- Qwen3.8 27B ベースで、98.2%の性能維持と9倍以上の圧縮率を両立
- 262Kトークン文脈長、テキスト+画像入力、 Apache 2.0ライセンス 対応
- NVIDIA/Appleデバイス で高速動作、省電力性向上
- ローカルAI活用やAIシステム全体の経済性・設計に大きな影響を与える新展開
Ternary Bonsai 2 27B:次世代ローカルAIモデル
- Ternary Bonsai 2 27B は、 Qwen3.8 27B を基にした最新・最強のBonsaiモデル
- 推論、コーディング、ビジョン、エージェント性能の大幅向上
- {−1, 0, +1} 三値重み + FP16グループスケーリング 採用
- 1重みあたり1.76ビット、モデル全体で 5.9GB の超軽量化
- 262Kトークン の文脈長、テキスト・画像のマルチモーダル入力対応
- Apache 2.0ライセンス で公開、商用利用も可能
圧縮と性能維持の両立
- フル精度モデル比で 9倍以上小型化 しつつ、 98.2% のベンチマーク性能維持
- ローカルデバイスでの展開を現実的にする圧縮技術
- コーディングエージェント や ツール利用、 長期推論 での高性能維持
- 小さな誤差が積み重なるタスクでも、フル精度モデルと遜色ない安定性
- 他の低ビットモデルと比較し、 知能密度(性能/GB) で突出
ベンチマーク結果
- 総合スコア: 83.9 (Qwen3.8 27Bは85.4)
- 分野別スコア(Ternary Bonsai 2 27B / Qwen3.8 27B)
- エージェント&ツール利用: 77.57 / 79.74
- コーディング: 81.58 / 82.17
- 指示追従: 82.66 / 81.25
- 知識&推論: 83.95 / 86.66
- 数学: 96.57 / 97.06
- ビジョン: 78.59 / 81.64
高速性・省電力性
- NVIDIA GeForce RTX 5090 で最大 143トークン/秒
- Apple M5 Max で 46.8トークン/秒
- RTX 4090 で 0.714 mWh/トークン (8Bフル精度比で40%省エネ)
- 高スループットにより、コーディングやマルチモーダルエージェントの応答性向上
- 省電力化で、バッテリー寿命延長や常時ローカル稼働が現実に
意義と今後の展望
- フル精度モデルとの性能ギャップを 95%→98%超 まで縮小
- 事実上「 ロスレス」な低ビットAIの実現
- ローカル推論だけでなく、 AIシステム全体のコスト・設計 に革命
- 同じメモリでより大きなモデルを搭載可能
- サーバーあたりの同時ユーザー数増加
- 消費電力削減、ハイブリッドAI(ローカル+クラウド)の実現性向上
- 今後は「 知能密度」がAIモデル選定の重要指標に
プラットフォーム対応・技術詳細
- NVIDIA GPU(CUDA)、 Apple(MLX) で動作
- カスタム低ビットカーネルで高速推論
- モデル重みは Apache 2.0ライセンス で公開中
- 圧縮・評価・ベンチマークの詳細は ホワイトペーパー 参照
導入・パートナー募集
- Bonsaiモデルの アプリケーション最適化 や 推論高速化 の共同開発提案
- メモリ・レイテンシ・消費電力要件が厳しいAI製品開発者向け支援
- お問い合わせ: contact@prismml.com
PrismMLについて・採用情報
- Caltech 研究者発のスタートアップ、 Khosla Ventures、 Cerberus、 Google、 Samsung 支援
- ニューラルネットワーク圧縮と性能維持の研究・開発に注力
- 次世代AI開発に興味ある方は 採用ページ をチェック