概要
Cerebrasのパブリックエンドポイントでは、オリジナルの未剪定モデルのみ提供。 量子化はストレージ時のみ選択的に実施、高精度を維持。 REAPによる剪定済みモデルはHugging Faceでのみ公開。 モデルアーキテクチャは予告なく変更されない方針。 圧縮・量子化・剪定の定義と運用方針。
Cerebrasパブリックエンドポイントで提供されるモデル一覧
-
Cerebrasパブリックエンドポイント 上で利用可能なモデルは、 無料トライアル および 従量課金制 で提供
- 利用には レート制限や価格設定 が適用
- Dedicated Endpoints では追加のモデルファミリー、専用キャパシティ、SLAが利用可能
-
提供モデル例
- OpenAI GPT OSS
- モデルID: gpt-oss-120b
- パラメータ数: 120 billion
- コンテキスト長: 65k(無料)/ 131k(有料)
- 推論速度:約 3000 tokens/s
- Qwen 3.8 27B
- モデルID: qwen-3.8-27b
- パラメータ数: 27 billion
- コンテキスト長: 64k(無料)/ 128k(有料)
- 推論速度:約 1500 tokens/s
- OpenAI GPT OSS
モデル圧縮・量子化・剪定の運用方針
-
全モデル は 未剪定(unpruned) のオリジナルバージョン
- 剪定済みモデル はパブリックAPIで提供せず
- REAP(Router-weighted Expert Activation Pruning) などの研究成果は Hugging Face で公開
-
量子化(Quantization) は ストレージ時のみ 選択的に実施
- 16bit/8bit/4bit の部分的な量子化
- 高精度が必要な層 はフル精度で保存し、推論時に 動的デクオンタイズ
- アクティベーション・Attention・kvキャッシュ は フル精度・非量子化
よくある質問(FAQ)
-
モデルアーキテクチャの無断変更有無
- 予告なくアーキテクチャ変更はしない方針
- 剪定などの新技術 を導入する場合は 別エンドポイント・明確な名称 で提供
-
REAP剪定済みモデルの入手先
- Hugging FaceのCerebras REAP Collection で研究・実験用途として公開
- プロダクションAPIでは未提供
-
圧縮・量子化・剪定の定義
- 圧縮(Compression) :モデルサイズや計算負荷を減らす総称
- 量子化(Quantization) :重みの数値精度を下げてメモリ使用量を削減(例:FP16→FP8)
- モデル構造は変更しない
- 剪定(Pruning) :モデルの一部(層やエキスパート)を恒久的に削除
- モデル構造が変化し、別モデルとなる
- 量子化(Quantization) :重みの数値精度を下げてメモリ使用量を削減(例:FP16→FP8)
- 圧縮(Compression) :モデルサイズや計算負荷を減らす総称
追加情報・参考リンク
- REAP技術詳細 :Cerebras公式リサーチブログ参照
- Hugging Face REAP Collection :Cerebrasの剪定済みモデル公開ページ