概要
- ブラウザ上で ローカルAIモデル による意思決定実験が可能
- バックエンド不要、データは端末から外部に送信されない設計
- 複数のモデルサイズと精度が選択可能、 GPU対応
- 2つの手法で 選択肢確率 を計測・比較
- モデルの読み込みや推論の 処理時間も可視化
ブラウザで動くローカルDecision Modelの解説
- ローカルAIモデル を用いた意思決定実験の提供
- 選択肢の確率 を直接読み出す手法(logits読み取り)と、 JSON形式で生成 させる手法の比較
- モデルサイズや精度に応じて、 MiniCPM5 2B(1.56GB) や Qwen3 0.6B(639MB) など複数モデルを選択可能
- モデルのロード・ウォームアップ・推論など、 各処理の所要時間 をリアルタイムで計測
- Hugging Face からモデルウェイトを取得し、 ブラウザキャッシュ に保存
- 入力データは 外部送信されず、端末内で完結
モデル選択と精度・サイズの違い
- Qwen3 0.6B :小容量、スマホなど低スペック端末向け、精度はやや低め
- MiniCPM5 2B :デスクトップ推奨、バランスの取れた精度と容量
- Qwen3.5 4B :高精度だがメモリ消費大、ハイスペック端末向け
- 各モデルの精度指標として Balanced Accuracy や TypeSafe などを表示
- モデル精度は 量子化 や端末性能によって変動
推論手法の比較
- 直接読み出し(Direct Readout)
- モデルのlogitsから 指定した選択肢のみ のソフトマックス計算
- デコード不要、 高速
- トークン生成(JSON Generation)
- モデルに 選択肢分布をJSON形式で出力 させる
- 1トークンずつ生成、 リアルタイムで出力を確認
- 両手法を同一GPU上で連続実行 し、 速度や出力の違い を計測
実験環境・注意点
- セットアップ :初回読み込みやウォームアップは数分かかる場合あり
- 端末性能 やネットワーク速度により体験が異なる
- 量子化モデル 利用のため、精度や速度はオリジナルモデルと異なる場合あり
- プライバシー重視 :入力データは一切外部送信されない
まとめ
- 完全ローカル環境 でAIモデルの意思決定過程を可視化
- モデルや手法ごとの違い を手軽に比較・体験可能
- プライバシー保護 と リアルタイム性能計測 を両立