概要
- Kimi Linear は従来のfull attentionを超える新しいハイブリッド線形アテンションアーキテクチャ
- Kimi Delta Attention (KDA) による高効率・高表現力の実現
- 計算効率 と メモリ節約 を両立し、長文やRLでも優位性
- ソースコード・学習済みモデル も公開
- 多様なタスク で従来手法より大幅な性能向上を実証
Kimi Linear: ハイブリッド線形アテンションの新提案
- Kimi Linear は、従来のfull attentionを初めて公平な条件下で上回る線形アテンションアーキテクチャ
- 短文・長文 ・ 強化学習(RL) のスケーリング全てで高性能を発揮
- 中核となる Kimi Delta Attention (KDA) は、Gated DeltaNetを拡張し きめ細かいゲーティング機構 を搭載
- 有限状態RNNメモリ の有効活用を実現
- 独自の チャンクワイズアルゴリズム を適用
- Diagonal-Plus-Low-Rank (DPLR) 遷移行列の特殊バリアントを利用
- 一般的なDPLRよりも 計算コスト大幅削減
- 古典的デルタ則 との整合性向上
モデル設計と学習
- Kimi Linearモデル は 3Bの活性パラメータ、 48Bの総パラメータ で事前学習
- KDA と Multi-Head Latent Attention (MLA) のレイヤーハイブリッド構成
- 同一学習レシピ で比較した場合、Kimi Linearはfull MLAを 全タスクで大幅に上回る精度
- KVキャッシュ使用量 を最大75%削減
- 1Mコンテキスト で最大6倍のデコーディングスループットを達成
性能・応用・公開
- full attentionアーキテクチャ の ドロップイン置換 として利用可能
- 長入力・長出力タスク でも 高効率・高性能 を両立
- KDAカーネル および vLLM実装 をオープンソースで公開
- 事前学習済み・命令チューニング済みチェックポイント もリリース
- 研究・実務両面での発展 を後押しする基盤提供