世界を動かす技術を、日本語で。

Kimi Linear: 表現力豊かで効率的なアテンションアーキテクチャ

2026年7月28日原文(arxiv.org)

概要

  • Kimi Linear は従来のfull attentionを超える新しいハイブリッド線形アテンションアーキテクチャ
  • Kimi Delta Attention (KDA) による高効率・高表現力の実現
  • 計算効率メモリ節約 を両立し、長文やRLでも優位性
  • ソースコード・学習済みモデル も公開
  • 多様なタスク で従来手法より大幅な性能向上を実証

Kimi Linear: ハイブリッド線形アテンションの新提案

  • Kimi Linear は、従来のfull attentionを初めて公平な条件下で上回る線形アテンションアーキテクチャ
  • 短文・長文強化学習(RL) のスケーリング全てで高性能を発揮
  • 中核となる Kimi Delta Attention (KDA) は、Gated DeltaNetを拡張し きめ細かいゲーティング機構 を搭載
  • 有限状態RNNメモリ の有効活用を実現
  • 独自の チャンクワイズアルゴリズム を適用
    • Diagonal-Plus-Low-Rank (DPLR) 遷移行列の特殊バリアントを利用
    • 一般的なDPLRよりも 計算コスト大幅削減
    • 古典的デルタ則 との整合性向上

モデル設計と学習

  • Kimi Linearモデル3Bの活性パラメータ48Bの総パラメータ で事前学習
  • KDAMulti-Head Latent Attention (MLA) のレイヤーハイブリッド構成
  • 同一学習レシピ で比較した場合、Kimi Linearはfull MLAを 全タスクで大幅に上回る精度
  • KVキャッシュ使用量 を最大75%削減
  • 1Mコンテキスト で最大6倍のデコーディングスループットを達成

性能・応用・公開

  • full attentionアーキテクチャドロップイン置換 として利用可能
  • 長入力・長出力タスク でも 高効率・高性能 を両立
  • KDAカーネル および vLLM実装 をオープンソースで公開
  • 事前学習済み・命令チューニング済みチェックポイント もリリース
  • 研究・実務両面での発展 を後押しする基盤提供

Hackerたちの意見

もう9ヶ月経ってるし、最近大きなモデルがリリースされたからね。

OPがこれを投稿したのは、新しいKimi K3が69のKDAレイヤーを持ってるからだと思う(他は24のGated MLA)。前の大きなKimiモデルはMLAレイヤーだけだった気がする。

K3については、これを読んでみて: https://arxiv.org/abs/2607.24653 K3の論文の主な貢献はStable LatentMoEだよ。他のモデルと同じように、レイヤー間で送信されるデータを圧縮していて、ルーターに特定の要件を課してる。K3は、よりバランスの取れたエキスパート選択戦略を使うことでパフォーマンスを向上させてる。

当時あまり話題にならなかったけど: https://news.ycombinator.com/item?id=45766937

Zhangらのまたすごいのが出たね。

Kimiの成功が蒸留攻撃に関するものだと思いたいなら、これを無視してもいいよ。

まだよくわからないんだよね。アメリカに「AIレースで勝ってほしい」と思ってるけど、今日のほとんどの発明が過去の知識の「蒸留」じゃないのか理解するのが難しい。Anthropicは、彼らが盗んだデータを企業秘密として主張してるの?

これは偽の二分法だよね?中国の研究所がすごく革新してるのは明らか。でも、蒸留による可能性のある利点を否定するわけじゃない。後者の程度はわからないけど、両方が真実であり得るよね。

フロンティアモデルは一つの要素だけでは作れないよ。これは段階的な改善だけど、モデルの成功全体を説明するわけじゃない。トレーニングセットはすごく重要だから、蒸留についてどう思うかに関わらずね。

よく言ったね。蒸留理論は、FableがKimiがリリースされる前に実質的に数日しか存在しなかったから、全く意味がないよ。

蒸留に関する不満は、カジノがカードカウントについて文句を言うのと似てると思う。

一方を排除しなきゃいけないの?

Hacker Newsで議論の続きを見る