67セントでARC-AGI-1が44%オフ
概要
- 小型Transformer を1.5時間で 5090 GPU 上で学習、既存LLMを多数上回る性能
- ARCベンチマーク で高いサンプル効率とコスト削減を実現
- 最新アーキテクチャ・アルゴリズム による大幅な性能向上
- オープンソース で公開、誰でも改良・参加が可能
- 今後の課題 としてさらなる効率化とデータ拡張排除を目指す
小型Transformerの高速学習とARCベンチマークでの成果
- 1.5時間 で NVIDIA 5090 上にて小型Transformerをゼロから学習
- 多くの LLM を上回る性能、 TRM/HRM と同等スコアをARCで達成
- 前回モデルからのアップグレードで、 高速・高精度・低コスト を実現
- ARC-1 の公開評価で高スコア、テスト時学習を行うモデルのみと比較
- オープンソース として GitHub でコード公開、議論は Twitter で活発
ARCベンチマーク選定理由と意義
- ARC はメタラーニング型ベンチマーク、 1000問 のみ・高次元空間
- 各問題は異なるルールだが共通概念あり、 少ない事前知識 で挑戦可能
- 人間でも容易 に解け、資金力のないAI研究者にもアクセス可能
- データ効率 を重視し、LLMや大量合成データ利用の手法は比較対象外
- サンプル効率 の限界探求とコスト削減が研究目的
技術的詳細と主な改良点
- 入力-出力ペア をトークン列に変換し、小型Transformerで自己回帰学習
- 各パズルに 個別埋め込み (学習済み)を付与、3D RoPE埋め込み利用
- カラーパーミュテーション や 二面体変換 によるデータ拡張
- 現代的アーキテクチャ (SwiGlu, RMSnorm等)、レイヤー数倍増(4→8)
- Augmentation削減、 Normuon最適化手法、 Flash Attention 導入
- 出力トークンのみ で損失計算、精度向上と安定化を実現
- ARC-2 の非重複タスク追加、データリーク防止のため厳密にフィルタリング
興味深い挙動とアブレーション結果
- 入力トークン学習廃止 で監督学習化、テスト損失は悪化もスコア向上
- 3D RoPE や パズル別埋め込み が性能に大きく寄与(除去で25%まで低下)
- 入力学習あり だとやや精度低下(~39%)、 1D RoPE や埋め込み除去で大幅低下
- CompressARCスタイル (各タスク個別・非監督)はさらに性能低下
- Augmentationや合成データなし でも高い性能維持可能性
さらなる貢献と今後の課題
- 誰でも改良可能なオープンソース、スコア・コスト削減に挑戦歓迎
- RoPEの改良 (PoPEなど)、アーキテクチャの更なる近代化
- GPU手書きコード 等で10倍のコスト削減も視野
- データ拡張排除 の工夫と、低コスト学習の両立が今後の課題
- Transformerのみで65%達成 も十分現実的と示唆
ARCベンチマークと研究コミュニティの反応
- 前回成果 はX(旧Twitter)で拡散、著名研究者から議論・批判・検証多数
- 評価パズルでの学習はチートではない (ラベル未使用、メタラーニングの本旨)
- 入力学習は情報リークではない (伝統的な帰納的推論として許容)
- コスト計算は全ライフタイムコストを明示、他モデルと公平比較
- 全テストタスク同時学習は現実的でない という批判もあるが、TRM等も同様
- ARC自体の意義 や「流動知能」評価としての価値を改めて強調
まとめと今後の展望
- Transformer+適切な表現 のみで高いARCスコアを低コストで達成
- データ拡張や合成データなし でも一定の性能維持が可能
- 65%突破 もTransformerフレームワーク内で十分達成可能と示唆
- コスト・サンプル効率の限界 を探求し続け、誰でも再現・拡張可能な環境提供
- 流動知能 の測定・研究、次世代AIの基礎技術への貢献