世界を動かす技術を、日本語で。

67セントでARC-AGI-1が44%オフ

概要

  • 小型Transformer を1.5時間で 5090 GPU 上で学習、既存LLMを多数上回る性能
  • ARCベンチマーク で高いサンプル効率とコスト削減を実現
  • 最新アーキテクチャ・アルゴリズム による大幅な性能向上
  • オープンソース で公開、誰でも改良・参加が可能
  • 今後の課題 としてさらなる効率化とデータ拡張排除を目指す

小型Transformerの高速学習とARCベンチマークでの成果

  • 1.5時間NVIDIA 5090 上にて小型Transformerをゼロから学習
  • 多くの LLM を上回る性能、 TRM/HRM と同等スコアをARCで達成
  • 前回モデルからのアップグレードで、 高速・高精度・低コスト を実現
  • ARC-1 の公開評価で高スコア、テスト時学習を行うモデルのみと比較
  • オープンソース として GitHub でコード公開、議論は Twitter で活発

ARCベンチマーク選定理由と意義

  • ARC はメタラーニング型ベンチマーク、 1000問 のみ・高次元空間
  • 各問題は異なるルールだが共通概念あり、 少ない事前知識 で挑戦可能
  • 人間でも容易 に解け、資金力のないAI研究者にもアクセス可能
  • データ効率 を重視し、LLMや大量合成データ利用の手法は比較対象外
  • サンプル効率 の限界探求とコスト削減が研究目的

技術的詳細と主な改良点

  • 入力-出力ペア をトークン列に変換し、小型Transformerで自己回帰学習
  • 各パズルに 個別埋め込み (学習済み)を付与、3D RoPE埋め込み利用
  • カラーパーミュテーション二面体変換 によるデータ拡張
  • 現代的アーキテクチャ (SwiGlu, RMSnorm等)、レイヤー数倍増(4→8)
  • Augmentation削減Normuon最適化手法Flash Attention 導入
  • 出力トークンのみ で損失計算、精度向上と安定化を実現
  • ARC-2 の非重複タスク追加、データリーク防止のため厳密にフィルタリング

興味深い挙動とアブレーション結果

  • 入力トークン学習廃止 で監督学習化、テスト損失は悪化もスコア向上
  • 3D RoPEパズル別埋め込み が性能に大きく寄与(除去で25%まで低下)
  • 入力学習あり だとやや精度低下(~39%)、 1D RoPE や埋め込み除去で大幅低下
  • CompressARCスタイル (各タスク個別・非監督)はさらに性能低下
  • Augmentationや合成データなし でも高い性能維持可能性

さらなる貢献と今後の課題

  • 誰でも改良可能なオープンソース、スコア・コスト削減に挑戦歓迎
  • RoPEの改良 (PoPEなど)、アーキテクチャの更なる近代化
  • GPU手書きコード 等で10倍のコスト削減も視野
  • データ拡張排除 の工夫と、低コスト学習の両立が今後の課題
  • Transformerのみで65%達成 も十分現実的と示唆

ARCベンチマークと研究コミュニティの反応

  • 前回成果 はX(旧Twitter)で拡散、著名研究者から議論・批判・検証多数
  • 評価パズルでの学習はチートではない (ラベル未使用、メタラーニングの本旨)
  • 入力学習は情報リークではない (伝統的な帰納的推論として許容)
  • コスト計算は全ライフタイムコストを明示、他モデルと公平比較
  • 全テストタスク同時学習は現実的でない という批判もあるが、TRM等も同様
  • ARC自体の意義 や「流動知能」評価としての価値を改めて強調

まとめと今後の展望

  • Transformer+適切な表現 のみで高いARCスコアを低コストで達成
  • データ拡張や合成データなし でも一定の性能維持が可能
  • 65%突破 もTransformerフレームワーク内で十分達成可能と示唆
  • コスト・サンプル効率の限界 を探求し続け、誰でも再現・拡張可能な環境提供
  • 流動知能 の測定・研究、次世代AIの基礎技術への貢献