新たな学習手法「Dust」がバックプロパゲーションを超える可能性

要約

新しい手法「Dust」は、トランスフォーマー言語モデルの事前トレーニングにおいて、従来のバックプロパゲーションに匹敵する最初のゼロ次法を提案します。Dustは、各トークンで独立してアクティベーションを摂動し、一度のフォワードパスで全てのトークンを並行して評価することができます。この方法では、大規模な計算リソースがあればバックプロパゲーションを超える可能性が示唆されています。

従来の重み空間進化戦略(ES)と比較して、Dustははるかに効率的であり、1Mトークン以上の規模では、最先端のES手法EGGROLLに対して1000倍から10000倍の効率を達成しています。興味深いことに、Dustは大きなモデルほど人口効率が良く、243Mパラメータのモデルが120倍小さいモデルを上回る成果を上げています。

この研究は、バックプロパゲーションに依存しない新しい学習アルゴリズムの必要性を示しており、計算資源が豊富な環境では、より一般的で brute-forceな学習方法が有効である可能性を示しています。Dustは、スケールを持つ中でバックプロパゲーションの勾配推定と良好に一致し、1Bトークンまでのスケールでその整合性を維持しています。


元記事: https://qlabs.sh/research/dust

公開日: Mon, 05 Oct 2026 21:15:07 +0000


この記事はAIアシスト編集により作成されています。

📰 元記事: 元記事を読む

コメントする