新たな言語モデルPSSA、トランスフォーマーを超える学習効率を実現!

要約

PSSAは、トランスフォーマーではない小さな言語モデルで、Rustでゼロから書かれています。このモデルは、トークンを一つずつ読み込み、エピソードメモリを保持しながら、実行中に自らの重みを一部書き換えます。同じパラメータとコーパスで比較すると、トランスフォーマーよりも早く学習し、同じCPU上で約12倍の速さでテキストを生成します。

PSSAの設計において、Rustが選ばれた理由は、速度のためではなく、トークンごとの重みの更新やメモリバンクの効率的な管理が必要だったからです。従来の自動微分フレームワークを利用することが困難だったため、線形代数を直接書くことで実装が簡潔になり、勾配を確認可能にしました。このアーキテクチャが重要な主張であり、実装言語は詳細に過ぎません。

PSSAは、トランスフォーマーとは異なり、固定サイズの状態を用いて一方向にシーケンスを処理し、メモリバンクから情報を取得します。コストはシーケンスの長さに対して線形に増加します。この構造により、効率的に情報を保持し、学習を加速させることが可能です。


元記事: https://github.com/Sparticle62ops/pssa

公開日: Wed, 30 Sep 2026 03:19:54 +0000


この記事はAIアシスト編集により作成されています。

📰 元記事: 元記事を読む

コメントする