要約
Etched Sohuは、トランスフォーマー専用のASICで、高速な推論処理を実現しています。Etched AIによると、1つの8チップSohuサーバーはLlama 70Bを用いて毎秒500,000トークンを処理でき、これはチップあたり62,500トークンに相当します。これに対し、NVIDIAのH100 SXM5はバッチ1で約700トークンを処理します。Sohuはトランスフォーマーアーキテクチャが今後数年間のAIの主流となるとの仮定に基づいており、プログラマビリティを放棄する代わりに高いスループットを実現しています。
Etched AIは2022年に設立され、約8億ドルを調達し、最初の製品であるSohuチップは自己回帰型言語モデルの推論のために設計されています。2026年6月30日にステルスから正式に抜け出し、実働するA0シリコンを展示し、10億ドル以上の契約を獲得しましたが、現在は購入やレンタルができる状態ではありません。
Sohuアーキテクチャの最大の特徴は、トランスフォーマーの注意機構を固定機能のシリコンとして実装することで、GPUでは実現できないスループットを達成することです。ただし、プログラマビリティがないため、将来のモデルに適応できないリスクも存在します。これにより、特定のワークロードにおいてSohuの選択が適切かどうかを評価する必要があります。
元記事: https://www.spheron.network/blog/etched-ai-sohu-vs-nvidia-transformer-asic-inference/
公開日: Sun, 23 Aug 2026 18:27:33 +0000
この記事はAIアシスト編集により作成されています。
📰 元記事: 元記事を読む