Personal news Publisher

AMDとCerebrasが推論基盤を分業、入力処理と高速生成を別チップへ

AMD HeliosとCerebras WSEがAI推論を分担する図解

AMDとCerebrasは、AI推論の工程を異なる計算機へ分ける共同基盤を発表しました。AMD Heliosが大量の入力と長い文脈を処理し、CerebrasのWafer-Scale Engineが低遅延のトークン生成を担当します。すべてを同じGPUで処理する構成から、工程ごとに得意なハードを組み合わせる動きです。

推論を2段階に分ける構成

両社は7月23日、AMD HeliosラックとCerebras WSEを一つの推論フローへ統合すると発表しました。プロンプト処理はAMD、デコードとトークン生成はCerebrasが担当し、Cerebras Cloudで2026年後半の提供を予定します。

異なるチップを組み合わせる理由

長い入力を大量に処理する能力と、回答を素早く返す能力ではボトルネックが異なります。分離構成により、リアルタイムエージェントやコーディング支援の応答速度を保ちながら、全体の処理量を増やす狙いです。

導入判断で見るべき点

クラウド事業者や大規模導入企業は、GPU台数だけでなく、入力処理と生成処理の配分、接続遅延、障害時の切り替えを評価する必要があります。 最大5倍の電力当たり性能は両社の想定値で、実サービスでの構成や料金は未確定です。提供時期と第三者評価を確認してください。

引用元