AIの進化を、ニュースで終わらせない。

半導体・インフラ · ·

DeepSeekがHuawei向けにAIの計算と通信を支えるソフトを公開

NVIDIA以外のチップでAIを動かすには、計算の手順、メモリ上のデータ配置、チップ間の通信まで整える必要がある。DeepGEMM-AscendとDeepEP-Ascendの公開から、その理由とAPI互換の範囲を読む。性能値は開発元の測定で、通信の測定環境には一般配布前のPoC HDKが使われている。

DeepSeekは2026年9月30日、HuaweiのAI向けチップAscend 950に対応する「DeepGEMM-Ascend」を初公開した。AIが大量に行う行列の計算を、Ascend上で速く処理するためのソフトウェアだ。複数のチップでAIを動かす際の通信を担う「DeepEP-Ascend」も公開されている。DeepGEMMの公開情報・DeepEPの説明

この公開から分かるのは、AI用のチップを変えると、計算とデータの運び方も作り直す必要があることだ。NVIDIA以外のチップに同じモデルを載せても、計算に使う数字が届くのを待っていては性能を発揮できない。DeepSeekの実装を読むと、何を共通にし、何をAscendに合わせたのかが見えてくる。

目次

  1. 行列演算にはチップに合った計算手順が要る
  2. 同じ数字でもメモリ上の並べ方を変える
  3. MoEでは計算の前後にチップ同士が通信する
  4. APIをそろえても使える機能には差がある
  5. 通信性能は一般配布前の環境で測られている
  6. 運用を判断するにはモデル全体での確認が残る

行列演算にはチップに合った計算手順が要る

AIは文章を数値の列に変えて処理する。その数値と、学習で得た「重み」と呼ばれる数値を掛け合わせ、足し合わせる計算を繰り返す。数値を縦横に並べた表が行列で、行列同士の積を求める処理をGEMMと呼ぶ。DeepGEMMは、この処理をまとめて呼び出せるライブラリだ。

たとえば多くの文章を一度に処理するときは、行列を小さな区画に分けてチップの計算器へ渡す。区画の大きさや計算の順番がチップの構造に合わなければ、計算器に余裕があっても待ち時間が増える。こうした処理を実行する小さなプログラムを「カーネル」という。

DeepGEMM-Ascendは、Ascendの行列乗算と加算の命令を使う。BF16、FP8、FP4という数値形式に対応し、データの読み込みと計算を重ねるなど、Ascend向けの工夫を施している。名前にある16、8、4は、各形式で一つの数値を表すビット数だ。少ないビット数ならデータを小さくできる一方、表現できる値や精度にも制約がある。DeepGEMMの概要と対応形式

計算手順を書くための道具も必要になる。DeepGEMM-Ascendの一部の処理では、カーネル開発用の言語TileLangを使っている。TileLangのAscend向け実装は、データのコピーや計算順序、処理同士の待ち合わせをチップに合わせて組み立てる。開発者が指定する計算を、実際の命令へ変換する部分にも対応作業がある。DeepGEMMの依存関係・TileLangのAscend向け説明

同じ数字でもメモリ上の並べ方を変える

行列の計算を速くするには、数字をメモリから読み出す手順も整えたい。必要な数字をチップが読みやすいまとまりで置けば、計算器へ渡しやすくなる。行列の縦横が同じでも、メモリ上でどの順に保存するかは別の問題だ。

DeepGEMM-Ascendには、NVIDIA向け実装との具体的な違いがある。低精度の数値を扱うためのスケーリング係数、つまり値の尺度を表す補助データの保存形式だ。Ascendでは係数を2個ずつ16ビットの整数に詰め、決められた順序で置く。READMEはこの違いを明記し、必要な配置へ変換する関数も案内している。係数の配置と変換関数

ソフトウェアを呼び出す方法が共通でも、入力データの準備まで同じとは限らない。この例は、チップを変える際に確かめるべき箇所を具体的に示している。関数名の確認に加え、渡すデータの形式や配置を合わせる作業が要る。

MoEでは計算の前後にチップ同士が通信する

MoEは、一つのモデルの中に複数の計算部を持ち、入力ごとに使う計算部を選ぶ仕組みだ。この計算部を「エキスパート」と呼ぶ。文章を処理する単位であるトークンごとに担当を選び、必要なエキスパートへ数値データを渡す。

エキスパートを複数のチップへ分けて置くと、担当が別のチップにいる場合に通信が必要になる。この分担方法がエキスパート並列、略してEPだ。送り先へデータを配る処理をdispatch、計算結果を集めてまとめる処理をcombineと呼ぶ。DeepEP-Ascendは、この往復の通信を担当する。DeepEPの機能と利用例

MoEの処理ソフトウェアが行うこと
入力を配る選ばれたエキスパートがあるチップへデータを送る
行列を計算する届いたデータを適切に並べて各エキスパートの計算を行う
結果を集める計算結果を元の担当へ戻してまとめる
DeepEPの利用例に基づきLATENTが処理の順番を整理した。実際には、通信と独立した計算を重ねて進められる。出典と実装例

チップ単体の計算が速くても、入力が届かなければ担当のエキスパートは計算を始められない。結果の回収にも時間がかかる。このため、DeepGEMMが担う計算の最適化と、DeepEPが担うチップ間の受け渡しの両方を整える必要がある。

APIをそろえても使える機能には差がある

APIは、別のプログラムから機能を呼び出すための決まりだ。DeepSeekはDeepGEMM-Ascendについて、DeepGEMMのAPIと完全に互換で、同じパッケージ名と開発手順を使えると説明している。ただし、この説明の対象はDeepGEMMのAPIである。NVIDIAのGPUを使う開発基盤CUDAの全体を置き換えた、という発表ではない。DeepGEMMの互換性の説明

DeepEP-Ascendも、NVIDIA向けDeepEPのAPIに合わせている。ただし、Ascend固有の動作条件がある。さらに、APIの形が用意されていても、内部の通信処理が未実装のものまで存在する。DeepEPのAPI対応表

複数のチップでデータを集めたり集計したりするBucket機能は実験段階にある。データを集めるall-gatherは利用できるが、集計を伴うreduce-scatterとall-reduceは開発中だ。計算段階をチップ間で分担するPPと、離れたメモリにアクセスするEngramも実験中で、正しさと性能の検証が続いている。エキスパートの負荷を調整する一部のAPIには、Ascend用の通信カーネルがまだない。開発中の機能

APIをそろえることには、既存のコードを移しやすくする意味がある。一方で、必要な機能が実装済みか、同じ結果が得られるか、十分な速さが出るかは、それぞれ確認が要る。「API互換」だけで、全機能や性能が同等だとは判断できない。

通信性能は一般配布前の環境で測られている

DeepGEMM-AscendのREADMEには、Ascend 950DTで行列演算がハードウェア上限の最大99.8%に達したという測定が載っている。これは特定の大きさのBF16行列を計算したときの値だ。CANN 9.20と専用の測定関数を使い、L2キャッシュにデータが残っていない条件で測っている。モデル全体が理論性能の99.8%で動くという意味ではない。DeepGEMMの測定条件と結果

DeepEP-Ascendは、通信に参加する処理単位であるrankを8から128まで増やした結果を公表している。EP8なら8 rank、EP128なら128 rankで分担する設定だ。帯域は1秒あたりに転送できるデータ量を表す。

EPの規模 入力を配る帯域 結果を集める帯域
EP8 373〜375 GB/s 345〜347 GB/s
EP16 348〜352 GB/s 338〜341 GB/s
EP32 335〜340 GB/s 320〜324 GB/s
EP64 323〜327 GB/s 294〜298 GB/s
EP128 313〜320 GB/s 272〜278 GB/s

出典:DeepEPの性能表。数値の幅は参加する全rankの範囲を表す。NVIDIA製チップとの比較値ではない。

測定機はAscend 950DTで、ソフトウェア基盤はCANN 9.2.0だ。256個のエキスパートからトークンごとに6個を選び、入力の配布にはFP8、結果の回収にはBF16を使う。rankごとの容量は16,384トークン、数値列の幅は7,168で、スーパーノード外部のClosネットワークを利用している。各rankで10回の予備実行と50回の測定を行い、キャッシュをフラッシュした。計測時間には転送の発行と転送完了までを含むが、最後の後処理は含まない。

この通信性能の測定には、DeepSeekへ提供された概念実証用のPoC HDKと手動設定が使われた。HDKはドライバーやファームウェアなど、ハードウェアを動かす側のソフトウェア一式だ。測定に使った構成は一般配布されておらず、公開コードを入れただけで同じ帯域が出るとは限らない。HDKとファームウェアの条件

READMEが推奨するのは、HuaweiのAtlas 850E向けQ3商用HDKだ。一般公開は2026年10月中旬、10月15日頃を予定していると記載されている。ただし、Huaweiの公開予定であり、日付の確約はない。上の数値も、その未公開の商用版を測った結果ではない。

運用を判断するにはモデル全体での確認が残る

今回の公開では、Ascend向けの計算と通信のコードに加え、対応する機能や測定条件を具体的に読めるようになった。NVIDIA以外でAIを動かそうとする開発者は、自分のモデルに必要な処理がそろっているかを確かめられる。

導入時には、モデルが呼び出す機能とデータ形式を確認し、ドライバーや開発ツールの版を合わせる。そのうえで回答の品質、処理時間、同時に扱える依頼数をモデル全体で測る必要がある。今回の資料だけでは、NVIDIA環境と同じ品質や運用費用になるかは分からない。

利用者にとっても、「別のチップで動いた」というニュースを読む基準になる。計算の対応だけでなく、メモリ配置、チップ間の通信、一般に入手できる実行環境まで確かめれば、どこまで実用化が進んだのかを判断しやすい。

資料確認日と記事日はいずれも2026年10月2日。性能値はDeepSeekの公開資料に基づく開発元の測定であり、LATENTでは実機で再測定していない。