大規模システムの通信最適化を研究しています。FPGA・DPU・機械学習・データ圧縮に関心があります。 現在は、マルチGPUでのLLM学習を対象に NVIDIA BlueField DPU 上での通信データ圧縮を研究しており、 将来の疎・不規則なアクセラレータワークロードに向けた通信基盤を見据えています。
NVIDIA BlueField-3 DPU の Arm コア上に NetZIP 型の可逆圧縮パイプライン (バイトグループ化+LZ4、16コア並列、チャンク単位の圧縮・転送オーバーラップ)を実装し、 同一 RDMA 経路の無圧縮通信と end-to-end で公平に比較。無圧縮ベースラインが RDMA バッファのページ構成で大きく変わること(4 KiB: 10.9 GB/s / THP: 24.6 GB/s)、 送信側処理が約 9 GB/s で律速となり専用ハードなしでは無圧縮を上回れないことを定量化し、 設計指針を提示しました。
DPURDMA可逆圧縮分散学習FPGA / DPU / 機械学習 / データ圧縮