研究の概要

大規模言語モデル(LLM)推論の急拡大に伴い、AIデータセンターの電力消費と炭素排出が急増している。従来の冷却システムは、GPU温度と冷却電力を独立して管理していたため、エネルギー効率の改善余地が大きかった。

本研究では、GPU推論サービスと冷却施設管理を統合する「ETCInfer(Energy-efficient Thermal-aware Cooling-joint scheduler)」を提案。周囲温度の上昇(冷却エネルギー削減)とGPUスロットリング(処理速度低下)のトレードオフをSLO(サービスレベル目標)制約のもとで同時最適化する手法を開発した。

主な発見・成果

  • カーボン・冷却エネルギーの削減:周囲温度設定点の最適化により、冷却電力(PUE改善)と炭素排出量を大幅削減
  • SLO遵守の確保:GPU温度上昇によるスロットリングを予測することで、SLO違反なしに冷却設定を緩和
  • 結合制御の優位性:GPU推論ワークロードスケジューラと冷却システムを統合制御することで、分離制御比でさらなる効率改善

実務への応用

企業がAI活用を進める中、データセンター運用のGHG排出(スコープ1・2)管理が重要課題になっている。LLM推論規模が大きいほど本アプローチの効果は大きく、AIインフラへの脱炭素投資の実効性を高める技術的基盤となる。