같은 MiniMax H3, 다른 하드웨어 — Ryzen AI Max+ 395 와 RTX Pro 6000 Blackwell

128GB UMA 미니PC 와 96GB Blackwell 워크스테이션에서 같은 영상 모델을 각각 가속 실측 — 속도 격차, 서로 이식되지 않는 최속 경로, 그리고 공통 교훈.

같은 MiniMax H3 를 두 하드웨어에서 각각 가속 실측했습니다 — AMD gfx1151 (Ryzen AI Max+ 395, 128GB 통합 메모리)과 NVIDIA RTX Pro 6000 Blackwell (96GB). 각 실측은 395 편Blackwell 편에 있고, 이 글은 둘을 나란히 놓았을 때 보이는 것을 정리합니다.

정밀 A/B 가 아닙니다. 두 실측은 프레임 수(124f vs 121f), step 수와 증류 LoRA, 가속 경로, 측정 시각이 다릅니다. 아래 비교는 "같은 1344×768, 약 5초 분량, few-step 증류"라는 동급 작업에서의 자릿수 비교로만 읽어야 합니다.

하드웨어 개요

Ryzen AI Max+ 395 (EVO-X2) RTX Pro 6000 Blackwell
형태 미니PC (APU) 워크스테이션 GPU
메모리 모델 128GB 통합 메모리 (UMA/GTT) VRAM 96GB + WDDM sysmem fallback
소프트웨어 스택 ROCm 10 / HIP CUDA / Triton
실측 전력 생성 중 소켓 전체 약 115W 미측정 (비교 생략)

속도 — 동급 작업 기준

1344×768, 약 5초 분량 영상, few-step 증류 조건의 각 머신 실측입니다.

머신 경로 시간
Blackwell FastH3 VSA 4-step 22초
Blackwell 8-step 터보 + Triton Sol 50.4초
395 LightX2V v1.1 4-step + HIP Sol 431.1초
395 LightX2V v1.1 4-step Dense 617.1초

대략 10~20배 차이입니다. 다만 395 도 sparse attention 최적화 이후 5초 영상이 7분대에 나오므로, "밤새 돌려 두는 배치"가 아니라 "기다렸다 확인하는 실사용"의 경계 안에는 들어옵니다.

최속 경로는 서로 이식되지 않는다

이번 비교에서 가장 실용적인 교훈입니다.

395 (gfx1151) Blackwell
최속 경로 comfy-kitchen 네이티브 HIP Sol Saganaki Triton Sol 패치 (SM120 튜닝) / FastH3 VSA
FastH3 VSA Sol 보다 못함 (-8.49% vs -13.65%) 최속 (2.4x)
"kitchen attention" HIP Sol 구현이 들어 있는 그 라이브러리 dense 백엔드 — sage 와 동급
과거 Triton Sol dense 보다 10.74% 느려 기각했던 것 이쪽에선 -22% 로 유효

같은 이름의 기법이 아키텍처에 따라 최속이 되기도, 함정이 되기도 합니다. 커뮤니티 커널은 특정 아키텍처에 튜닝되어 나오기 때문에 벤치마크 소식은 자기 하드웨어 실측으로 걸러야 합니다.

공통으로 확인된 것

  1. sparse attention 의 이득은 토큰 수에 비례해 커진다 — 395 실측에서 768×448 (12,877 tokens) 13.65% → 1344×768 (37,741 tokens) 30.15%. attention 비용이 토큰 수의 제곱이기 때문이고, 해상도·길이가 클수록 sparse 가 유리합니다.
  2. sparse 로 학습된 체크포인트는 sparse 로 실행해야 한다 — Blackwell 에서 VSA 체크포인트를 dense 강제하면 열화. 학습 모드와 실행 모드의 일치가 전제입니다.
  3. 품질 지표는 궤적 차이 자료다 — 양쪽 모두 가속 경로의 SSIM 저하는 "다른 영상이 나온다"는 뜻이지 "나쁜 영상이 나온다"가 아니었습니다. 최종 판단은 눈으로.

역할 분담

속도가 필요한 프로덕션 생성은 Blackwell 급이 맞습니다. 395 의 자리는 다릅니다 — 약 115W 로 상시 켜 두는 저전력 박스로서 LLM 서빙과 영상 생성을 겸하고, 급하지 않은 생성을 받아 주는 쪽입니다. 두 실측이 보여 주는 건 "무엇이 더 좋은 하드웨어냐"가 아니라, 같은 모델이라도 하드웨어마다 가속 경로를 따로 검증해야 제 속도가 나온다는 것입니다.