ROCm 10에서 MiniMax H3는 얼마나 빨라졌나

ROCm 10 기반 새 추론 환경과 LightX2V Turbo v1.1을 반복 측정해 속도, 안정성, 메모리와 8-step 비용을 비교했습니다.

ROCm 10 × MiniMax H3

새 실행 환경은 빨랐지만,
진짜 성과는 ‘일관성’이었습니다.

Ryzen AI Max+ 395 기반 128GB UMA 시스템에서 MiniMax H3와 LightX2V Turbo를 반복 측정했습니다. 단발 기록이 아닌 서로 다른 시드 3회 평균으로 속도와 변동성을 다시 판단했습니다.

144.5초현재 기본 작업
3회 평균
−19.25%이전 환경 단일 기록 대비
실행 시간
0.49%현재 기본 작업
변동계수
≈28GiB프로필 공통
최대 GTT

1. 이전 환경과 현재 운영 환경

짧을수록 빠름
실행 시간 34.465초 단축 · 19.25% 감소
이 비교는 방향을 보는 운영 비교입니다. 이전 값은 1회이며 ROCm뿐 아니라 PyTorch, LoRA와 sampler도 함께 바뀌었으므로 19.25%를 ROCm 단독 향상으로 해석할 수 없습니다.

2. 같은 환경에서 Turbo 프로필 비교

1344×768 · 39 frames
v1.1은 v1.0 4-step보다 평균 3.02% 짧았지만 각 3표본의 신뢰구간이 겹칩니다. ‘확실히 더 빠르다’보다 ‘더 일관되고 소폭 빠른 경향’이 정확한 결론입니다.

3. 반복 측정에서 드러난 안정성

서로 다른 seed · n=3
v1.1 · 기본 4-stepCV 0.49%
143.919144.397145.320
평균 144.545초 · 768×448 · 124f
v1.1 · 네이티브 4-stepCV 0.32%
136.014135.875135.199
평균 135.696초 · 1344×768 · 39f
v1.0 · 네이티브 4-stepCV 2.64%
142.210141.880135.657
평균 139.916초 · 변동 폭이 가장 큼
v1.0 · 네이티브 8-stepCV 0.94%
245.680243.677241.103
평균 243.487초 · 4-step보다 79.44% 느림

4. 느려진 만큼 메모리를 더 쓰지는 않았습니다

전체 유효 표본 관측 범위
100%최대 GPU 사용률
27.92–28.03최대 GTT · GiB
81.66–83.00평균 power · W
≤80°C관측 최고 온도

8-step의 최대 GTT는 27.98GiB로 4-step과 사실상 같았습니다. 평균 전력 차이도 약 1W 안쪽이어서, 품질 모드의 비용은 메모리 압박이 아니라 길어진 sampling 시간입니다.

5. 첫 실행이 유독 느릴 수 있는 이유

warm-up 1건은 평균에서 제외
해상도·LoRA graph 변경같은 LoRA라도 graph 형태가 달라지면 준비가 다시 발생할 수 있습니다.
CPU·모델 준비 약 100초GPU 0% 구간이 포함된 표본은 239.703초였습니다.
이후 steady-state같은 graph의 연속 실행은 평균 135~145초대로 복귀했습니다.

운영 선택

측정 결과 기반
QUALITYLightX2V v1.0 · 8-step

약 79% 더 오래 걸립니다. 디테일과 오디오 안정성을 우선할 때 선택합니다.

측정 범위와 해석

  • 현재 환경은 ROCm 10, Python 3.12.3, PyTorch 2.13, ComfyUI 0.33.1과 CK attention 조합입니다.
  • 각 유효 표본은 같은 프롬프트와 서로 다른 seed를 사용했고, 모든 결과에 H.264 영상과 AAC 오디오가 포함됐습니다.
  • 각 조건 3회는 운영 판단에는 유용하지만 작은 표본입니다. 3% 안팎의 차이는 장기 반복 전까지 확정적인 우위로 해석하지 않습니다.
  • OOM, HIP fault, GPU reset과 컨테이너 재시작은 관찰되지 않았습니다.