gfx1151 의 MiniMax H3, 네이티브 HIP Sol 로 30% 단축 — 기각했던 결론이 뒤집히다

dense 보다 느려서 기각했던 Sol attention 이 comfy-kitchen 의 네이티브 HIP 구현으로 뒤집혔다 — 1344×768 에서 617초→431초, 영상당 3분 6초 절약.

지난 실측에서 ROCm Sol-Attn 은 dense CK 보다 10.74% 느려서 기각했습니다. 그런데 그 결과는 당시의 custom Triton 구현에 대한 것이었습니다. comfy-kitchen v0.2.33 에 네이티브 HIP Sol 이 들어오면서 결론이 뒤집혔습니다 — 같은 gfx1151 (Ryzen AI Max+ 395 / Radeon 8060S)에서 1344×768 생성이 30% 빨라졌고, 운영 기본값도 바뀌었습니다.

30.15%1344×768·124f 생성 시간 단축
1.432x처리 속도 배율
3분 6초영상 한 편당 절약 (10분 17초 → 7분 11초)
+1.15GiBSol 의 GTT 증가 (유효 실행)

시험 환경

  • ComfyUI e308cc7, comfy-kitchen v0.2.33 을 gfx1151 용으로 빌드
  • ROCm 10.0.0 / PyTorch 2.13.0 / Python 3.12, CPU power-saver / GPU auto
  • 기존 custom Triton Sol 은 비활성화, 코어 BlockSparseAttention 사용
  • 각 조건 워밍업 1회 + 측정 3회, 전체 8조건 32개 영상·음성 생성 모두 성공

768×448 — 후보 4개 비교

768×448·124프레임·4-step 조건입니다 (768p LoRA 라는 이름과 시험 해상도를 혼동하지 말 것 — 768×448 은 768p 가 아닙니다).

경로 평균 (초) 표본 SD Dense 대비 최대 GTT (GiB)
v1.1 Dense CK 135.973 0.188 기준 40.680
v1.2 Dense CK 135.900 0.168 0.05% 40.680
v1.1 HIP Sol 117.413 0.296 13.65% 41.163
FastH3 HIP VSA 124.430 0.092 8.49% 43.061

HIP VSA 도 dense 를 이기지만 Sol 에는 못 미쳤습니다 (GTT 도 +2.38GiB 로 더 큼). v1.2 LoRA 는 v1.1 의 설정을 잠정 재사용한 결과로, 속도 차이도 품질 우위도 입증되지 않았습니다.

본 시험 — 1344×768 에서 30% 단축

1344×768·124프레임·24fps·4-step, 워밍업 1회 제외 + 유효 3회입니다.

경로 평균 (초) 중앙값 표본 SD CV 최대 GTT (GiB)
Dense CK 617.138 616.902 0.419 0.068% 44.434
네이티브 HIP Sol 431.056 430.968 0.258 0.060% 45.587

생성되는 영상 자체는 약 5.167초 분량 — 한 편당 평균 186초를 아낍니다. 유효 측정의 최대 온도는 79~80°C, 최대 전력은 약 115W (약 2초 주기 표본의 최대치이며 정밀 피크 측정이 아닙니다), OOM·GPU reset·ring timeout 은 없었습니다.

왜 해상도가 클수록 이득이 커지나

해상도 / 프레임 / step 실제 attention 토큰 Dense 평균 HIP Sol 평균 시간 감소
768×448 / 124 / 4 12,877 135.973초 117.413초 13.65%
1344×768 / 124 / 4 37,741 617.138초 431.056초 30.15%

sparse attention 의 이득은 토큰 수가 늘수록 커집니다 — attention 비용은 토큰 수에 제곱으로 붙기 때문입니다. 다만 두 시험은 별도 시각의 해상도별 시험이므로, 모든 입력·길이·품질 설정에서 같은 개선율을 보장하지는 않습니다.

품질 지표는 조심해서 읽어야 합니다. 동일 프롬프트·시드의 Dense 대비 Sol 은 SSIM 0.7895 / PSNR 22.69dB — 생성 궤적이 달라진다는 자료이지 품질 순위가 아닙니다. 확인한 프레임들에서 장면 자체(붉은 로봇이 실험실을 걷는 장면)는 유지되고 외형·배경·발 위치에 차이가 있었으며, 검은 화면이나 심한 깨짐은 없었습니다.

적용 범위 — 텍스트 v1.1 4-step 에만

운영에서는 텍스트→영상 v1.1 4-step 에만 HIP Sol 을 적용합니다. 8-step·정규 20-step·image/reference 경로는 미검증이라 자동 적용하지 않고, 짧은 토큰 작업은 자동 Dense CK 로 돌립니다. Sol 설정은 tau 1.3, start 0.2/end 1.0, min_tokens 12288, extra_tokens 256, exact_kv_and_rows 입니다.

정리

  • 기각했던 기법도 구현이 바뀌면 다시 재야 합니다. "Sol 은 느리다"가 아니라 "그때의 Triton Sol 이 느렸다"가 정확한 결론이었습니다
  • 같은 이유로, 이번 결론도 조건부입니다 — 검증된 범위(텍스트 v1.1 4-step)에만 적용

이 글은 128GB 미니PC 로컬 AI 시리즈의 각론입니다. 같은 모델을 NVIDIA Blackwell 에서 가속한 실측은 별도 글, 두 하드웨어의 비교는 비교 글에 있습니다.