gfx1151 의 MiniMax H3, 네이티브 HIP Sol 로 30% 단축 — 기각했던 결론이 뒤집히다
dense 보다 느려서 기각했던 Sol attention 이 comfy-kitchen 의 네이티브 HIP 구현으로 뒤집혔다 — 1344×768 에서 617초→431초, 영상당 3분 6초 절약.
지난 실측에서 ROCm Sol-Attn 은 dense CK 보다
10.74% 느려서 기각했습니다. 그런데 그 결과는 당시의 custom Triton 구현에 대한
것이었습니다. comfy-kitchen v0.2.33 에 네이티브 HIP Sol 이 들어오면서 결론이
뒤집혔습니다 — 같은 gfx1151 (Ryzen AI Max+ 395 / Radeon 8060S)에서 1344×768 생성이
30% 빨라졌고, 운영 기본값도 바뀌었습니다.
시험 환경
- ComfyUI
e308cc7, comfy-kitchen v0.2.33 을gfx1151용으로 빌드 - ROCm 10.0.0 / PyTorch 2.13.0 / Python 3.12, CPU
power-saver/ GPUauto - 기존 custom Triton Sol 은 비활성화, 코어
BlockSparseAttention사용 - 각 조건 워밍업 1회 + 측정 3회, 전체 8조건 32개 영상·음성 생성 모두 성공
768×448 — 후보 4개 비교
768×448·124프레임·4-step 조건입니다 (768p LoRA 라는 이름과 시험 해상도를 혼동하지 말 것 — 768×448 은 768p 가 아닙니다).
| 경로 | 평균 (초) | 표본 SD | Dense 대비 | 최대 GTT (GiB) |
|---|---|---|---|---|
| v1.1 Dense CK | 135.973 | 0.188 | 기준 | 40.680 |
| v1.2 Dense CK | 135.900 | 0.168 | 0.05% | 40.680 |
| v1.1 HIP Sol | 117.413 | 0.296 | 13.65% | 41.163 |
| FastH3 HIP VSA | 124.430 | 0.092 | 8.49% | 43.061 |
HIP VSA 도 dense 를 이기지만 Sol 에는 못 미쳤습니다 (GTT 도 +2.38GiB 로 더 큼). v1.2 LoRA 는 v1.1 의 설정을 잠정 재사용한 결과로, 속도 차이도 품질 우위도 입증되지 않았습니다.
본 시험 — 1344×768 에서 30% 단축
1344×768·124프레임·24fps·4-step, 워밍업 1회 제외 + 유효 3회입니다.
| 경로 | 평균 (초) | 중앙값 | 표본 SD | CV | 최대 GTT (GiB) |
|---|---|---|---|---|---|
| Dense CK | 617.138 | 616.902 | 0.419 | 0.068% | 44.434 |
| 네이티브 HIP Sol | 431.056 | 430.968 | 0.258 | 0.060% | 45.587 |
생성되는 영상 자체는 약 5.167초 분량 — 한 편당 평균 186초를 아낍니다. 유효 측정의 최대 온도는 79~80°C, 최대 전력은 약 115W (약 2초 주기 표본의 최대치이며 정밀 피크 측정이 아닙니다), OOM·GPU reset·ring timeout 은 없었습니다.
왜 해상도가 클수록 이득이 커지나
| 해상도 / 프레임 / step | 실제 attention 토큰 | Dense 평균 | HIP Sol 평균 | 시간 감소 |
|---|---|---|---|---|
| 768×448 / 124 / 4 | 12,877 | 135.973초 | 117.413초 | 13.65% |
| 1344×768 / 124 / 4 | 37,741 | 617.138초 | 431.056초 | 30.15% |
sparse attention 의 이득은 토큰 수가 늘수록 커집니다 — attention 비용은 토큰 수에 제곱으로 붙기 때문입니다. 다만 두 시험은 별도 시각의 해상도별 시험이므로, 모든 입력·길이·품질 설정에서 같은 개선율을 보장하지는 않습니다.
품질 지표는 조심해서 읽어야 합니다. 동일 프롬프트·시드의 Dense 대비 Sol 은 SSIM 0.7895 / PSNR 22.69dB — 생성 궤적이 달라진다는 자료이지 품질 순위가 아닙니다. 확인한 프레임들에서 장면 자체(붉은 로봇이 실험실을 걷는 장면)는 유지되고 외형·배경·발 위치에 차이가 있었으며, 검은 화면이나 심한 깨짐은 없었습니다.
적용 범위 — 텍스트 v1.1 4-step 에만
운영에서는 텍스트→영상 v1.1 4-step 에만 HIP Sol 을 적용합니다. 8-step·정규
20-step·image/reference 경로는 미검증이라 자동 적용하지 않고, 짧은 토큰 작업은 자동
Dense CK 로 돌립니다. Sol 설정은 tau 1.3, start 0.2/end 1.0, min_tokens 12288,
extra_tokens 256, exact_kv_and_rows 입니다.
정리
- 기각했던 기법도 구현이 바뀌면 다시 재야 합니다. "Sol 은 느리다"가 아니라 "그때의 Triton Sol 이 느렸다"가 정확한 결론이었습니다
- 같은 이유로, 이번 결론도 조건부입니다 — 검증된 범위(텍스트 v1.1 4-step)에만 적용
이 글은 128GB 미니PC 로컬 AI 시리즈의 각론입니다. 같은 모델을 NVIDIA Blackwell 에서 가속한 실측은 별도 글, 두 하드웨어의 비교는 비교 글에 있습니다.