같은 MiniMax H3, 다른 하드웨어 — Ryzen AI Max+ 395 와 RTX Pro 6000 Blackwell
128GB UMA 미니PC 와 96GB Blackwell 워크스테이션에서 같은 영상 모델을 각각 가속 실측 — 속도 격차, 서로 이식되지 않는 최속 경로, 그리고 공통 교훈.
같은 MiniMax H3 를 두 하드웨어에서 각각 가속 실측했습니다 — AMD gfx1151
(Ryzen AI Max+ 395, 128GB 통합 메모리)과 NVIDIA RTX Pro 6000 Blackwell (96GB).
각 실측은 395 편과
Blackwell 편에 있고, 이 글은 둘을 나란히
놓았을 때 보이는 것을 정리합니다.
정밀 A/B 가 아닙니다. 두 실측은 프레임 수(124f vs 121f), step 수와 증류 LoRA, 가속 경로, 측정 시각이 다릅니다. 아래 비교는 "같은 1344×768, 약 5초 분량, few-step 증류"라는 동급 작업에서의 자릿수 비교로만 읽어야 합니다.
하드웨어 개요
| Ryzen AI Max+ 395 (EVO-X2) | RTX Pro 6000 Blackwell | |
|---|---|---|
| 형태 | 미니PC (APU) | 워크스테이션 GPU |
| 메모리 모델 | 128GB 통합 메모리 (UMA/GTT) | VRAM 96GB + WDDM sysmem fallback |
| 소프트웨어 스택 | ROCm 10 / HIP | CUDA / Triton |
| 실측 전력 | 생성 중 소켓 전체 약 115W | 미측정 (비교 생략) |
속도 — 동급 작업 기준
1344×768, 약 5초 분량 영상, few-step 증류 조건의 각 머신 실측입니다.
| 머신 | 경로 | 시간 |
|---|---|---|
| Blackwell | FastH3 VSA 4-step | 22초 |
| Blackwell | 8-step 터보 + Triton Sol | 50.4초 |
| 395 | LightX2V v1.1 4-step + HIP Sol | 431.1초 |
| 395 | LightX2V v1.1 4-step Dense | 617.1초 |
대략 10~20배 차이입니다. 다만 395 도 sparse attention 최적화 이후 5초 영상이 7분대에 나오므로, "밤새 돌려 두는 배치"가 아니라 "기다렸다 확인하는 실사용"의 경계 안에는 들어옵니다.
최속 경로는 서로 이식되지 않는다
이번 비교에서 가장 실용적인 교훈입니다.
| 395 (gfx1151) | Blackwell | |
|---|---|---|
| 최속 경로 | comfy-kitchen 네이티브 HIP Sol | Saganaki Triton Sol 패치 (SM120 튜닝) / FastH3 VSA |
| FastH3 VSA | Sol 보다 못함 (-8.49% vs -13.65%) | 최속 (2.4x) |
| "kitchen attention" | HIP Sol 구현이 들어 있는 그 라이브러리 | dense 백엔드 — sage 와 동급 |
| 과거 Triton Sol | dense 보다 10.74% 느려 기각했던 것 | 이쪽에선 -22% 로 유효 |
같은 이름의 기법이 아키텍처에 따라 최속이 되기도, 함정이 되기도 합니다. 커뮤니티 커널은 특정 아키텍처에 튜닝되어 나오기 때문에 벤치마크 소식은 자기 하드웨어 실측으로 걸러야 합니다.
공통으로 확인된 것
- sparse attention 의 이득은 토큰 수에 비례해 커진다 — 395 실측에서 768×448 (12,877 tokens) 13.65% → 1344×768 (37,741 tokens) 30.15%. attention 비용이 토큰 수의 제곱이기 때문이고, 해상도·길이가 클수록 sparse 가 유리합니다.
- sparse 로 학습된 체크포인트는 sparse 로 실행해야 한다 — Blackwell 에서 VSA 체크포인트를 dense 강제하면 열화. 학습 모드와 실행 모드의 일치가 전제입니다.
- 품질 지표는 궤적 차이 자료다 — 양쪽 모두 가속 경로의 SSIM 저하는 "다른 영상이 나온다"는 뜻이지 "나쁜 영상이 나온다"가 아니었습니다. 최종 판단은 눈으로.
역할 분담
속도가 필요한 프로덕션 생성은 Blackwell 급이 맞습니다. 395 의 자리는 다릅니다 — 약 115W 로 상시 켜 두는 저전력 박스로서 LLM 서빙과 영상 생성을 겸하고, 급하지 않은 생성을 받아 주는 쪽입니다. 두 실측이 보여 주는 건 "무엇이 더 좋은 하드웨어냐"가 아니라, 같은 모델이라도 하드웨어마다 가속 경로를 따로 검증해야 제 속도가 나온다는 것입니다.