RTX Pro 6000 Blackwell 에서 MiniMax H3 가속 — Triton Sol 과 FastH3 VSA 실측
96GB Blackwell 에서 H3 의 가속 후보를 실측 — 8-step Sol 패치는 -22%, FastH3 VSA 4-step 은 2.4배. 그리고 이름에 속기 쉬운 함정 하나.
영상 생성 서버(Windows, RTX Pro 6000 Blackwell 96GB)에서 MiniMax H3 의 가속 후보들을 실측했습니다. 결론은 두 단계입니다: 8-step 터보 경로에서는 Triton Sol 패치가 22% 를 줄여 주고, FastH3 VSA 4-step 으로 갈아타면 2.4배가 됩니다. 다만 후자는 아직 텍스트→영상 전용이라 모든 작업판을 대체하지는 못합니다.
실측 — T2VA 1344×768·121f (warm)
| 구성 | 샘플링 | 비고 |
|---|---|---|
| 8-step 터보 + SolAttnPatch (Saganaki Triton) | 50.4초 | dense 대비 -22% |
| 8-step 터보, 패치 없음 (전역 sage) | 64.5초 | |
| 8-step 터보 + 코어 "comfy kitchen attention" | 64.9초 | dense 백엔드 — sage 와 동급 |
| FastH3 VSA 4-step (DataFree-1300 int8) | 22초 | 스텝당 -16%, 주 이득은 4-step 증류 |
이름에 속기 쉬운 함정: 코어의 ModelAttentionBackend "comfy kitchen attention" 은
이 GPU 에서 dense 백엔드라 sage 와 동급입니다 — 희소 Sol attention 이 아닙니다.
"kitchen 이 더 빠르다"는 말만 듣고 갈아타면 오히려 Sol 패치(-22%)를 잃습니다.
트윗발 "X 가 더 빠르다"는 반드시 자기 하드웨어 실측으로 걸러서 반영해야 합니다.
같은 VSA 체크포인트를 dense 로 강제하면 뚜렷한 품질 열화가 나타났습니다 — sparse 모드로 학습된 체크포인트라 학습 모드와 실행 모드가 일치해야 합니다.
FastH3 를 돌리기 위한 비용
FastH3 VSA 는 순정 구성으로는 돌지 않습니다:
- ComfyUI 코어에 PR #15958 패치 (+12/-5, VSA 체크포인트 로드 지원 — dense 경로에는 무영향)
- comfy-kitchen 0.2.32 (int8 Sol-Attn 커널)
- 전용 int8 체크포인트 22.9GB (
fastvideo_vsa_datafree_1300step_4step)
코어가 PR 을 머지하면 패치는 제거하면 되지만, 그때까지는 코어 업데이트 때마다 재적용 여부를 판단해야 하는 비순정 상태의 유지비가 있습니다.
한계 — 아직 텍스트→영상 전용
FastH3 는 프리뷰 v1 (2026-09-04 공식 출시) 기준 T2VA 전용입니다 — 공식 문서가 "FL2VA and Ref2VA were not distilled" 라고 명시합니다. 첫·끝 프레임 지정(FL2V)이나 참조 기반(R2V) 작업판은 여전히 8-step 터보 + Sol 패치 경로를 씁니다. 공식 v1 은 diffusers 포맷 + 전용 런처 구성이라, ComfyUI 에서 쓰려면 커뮤니티 변환본을 기다려야 합니다.
다음 후보 (조사만 끝난 것)
| 기술 | 요지 | 판단 |
|---|---|---|
| VDN (Video Delta Net) | 공식 하이브리드 attention (근접 softmax + 원거리 선형 delta) 포트. 단일 GPU 약 2.6x, 긴 영상일수록 유리 | 가장 유망 — A/B 후보 |
| Spectrum | 훈련 불필요 스텝 스킵, 20-step 기준 약 1.8x. 근사라 같은 시드 출력이 달라짐 | 풀스텝 경로용 opt-in |
| PDD LoRA | 8-step 가속 (shift 12/3 레시피) | 준비됨, 코어 릴리스 대기 |
운영 메모
- 이 GPU 는 WDDM 모드라 VRAM 을 넘치면 시스템 RAM 으로 fallback 합니다 — VRAM 압박이 조용히 RAM 잠식으로 바뀌므로 96GB 라고 방심하면 안 됩니다
- 픽셀 업스케일의 RAM 소요는
frames×W×H×scale²×12B— 4x·10초면 72GB 에 달해 실제로 RAM 고갈 hang 을 겪은 뒤 2x·15초 상한을 두었습니다
같은 모델을 AMD gfx1151 (Ryzen AI Max+ 395) 에서 가속한 실측은
별도 글, 두 하드웨어의 비교는
비교 글에 있습니다.