RTX Pro 6000 Blackwell 에서 MiniMax H3 가속 — Triton Sol 과 FastH3 VSA 실측

96GB Blackwell 에서 H3 의 가속 후보를 실측 — 8-step Sol 패치는 -22%, FastH3 VSA 4-step 은 2.4배. 그리고 이름에 속기 쉬운 함정 하나.

영상 생성 서버(Windows, RTX Pro 6000 Blackwell 96GB)에서 MiniMax H3 의 가속 후보들을 실측했습니다. 결론은 두 단계입니다: 8-step 터보 경로에서는 Triton Sol 패치가 22% 를 줄여 주고, FastH3 VSA 4-step 으로 갈아타면 2.4배가 됩니다. 다만 후자는 아직 텍스트→영상 전용이라 모든 작업판을 대체하지는 못합니다.

22초FastH3 VSA 4-step (1344×768·121f)
2.4x8-step 기준 대비 속도
-22%8-step + Triton Sol 패치 효과
96GBVRAM (WDDM 모드)

실측 — T2VA 1344×768·121f (warm)

구성 샘플링 비고
8-step 터보 + SolAttnPatch (Saganaki Triton) 50.4초 dense 대비 -22%
8-step 터보, 패치 없음 (전역 sage) 64.5초
8-step 터보 + 코어 "comfy kitchen attention" 64.9초 dense 백엔드 — sage 와 동급
FastH3 VSA 4-step (DataFree-1300 int8) 22초 스텝당 -16%, 주 이득은 4-step 증류

이름에 속기 쉬운 함정: 코어의 ModelAttentionBackend "comfy kitchen attention" 은 이 GPU 에서 dense 백엔드라 sage 와 동급입니다 — 희소 Sol attention 이 아닙니다. "kitchen 이 더 빠르다"는 말만 듣고 갈아타면 오히려 Sol 패치(-22%)를 잃습니다. 트윗발 "X 가 더 빠르다"는 반드시 자기 하드웨어 실측으로 걸러서 반영해야 합니다.

같은 VSA 체크포인트를 dense 로 강제하면 뚜렷한 품질 열화가 나타났습니다 — sparse 모드로 학습된 체크포인트라 학습 모드와 실행 모드가 일치해야 합니다.

FastH3 를 돌리기 위한 비용

FastH3 VSA 는 순정 구성으로는 돌지 않습니다:

  • ComfyUI 코어에 PR #15958 패치 (+12/-5, VSA 체크포인트 로드 지원 — dense 경로에는 무영향)
  • comfy-kitchen 0.2.32 (int8 Sol-Attn 커널)
  • 전용 int8 체크포인트 22.9GB (fastvideo_vsa_datafree_1300step_4step)

코어가 PR 을 머지하면 패치는 제거하면 되지만, 그때까지는 코어 업데이트 때마다 재적용 여부를 판단해야 하는 비순정 상태의 유지비가 있습니다.

한계 — 아직 텍스트→영상 전용

FastH3 는 프리뷰 v1 (2026-09-04 공식 출시) 기준 T2VA 전용입니다 — 공식 문서가 "FL2VA and Ref2VA were not distilled" 라고 명시합니다. 첫·끝 프레임 지정(FL2V)이나 참조 기반(R2V) 작업판은 여전히 8-step 터보 + Sol 패치 경로를 씁니다. 공식 v1 은 diffusers 포맷 + 전용 런처 구성이라, ComfyUI 에서 쓰려면 커뮤니티 변환본을 기다려야 합니다.

다음 후보 (조사만 끝난 것)

기술 요지 판단
VDN (Video Delta Net) 공식 하이브리드 attention (근접 softmax + 원거리 선형 delta) 포트. 단일 GPU 약 2.6x, 긴 영상일수록 유리 가장 유망 — A/B 후보
Spectrum 훈련 불필요 스텝 스킵, 20-step 기준 약 1.8x. 근사라 같은 시드 출력이 달라짐 풀스텝 경로용 opt-in
PDD LoRA 8-step 가속 (shift 12/3 레시피) 준비됨, 코어 릴리스 대기

운영 메모

  • 이 GPU 는 WDDM 모드라 VRAM 을 넘치면 시스템 RAM 으로 fallback 합니다 — VRAM 압박이 조용히 RAM 잠식으로 바뀌므로 96GB 라고 방심하면 안 됩니다
  • 픽셀 업스케일의 RAM 소요는 frames×W×H×scale²×12B — 4x·10초면 72GB 에 달해 실제로 RAM 고갈 hang 을 겪은 뒤 2x·15초 상한을 두었습니다

같은 모델을 AMD gfx1151 (Ryzen AI Max+ 395) 에서 가속한 실측은 별도 글, 두 하드웨어의 비교는 비교 글에 있습니다.