128GB UMA에서 MiniMax H3를 어디까지 돌릴 수 있나

Ryzen AI Max+ 395의 128GB 통합 메모리에서 MiniMax H3를 적재하고 Turbo, 해상도, attention을 단계별로 검증한 실사용 보고서입니다.

128GB UMA FIELD REPORT

“적재 가능한가?”에서
“운영 가능한가?”까지

Ryzen AI Max+ 395의 128GB 통합 메모리에서 MiniMax H3 영상·오디오 생성을 단계별로 검증했습니다. 결론은 명확합니다. 메모리는 충분했고, 실제 병목은 해상도와 sampling 연산이었습니다.

3.40×0.4MP Turbo의
정규 20-step 대비 속도
4.07×1.0MP Turbo의
정규 20-step 대비 속도
−14.71%CK attention의
PyTorch 대비 시간
32.69GiB전체 시험 중
최대 GTT

1. 실행 가능성은 이렇게 확보했습니다

모델 구성 → 안정화 → 최적화
01 / FIT원본 BF16은 제외

초기 가용 GTT에 맞지 않아 그대로 적재하는 경로는 실용적이지 않았습니다.

02 / QUANT혼합 양자화 42.47GB

INT8 diffusion, NVFP4 AWQ text encoder와 두 VAE로 단일 pipeline을 구성했습니다.

03 / STABLE쓰기 경로와 offload 정리

영구 볼륨 권한과 low-VRAM 경로를 고정해 재시작 원인을 제거했습니다.

04 / FASTTurbo + CK attention

4-step LoRA와 gfx1151 지원 HIP INT8 attention을 운영 기본값으로 삼았습니다.

2. 5.167초 결과물을 만드는 시간

24 FPS · 영상 + 오디오
픽셀 수가 정확히 3배 늘자 Turbo 시간은 3.88배, 정규 시간은 4.65배가 됐습니다. 고해상도 비용은 단순 비례보다 더 빠르게 증가했습니다.

3. gfx1151에서 효과가 확인된 최적화

동일 seed · 동일 작업 A/B
COMFY KITCHEN HIP INT8179.010초

GPU 100%, 정상 영상·오디오 출력. 운영 기본 attention으로 채택했습니다.

PYTORCH CROSS ATTENTION209.895초

같은 조건에서 30.885초 더 걸렸습니다. CK가 실행 시간을 14.71% 줄였습니다.

또한 새 1.0MP Turbo는 구 환경의 1024×576 결과보다 픽셀이 1.75배 많으면서도 20.90% 빨랐습니다. 다만 이는 CK attention, ComfyUI 최적화와 새 Turbo LoRA의 합산 효과입니다.

4. 메모리보다 연산이 병목이었습니다

4개 핵심 조건 모두 성공
110GiB시스템 GTT 한도
32.69GiB관측 최대 GTT
84°C관측 최고 GPU 온도
0건OOM · reset · HIP 오류

1.0MP 정규 작업도 GTT 한도의 약 30%만 사용했습니다. 반면 실행 시간은 최대 47분에 가까웠습니다. 이 구성에서 더 큰 메모리 예약보다 attention, step 수와 해상도 선택이 체감 성능을 좌우했습니다.

실사용 선택표

목적별 추천
ITERATION0.4MP · Turbo 4-step

약 3분. 프롬프트와 동작을 빠르게 반복할 때 가장 현실적입니다.

DELIVERY1.0MP · Turbo 4-step

약 11분 35초. 네이티브 768p 캔버스의 납품 후보를 만들 때 적합합니다.

REFERENCE정규 20-step

품질 대조용입니다. 1.0MP는 약 47분이어서 상시 기본값으로는 비효율적입니다.

측정 범위와 해석

  • 모든 핵심 출력은 H.264 영상, AAC 32kHz 스테레오 오디오, 24 FPS와 요청 해상도를 확인했습니다.
  • 구 환경 비교는 여러 소프트웨어 변화가 함께 포함돼 특정 패치 하나의 효과로 분리하지 않습니다.
  • 128GB UMA가 모델 적재를 해결했지만, 여러 대형 AI 서비스를 동시에 상주시키는 구성은 시험하지 않았습니다.