128GB UMA에서 MiniMax H3를 어디까지 돌릴 수 있나
Ryzen AI Max+ 395의 128GB 통합 메모리에서 MiniMax H3를 적재하고 Turbo, 해상도, attention을 단계별로 검증한 실사용 보고서입니다.
128GB UMA FIELD REPORT
“적재 가능한가?”에서
“운영 가능한가?”까지
Ryzen AI Max+ 395의 128GB 통합 메모리에서 MiniMax H3 영상·오디오 생성을 단계별로 검증했습니다. 결론은 명확합니다. 메모리는 충분했고, 실제 병목은 해상도와 sampling 연산이었습니다.
정규 20-step 대비 속도
정규 20-step 대비 속도
PyTorch 대비 시간
최대 GTT
1. 실행 가능성은 이렇게 확보했습니다
모델 구성 → 안정화 → 최적화초기 가용 GTT에 맞지 않아 그대로 적재하는 경로는 실용적이지 않았습니다.
INT8 diffusion, NVFP4 AWQ text encoder와 두 VAE로 단일 pipeline을 구성했습니다.
영구 볼륨 권한과 low-VRAM 경로를 고정해 재시작 원인을 제거했습니다.
4-step LoRA와 gfx1151 지원 HIP INT8 attention을 운영 기본값으로 삼았습니다.
2. 5.167초 결과물을 만드는 시간
24 FPS · 영상 + 오디오3. gfx1151에서 효과가 확인된 최적화
동일 seed · 동일 작업 A/BGPU 100%, 정상 영상·오디오 출력. 운영 기본 attention으로 채택했습니다.
같은 조건에서 30.885초 더 걸렸습니다. CK가 실행 시간을 14.71% 줄였습니다.
또한 새 1.0MP Turbo는 구 환경의 1024×576 결과보다 픽셀이 1.75배 많으면서도 20.90% 빨랐습니다. 다만 이는 CK attention, ComfyUI 최적화와 새 Turbo LoRA의 합산 효과입니다.
4. 메모리보다 연산이 병목이었습니다
4개 핵심 조건 모두 성공1.0MP 정규 작업도 GTT 한도의 약 30%만 사용했습니다. 반면 실행 시간은 최대 47분에 가까웠습니다. 이 구성에서 더 큰 메모리 예약보다 attention, step 수와 해상도 선택이 체감 성능을 좌우했습니다.
실사용 선택표
목적별 추천약 3분. 프롬프트와 동작을 빠르게 반복할 때 가장 현실적입니다.
약 11분 35초. 네이티브 768p 캔버스의 납품 후보를 만들 때 적합합니다.
품질 대조용입니다. 1.0MP는 약 47분이어서 상시 기본값으로는 비효율적입니다.
측정 범위와 해석
- 모든 핵심 출력은 H.264 영상, AAC 32kHz 스테레오 오디오, 24 FPS와 요청 해상도를 확인했습니다.
- 구 환경 비교는 여러 소프트웨어 변화가 함께 포함돼 특정 패치 하나의 효과로 분리하지 않습니다.
- 128GB UMA가 모델 적재를 해결했지만, 여러 대형 AI 서비스를 동시에 상주시키는 구성은 시험하지 않았습니다.