이미지 조건이 붙어도 30% — MiniMax H3 HIP Sol, FL2VA·R2VA 후속 실측

텍스트 전용으로 검증했던 네이티브 HIP Sol 을 시작/종료 이미지(FL2VA)와 참조 이미지(R2VA) 입력까지 확장 실측 — 전 조건에서 30.2% 단축, 24회 전부 성공.

지난 실측에서 gfx1151 (Ryzen AI Max+ 395)의 네이티브 HIP Sol 은 텍스트→영상(T2VA)에서만 검증했고, 이미지 조건이 붙는 경로는 미측정으로 남겨 뒀습니다. 그 숙제를 마쳤습니다 — 시작/종료 이미지(FL2VA)와 참조 이미지(R2VA)까지 Dense/Sol A/B 를 돌렸고, 모든 조건에서 30.2% 안팎의 단축이 재현됐습니다.

30.2%전 조건 시간 감소 (30.15~30.24%)
24회6조건 × (워밍업 1 + 유효 3) 전부 성공
1.43x속도 배율 (조건 무관 일정)
+1.1~1.3GiBSol 의 GTT 증가

결과 — 조건이 붙어도 이득이 유지된다

1344×768·124프레임/24fps·4-step 조건입니다.

입력 Dense 평균 (초) Sol 평균 (초) 시간 감소 배율
T2VA (텍스트만, 전날 실측) 617.138 431.056 30.15% 1.432
FL2VA 시작 이미지 664.281 463.558 30.22% 1.433
FL2VA 시작+종료 이미지 720.721 502.754 30.24% 1.434
R2VA 참조 이미지 1장 661.994 462.370 30.15% 1.432

흥미로운 점은 감소율이 조건 종류와 무관하게 거의 일정하다는 것입니다. 조건 입력이 붙으면 attention 토큰이 늘어나는데(시작 39,765 / 시작+종료 41,789 / 참조 39,771 — Sol 12회 모두 sparse 실행 확인), sparse 이득이 그 규모에서 이미 포화 구간에 들어간 모양새입니다.

측정 위생: 표본 SD 0.15~1.01초 (CV 0.1% 수준), 최대 온도 80~82°C, OOM·GPU reset· timeout 없음, sampler cache hit 0 (매번 실제 샘플링). FL2VA 는 v1.1 768p 4-step (shift 6/3), R2VA 는 전용 v0.1 4-step (shift 12/3, SHA256 검증 후 신규 설치).

품질 지표: Dense 대비 Sol SSIM 은 시작 0.951 / 시작+종료 0.973 / R2VA 0.839 — R2VA 의 픽셀 차이가 상대적으로 컸습니다. 선택 프레임에서 시작/종료·참조 외형은 유지됐지만, 이 수치는 궤적 차이 자료이지 참조 충실도(identity) 점수가 아닙니다.

아직 안 한 것

  • R2VA 의 참조 영상·음성, 다중 인물, 8-step 비교는 미실시
  • 이번 결과는 image/reference 경로에 Sol 옵션을 도입할 근거이며, 운영 자동 적용 승격은 별도로 결정합니다 (운영 기본값은 아직 텍스트 v1.1 4-step 에만 Sol)

이 글은 gfx1151 HIP Sol 실측의 후속이며, 128GB 미니PC 로컬 AI 시리즈의 각론입니다.