DeepSeek V4 Flash 를 320K 컨텍스트로 — 유효했던 조정은 둘뿐이었다
80.8GiB DeepSeek V4 Flash 를 320K 컨텍스트로 운영하며 DSpark 와 ROCm 미세조정을 실측으로 기각하고, prefill chunk 와 전력 설정만 남긴 기록.
EVO-X2 에서 DwarfStar4 로 돌리는 DeepSeek V4 Flash 0731 Q2 는 약 80.76GiB 모델을
320K context 로 안정적으로 구동했습니다. 흥미로운 건 무엇이 효과가 없었는가입니다.
speculative 기법도, ROCm workgroup 조정도 아니고 — 유효했던 조정은 prefill chunk
4096 과 CPU power-saver 둘뿐이었습니다.
기준 구성
| 항목 | 값 |
|---|---|
| DwarfStar 기준 소스 | c1d4597 (2026-08-24) |
| 모델 | DeepSeek V4 Flash 0731 IQ2XXS/Q8 혼합 Q2 |
| 모델 크기 | 80.76GiB |
| context / output | 327,680 / 16,384 tokens |
| prefill chunk | 4,096 tokens |
| 계획 메모리 | 약 87.82GiB |
45건의 실제 agent 요청은 총 54,170 tokens 를 13.352 tok/s 의 가중 decode 로 생성했습니다. 1K 이상 새 입력 146,159 tokens 의 가중 prefill 은 122.734 tok/s. decode 는 짧은 context 약 15.7~16.0 tok/s 에서 40~80K 구간 12.655 tok/s 로 완만히 감소했습니다. 합성 짧은 시험과 실제 agent loop 를 섞어 순수 모델 비교로 쓰면 안 됩니다.
--kv-disk-dir 은 활성 attention 이 SSD 의 KV 를 직접 읽는 disk offload 가 아닙니다.
live KV 한 개는 RAM/GTT 에 두고, 세션 교체·재시작을 위해 prefix checkpoint 를 SSD 에
저장·복원하는 persistence 기능입니다. 활성 context 메모리를 SSD 로 확장해 주지 않습니다.
기각 1 — DSpark (speculative)
512-token 고정 시험 결과입니다.
코드 수락률이 높은데도 verifier layer 실행 비용이 proposal 절감 시간을 초과했습니다. 느린 speculative 구간을 피하는 adaptive-128 도 기준선을 넘지 못했습니다.
speculative 은 수락률이 아니라 최종 tok/s 와 net_saved 가 모두 양수인지로 판단해야 합니다. support GGUF 와 시험 코드는 재검증용으로만 남기고 운영 기동에서는 뺐습니다.
기각 2 — ROCm RPB 와 소스 미세조정
- routed MoE rows-per-block 1~32: 15.98~16.00 tok/s, 차이 0.13% 이하
- Q8 rows/HC workgroup 소스 시험: 최선의 전체 개선 약 0.25%
- Q2 decode 의 GPU 시간은 여러 Q8 행렬 경로가 함께 지배해, MoE kernel 하나만 조정해서 얻을 수 있는 폭이 작았습니다
유지보수할 로컬 patch 를 만들 만큼의 이득이 아니어서 upstream 기본값으로 복구했습니다.
남긴 조정 — prefill chunk 와 전력
prefill chunk 512→4096 은 raw KV 와 buffer 계획을 약 2.49GiB 늘리지만 긴 신규 프롬프트 처리에 맞는 DwarfStar 권장값입니다 (decode 가속 옵션이 아닙니다).
동일 decode 에서 CPU power-saver 는 16.02 tok/s 를 유지하면서 socket 전력을 약 17W
줄였습니다. 반면 GPU low 와 DwarfStar --power 80/60 은 전력을 줄인 만큼
12.59/9.45 tok/s 로 느려져 대화형 기본값에서 제외 — 권장 조합은 BIOS/GPU auto +
CPU power-saver 입니다.
언제 다시 재나
- upstream ROCm verifier/graph 또는
gfx1151kernel 이 바뀐 경우 - DwarfStar 의 Q2/Q8 행렬 kernel 구현이 바뀐 경우
- 장문 정형 코드에서 DSpark 의 높은 수락 길이가 반복 관측되는 경우
- 같은 prompt·생성량의 기준선과 분리 A/B 할 수 있는 경우
이 글은 128GB 미니PC 로컬 AI 시리즈의 각론입니다.