# 한국어 TTS 측정 기록

2026-09-16에 기존 실험 폴더의 runs.csv를 재집계한 스냅샷입니다. 새 모델 추론을 실행한 결과가 아닙니다.

- 원본 실험: Windows 11 / 일부 WSL2 / RTX 5090 32GB / batch 1 / Supertonic은 ONNX CPU.
- runs.csv: run_id별 마지막 기록, 1편 활성 5모델, smoke 제외, 감정 제어 미지원 모델의 감정 샘플 제외, generated/validated/generated_no_eos 상태. 원본의 측정·버전 필드를 보존하고 내부 파일 경로와 자유 형식 notes는 제외했습니다.
- summary.json: 모델별 RTF 중앙값과 60초 환산값, 최대 VRAM. 음성 길이·대본·보이스가 다른 표본의 기술 통계이며 통제된 같은 입력의 반복 평균이 아닙니다.
- `python summarize.py`: 표준 라이브러리로 집계를 다시 계산하고 공개 JSON과 비교합니다.
- generation-controls.json: 당시 모델별 제어 조건입니다.
- audio/*.wav: 각 모델의 ko_pacing 원본 1개씩, 1.1배속 파생본이 아닙니다. 결과 음성에는 오독이 포함될 수 있습니다.
- CPU 모델·실제 스레드 수와 모든 런타임 버전은 이 기록에 남아 있지 않습니다. 현재 PC 사양으로 과거 조건을 추정하지 않았습니다.
- Qwen은 이전 정리표의 중앙 RTF 1.778/VRAM 4.593GB와 현재 로그 집계 1.691/4.592GB가 다릅니다. 이전 표본 스냅샷은 복원하지 못했으므로 두 값을 동일 표본으로 간주하지 않습니다.
- 대부분의 GPU 수치는 PyTorch peak allocation, Higgs는 별도 서버의 nvidia-smi 총사용량에서 서버 시작 전 기준값을 뺀 관측치입니다. 동일 방식의 메모리 벤치마크가 아닙니다. Supertonic RAM은 생성 후 process RSS 관측값입니다.

Higgs 음성: This audio was created with Boson AI's Higgs Audio — https://www.boson.ai/higgs-audio

가중치나 제3자 소스 코드는 포함하지 않습니다. 음성은 비교·청취용 결과물이며 모델·목소리 사용 권리를 포괄적으로 허여하는 라이선스가 아닙니다.
