Fast-Mimi, kyutai/mimi için
Transformers bağımlılığı olmayan bir PyTorch çıkarım çalışma zamanıdır.
v1, eski 0.1.0 model kodunun bulunduğu
8e2d3e2
commit’idir. v2, 2.0.0 model kodunun bulunduğu
e0e6c65
commit’idir.
| Süre | v1 medyan | v2 medyan | v2 hızlanma (%95 GA) | v1 → v2 RTF | v1 → v2 tepe GPU belleği | Doğrulama |
|---|---|---|---|---|---|---|
| 10 sn | 13.886 ms | 9.248 ms | 1.501x (1.4964x–1.5072x) | 0.001389 → 0.000925 | 651.8 → 883.7 MiB | kod ve dalga biçimi birebir |
| 25 sn | 32.018 ms | 32.013 ms | 1.000x (0.9996x–1.0009x) | 0.001281 → 0.001281 | 1004.1 → 1004.1 MiB | kod ve dalga biçimi birebir |
| 100 sn | 97.564 ms | 59.510 ms | 1.639x (1.6384x–1.6408x) | 0.000976 → 0.000595 | 2196.2 → 5028.9 MiB | kodlar birebir; yalnız uzun-form toleransı geçti |
Ölçümler RTX 5070 Ti üzerinde aynı checkpoint, aynı seed’li 24 kHz mono FP32 giriş ve q8 ile yapıldı. Her satır ayrı süreçte 5 ısınma ve 50 zamanlı çağrı içerir; ilk çağrı medyana dahil değildir.
- 25 saniyelik giriş iki sürümde de taşınabilir PyTorch yolunu kullanır; ölçülen bir v2 hızlanması yoktur.
- 100 saniyede SI-SDR gerilemesi yoktur. Sıkı
rtol=1e-4, atol=1e-5toleransı geçmez; yayımlanmış uzun-formrtol=1e-4, atol=2e-4toleransı geçer. - Tepe GPU belleği 10 saniyede
%35.6, 100 saniyede%129.0artar; bu iki sonuç%10bellek artışı sınırını aşar ve sınırı sağlayamaz.
Ham ölçüm kaydı ve yeniden üretim betiği depoda tutulur.
pip install "fast-mimi[optimized] @ git+https://github.com/kadirnar/fast-mimi.git@v2.0.0"import torch
from fast_mimi import MimiModel
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
model = MimiModel.from_pretrained(device=device)
audio = torch.randn(1, 1, 240_000, device=device) * 0.05
mask = torch.ones_like(audio, dtype=torch.bool)
with torch.inference_mode():
output = model(audio, padding_mask=mask, num_quantizers=8)Desteklenmeyen girişler taşınabilir PyTorch yoluna yönlendirilir.
Kod Apache-2.0, Mimi ağırlıkları CC-BY-4.0 lisanslıdır.