Açık yayın
Antalia 1 — açık bir Türkçe metinden konuşma modeli.
Geliştirme durduruldu; eksiksiz yayımlandı. Tek bir profesyonel ses, yaklaşık 300 milyon parametre, 24 kHz’de rectified-flow akustik model. Bu sayfada modelin neyi iyi yaptığını ve nerede yetersiz kaldığını, her örneğin arkasındaki sayılarla birlikte dinleyebilirsiniz.
- 304,6M parametre
- 24 kHz çıkış
- 67,55 sa Common Voice + FLEURS temel veri
- 5,0 sa yayımlanan sesten kayıt
- Yalnızca Türkçe, harf tabanlı girdi
Dinleyin
Her kategoriden iki örnek, ham ve seçilmiş
120 istemli turkish-v2 değerlendirme setinden, kategori başına iki tane olmak üzere yirmi istem. Her kart aynı cümleyi iki kez çalar: ilk rastgele tohumla üretilen hâli ve otomatik bir puanla (WavLM konuşmacı benzerliği eksi Whisper karakter hata oranı, eksi küçük F0 zarfı ve tını cezaları) sekiz tohum arasından seçilen en iyisi. CER, istem metnine göre Whisper-large-v3 karakter hata oranıdır; Benzerlik, seslendirme sanatçısının kayıtlarına WavLM x-vektör kosinüs benzerliğidir. Seçim 8 kat hesaplama maliyeti getirir.
Nerede başarısız oluyor
Sayılar, normalleştirme ve yabancı terimler
Bunlar sette en yüksek hata oranına sahip istemler: altısı tek tohumda en kötü sonuçlar, üçü seçimden sonra en kötü sonuçlar. Bazıları tek tohumda başarısız olup 8’de en iyi seçimiyle düzeliyor; bazılarını seçim puanı içindeki hiçbir tohum düzeltemiyor. Her cümlenin altındaki not, sekiz adayın tümündeki CER aralığını gösterir.
Uzun girdiler
Tüm girdi için tek bir süre
Model, her girdi için havuzlanmış metin kodlamasından tek bir toplam çerçeve sayısı tahmin eder; belirteç başına süre ve hizalayıcı yoktur. Uzun metinlerde bu tahmin yetersiz kalır: aynı 370 karakterlik pasaj tek geçişte verildiğinde 9,1 saniyelik aceleci ve geveleyen bir konuşma, çıkarım katmanı onu cümle sınırlarından böldüğünde (≤120 karakter, 160 ms duraklama, boşluk dışı karakter başına 0,085 s taban) 34,8 saniye üretir. Parçalama, tek tohumda uzun metin WER’ini %36,6’dan %10,7’ye düşürdü.
Temel model, koşulsuz
Antalia 1 Foundation, konuşmacıdan bağımsız temeldir (299,6M parametre; 67,55 saat Common Voice 26 ve FLEURS Türkçe verisi üzerinde 100.000 güncelleme). Konuşmacı kimliği 0 ile kimseye ait olmayan ortalama bir ses üretir. Setteki tek tohum CER’i 0,18’dir; bu iki örnek, ince ayar aşamalarının başladığı noktadır.
32 yerine 16 adım
Euler adımlarını yarıya indirmek üretim süresini %45,1 azalttı. Ortalama konuşmacı benzerliği 32 adımlı tarifin 0,0006 içinde kaldı; 10. yüzdelik benzerlik daha düşüktü. Yayın tarifi 32 adım kullanır.
Değerlendirme
Neler çalışıyor, neler çalışmıyor
Neler çalışıyor
- Kısa, günlük Türkçe anlaşılır. Set genelinde tek tohum CER 0,053 (p90 0,135); 8’de en iyi CER 0,030 (p90 0,101).
- Deterministik normalleştiriciyle harf tabanlı girdi. Sayılar, tarihler, para birimleri ve kısaltmalar sentezden önce kodla açık yazılır; fonem sözlüğü gerekmez.
- Cümle parçalama uzun girdileri kullanılabilir kılar. ≤120 karakterlik parçalarla uzun metin WER’i %36,6 → %10,7.
- Donmuş, şeffaf bir vocoder. BigVGAN v2 24 kHz, gerçek mel yeniden kurmada ±0,4 dB içinde ölçülür; dolayısıyla duyduğunuz hatalar akustik modelden gelir.
- Yayın eksiksizdir. Her iki kontrol noktası, eğitim, seçim ve değerlendirme kodu, 120 istemlik set, dinleme protokolü ve ham sonuçları herkese açık. Seslendirme sanatçısının kayıtları değil.
Neler çalışmıyor
- Ses benzerliği. Otomatik benzerlik 0,93–0,94 okuyor, ama sesi tanıyan ana dili Türkçe bir dinleyici 12 sentez–gerçek çiftinin 0’ını aynı kişi olarak değerlendirdi. Fark, presence bandındaki bir tını sapmasıdır (4,7–6,8 kHz’de +4,0 dB). En büyük kısıt budur.
- Uzun girdiler. Toplam süre başlığı yetersiz bütçeler; cümle parçalama (≤120 karakter) ve karakter başına çerçeve tabanı olmadan uzun cümleler acele eder ve geveler.
- Sayılar, normalleştirme ağırlıklı metin, yabancı isimler ve kısaltmalar en yüksek CER’e sahiptir. 8’de en iyi kısmen düzeltir; bazı istemler sekiz tohumun tümünde başarısız olur.
- Tek tohum varyansı büyüktür. İstem başına CER tohumlar arasında 0,00–0,17’ye kadar açılır. Başlık sayıları, Whisper ve WavLM puanlayıcılarıyla 8’de en iyi seçimine bağlıdır; bu da 8 kat hesaplama maliyeti demektir.
- Tek sabit ses. Sıfır atışlı klonlama yok, yalnızca Türkçe, 24 kHz, harf tabanlı girdi.
- Çok dinleyicili MOS yok, ezberleme denetimi yok, filigran yok.
- Gecikme. A100 üzerinde 32 adım ve bellekte hazır modelle 5 saniyelik bir cümle ısınmadan sonra yaklaşık 2,1–2,3 s sürer; ilk istek yaklaşık 6 s. İptal edilen Cloud Run L4 ön üretim ortamında ilk sese kadar geçen süre düşük yükte p50 5,0 s / p95 9,2 s idi.
İnsan dinleme değerlendirmesi
Bir dinleyici, yirmi yedi deneme, tek bir karar
9 Ağustos 2026’da, seslendirme sanatçısının sesini tanıyan tek bir ana dili Türkçe dinleyiciyle (proje sahibi) karşılaştırmalı bir MOS oturumu yapıldı. 27 gerçek deneme; 3 kontrol denemesi doğru değerlendirildi. Havuzlanmış CMOS adaya doğru −0,667 ± 0,653 idi. Kapılı sunum tarifi, düz tarife karşı +0,267 ± 0,728 aldı (n = 15). Gerçek kayıtlara karşı sentezlenen konuşma −1,833 ± 0,757 aldı (n = 12) ve dinleyici 12 çiftin 0’ını aynı kişi olarak değerlendirdi.
Kategori bazında: duygu +2,0, genel +2,0, sorular +0,2, onaylama 0,0, uzun −0,5, isimler ve yerler −1,0, sesli asistan −1,0, yabancı −1,14, sayısal −2,0, normalleştirme −2,5.
Oturum, v5 öncül kontrol noktasını değerlendirdi. Seçimdeki tını cezası ve Antalia 1’e dönüşen adaptör aşaması buna yanıt olarak geldi; ölçülen cezayı 2,585’ten 1,997’ye düşürdüler, ancak bu değer gerçek ses aralığının (0,47–0,98) hâlâ dışındadır. ≥3 dinleyicili bir protokol tasarlandı ve hiç uygulanmadı. Bu model için çok dinleyicili MOS yoktur; otomatik konuşmacı benzerliği kimlik kanıtı olarak okunmamalıdır.
- Aynı kişi
- 0 / 12sabitlenmiş sentez–gerçek
- Gerçeğe karşı CMOS
- −1,83± 0,76, n = 12
- Havuzlanmış CMOS
- −0,67± 0,65, n = 27
- Dinleyici
- 1ana dili Türkçe, bilgili
Mimari
Harfler girer, mel çerçeveleri çıkar
CrossFlow tarzı bir rectified-flow modelinin bağımsız uygulaması. Harfler bir kez kodlanır; akustik kod çözücü, çapraz dikkat yoluyla onlara koşullanmış 100 bantlı log-mel çerçevelerinin gürültüsünü giderir. F5-TTS veya FreyaTTS ağırlıklarını, kodunu, sesini ya da verisini kullanmaz ve bunlara bağlı değildir.
| Sistem | CER ort. | CER p90 | WER ort. | Benzerlik ort. | Benzerlik p10 |
|---|---|---|---|---|---|
| Temel v3 @100k, koşulsuz, tek tohum | 0,1835 | 0,4049 | 0,3952 | 0,8162* | 0,625* |
| v5 tutarlılık @6000, tek tohum | 0,0840 | 0,2325 | 0,1870 | 0,9315 | 0,8913 |
| v5 8’de en iyi (tını kapılı, w = 0,05) | 0,0375 | 0,1127 | 0,1059 | 0,9423 | 0,9113 |
| Antalia 1 (adaptör v2 @1400), tek tohum | 0,0528 | 0,1348 | 0,1297 | 0,9331 | 0,9054 |
| Antalia 1 8’de en iyi (tını kapılı) | 0,0298 | 0,1007 | 0,0934 | 0,9445 | 0,9170 |
* Temel modelin benzerliği, hiç görmediği yayımlanan sese karşı ölçülmüştür; yalnızca doğrulayıcının tabanı olarak verilmiştir. 0,93’ün üzerindeki benzerlik değerleri insan kimlik yargılarıyla örtüşmedi (bkz. İnsan dinleme değerlendirmesi).
Yerelde çalıştırın
Bir cümle sentezleyin
Hiçbir şey barındırılmıyor. Yükleyici, kontrol noktasını Hugging Face’ten, vocoder’ı nvidia/bigvgan_v2_24khz_100band_256x deposundan çeker. GPU önerilir; bu sayfadaki sayılar A100 üzerinde ölçüldü.
-
Depoyu klonlayın ve paketi kurun.
git clone https://github.com/0daycloud/antalia cd antalia uv sync # veya: pip install -e . -
BigVGAN kaynak ağacını kurun. Vocoder yeniden dağıtılmaz: depo
7d2b4545commit’ini sabitler ve tek satırlık birhuggingface_hubuyumluluk yaması içerir. README’deki “Vocoder” bölümünü izleyin.# BigVGAN source tree (pinned commit + one-line hub patch), see README "Vocoder" -
Sentezleyin.
python scripts/synthesize-crossflow.py \ --checkpoint cloud0day3/antalia-1 \ --vocoder nvidia/bigvgan_v2_24khz_100band_256x \ --speaker voicedata-candidate-b \ --text "Merhaba" \ --output merhaba.wav
--checkpoint bir Hub depo kimliği, yerel bir yayın dizini veya bir eğitim .pt dosyası kabul eder. 8’de en iyi seçimi için --seed-candidates 8 ile tohum adayları üretin ve ağırlık deposundaki timbre-profile.json ile envelope-stats.json dosyalarını kullanarak scripts/select-best-of-n.py çalıştırın.