Spaces:

Kamtera
/

Persian-tts-CoquiTTS

Running

App Files Files Community

Kamtera commited on Dec 24, 2022

Commit

8d910b7

•

1 Parent(s): 939f807

persian tts

Browse files

Files changed (6) hide show

.gitattributes +1 -0
app.py +65 -0
best_model.pth +3 -0
config.json +189 -0
packages.txt +2 -0
requirements.txt +1 -0

.gitattributes CHANGED Viewed

@@ -32,3 +32,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+best_model.pth filter=lfs diff=lfs merge=lfs -text

app.py ADDED Viewed

	@@ -0,0 +1,65 @@

+import tempfile
+from typing import Optional
+from TTS.config import load_config
+import gradio as gr
+import numpy as np
+import os
+import json
+from TTS.utils.manage import ModelManager
+from TTS.utils.synthesizer import Synthesizer
+MAX_TXT_LEN = 800
+def tts(text: str):
+    if len(text) > MAX_TXT_LEN:
+        text = text[:MAX_TXT_LEN]
+        print(f"Input text was cutoff since it went over the {MAX_TXT_LEN} character limit.")
+    print(text)
+    model_path = os.getcwd() + "/best_model.pth"
+    config_path = os.getcwd() + "/config.json"
+    synthesizer = Synthesizer(
+        model_path, config_path, speakers_file_path
+    )
+    # synthesize
+    if synthesizer is None:
+        raise NameError("model not found")
+    wavs = synthesizer.tts(text, speaker_idx)
+    # return output
+    with tempfile.NamedTemporaryFile(suffix=".wav", delete=False) as fp:
+        synthesizer.save_wav(wavs, fp)
+        return fp.name
+description="""
+This is a demo of first public free persian text to speech model.
+Model trained on this dataset : https://www.kaggle.com/datasets/magnoliasis/persian-tts-dataset-famale
+"""
+article= ""
+iface = gr.Interface(
+    fn=tts,
+    inputs=[
+        gr.inputs.Textbox(
+            label="Text",
+            default="زندگی فقط یک بار است؛ از آن به خوبی استفاده کن",
+        )
+    ],
+    outputs=gr.outputs.Audio(label="Output"),
+    title="🗣️Persian ttt - glow_tts 🗣️",
+    theme="grass",
+    description=description,
+    article=article,
+    allow_flagging=False,
+    flagging_options=['error', 'bad-quality', 'wrong-pronounciation'],
+    layout="vertical",
+    live=False
+)
+iface.launch(share=False)

best_model.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:aef214c5d0c32265991b5a6ae2b37ae739021e010ed17bed28e20088a73ba680
+size 343874215

config.json ADDED Viewed

	@@ -0,0 +1,189 @@

+{
+    "output_path": "/kaggle/working/train_output",
+    "logger_uri": null,
+    "run_name": "run",
+    "project_name": null,
+    "run_description": "\ud83d\udc38Coqui trainer run.",
+    "print_step": 25,
+    "plot_step": 100,
+    "model_param_stats": false,
+    "wandb_entity": null,
+    "dashboard_logger": "tensorboard",
+    "log_model_step": null,
+    "save_step": 1000,
+    "save_n_checkpoints": 5,
+    "save_checkpoints": true,
+    "save_all_best": false,
+    "save_best_after": 10000,
+    "target_loss": null,
+    "print_eval": false,
+    "test_delay_epochs": -1,
+    "run_eval": true,
+    "run_eval_steps": null,
+    "distributed_backend": "nccl",
+    "distributed_url": "tcp://localhost:54321",
+    "mixed_precision": true,
+    "epochs": 1000,
+    "batch_size": 8,
+    "eval_batch_size": 4,
+    "grad_clip": 5.0,
+    "scheduler_after_epoch": true,
+    "lr": 0.001,
+    "optimizer": "RAdam",
+    "optimizer_params": {
+        "betas": [
+            0.9,
+            0.998
+        ],
+        "weight_decay": 1e-06
+    },
+    "lr_scheduler": "NoamLR",
+    "lr_scheduler_params": {
+        "warmup_steps": 4000
+    },
+    "use_grad_scaler": false,
+    "cudnn_enable": true,
+    "cudnn_deterministic": false,
+    "cudnn_benchmark": false,
+    "training_seed": 54321,
+    "model": "glow_tts",
+    "num_loader_workers": 0,
+    "num_eval_loader_workers": 0,
+    "use_noise_augment": false,
+    "audio": {
+        "fft_size": 1024,
+        "win_length": 1024,
+        "hop_length": 256,
+        "frame_shift_ms": null,
+        "frame_length_ms": null,
+        "stft_pad_mode": "reflect",
+        "sample_rate": 24000,
+        "resample": false,
+        "preemphasis": 0.0,
+        "ref_level_db": 20,
+        "do_sound_norm": false,
+        "log_func": "np.log10",
+        "do_trim_silence": true,
+        "trim_db": 45,
+        "do_rms_norm": false,
+        "db_level": null,
+        "power": 1.5,
+        "griffin_lim_iters": 60,
+        "num_mels": 80,
+        "mel_fmin": 0.0,
+        "mel_fmax": null,
+        "spec_gain": 20,
+        "do_amp_to_db_linear": true,
+        "do_amp_to_db_mel": true,
+        "pitch_fmax": 640.0,
+        "pitch_fmin": 1.0,
+        "signal_norm": true,
+        "min_level_db": -100,
+        "symmetric_norm": true,
+        "max_norm": 4.0,
+        "clip_norm": true,
+        "stats_path": null
+    },
+    "use_phonemes": true,
+    "phonemizer": "espeak",
+    "phoneme_language": "fa",
+    "compute_input_seq_cache": false,
+    "text_cleaner": "basic_cleaners",
+    "enable_eos_bos_chars": false,
+    "test_sentences_file": "",
+    "phoneme_cache_path": "/kaggle/working/train_output/phoneme_cache",
+    "characters": {
+        "characters_class": "TTS.tts.utils.text.characters.IPAPhonemes",
+        "vocab_dict": null,
+        "pad": "<PAD>",
+        "eos": "<EOS>",
+        "bos": "<BOS>",
+        "blank": "<BLNK>",
+        "characters": "\u02c8\u02cc\u02d0\u02d1pbtd\u0288\u0256c\u025fk\u0261q\u0262\u0294\u0274\u014b\u0272\u0273n\u0271m\u0299r\u0280\u2c71\u027e\u027d\u0278\u03b2fv\u03b8\u00f0sz\u0283\u0292\u0282\u0290\u00e7\u029dx\u0263\u03c7\u0281\u0127\u0295h\u0266\u026c\u026e\u028b\u0279\u027bj\u0270l\u026d\u028e\u029faegiouwy\u026a\u028a\u0329\u00e6\u0251\u0254\u0259\u025a\u025b\u025d\u0268\u0303\u0289\u028c\u028d0123456789\"#$%*+/=ABCDEFGHIJKLMNOPRSTUVWXYZ[]^_{}",
+        "punctuations": "!(),-.:;? \u0320\u060c\u061b\u061f\u200c<>",
+        "phonemes": "\u02c8\u02cc\u02d0\u02d1pbtd\u0288\u0256c\u025fk\u0261q\u0262\u0294\u0274\u014b\u0272\u0273n\u0271m\u0299r\u0280\u2c71\u027e\u027d\u0278\u03b2fv\u03b8\u00f0sz\u0283\u0292\u0282\u0290\u00e7\u029dx\u0263\u03c7\u0281\u0127\u0295h\u0266\u026c\u026e\u028b\u0279\u027bj\u0270l\u026d\u028e\u029faegiouwy\u026a\u028a\u0329\u00e6\u0251\u0254\u0259\u025a\u025b\u025d\u0268\u0303\u0289\u028c\u028d0123456789\"#$%*+/=ABCDEFGHIJKLMNOPRSTUVWXYZ[]^_{}",
+        "is_unique": true,
+        "is_sorted": true
+    },
+    "add_blank": false,
+    "batch_group_size": 0,
+    "loss_masking": null,
+    "min_audio_len": 1,
+    "max_audio_len": Infinity,
+    "min_text_len": 1,
+    "max_text_len": Infinity,
+    "compute_f0": false,
+    "compute_linear_spec": false,
+    "precompute_num_workers": 0,
+    "start_by_longest": false,
+    "shuffle": false,
+    "drop_last": false,
+    "datasets": [
+        {
+            "formatter": "mozilla",
+            "dataset_name": "",
+            "path": "/kaggle/input/persian-tts-dataset-famale",
+            "meta_file_train": "metadata.csv",
+            "ignored_speakers": null,
+            "language": "",
+            "meta_file_val": "",
+            "meta_file_attn_mask": ""
+        }
+    ],
+    "test_sentences": [
+        "\u0633\u0644\u0637\u0627\u0646 \u0645\u062d\u0645\u0648\u062f \u062f\u0631 \u0632\u0645\u0633\u062a\u0627\u0646\u06cc \u0633\u062e\u062a \u0628\u0647 \u0637\u0644\u062e\u06a9 \u06af\u0641\u062a \u06a9\u0647: \u0628\u0627 \u0627\u06cc\u0646 \u062c\u0627\u0645\u0647 \u06cc \u06cc\u06a9 \u0644\u0627 \u062f\u0631 \u0627\u06cc\u0646 \u0633\u0631\u0645\u0627 \u0686\u0647 \u0645\u06cc \u06a9\u0646\u06cc ",
+        "\u0645\u0631\u062f\u06cc \u0646\u0632\u062f \u0628\u0642\u0627\u0644\u06cc \u0622\u0645\u062f \u0648 \u06af\u0641\u062a \u067e\u06cc\u0627\u0632 \u0647\u0645 \u062f\u0647 \u062a\u0627 \u062f\u0647\u0627\u0646 \u0628\u062f\u0627\u0646 \u062e\u0648 \u0634\u0628\u0648\u06cc \u0633\u0627\u0632\u0645.",
+        "\u0627\u0632 \u0645\u0627\u0644 \u062e\u0648\u062f \u067e\u0627\u0631\u0647 \u0627\u06cc \u06af\u0648\u0634\u062a \u0628\u0633\u062a\u0627\u0646 \u0648 \u0632\u06cc\u0631\u0647 \u0628\u0627\u06cc\u06cc \u0645\u0639\u0637\u0651\u0631 \u0628\u0633\u0627\u0632",
+        "\u06cc\u06a9 \u0628\u0627\u0631 \u0647\u0645 \u0627\u0632 \u062c\u0647\u0646\u0645 \u0628\u06af\u0648\u06cc\u06cc\u062f.",
+        "\u06cc\u06a9\u06cc \u0627\u0633\u0628\u06cc \u0628\u0647 \u0639\u0627\u0631\u06cc\u062a \u062e\u0648\u0627\u0633\u062a"
+    ],
+    "eval_split_max_size": null,
+    "eval_split_size": 0.01,
+    "use_speaker_weighted_sampler": false,
+    "speaker_weighted_sampler_alpha": 1.0,
+    "use_language_weighted_sampler": false,
+    "language_weighted_sampler_alpha": 1.0,
+    "use_length_weighted_sampler": false,
+    "length_weighted_sampler_alpha": 1.0,
+    "num_chars": 156,
+    "encoder_type": "rel_pos_transformer",
+    "encoder_params": {
+        "kernel_size": 3,
+        "dropout_p": 0.1,
+        "num_layers": 6,
+        "num_heads": 2,
+        "hidden_channels_ffn": 768,
+        "input_length": null
+    },
+    "use_encoder_prenet": true,
+    "hidden_channels_enc": 192,
+    "hidden_channels_dec": 192,
+    "hidden_channels_dp": 256,
+    "dropout_p_dp": 0.1,
+    "dropout_p_dec": 0.05,
+    "mean_only": true,
+    "out_channels": 80,
+    "num_flow_blocks_dec": 12,
+    "inference_noise_scale": 0.0,
+    "kernel_size_dec": 5,
+    "dilation_rate": 1,
+    "num_block_layers": 4,
+    "num_speakers": 0,
+    "c_in_channels": 0,
+    "num_splits": 4,
+    "num_squeeze": 2,
+    "sigmoid_scale": false,
+    "d_vector_dim": 0,
+    "data_dep_init_steps": 10,
+    "style_wav_for_test": null,
+    "length_scale": 1.0,
+    "use_speaker_embedding": false,
+    "speakers_file": null,
+    "use_d_vector_file": false,
+    "d_vector_file": false,
+    "min_seq_len": 3,
+    "max_seq_len": 500,
+    "r": 1,
+    "restore_path": "/kaggle/working/train_output/run-December-24-2022_09+28AM-0000000/checkpoint_40000.pth",
+    "github_branch": "inside_docker"
+}

packages.txt ADDED Viewed

	@@ -0,0 +1,2 @@


1	+ libsndfile1
2	+ espeak-ng

requirements.txt ADDED Viewed

	@@ -0,0 +1 @@


1	+ git+https://github.com/coqui-ai/TTS@dev#egg=TTS