發表文章

目前顯示的是有「文字轉語音」標籤的文章

index TTS2 文字轉語音50種情緒控制提示詞 + 範例

主類別 語氣名稱,語氣描述 示範腳本 正面情緒 快樂,語氣明亮、有笑意、節奏稍快 今天的天氣真好!陽光剛剛好,風也很舒服,感覺整個世界都在微笑呢! 正面情緒 開心,輕快、自然、有笑聲 哈哈,我真的太開心了!沒想到事情能這麼順利! 正面情緒 喜悅,飽滿、有能量、聲音明亮 真是太棒了!我等這一天等好久了! 正面情緒 感動,聲音微顫、真摯 謝謝你,一直以來的支持和陪伴,真的很感動。 正面情緒 驚喜,聲音上揚、情緒突然 哇~真的嗎?我完全沒想到會有這樣的結果,太讓人驚訝了! 正面情緒 自信,穩定有力、語尾收緊 放心吧,這件事交給我就好。我知道該怎麼做。 正面情緒 誇讚,語氣溫暖、節奏柔和 你做得真的很好,完全超出我的預期! 正面情緒 溫柔,柔軟、低速、有關懷感 別急,我在這裡陪你,慢慢來,好嗎? 正面情緒 迷人,輕柔、有氣音、語尾拉長 你知道嗎?有時候,只要一句話,就能讓人心動一整天。 正面情緒 鼓勵,堅定、溫暖 別怕,你可以的!每一步都比昨天更靠近成功。 負面情緒 悲傷,聲音低沉、語速慢 有些事,不管多努力也回不去了。 負面情緒 失望,平靜中帶嘆息、語尾下滑 我以為他會懂的……結果還是一樣。 負面情緒 憤怒,語速快、氣息重 你到底知不知道你在做什麼?我真的受夠了! 負面情緒 不滿,短促、帶刺 又來了,每次都這樣,真煩人。 負面情緒 抱怨,拉長語氣、帶無奈 唉,今天又加班到這麼晚,真累啊。 負面情緒 怨恨,冷漠、帶壓抑 有些傷,不會那麼容易被原諒。 負面情緒 嫉妒,語氣酸、笑中帶刺 哼,她不過是運氣好罷了。 負面情緒 厭倦,語速慢、氣息重 每天都一樣,真不知道有什麼意義。 負面情緒 孤單,輕聲、空靈 夜裡的風好冷,一個人真的好孤單。 負面情緒 內疚,低聲、懊悔 對不起,我真的不該那樣說。 緊張恐懼 害怕,顫抖、音量低 那、那是什麼聲音?你聽到了嗎? 緊張恐懼 驚嚇,突然高音、尖銳 啊!什麼!? 緊張恐懼 焦慮,語速快、語尾顫抖 我不知道該怎麼辦,時間快到了…… 緊張恐懼 緊張,語氣急促、呼吸重 我手都在抖,希望不會出錯。 緊張恐懼 恐懼,呼吸急促、顫音 那個影子……它在動! 平靜療癒 平靜,穩定、低速 閉上眼,深呼吸。放下一切。 平靜療癒 舒適,放鬆、語尾柔 風吹過臉頰,整個人都安靜下來。 平靜療癒 療癒,柔和、...

🎬 Youtube AI 教學視頻連結列表 (持續更新)

圖片
🎬 全部 AI 教學視頻

告別AI機器音!Index TTS2 讓你的聲音充滿喜怒哀樂,真正實現聲音自由!

圖片
一個音色與情感分開控制的 AI 文字轉語音工具 Index TTS2,可以用本人音色加上別人情感或自訂的情感描述,合成你希望的任何語音,真正實現聲音自由,應用範圍廣泛。 Large-scale text-to-speech (TTS) models are typically categorized into autoregressive and non-autoregressive systems. Although autoregressive systems exhibit certain advantages in speech naturalness, their token-by-token generation mechanism makes it difficult to precisely control the duration of the synthesized speech. This becomes a significant limitation in applications such as video dubbing, where strict audio-visual synchronization is required. This paper introduces IndexTTS2, which proposes a novel, general, and autoregressive-model-friendly method for speech duration control. The method supports two generation modes: one allows explicit specification of the number of generated tokens, thereby enabling precise control over speech duration; the other does not require manual token count input, letting the model freely generate speech in an autoregressive manner while faithfully reproducing prosod...

AI 數字人免費製作套餐組合 Supawork AI + Index TTS + SUTRA Avatar v2 + 剪映 6.0.1

圖片
這次的視頻分成四個部分 1、生成數字人頭像 2、製作語音檔 3、生成說話數字人 4、將數字人加入視頻 Vidu AI 免費快速生成視頻 (推薦) Supawork AI 免費 AI 專業頭像生成器 Index TTS 線上文字轉語音工具 (推薦) Index TTS 202505 一鍵整合包下載 Index TTS 展示頁面 Supawork AI 免費 AI 圖片換臉工具 Supawork AI 免費 AI 視頻換臉工具 SUTRA Avatar v2 圖片、影片生成數字人工具 SUTRA Avatar v2 GITHUB 項目地址 剪映 6.0.1 免安裝版 6+*

不會讓你失望、更自然更像真人的文字轉語音工具 Index TTS,一鍵整合包下載與免註冊無限使用線上版

圖片
1、每次生成長度建議在 3 到 5 句之間, 大約在 100 個中文字以內, 這並不是絕對的, 實際上會受說話的速度快或慢影響, 整合包應該沒這問題, 不過太長的段落不易於視頻的編輯, 以及發音的錯誤修正, 因此不建議太長的文字, , 2、生成間隔不要太接近, 因為在 Huggingface 的 GPU 是有額度限制的, 如果生成語音的間隔太接近, 或每次生成語音的字數太多, 都很容易造成錯誤, 但更換 IP 或稍等一下就能繼續使用 3、注音符號有不同的停頓效果, 在語音生成中是不會被讀出來的, 請依照正常的文章寫作方式添加即可, 運算符號則會被唸出來, 尤其是英文句子中間的連接線, 請使用空格代替 4、 Index TTS 1.5 整合包支援多國語言(含繁體中文)、50 系列顯示卡、僅需 6G 顯示卡記憶體、支援CPU運算模式、一鍵式操作介面、支援長篇文字轉換、提高英文的發音表現和模型的穩定度,下載網址請參考說明欄的影片資訊連結 5、線上版 Index TTS 整個語音生成的發音表現, 讓人眼睛為之一亮, 除了劇本字數太多造成的停頓間隔過長、極少部分的多音字要修正以外, 其他幾乎都是一步到位 6、線上版 Index TTS 雖然不必註冊或登入就能使用, 但還是有 GPU 的額度限制, 如果你太過於頻繁的生成語音, 大約 5 次就用完了, 這時候只要把網路連線中斷, 等約 15 秒以上在連線就能繼續使用 7、生成語音時的參考音頻, 建議至少 15 秒以上, 雖然說 3 到 5 秒也能生成不錯的聲音, 但是越長的參考音頻能提供的語音數據就越多, 生成後的語音也會更真實, 所謂的 0 樣本學習是指, 你不需要提供參考音頻的文字內容, 不是不需要提供參考音頻, 別搞錯了 8、如果你是使用線上版 Index TTS, 且每次生成語音的劇本都在一百個字左右, 那麼生成時間應該都在 60 秒以內(甚至更短), 第一次生成都沒有提示, 不要當成當機, 如果超過 120 秒還沒完成, 請重新生成 Index TTS 線上文字轉語音工具 (推薦) ChatGPT 4o mini TTS 線上文字轉語音工具 Index TTS 202505 一鍵整合包下載 Index TTS DEMO Raphael 無限制免費 AI 圖片產生器

OpenAI GPT-4O mini TTS 文字轉語音工具、台灣口音、超過 50+ 語言、流式推理、快速穩定、免費、免登錄、無限使用

圖片
Supported languages(支援語言): Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese, and Welsh. GPT-4O mini TTS 內建音色風格對照表 聲音名稱 推測性別 年齡感 語音風格特點 Alloy 男性 青壯年(25–35) 穩定中性、敘述用廣泛 Ash 中性偏男性 青壯年(25–35) 較冷靜、略偏數位感 Ballad 男性 成熟(35–50) 溫柔、低沉、像講故事 Coral 女性 青年(20–30) 清晰明亮,偏活潑自然 Echo 女性 青年(20–30) 朝氣、清脆、適合歡快語氣 Fable 女性 青年(20–30) 柔和、有故事感,像說童話 Onyx 男性 青壯年(30–40) 深沉穩重、有磁性,像播音員 Nova 女性 青年(20–30) 最中性自然、用處廣、清晰穩定 Sage 男性 成熟(35–50) 冷靜穩重,聲線深厚,有智者感 Shim...

GPT-SoVITS、Openai.fm最強的文字轉語音工具,免費免註冊免登入,生成逼近真人的語氣,附GPT-SoVITS V3整合包下載,支持中文、英語、日語、韓語和粵語

圖片
Openai.fm 文字轉語音支持的語言: 英語,阿拉伯語,克羅埃西亞語,捷克語,丹麥語,荷蘭語,英語,愛沙尼亞語,芬蘭語,法語,加利西亞語,德語,希臘語,希伯來語,印地語,匈牙利語,冰島語,印度尼西亞語,義大利語,日語,卡納達語,哈薩克語,韓語,拉脫維亞語,立陶宛語,馬其頓語,馬來語,馬拉地語,毛利語,尼泊爾語,挪威語,波斯語,波蘭語,葡萄牙語,羅馬尼亞語,俄語,韓語塞爾維亞語、斯洛伐克語、斯洛維尼亞語、西班牙語、斯瓦希里語、瑞典語、塔格什語、泰米爾語、泰語、土耳其語、烏克蘭語、烏爾都語、越南語和威爾斯語。 Supported languages Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese, and Welsh. GPT-SoVITS V2 線上版連結 GPT-SoVITS V3 整合包 Google 下載連結 Openai.fm 線上版連結 沉浸式翻譯擴充套件下載連結

TTSMaker 線上免費文字轉語音,多國語言,合成速度快,可商業使用

圖片
接觸 TTSMaker 文字轉語音 應該也快一年了,雖然使用頻率不高,但只要有用到文字轉語音功能時那就非 TTSMaker 莫屬了,個人覺得以目前的文字轉語音技術來說,能夠比微軟的 Azure 更好用而且免費的也只有 TTSMaker 文字轉語音 了,當然或許有更好的,只是我不知道... TTSMaker 文字轉語音 的確很方便,除了可以免費使用外,還提供了超過50種語言,中、英文各有六十多種配音腳色供你選擇,從男、女、小孩、成人、老人應有盡有,使用 TTSMaker 文字轉語音 生成的音檔,可以 100% 的擁有版權所有權,並且可以將其用於任何目的,包括商業用途,只要符合當地法律即可。同時可以在 YouTube、TikTok、Podcasts 等平台上使用 TTSMaker 文字轉語音 生成的音檔,無需註明來源。但是,如果您願意註明來源,當然更好。 TTSMaker 文字轉語音 怎麼使用? TTSMaker 文字轉語音 簡單易用也是它的特色,因為是中文介面,所以操作上沒什麼難度: 1、每個配音者都有限制每次可轉換字數,並在此顯示【 剩餘 】及【 可輸入 】字數 2、正常的輸入要轉語音的文字,也可以在其他文字編輯器打好再複製過來,建議一句一行,標點符號或段落、換行,都會有預設的停頓時間(約0.3秒) 3、在你輸入的文字中,標點符號或段落、換行,都會有預設的停頓時間(約0.3秒),但有時你可能需要更長的停頓時間,此時就可以透過點擊【 插入停頓 】或手動輸入【 ((⏱️=1000)) 】來設定游標所在之處的停頓時間,其中的1000等於1秒,例如你想停頓0.5秒那就輸入【 ((⏱️=500)) 】,你想停頓3秒那就輸入【 ((⏱️=3000)) 】,最大的停頓時間為10秒,最多可以插入 100 個停頓時間 4、從下拉清單中選擇語言,注意:要轉語音的文字必須和選擇的語言相符,否則會有非預期結果 5、在框中任意處點擊,就可以選擇該聲音,每個聲音都有各自單次的轉換限制字數,並在(1)顯示【 剩餘 】及【 可輸入 】字數 6、點擊【 試聽聲音 】可以試聽該發音者的音色是否喜歡 7、輸入右側的4位數驗證碼 8、【 高級設定 】通常很少變更,但是你可以根據需求【 加入背景音樂 】、【 調節語速 】、【 調節音量 】、【 調節音高(可以做變聲效果)...

Talking Avatar 集合了即時克隆的文字轉語音、生成數字人視頻,線上 + Windows,CPU可用

圖片
生成視頻長度和次數不受限制 沒有文字轉語音次數限制 視頻生成沒有限制 沒有浮水印 Talking Avatar 數字人生成 文字轉語音工具 F5 TTS 升級版免費免登入無限制使用極速克隆生成帶情感的真人語音

另一個好用的文字轉語音工具FireRedTTS,實現了具有副語言行為和情感可控類人語音生成(20250227更新)

圖片
如何判斷浮動IP? 1、一般的ADSL連線除非有申請固定 IP,否則預設都是浮動 IP 2、你可以訪問 https://we-shop.net/ip.php 你的IP是:123.123.123.0~255,4組數字就是你目前的 IP 3、先中斷連線等約10~15秒再重新連線 4、再訪問 https://we-shop.net/ip.php,如果 IP 和之前不同,即可確定為浮動 IP 5、有時 ISP 會因沒有閒置的浮動 IP 而無法更換,如果重新連線多次,IP 都一樣的話,即可確定為固定 IP FireRedTTS 文字轉語音工具範例 FireRedTTS 文字轉語音工具線上版 (執行錯誤) 夸克網盤 (提取碼:gsfF) 百度網盤 (提取碼:eu0y) Google 雲端硬碟 (5.74G)

文字轉語音工具 F5 TTS 升級版免費免登入無限制使用極速克隆生成帶情感的真人語音

圖片
強烈建議使用 Huggingface 的線上 F5-TTS 因為線上的 F5-TTS 速度快,不需要註冊 不消耗過多硬體資源 哪怕硬體再爛都能使用 不需自行維護 Bug 與功能升級 生成的速度超快 如何能一直免費使用的方法 視頻後面會告訴你 如何判斷浮動IP? 1、一般的ADSL連線除非有申請固定 IP,否則預設都是浮動 IP 2、你可以訪問 https://we-shop.net/ip.php 你的IP是:123.123.123.0~255,4組數字就是你目前的 IP 3、先中斷連線等約10~15秒再重新連線 4、再訪問 https://we-shop.net/ip.php,如果 IP 和之前不同,即可確定為浮動 IP 5、有時 ISP 會因沒有閒置的浮動 IP 而無法更換,如果重新連線多次,IP 都一樣的話,即可確定為固定 IP HuggingFace 開源的 AI 倉庫 F5-TTS 文字轉語音工具 V2 線上版 F5-TTS 文字轉語音工具 V2 一鍵整合包 Google 下載

ChatTTS AI文字轉語音神器,可直接輸入繁體中文,可繼承之前音色,一鍵部署、簡單易用(含win离线整合包)使用教學與下載

圖片
今天要介紹的是 ChatTTS 的升級版,不但修復了中英混讀的問題,還增加許多功能,也讓生成的語音更加自然穩定,沒有獨立顯示卡,使用CPU一樣也能執行,這一版已經內鍵 CUDA 驅動程式,你不需要另外安裝,另外一個問題是,上一個版本儲存的音色,要如何在這個新版本繼續用,以便保持一致的音色,都會在今天告訴你 這一版除了檔案比較小之外,執行速度也有提升,下載方式也有改變,當你進入到 下載 頁面之後,往下捲動,會看到整合版下載地址的文字,點選紅框中的連結進入下載列表,再點選這個ChatTTS_colab_offline-0.0.6.7z,這裡的0.0.6是最新版本,你下載的時候或許是0.0.7、0.0.8,或甚至更高,最後,點選 download 開始下載 爲了避免檔案遺失,還是建議直接下載到 D 槽下,然後解壓縮至此,會看到 ChatTTS_colab_offline-0.0.6目錄,你可以把這個目錄改成其他名字,例如 ChatTTS,但就是不能用中文字,進入 ChatTTS 目錄裡,就會看到所有檔案,如果不清楚自己的電腦有沒有GPU,可以雙擊,【GPU诊断.bat】,如果知道自己的電腦,沒有獨立顯示卡,就不用測試了,如果出現Windows視窗,先按【其他資訊】,然後再按【仍要執行】就可以了,這個測試結果會告訴你,使用CPU還是使用GPU,顯示卡加速,按任意鍵就可以關閉DOS視窗 雙擊【运行.bat】啟動ChatTTS,然後啟動前會自動偵測使用CPU還是GPU,並且載入相關模組,最後才會開啟預設瀏覽器,所以需要點時間,請勿關閉DOS視窗,依照你的硬體而有所不同,像我沒有GPU,大約需要1至2分鐘,請耐心等待 ChatTTS啟動後,預設會進入【音色抽卡】頁簽,這是用來讓你挑選音色用的,和前一版本的差別就是,多了一個Path(路徑)欄位和試聽按鈕,讓你更輕鬆找到喜歡的音色、種子編號,方便在【長音頻】或者【角色扮演】中使用 因為【音色抽卡】的種子ID是隨機生成的,如果你沒有儲存,當你更新了ChatTTS版本之後,就很難再使用音色抽卡,找到相同的音色,相反的,如果你有儲存自己喜歡的音色,最好是備份在ChatTTS以外的地方,只要把這些音色檔案還原,就可以一直保持一模一樣的音色,但前提還是要一樣的環境才可以,否則的話還是會有些許差別,要...

ChatTTS 最像真人的文字轉語音 AI,詳細使用教學與下載(上)

圖片
這個文字轉語音的 AI ChatTTS 雖然開源專案在 GitHub 上已經許久了,但火爆程度依然未減,因為它合成的語音效果實在是太真實了,已經超越許多商用的TTS服務,ChatTTS 無論是語氣、停頓或是說話的節奏,如果沒有仔細聽,還真難分辨出是真人還是AI,這還只是用了4萬小時的聲音進行訓練開放出來的小模型合成的效果,而且是沒有經過特定任務微調的版本,另外還有個10萬小時素材訓練的模型,因為合成效果過於真實,開發者擔心存在安全和隱私風險,所以並沒有釋放出來... 今天要介紹如何在本機 Windows環境下使用 ChatTTS 整合包,ChatTTS 對硬體的要求不高,沒有獨立顯示卡使用 CPU 也能執行,但建議記憶體至少 8G 以上,如果擁有獨立顯示且視訊記憶體高於 4GB 就可以使用 GPU 來執行,前提是要安裝好 CUDA 驅動程式,推薦安裝CUDA 12.1這個版本,可以直接使用整合包內附的檔案進行安裝... 如何佈署 下載壓縮包之後解壓縮在此會得到 ChatTTS 目錄(建議放在D槽下,路徑不能有中文),進入 ChatTTS 目錄雙擊 0)check-gpu.bat,會開啟 DOS 視窗並測試能否使用 GPU 整合顯示卡,如果沒有獨立顯卡就不用測試了,因為只能使用 CPU ,執行測試結果如果是 true 代表可以使用顯示卡加速,如果是 False,然後按任意鍵關閉 DOS 視窗 接下來要安裝 CUDA 12.1 (雙擊執行 reinstall-cuda121.bat)這個2號指令碼,一樣會開啟 DOS 視窗,更新的過程會詢問四次都一樣的先輸入Y然後按 Enter,直到【請按任意鍵繼續...】,就會開始自動下載更新,中國大陸的朋友要提前開好 VPN 否則下載速度會很慢,如果中途更新中斷請關閉 DOS 視窗重新執行更新即可,更新完成後按任意鍵關閉 DOS 視窗 如何開始使用 go-webui.bat 和 go-webui-api.bat 是一般的操作介面,功能顯得陽春,因此建議雙擊 go-webui-mix.bat 來啟動 ChatTTS,啟動前會先開啟 DOS 視窗,用來顯示過程中所有進度與狀態,過程中請勿關閉,ChatTTS 啟動前也會先先載入必要檔案,最後才會開啟預設瀏覽器,所以載入時間會依照你的硬體而有所不同,像我沒有 G...

ChatTTS 最像真人的文字轉語音 AI,詳細使用教學與下載(下)

圖片
下載連結在最底下 如何使用長音頻生成語音 長音頻生成適合生成單人音色的語音 1、朗读文本:輸入或貼上要合成語音的文字,只能用英文或簡體中文,實際能生成語音的字數不清楚,只要硬體夠用應該沒啥限制... 2、选择固定音色: 目前有 12 種固定音色可選,如果想隨機生成音色,請選擇【用seed生成音色】,選擇時要點選文字右邊空白處才有作用 3、指定种子(留空则随机): 如果沒有選擇固定音色,就會隨機產生一個種子編號,此版的指定種子無法使用 4、语速: 數字越小越慢,但差距不明顯聽不太出來 5、口语化: 保持預設即可,會自動在句子中加入口頭語 6、笑声: 預設0(關閉),會自動在句子中加入笑聲,超過2會出錯 7、停顿: 數字越大停頓越久,但差距不明顯聽不太出來 8、文本分段长度、9、批大小: 保持預設即可 10、其他参数: 【溫度】數字越低合成的語音越穩定,調大可以增加 AI 語音生成的創意和隨機性也越大,其他建議保持預設即可 11、當所有參數都設置好後,就可以按這裡開始【生成音頻】,音頻完成後會在下方顯示【撥放鈕】(12)供你試聽,如果對生成結果不滿意,只需重新生成直到滿意為止 如何使用角色扮演生成語音 角色扮演適合多人對話的場景,可以任意指定不同角色生成不同語音 1、OpenAI API Key: 如果你有請輸入,然後在【剧情简介或者一段故事】(2)裡說明想讓AI為你生成怎樣的劇本,之後再按【AI脚本生成】(3),AI 就會自動幫你生成腳本,如果沒有 OpenAI API Key,那就讓 CHATGPT 幫你寫一段吧! 4、脚本格式: 以兩個半型的冒號(::)相隔,冒號的左邊是角色名字(不會出現語音中),冒號的右邊是該角色說的內容,換角色就換行(一行一個角色),完成後按【步骤①:提取角色】(5) 6、所有劇本中用到的腳都列在這裡,請逐個修改角色所要使用的語音種子【 音色抽卡 】,然後按【步骤②:生成音频】(7)開始生成音頻 音頻完成後會在下方顯示【撥放鈕】(8)供你試聽,如果對生成結果不滿意,只需重新生成直到滿意為止 生成後的音頻也會以日期時間命名,同步存在 ChatTTS 的目錄裡 ChatTTS 下載連結

F5-TTS Multi-Speech 完美實現仿真人情境的多角色多情感多人對話語音

圖片
F5-TTS 中的多角色多情感多人對話語音除了能指定多角色對話外,還能指定同一角色使用不同的對話情境,如:高興、生氣...,使得整個對話更逼真 新版整合包百度下載(10G)【解決語音底噪和吞字問題,優化推理穩定性】 F5TTS中文版本,最新升级整合包百度下載(13.82G) 雖然 Hugging Face 的線上 F5-TTS 會有次數限制,但是可以透過註冊多個帳號來解決,所以還是建議使用 線上的 F5-TTS ,因為 線上的 F5-TTS 速度快,不消耗過多硬體資源,不需自行維護BUG、功能升級,但是有一點要注意的是,免費版通常是排在最後的,因此越晚越容易塞車 切換頁簽至做多角色多情感的多人語音【Multi-Speech】 1、【Speech Type Name】輸入劇本中用到的自訂角色名稱,前面必須是英文或數字,之後就可以中英混合 2、【Reference Audio】上傳一段不超過 15 秒乾淨的參考音頻,這個角色將模仿此音頻的語調、音色與情感 3、如果參考音頻過長,可以點擊這個剪刀ICON進行裁剪 4、【Reference Text (Regular)】的文字欄位,預設不需輸入,系統會自動擷取你在【Reference Audio】上傳的參考音頻內容,但是該音頻若有其他雜音,可能導致生成後的語音不理想,如果你不確定音頻乾淨,還是乖乖輸入參考音頻的文字內容,這樣生成後的語音會比較完美 5、【Insert Label】會將角色名稱插入到【Text to Generate】最後 6、如果角色不只一個,請按【Add Speech Type】新增一個角色欄位,並設定角色名稱、上傳參考音頻 【Text to Generate】裡是要生成語音的劇本內容,格式是:{自訂角色名稱}對話內容,這裡的 自訂角色名稱 必須已經存在【Speech Type Name】,否則將無法合成,內容可以一段一行或一句一行,簡體或繁體都可以,但要注意的是某些字兩岸的讀法是有出入的,例如此例的 坎坷 ,如果不改成 坎科 就會讀成 坎可 ,還有很多,另外,台灣人也不太習慣捲舌,如果你在意,應該先行修正,建議先在文字編輯器修改好再貼過來 點開【Advanced Settings】後,有個【Remove Silences】預設是選取的,因為語音生成時會產生靜音(交流...

只須給十秒鐘的聲音樣本,F5-TTS 完美實現仿真人情境的語音

圖片
F5-TTS是上海交通大學推出的,一款高效能文字轉語音工具,F5-TTS 整合包適合電腦有裝N卡的人使用,沒有任何限制處理速度也很快,沒有裝顯示卡的人雖然也可以用,不過速度會慢很多 如果是使用整合包,F5-TTS 的位置建議直接放在 D 磁碟,如 D:\F5-TTS 以確保路徑沒有中文,首次啟動會先下載和載入模型,可能需要3-4分鐘,請耐心等待,啟動時開啟的 DOS 視窗在 TTS 執行中都不能關閉,啟動完成後複製網址 http://127.0.0.1:7860/ ,或直接在瀏覽器的網址列輸入 http://127.0.0.1:7860/ 沒有裝顯示卡的人,建議使用 Hugging Face 提供的線上 F5-TTS,不需要註冊也可以使用,不過使用次數會比有註冊者少很多, 註冊 並 登入 後還可使用 Hugging Face 的其他 AI 功能 完整整合包百度下載(14.98G) 新版整合包百度下載(10G)【解決語音底噪和吞字問題,優化推理穩定性】 普通整合包MEGA下載(4.19G)(需要自行安裝 FFMPEG) ( 【FFmpeg 下載與安裝教學】 因為我的電腦只有 CPU,若使用整合包效率太低,所以這篇教學就以 Hugging Face 的線上 F5-TTS 為例給大家介紹,這個工具支援 F5 和 E2 兩個 TTS 模型,主要區別在於 F5 產生語音的時間更短,但是聲音還原度沒那麼高,而 E2 產生的聲音更逼真,導致生成速度就更慢一點,雖有細微差別但不明顯,支援英文和中文兩種語言合成,並且支援中英兩種語言之間無縫切換,參考音頻不要超過 15 秒效果比較好, F5-TTS 較重要的功能有長文字合成語音和多情境語音的合成,其他如:語音對話、Podcast的播客功能,就不多作介紹了。 1、F5 和 E2 兩個 TTS 模型差別但不明顯,建議直接使用 F5 即可,當然你也可以試試 E2 2、【Basic-TTS】用來生成單人的語音,支援英文和中文兩種語言合成,並且支援中英兩種語言之間無縫切換,【Multi-Speech】用來做多角色多情感的多人對話 3、在【Reference Audio】上傳一段不超過 15 秒乾淨的參考音頻,F5-TTS 將模仿此音頻的語調、音色與情感 4、【Text to Generate】就是...