受夠了 AI 機械配音,我給 Codex 裝上了“我的聲音”!

作者:大瑜聊AI
日期:2026年9月5日 下午7:54
來源:WeChat 原文

整理版優先睇

速讀 5 個重點 高亮

將把聲放入 Codex:低頻用 MiniMax,長期自動化揀 Qwen3-TTS

整理版摘要

大瑜係一個成日用 AI 工具整片嘅內容創作者,佢用 codex + hyperframe 自動將公眾號文章轉成影片:一篇文章寫完,系統就會生成影片同剪接,慳唔少時間。但 Hyperframe 內置嘅配音係機械腔,整到啲片冇咗個人特色,於是佢就想辦法將自己把聲放入個流程度。

佢試咗兩個方案。第一個係用 MiniMax 嘅線上 TTS,支持上傳音色,喺網頁輸入文字就出到音頻,每個月送 1000 積分,大概做到 10分鐘貨仔,好適合低頻用。第二個係自己裝 Qwen3-TTS,呢個開源模型嘅聲音克隆比較逼真,仲可以將你把聲儲起,日後隨時用。

整體結論好清楚:如果你只係間中整幾條片,MiniMax 夠方便;但你想長遠做自動化,尤其係配合 Codex 批量生成,就應該用 Qwen3-TTS,因為佢提供 API,可以直接畀 Codex 調用,實現『文章 → 配音 → 影片』全自動。大瑜自己都係揀咗呢條路,最後半個鐘就搞掂。

  • 自動化生成影片雖然爽,但機械配音會即刻拉低質素,聲音克隆先可以保留個人特色。
  • MiniMax 免費額度係月送 1000 積分,數到盡都係得 10幾分鐘,適合低頻使用。
  • Qwen3-TTS 本地安裝可以複製你把聲,效果好逼真,仲可以保存聲線。
  • 最關鍵係 Qwen3-TTSAPI,畀 Codex 直接調用,先做到真正自動化而唔使人手下載
  • 成個方案大概花半個鐘設定,之後你嘅 AI 影片就可以一直用返你自己把聲。
值得記低
工具 minimax.io

MiniMax Text-to-Speech

線上 TTS 服務,支援上傳個人音色生成語音。每月有 1000 積分免費額度,適合低頻使用。

工具 github.com

Qwen3-TTS (GitHub)

開源聲音克隆模型,可本地安裝並提供 API,方便整合到 Codex 自動化流程。

整理重點

機械配音,係自動化影片嘅死穴

大瑜用開 codex + hyperframe,將公眾號文章自動變成影片。流程係『文章寫好 → 自動生成影片 → 自動剪接』,慳咗好多手腳。

成條流程最礙眼嘅位,就係 Hyperframe 內置嘅機械配音。

機械腔一嚟,就算內容幾有料,個人特色都即刻歸零。所以大瑜就試緊點樣將自己把聲放入個 pipeline。

記住呢個原則:低頻用 MiniMax,長期自動化用 Qwen3-TTS

整理重點

方案一:MiniMax 線上配音,快但額度有限

第一個方案係用 MiniMax 嘅線上 TTS 工具。你可以上傳個人音色,之後輸入文字,就即場下載音頻。

上傳音色呢一步最方便,唔使自己搞 server。

不過免費額度唔算多:每個月送 1000 積分。

  • 1 分半鐘嘅影片大概用 800 積分。
  • 換句話講,每個月 account 大概做到 10幾分鐘音頻。

如果只係間中整幾條片,呢個量都算夠用;但用得多就唔係好夠喉。

一句總結MiniMax 適合低頻或者貪方便嗰陣用。

整理重點

方案二:本地安裝 Qwen3-TTS,聲音克隆自己揸莊

第二個方案係自己安裝 Qwen3-TTS。呢個模型嘅聲音克隆效果好逼真,大瑜測試過都話得。

發送畀 Codex 嘅指令 text
我需要一個 tts 的工具,幫我查詢地址git clone
https://github.com/QwenLM/Qwen3-TTS.git並安裝,啓動。

安裝步驟可以直接交畀 Codex 搞,唔使自己慢慢打 command。

裝好之後,使用步驟好簡單

  1. 1 上傳你自己嘅音頻同對應文字。
  2. 2 輸入你要克隆嘅文字。
  3. 3 等合成完,就可以下載音頻。

呢個方案可以將你把聲保存低,下次直接 reuse。

仲有,Qwen3-TTS 提供 API,呢個先係佢最殺食嘅地方。

如果你唔怕麻煩,呢個先係長遠做自動化嘅根基。

整理重點

用 API 接入 Codex,先至係真自動化

Qwen3-TTS 提供 API,即係話你可以喺 Codex 入面直接 call 佢。

一有 API,『文章 → 口播腳本 → 音頻』成條線就可以交畀 Codex 一條龍搞掂。

大瑜自己由零開始設定到成功出片,大約用咗半個鐘。之後每次只要文章寫好,Codex 就會自動搞掂配音部分。

唔使再喺 MiniMax 網頁同剪片軟件之間切來切去,效率高好多。

最近大瑜用 codex+hyperframe 將大瑜公眾號嘅內容自動變成影片。

文章寫完 → 自動生成影片 → 自動剪片。

但係有一個地方好頭痕:

Hyperframe 內置嘅配音,把聲好機械。

咁點樣先可以幫啲內容配上大瑜自己把聲呢?

兩個方法分享畀你,可以收藏定。

先講結論:

低頻****使用嘅話 → MiniMax

長期自動化嘅話 → Qwen3-TTS +API

一、用 minimax 內置嘅 tts 工具

網址:https://www.minimax.io/audio/text-to-speech

圖片

支援自己上載聲線,之後直接輸入文字,就可以快速下載音頻。

一個帳號,每個月送 1000 積分,一分半鐘嘅影片大概要消耗 800 積分。

圖片

大概每個月每個帳號就可以生成十幾分鐘嘅音頻。

二、自己裝聲音克隆軟件

暫時 qwen3-tts 都幾好,聲音克隆嘅效果好逼真。

直接將呢句話發畀 codex,就得㗎喇。

我需要一個 tts 的工具,幫我查詢地址
git clone https://github.com/QwenLM/Qwen3-TTS.git
並安裝,啓動。

然後等一陣,你就會發現。

圖片

很方便

1、上載你自己嘅音頻同對應嘅文字

2、輸入你想克隆嘅文字

3、等最後合成。

當然,如果你覺得每次咁樣好麻煩,可以將你自己把聲儲低,下次直接用。

圖片

而且呢個本地方案嘅好處係:提供 API

圖片

我哋用緊 codex 嘅時候,可以直接調用 API,快速根據旁白稿生成音頻。

咁樣就完全自動化曬啦!唔使喺唔同系統之間切換嚟切換去喇!

寫喺後面嘅話

今日搞咗半個鐘頭,終於合成咗呢條影片,大家覺得點?有興趣可以讚好同收藏。


我係大瑜,關注我,會分享更多關於 AI 編程同 Agent 嘅內容。

步驟:關注大瑜 -> 私訊大瑜 -> 認識大瑜。

圖片
過往文章:
AI 編程必備:3 條規則,令 Agent 少講廢話、少燒 Token!
換咗一個 AI 工具,我之前調教出嚟嘅「大瑜」全部冇曬!
微信個人小程序點樣接入支付系統?呢篇文章話畀你知。

最近大瑜用 codex+hyperframe 自動將大瑜公眾號內容轉化為視頻。

文章寫完 → 自動生成視頻 → 自動剪輯。

但是有一個地方很頭疼:

Hyperframe 自帶的配音,一股機械腔調。

那如何給文案配上大瑜自己的音頻呢?

兩種方案分享給你,可以收藏。

先說結論:

低頻****使用 → MiniMax

長期自動化 → Qwen3-TTS +API

一、用 minimax 自帶的tts 工具

網站:https://www.minimax.io/audio/text-to-speech

圖片

支持可以自己上傳音色,後續直接輸入文字,就能快速下載音頻。

一個賬號,1 個月贈送 1000 積分,1 分半的視頻差不多消耗 800 積分。

圖片

差不多 1 個月 1 個賬號可以生成 10 多分鐘的音頻。

二、自己安裝聲音克隆軟件

目前qwen3-tts 還是不錯,聲音克隆還是很逼真的。

直接把這句話發給 codex,即可。

我需要一個 tts 的工具,幫我查詢地址
git clone https://github.com/QwenLM/Qwen3-TTS.git
並安裝,啓動。

然後等待片刻,就會發現。

圖片

很方便

1、上傳你自己音頻和對應的文字

2、輸入你要克隆的文字

3、等待最終合成。

當然,如果你覺得每次麻煩,可以直接將你的聲音保存起來,下次直接用。

圖片

而且這個本地的好處 是:提供 API

圖片

我們在用 codex 中,直接調用 API 快速根據口播腳本,生成音頻。

這不是妥妥的自動化了嘛!也不用去各個系統去來回切換了嘛!

寫在後面的話

今天折騰了半個小時,最終合成了這樣的視頻,大家覺得如何,感興趣可以點贊收藏。


我是大瑜,關注我,分享更多 AI 編程和 Agent 相關的內容。

步驟:關注大瑜->私信->認識大瑜。

圖片
歷史文章:
AI 編程必備:3 條規則,讓 Agent 少廢話、少燒 Token!
換了一個AI工具,我之前調教出來的“大瑜”全沒了!
微信個人小程序如何接入支付系統?這篇文章告訴你。