วิธีสร้างเสียงบรรยายด้วย Gemini Text-to-Speech

วิธีสร้างเสียงบรรยายด้วย Gemini Text-to-Speech หรือ Gemini TTS สามารถทำได้ผ่าน Google AI Studio โดยเลือกโมเดล Text-to-Speech กำหนดเสียงผู้พูด วางสคริปต์ แล้วเขียน Prompt ควบคุมน้ำเสียง อารมณ์ ความเร็ว และการเว้นจังหวะ จากนั้นสั่งสร้างและดาวน์โหลดเป็นไฟล์เสียงเพื่อนำไปตัดต่อได้

Gemini TTS รองรับภาษาไทย เสียงผู้บรรยายคนเดียว และบทสนทนาสองคน เหมาะสำหรับวิดีโอ YouTube, TikTok, Podcast, หนังสือเสียง บทเรียนออนไลน์ โฆษณา และงานนำเสนอ

🎙️ Gemini Text-to-Speech คืออะไร

Gemini Text-to-Speech คือความสามารถในการเปลี่ยนข้อความเป็นเสียงพูดด้วยโมเดล Gemini ผู้ใช้สามารถควบคุมการแสดงอารมณ์ รูปแบบการอ่าน ความเร็ว สำเนียง และจังหวะเสียงผ่านคำสั่งภาษาธรรมชาติ

Gemini TTS แตกต่างจากระบบอ่านข้อความทั่วไป เพราะสามารถเข้าใจบริบทของสคริปต์และปรับการอ่านตามเนื้อหา เช่น

  • เพิ่มความตื่นเต้นในประโยคเปิด
  • พูดช้าลงเมื่ออธิบายข้อมูลสำคัญ
  • ลดเสียงในช่วงเศร้า
  • เว้นจังหวะก่อนคำสำคัญ
  • ใช้น้ำเสียงอบอุ่นสำหรับหนังสือเสียง
  • ใช้น้ำเสียงกระชับสำหรับคลิปสั้น
  • แยกเสียงผู้พูดสองคนในบทสนทนา

🆚 Gemini TTS, Gemini Live และ Audio Overview ต่างกันอย่างไร

ฟีเจอร์ใช้ทำอะไรเหมาะกับงาน
Gemini Text-to-Speechอ่านข้อความตามสคริปต์และสร้างไฟล์เสียงเสียงพากย์ หนังสือเสียง Podcast และโฆษณา
Gemini Liveสนทนาด้วยเสียงแบบเรียลไทม์ถามตอบ ฝึกภาษา และพูดคุย
Audio Overviewสรุปเอกสารเป็นรายการเสียงฟังสรุปรายงานหรือเอกสาร
Gemini API Liveสร้างระบบโต้ตอบด้วยเสียงแอป ผู้ช่วยเสียง และระบบบริการลูกค้า
Lyriaสร้างเพลง ดนตรี และเสียงร้องเพลงและเพลงประกอบ

หากต้องการให้ AI อ่านสคริปต์ตามข้อความทุกคำ ควรใช้ Gemini Text-to-Speech ไม่ควรใช้ Audio Overview เพราะระบบอาจสรุปและเรียบเรียงเนื้อหาใหม่

✅ Gemini TTS ใช้ทำอะไรได้บ้าง

  • เสียงบรรยายวิดีโอ YouTube
  • เสียงพากย์ TikTok
  • เสียงสำหรับ Facebook Reels
  • Podcast
  • หนังสือเสียง
  • บทเรียนออนไลน์
  • เสียงโฆษณา
  • เสียงแนะนำสินค้า
  • เสียงประกาศ
  • ระบบตอบรับอัตโนมัติ
  • บทสนทนาสองคน
  • เสียงตัวละคร
  • เสียงอ่านข่าว
  • เสียงบรรยายสารคดี
  • เสียงสำหรับเกม
  • เสียงนำเสนอธุรกิจ
  • เสียงอธิบายวิธีใช้งาน

🤖 โมเดล Gemini TTS ที่ควรรู้จัก

Gemini 3.1 Flash TTS

เหมาะกับงานที่ต้องการความเร็ว คุณภาพเสียงเป็นธรรมชาติ และการควบคุมอารมณ์อย่างละเอียด รองรับคำสั่งควบคุมรูปแบบการอ่านและการสร้างเสียงแบบ Streaming

Gemini 2.5 Flash TTS

เหมาะกับการสร้างเสียงจำนวนมาก งานบรรยายทั่วไป ระบบสนทนา และงานที่ต้องการลดเวลาและค่าใช้จ่าย

Gemini 2.5 Pro TTS

เหมาะกับเสียงบรรยายยาว หนังสือเสียง และงานระดับมืออาชีพที่ต้องการความชัดเจนกับจังหวะเสียงคุณภาพสูง

ชื่อรุ่นและสถานะ Preview อาจเปลี่ยนตามการอัปเดต ควรเลือกโมเดล TTS รุ่นล่าสุดที่แสดงใน Google AI Studio

💻 วิธีสร้างเสียงบรรยายด้วย Gemini TTS ใน Google AI Studio

1. เตรียมสคริปต์

ตรวจข้อความให้เรียบร้อยก่อนสร้างเสียง โดยตรวจ

  • ตัวสะกด
  • เครื่องหมายวรรคตอน
  • ชื่อเฉพาะ
  • ตัวเลข
  • วันที่
  • คำย่อ
  • คำภาษาอังกฤษ
  • การแบ่งย่อหน้า
  • คำที่ต้องการเน้น

สคริปต์สำหรับเสียงพูดควรใช้ประโยคสั้นและเป็นภาษาพูดมากกว่าภาษาเขียนที่ซับซ้อน

2. เปิด Google AI Studio

เข้าสู่ Google AI Studio ด้วยบัญชี Google แล้วเปิดพื้นที่สำหรับสร้างเสียง

มองหาเมนูที่เกี่ยวข้อง เช่น

  • Text-to-Speech
  • Speech generation
  • TTS
  • Voice Library
  • Generate Media
  • Audio

ตำแหน่งและชื่อเมนูอาจเปลี่ยนตามเวอร์ชันของระบบ

3. เลือกโมเดล TTS

เลือก Gemini 3.1 Flash TTS หรือโมเดล Text-to-Speech รุ่นล่าสุดที่บัญชีสามารถใช้งานได้

หากเป็นงานบรรยายยาวและต้องการคุณภาพสูง สามารถทดลองเปรียบเทียบกับ Gemini 2.5 Pro TTS

4. เลือก Single Speaker หรือ Multi-Speaker

เลือก Single Speaker สำหรับงานผู้บรรยายคนเดียว

เลือก Multi-Speaker สำหรับบทสนทนาสองคน เช่น Podcast สัมภาษณ์ หรือบทเรียนภาษา

5. เลือกเสียง

Gemini TTS มีเสียงสำเร็จรูปหลายบุคลิก เช่น

  • Bright
  • Upbeat
  • Informative
  • Firm
  • Youthful
  • Breezy
  • Easy-going
  • Smooth
  • Clear
  • Gravelly
  • Soft
  • Mature
  • Friendly
  • Casual
  • Gentle
  • Lively
  • Knowledgeable
  • Warm

ควรทดลองฟังเสียงกับภาษาไทยจริงก่อนเลือก เพราะเสียงเดียวกันอาจเหมาะกับภาษาและประเภทเนื้อหาต่างกัน

6. เขียนคำสั่งกำกับการอ่าน

ตัวอย่างคำสั่ง ได้แก่

  • อ่านเป็นภาษาไทยมาตรฐาน
  • ใช้น้ำเสียงอบอุ่น
  • พูดด้วยความเร็วปานกลาง
  • เว้นช่วงหลังแต่ละประโยค
  • เน้นคำสำคัญ
  • อ่านเหมือนผู้ดำเนินรายการ
  • ห้ามเพิ่มคำ
  • ห้ามสรุปข้อความ
  • ออกเสียงชื่อแบรนด์ให้ชัด
  • รักษาระดับเสียงสม่ำเสมอ

7. วางสคริปต์

แยกคำสั่งกำกับเสียงออกจากข้อความที่ต้องการให้อ่านอย่างชัดเจน

ตัวอย่าง

“อ่านสคริปต์ต่อไปนี้เป็นภาษาไทยมาตรฐาน ใช้เสียงผู้ชายวัยผู้ใหญ่ที่อบอุ่นและน่าเชื่อถือ ความเร็วปานกลาง เว้นช่วงสั้นหลังแต่ละประโยค เน้นคำว่า Google Gemini และห้ามเพิ่มหรือลดข้อความ

สคริปต์:

Google Gemini เป็นเครื่องมือปัญญาประดิษฐ์ที่ช่วยให้เราค้นคว้า สรุปข้อมูล และสร้างเนื้อหาได้อย่างรวดเร็ว แต่ผลลัพธ์ที่ดีเริ่มต้นจากคำสั่งที่ชัดเจน”

8. กดสร้างเสียง

กด Run หรือ Generate แล้วรอระบบประมวลผล

ระยะเวลาขึ้นอยู่กับความยาวของสคริปต์ โมเดล โควตา และจำนวนผู้ใช้งานในขณะนั้น

9. ฟังและตรวจสอบ

ตรวจสอบว่า

  • อ่านครบทุกคำ
  • ไม่มีคำตกหล่น
  • ภาษาไทยชัดเจน
  • ชื่อเฉพาะออกเสียงถูก
  • ความเร็วเหมาะสม
  • การเว้นจังหวะเป็นธรรมชาติ
  • น้ำเสียงตรงกับเนื้อหา
  • ไม่มีเสียงแตก
  • ระดับเสียงสม่ำเสมอ
  • ตอนจบไม่ถูกตัด

10. ดาวน์โหลดไฟล์

กด Download หรือ Export เพื่อบันทึกเสียงลงในอุปกรณ์

ไฟล์ที่ได้อาจเป็น WAV หรือรูปแบบเสียงที่ระบบรองรับ หากต้องการ MP3 สามารถนำไฟล์ไป Export ในโปรแกรมตัดต่อเสียงภายหลัง

🇹🇭 Gemini TTS รองรับภาษาไทยไหม

Gemini TTS รองรับภาษาไทยและสามารถตรวจจับภาษาจากข้อความได้โดยอัตโนมัติ แต่ควรระบุภาษาใน Prompt เพื่อควบคุมผลลัพธ์ให้ชัดเจน

ตัวอย่างคำสั่ง

“อ่านเป็นภาษาไทยมาตรฐาน ไม่ใช้สำเนียงภาษาอังกฤษ ออกเสียงพยัญชนะและวรรณยุกต์ให้ชัดเจน พูดด้วยความเร็วปานกลาง และไม่ลากเสียงจนความหมายของคำเปลี่ยน”

คำที่ต้องตรวจสอบเป็นพิเศษ ได้แก่

  • ชื่อคน
  • ชื่อสถานที่
  • ชื่อสินค้า
  • ชื่อเว็บไซต์
  • คำย่อ
  • ตัวเลข
  • วันที่
  • หน่วยวัด
  • URL
  • คำศัพท์ภาษาอังกฤษ

🧠 สูตร Prompt สร้างเสียงบรรยาย

ใช้สูตรต่อไปนี้

“ภาษา + บุคลิกผู้พูด + น้ำเสียง + อารมณ์ + ความเร็ว + การเว้นจังหวะ + คำที่ต้องเน้น + การออกเสียง + ข้อห้าม + สคริปต์”

Template พร้อมใช้

“อ่านสคริปต์ต่อไปนี้เป็นภาษา [ภาษา] ใช้เสียง [บุคลิกผู้พูด] น้ำเสียง [ลักษณะน้ำเสียง] ให้ความรู้สึก [อารมณ์] พูดด้วยความเร็ว [ระดับความเร็ว] เว้นช่วง [รูปแบบการเว้นจังหวะ] เน้นคำว่า [คำสำคัญ] ออกเสียง [ชื่อเฉพาะหรือคำศัพท์] ว่า [คำอ่าน] ห้ามเพิ่ม ลบ สรุป หรือเปลี่ยนข้อความ อ่านตามสคริปต์ทุกคำ”

▶️ Prompt เสียงพากย์ YouTube

“อ่านเป็นภาษาไทยมาตรฐานด้วยเสียงผู้ชายวัยผู้ใหญ่ที่เป็นมิตรและน่าเชื่อถือ รูปแบบเหมือนผู้ดำเนินรายการ YouTube ด้านเทคโนโลยี ความเร็วกระชับแต่ไม่รีบ เน้นประโยคเปิดเพื่อดึงดูดความสนใจ เว้นช่วงก่อนเริ่มหัวข้อใหม่ และลดน้ำเสียงในตอนสรุป ห้ามเพิ่มหรือลดข้อความ”

📱 Prompt เสียงพากย์ TikTok

“อ่านเป็นภาษาไทยด้วยเสียงผู้หญิงสดใส เป็นธรรมชาติ และมีพลัง พูดเร็วกว่าปกติเล็กน้อย ให้ประโยคแรกดึงดูดความสนใจทันที เน้นตัวเลขและคำสำคัญ เว้นช่วงน้อยเพื่อให้เหมาะกับคลิปสั้น แต่ออกเสียงทุกคำให้ชัด ห้ามตะโกนและห้ามเพิ่มข้อความ”

🎙️ Prompt เสียง Podcast

“อ่านเป็นภาษาไทยด้วยเสียงผู้ชายที่อบอุ่น ผ่อนคลาย และเป็นกันเอง รูปแบบเหมือนผู้ดำเนินรายการ Podcast พูดกับผู้ฟังเพียงคนเดียว ความเร็วปานกลาง เว้นจังหวะตามธรรมชาติ เน้นคำถามและใจความสำคัญ ไม่อ่านเหมือนผู้ประกาศข่าว และห้ามเปลี่ยนสคริปต์”

📢 Prompt เสียงโฆษณา

“อ่านเป็นภาษาไทยด้วยเสียงผู้หญิงวัยทำงานที่มั่นใจและเป็นมิตร น้ำเสียงโฆษณาสมัยใหม่ มีพลังแต่ไม่ตะโกน ความเร็วปานกลาง เน้นชื่อสินค้า ราคา และประโยชน์หลัก ออกเสียงเงื่อนไขให้ชัดเจน ห้ามเพิ่มคำกล่าวอ้างนอกเหนือจากสคริปต์”

🎓 Prompt เสียงบทเรียนออนไลน์

“อ่านเป็นภาษาไทยมาตรฐานด้วยเสียงผู้ชายที่สงบ ชัดเจน และเหมือนครูอธิบายให้ผู้เริ่มต้นฟัง ความเร็วช้ากว่าปกติเล็กน้อย เว้นช่วงหลังคำจำกัดความและตัวอย่าง เน้นคำศัพท์สำคัญ และออกเสียงคำภาษาอังกฤษช้า ห้ามสรุปหรือแก้ไขข้อความ”

📚 Prompt หนังสือเสียง

“อ่านเป็นภาษาไทยด้วยเสียงผู้หญิงที่อบอุ่นและเป็นธรรมชาติ รูปแบบหนังสือเสียง ใช้จังหวะช้าเล็กน้อย เปลี่ยนอารมณ์ตามเหตุการณ์โดยไม่แสดงมากเกินไป เว้นช่วงระหว่างย่อหน้า ลดเสียงในประโยคที่ตัวละครกระซิบ และรักษาความดังให้สม่ำเสมอ ห้ามตัดหรือเพิ่มเนื้อหา”

📰 Prompt เสียงอ่านข่าว

“อ่านเป็นภาษาไทยมาตรฐานด้วยน้ำเสียงผู้ประกาศข่าวที่เป็นกลาง ชัดเจน และน่าเชื่อถือ ความเร็วปานกลาง รักษาระดับเสียงให้สม่ำเสมอ เน้นชื่อบุคคล สถานที่ วันที่ และตัวเลข ห้ามแสดงความเห็นหรือเพิ่มอารมณ์เกินเนื้อหา”

🏢 Prompt เสียงนำเสนอธุรกิจ

“อ่านเป็นภาษาไทยด้วยเสียงผู้หญิงวัยผู้ใหญ่ที่เป็นมืออาชีพ มั่นใจ และอบอุ่น ความเร็วปานกลาง เน้นชื่อบริษัท วิสัยทัศน์ และตัวเลขสำคัญ เว้นช่วงระหว่างหัวข้อ ให้ความรู้สึกทันสมัยและน่าเชื่อถือ ไม่อ่านแบบโฆษณาเกินจริง”

🧒 Prompt เสียงสำหรับเด็ก

“อ่านเป็นภาษาไทยด้วยเสียงที่สดใส อ่อนโยน และเป็นมิตร เหมาะกับเด็กอายุ 5–8 ปี พูดช้า ใช้จังหวะสนุก เน้นคำสำคัญและตัวเลข หลีกเลี่ยงเสียงดังหรือน่ากลัว เว้นช่วงให้เด็กสามารถพูดตามได้”

👥 วิธีสร้างเสียงพูดสองคน

Gemini TTS รองรับ Multi-Speaker สูงสุดสองคน เหมาะกับ

  • Podcast
  • บทสัมภาษณ์
  • บทสนทนาภาษา
  • ละครเสียง
  • วิดีโอถามตอบ
  • บทเรียน
  • ระบบบริการลูกค้า

ขั้นตอนคือ

  1. เลือก Multi-Speaker
  2. กำหนดชื่อผู้พูดคนที่หนึ่ง
  3. เลือกเสียงคนที่หนึ่ง
  4. กำหนดชื่อผู้พูดคนที่สอง
  5. เลือกเสียงคนที่สอง
  6. ใช้ชื่อเดียวกันในสคริปต์
  7. กำหนดบุคลิกแต่ละคน
  8. กดสร้างและตรวจเสียง

ตัวอย่าง Prompt

“สร้างบทสนทนาภาษาไทยระหว่างผู้ดำเนินรายการและผู้เชี่ยวชาญ

ผู้ดำเนินรายการ: ใช้เสียงอบอุ่น เป็นมิตร และพูดด้วยความเร็วปานกลาง
ผู้เชี่ยวชาญ: ใช้เสียงเป็นผู้ใหญ่ ชัดเจน และน่าเชื่อถือ

ผู้ดำเนินรายการ: วันนี้เราจะมาคุยกันว่า AI ช่วยธุรกิจขนาดเล็กได้อย่างไร
ผู้เชี่ยวชาญ: จุดเริ่มต้นที่ง่ายที่สุด คือการนำ AI มาช่วยลดงานที่ต้องทำซ้ำทุกวัน”

ชื่อผู้พูดในสคริปต์ต้องตรงกับชื่อในส่วนตั้งค่าเสียง มิฉะนั้นระบบอาจสลับเสียงหรือไม่สามารถแยกผู้พูดได้

🔤 วิธีแก้การออกเสียงภาษาไทย

เปลี่ยนตัวเลขเป็นคำ

แทนที่จะเขียนว่า

“ราคา 1,590 บาท”

ให้เขียนว่า

“ราคาหนึ่งพันห้าร้อยเก้าสิบบาท”

เขียนคำย่อเป็นคำอ่าน

  • AI เขียนเป็น เอไอ
  • SEO เขียนเป็น เอสอีโอ
  • URL เขียนเป็น ยูอาร์แอล
  • Wi-Fi เขียนเป็น ไวไฟ

กำหนดคำอ่านชื่อเฉพาะ

“ชื่อ COMSIAM ให้ออกเสียงว่า ‘คอม-สยาม’ แต่ให้อ่านเฉพาะชื่อ COMSIAM เพียงครั้งเดียว”

ลดความเร็ว

“ลดความเร็วในการอ่านลงประมาณ 10 เปอร์เซ็นต์ และเว้นช่วงก่อนชื่อเฉพาะ”

แบ่งประโยค

หากประโยคยาวเกินไป ให้แบ่งเป็นสองหรือสามประโยค เพื่อให้เสียงอ่านและลงจังหวะเป็นธรรมชาติขึ้น

⏱️ วิธีควบคุมความเร็ว

ใช้คำสั่งภาษาธรรมชาติ เช่น

  • พูดช้ากว่าปกติเล็กน้อย
  • พูดเร็วขึ้นประมาณ 10 เปอร์เซ็นต์
  • เว้นช่วงครึ่งวินาทีหลังประโยค
  • หยุดสั้นๆ ก่อนคำสำคัญ
  • ลดความเร็วเมื่ออ่านตัวเลข
  • เร่งความเร็วในช่วงเปิด
  • เว้นช่วงระหว่างย่อหน้า
  • อย่ารีบอ่านประโยคสุดท้าย

เครื่องหมายจุด จุลภาค คำถาม และการขึ้นบรรทัดใหม่มีผลต่อจังหวะการอ่าน จึงควรจัดสคริปต์ให้เหมาะกับเสียงพูด

🎭 วิธีควบคุมอารมณ์

สามารถระบุการเปลี่ยนอารมณ์ภายใน Prompt เช่น

“เริ่มต้นด้วยน้ำเสียงสงบและลึกลับ เมื่อถึงประโยค ‘แต่สิ่งที่เกิดขึ้นต่อจากนั้น ไม่มีใครคาดคิด’ ให้เว้นช่วงและเพิ่มความตื่นเต้น จากนั้นกลับมาใช้น้ำเสียงจริงจังในตอนสรุป”

ควรเปลี่ยนอารมณ์เฉพาะช่วงสำคัญ หากกำหนดอารมณ์ใหม่ทุกประโยค เสียงอาจฟังไม่เป็นธรรมชาติ

✍️ วิธีเตรียมสคริปต์สำหรับ TTS

เขียนแบบภาษาพูด

ข้อความควรเหมือนสิ่งที่คนจริงพูด ไม่ควรเต็มไปด้วยประโยคทางการและคำซ้อนยาวๆ

ใช้ประโยคสั้น

หนึ่งประโยคควรมีใจความหลักหนึ่งอย่าง ช่วยให้ผู้ฟังเข้าใจและทำให้ระบบลงจังหวะง่ายขึ้น

แปลงตารางเป็นประโยค

ไม่ควรวางตาราง สัญลักษณ์ หรือข้อมูลหลายคอลัมน์ให้ TTS อ่านโดยตรง ควรเรียบเรียงเป็นข้อความก่อน

แบ่งงานยาวเป็นตอน

หนังสือเสียงหรือบทเรียนยาวควรแบ่งไฟล์ตามบทหรือหัวข้อ แล้วใช้เสียงและ Prompt เดิมทุกตอน

เก็บต้นฉบับ

ควรเก็บสคริปต์ Prompt ชื่อเสียง รุ่นโมเดล วันที่สร้าง และชื่อไฟล์ไว้ด้วยกัน

🔄 วิธีแก้เสียงที่ยังไม่ตรงใจ

ให้แก้ทีละประเด็น เช่น

  • “ลดความเร็วลงเล็กน้อย”
  • “ทำให้น้ำเสียงอบอุ่นขึ้น”
  • “ลดความตื่นเต้น”
  • “ออกเสียงคำภาษาอังกฤษให้ชัดขึ้น”
  • “เว้นช่วงหลังประโยคแรกให้นานขึ้น”
  • “รักษาบุคลิกเสียงเดิมแต่เพิ่มพลังในตอนจบ”
  • “ห้ามเพิ่มคำหรือสรุปข้อความ”
  • “สร้างใหม่เฉพาะประโยคที่ออกเสียงผิด”

หากผิดเพียงประโยคเดียว ให้สร้างเสียงใหม่เฉพาะประโยคนั้นแล้วนำไปแทนในโปรแกรมตัดต่อ ไม่จำเป็นต้องสร้างไฟล์ทั้งหมดใหม่

💾 วิธีดาวน์โหลดและแปลงไฟล์เสียง

เมื่อสร้างเสร็จแล้ว ให้กด Download หรือ Export

หากได้ไฟล์ WAV สามารถนำไปตัดต่อโดยตรง หรือแปลงเป็น MP3 ภายหลัง

WAV

  • คุณภาพสูง
  • เหมาะกับการตัดต่อ
  • ขนาดไฟล์ใหญ่
  • ควรเก็บเป็นไฟล์ต้นฉบับ

MP3

  • ขนาดเล็กกว่า
  • แชร์ง่าย
  • เหมาะกับ Podcast และการเผยแพร่
  • คุณภาพขึ้นอยู่กับค่าที่ใช้ Export

แนวทางที่เหมาะสมคือเก็บ WAV เป็น Master และสร้าง MP3 อีกไฟล์สำหรับนำไปใช้งาน

🎬 วิธีนำเสียงไปใส่ในวิดีโอ

  1. เปิดโปรแกรมตัดต่อวิดีโอ
  2. นำเข้าวิดีโอ
  3. นำเข้าไฟล์เสียง
  4. วางเสียงลงใน Timeline
  5. ตัดช่วงเงียบ
  6. ปรับภาพให้ตรงกับคำพูด
  7. ลดเพลงพื้นหลัง
  8. เพิ่มคำบรรยาย
  9. ตรวจระดับความดัง
  10. Export วิดีโอ

หากเสียงสั้นหรือยาวกว่าภาพ ควรแก้จังหวะภาพหรือสร้างเสียงใหม่ด้วยความเร็วที่เหมาะสม ไม่ควรเร่งเสียงมากจนฟังผิดธรรมชาติ

🛡️ เสียงจาก Gemini มีลายน้ำหรือไม่

เสียงที่สร้างด้วยโมเดลเสียงของ Google มี SynthID ฝังอยู่ในสัญญาณเสียง เพื่อช่วยตรวจสอบว่าเป็นสื่อที่สร้างด้วย AI โดยทั่วไปผู้ฟังจะไม่ได้ยินลายน้ำดังกล่าว

ไม่ควรพยายามลบหรือหลีกเลี่ยงการตรวจสอบ และควรแจ้งว่าเป็นเสียง AI เมื่อสื่ออาจทำให้ผู้ฟังเข้าใจผิดว่าเป็นเสียงของบุคคลจริง

⚖️ ข้อควรระวัง

  • ไม่ใช้เสียงเพื่อแอบอ้างบุคคลอื่น
  • ไม่สร้างข่าวปลอม
  • ไม่ปลอมเสียงเพื่อหลอกให้โอนเงิน
  • ไม่สร้างหลักฐานเท็จ
  • ไม่ใช้ข้อมูลลับในสคริปต์
  • ตรวจข้อเท็จจริงก่อนเผยแพร่
  • ตรวจข้อกำหนดเชิงพาณิชย์
  • ไม่ใช้เนื้อหาที่ละเมิดลิขสิทธิ์
  • เก็บไฟล์และ Prompt ต้นฉบับ
  • เปิดเผยว่าเป็นเสียง AI เมื่อจำเป็น

Gemini TTS ใช้เสียงสำเร็จรูป ไม่ควรถูกนำไปใช้เป็นเครื่องมือเลียนแบบหรือโคลนเสียงบุคคลจริงโดยไม่ได้รับอนุญาต

🛠️ สร้างเสียงไม่ได้ แก้อย่างไร

หาก Gemini TTS ไม่สร้างเสียง ให้ตรวจสอบตามลำดับนี้

  1. เลือกโมเดล TTS ถูกต้อง
  2. อินพุตเป็นข้อความ
  3. Output ถูกตั้งเป็น Audio
  4. เลือกเสียงแล้ว
  5. สคริปต์ไม่ยาวเกินขีดจำกัด
  6. Prompt ไม่ขัดนโยบาย
  7. โควตายังเหลือ
  8. บัญชีมี Billing หากระบบกำหนด
  9. อินเทอร์เน็ตเสถียร
  10. เริ่ม Session ใหม่
  11. รีเฟรช Google AI Studio
  12. ทดลองโมเดล TTS อื่น

หากใช้ API และได้รับ Error เกี่ยวกับ Rate Limit ให้รอ ลดจำนวนคำขอ หรือตรวจโควตาของโปรเจกต์

❓ คำถามที่พบบ่อย

Gemini TTS สร้างเสียงภาษาไทยได้ไหม

ได้ Gemini TTS รองรับภาษาไทย แต่ควรตรวจชื่อเฉพาะ ตัวเลข คำย่อ และคำภาษาอังกฤษ

ใช้ Gemini TTS โดยไม่เขียนโค้ดได้ไหม

ได้ สามารถทดลองและสร้างเสียงผ่าน Google AI Studio

Gemini TTS มีเสียงให้เลือกกี่เสียง

โมเดล TTS มีเสียงสำเร็จรูปประมาณ 30 ตัวเลือก แต่จำนวนและรายชื่ออาจเปลี่ยนตามโมเดล

สร้างเสียงสองคนได้ไหม

ได้ Multi-Speaker รองรับผู้พูดสูงสุดสองคน โดยต้องกำหนดชื่อและเสียงให้ตรงกับสคริปต์

ดาวน์โหลดไฟล์เสียงได้ไหม

ได้ สามารถดาวน์โหลดหรือ Export ผลลัพธ์จาก Google AI Studio แล้วนำไปตัดต่อหรือแปลงรูปแบบไฟล์ได้

Gemini TTS อ่านตรงตามสคริปต์หรือไม่

TTS ถูกออกแบบให้อ่านข้อความตามสคริปต์ แต่ยังควรตรวจทุกประโยค เพราะอาจออกเสียงหรือเว้นจังหวะผิดได้

Gemini Live ใช้แทน TTS ได้ไหม

ไม่เหมาะ Gemini Live ใช้สำหรับสนทนาแบบเรียลไทม์ ส่วน TTS ใช้สร้างเสียงจากสคริปต์และดาวน์โหลดไฟล์

Audio Overview ใช้แทน TTS ได้ไหม

Audio Overview เหมาะกับการสรุปเอกสารเป็นรายการเสียง แต่ไม่รับประกันว่าจะอ่านข้อความต้นฉบับทุกคำ

ไฟล์ WAV แปลงเป็น MP3 ได้ไหม

ได้ สามารถนำไป Export เป็น MP3 ด้วยโปรแกรมตัดต่อเสียง โดยควรเก็บ WAV เป็นไฟล์ต้นฉบับคุณภาพสูง

✅ สรุป

วิธีสร้างเสียงบรรยายด้วย Gemini Text-to-Speech คือเปิด Google AI Studio เลือกโมเดล TTS กำหนดผู้พูด เลือกเสียง วางสคริปต์ แล้วเขียน Prompt ควบคุมภาษา น้ำเสียง อารมณ์ ความเร็ว และการเว้นจังหวะ

Gemini TTS รองรับภาษาไทย เสียงผู้พูดคนเดียว และบทสนทนาสองคน เหมาะสำหรับวิดีโอ Podcast หนังสือเสียง บทเรียนออนไลน์ และโฆษณา

ก่อนนำไฟล์ไปใช้งานควรฟังตรวจทุกประโยค โดยเฉพาะชื่อบุคคล ชื่อสินค้า ตัวเลข และคำย่อ หากเป็นเนื้อหายาว ควรแบ่งสคริปต์เป็นตอนและใช้เสียงกับ Prompt ชุดเดิม เพื่อรักษาบุคลิกของผู้บรรยายให้สม่ำเสมอ