Contact
Line : comsiam
Contact
Line : comsiam

วิธีสร้างเสียงบรรยายด้วย Gemini Text-to-Speech หรือ Gemini TTS สามารถทำได้ผ่าน Google AI Studio โดยเลือกโมเดล Text-to-Speech กำหนดเสียงผู้พูด วางสคริปต์ แล้วเขียน Prompt ควบคุมน้ำเสียง อารมณ์ ความเร็ว และการเว้นจังหวะ จากนั้นสั่งสร้างและดาวน์โหลดเป็นไฟล์เสียงเพื่อนำไปตัดต่อได้
Gemini TTS รองรับภาษาไทย เสียงผู้บรรยายคนเดียว และบทสนทนาสองคน เหมาะสำหรับวิดีโอ YouTube, TikTok, Podcast, หนังสือเสียง บทเรียนออนไลน์ โฆษณา และงานนำเสนอ
Gemini Text-to-Speech คือความสามารถในการเปลี่ยนข้อความเป็นเสียงพูดด้วยโมเดล Gemini ผู้ใช้สามารถควบคุมการแสดงอารมณ์ รูปแบบการอ่าน ความเร็ว สำเนียง และจังหวะเสียงผ่านคำสั่งภาษาธรรมชาติ
Gemini TTS แตกต่างจากระบบอ่านข้อความทั่วไป เพราะสามารถเข้าใจบริบทของสคริปต์และปรับการอ่านตามเนื้อหา เช่น
| ฟีเจอร์ | ใช้ทำอะไร | เหมาะกับงาน |
|---|---|---|
| Gemini Text-to-Speech | อ่านข้อความตามสคริปต์และสร้างไฟล์เสียง | เสียงพากย์ หนังสือเสียง Podcast และโฆษณา |
| Gemini Live | สนทนาด้วยเสียงแบบเรียลไทม์ | ถามตอบ ฝึกภาษา และพูดคุย |
| Audio Overview | สรุปเอกสารเป็นรายการเสียง | ฟังสรุปรายงานหรือเอกสาร |
| Gemini API Live | สร้างระบบโต้ตอบด้วยเสียง | แอป ผู้ช่วยเสียง และระบบบริการลูกค้า |
| Lyria | สร้างเพลง ดนตรี และเสียงร้อง | เพลงและเพลงประกอบ |
หากต้องการให้ AI อ่านสคริปต์ตามข้อความทุกคำ ควรใช้ Gemini Text-to-Speech ไม่ควรใช้ Audio Overview เพราะระบบอาจสรุปและเรียบเรียงเนื้อหาใหม่
เหมาะกับงานที่ต้องการความเร็ว คุณภาพเสียงเป็นธรรมชาติ และการควบคุมอารมณ์อย่างละเอียด รองรับคำสั่งควบคุมรูปแบบการอ่านและการสร้างเสียงแบบ Streaming
เหมาะกับการสร้างเสียงจำนวนมาก งานบรรยายทั่วไป ระบบสนทนา และงานที่ต้องการลดเวลาและค่าใช้จ่าย
เหมาะกับเสียงบรรยายยาว หนังสือเสียง และงานระดับมืออาชีพที่ต้องการความชัดเจนกับจังหวะเสียงคุณภาพสูง
ชื่อรุ่นและสถานะ Preview อาจเปลี่ยนตามการอัปเดต ควรเลือกโมเดล TTS รุ่นล่าสุดที่แสดงใน Google AI Studio
ตรวจข้อความให้เรียบร้อยก่อนสร้างเสียง โดยตรวจ
สคริปต์สำหรับเสียงพูดควรใช้ประโยคสั้นและเป็นภาษาพูดมากกว่าภาษาเขียนที่ซับซ้อน
เข้าสู่ Google AI Studio ด้วยบัญชี Google แล้วเปิดพื้นที่สำหรับสร้างเสียง
มองหาเมนูที่เกี่ยวข้อง เช่น
ตำแหน่งและชื่อเมนูอาจเปลี่ยนตามเวอร์ชันของระบบ
เลือก Gemini 3.1 Flash TTS หรือโมเดล Text-to-Speech รุ่นล่าสุดที่บัญชีสามารถใช้งานได้
หากเป็นงานบรรยายยาวและต้องการคุณภาพสูง สามารถทดลองเปรียบเทียบกับ Gemini 2.5 Pro TTS
เลือก Single Speaker สำหรับงานผู้บรรยายคนเดียว
เลือก Multi-Speaker สำหรับบทสนทนาสองคน เช่น Podcast สัมภาษณ์ หรือบทเรียนภาษา
Gemini TTS มีเสียงสำเร็จรูปหลายบุคลิก เช่น
ควรทดลองฟังเสียงกับภาษาไทยจริงก่อนเลือก เพราะเสียงเดียวกันอาจเหมาะกับภาษาและประเภทเนื้อหาต่างกัน
ตัวอย่างคำสั่ง ได้แก่
แยกคำสั่งกำกับเสียงออกจากข้อความที่ต้องการให้อ่านอย่างชัดเจน
ตัวอย่าง
“อ่านสคริปต์ต่อไปนี้เป็นภาษาไทยมาตรฐาน ใช้เสียงผู้ชายวัยผู้ใหญ่ที่อบอุ่นและน่าเชื่อถือ ความเร็วปานกลาง เว้นช่วงสั้นหลังแต่ละประโยค เน้นคำว่า Google Gemini และห้ามเพิ่มหรือลดข้อความ
สคริปต์:
Google Gemini เป็นเครื่องมือปัญญาประดิษฐ์ที่ช่วยให้เราค้นคว้า สรุปข้อมูล และสร้างเนื้อหาได้อย่างรวดเร็ว แต่ผลลัพธ์ที่ดีเริ่มต้นจากคำสั่งที่ชัดเจน”
กด Run หรือ Generate แล้วรอระบบประมวลผล
ระยะเวลาขึ้นอยู่กับความยาวของสคริปต์ โมเดล โควตา และจำนวนผู้ใช้งานในขณะนั้น
ตรวจสอบว่า
กด Download หรือ Export เพื่อบันทึกเสียงลงในอุปกรณ์
ไฟล์ที่ได้อาจเป็น WAV หรือรูปแบบเสียงที่ระบบรองรับ หากต้องการ MP3 สามารถนำไฟล์ไป Export ในโปรแกรมตัดต่อเสียงภายหลัง
Gemini TTS รองรับภาษาไทยและสามารถตรวจจับภาษาจากข้อความได้โดยอัตโนมัติ แต่ควรระบุภาษาใน Prompt เพื่อควบคุมผลลัพธ์ให้ชัดเจน
ตัวอย่างคำสั่ง
“อ่านเป็นภาษาไทยมาตรฐาน ไม่ใช้สำเนียงภาษาอังกฤษ ออกเสียงพยัญชนะและวรรณยุกต์ให้ชัดเจน พูดด้วยความเร็วปานกลาง และไม่ลากเสียงจนความหมายของคำเปลี่ยน”
คำที่ต้องตรวจสอบเป็นพิเศษ ได้แก่
ใช้สูตรต่อไปนี้
“ภาษา + บุคลิกผู้พูด + น้ำเสียง + อารมณ์ + ความเร็ว + การเว้นจังหวะ + คำที่ต้องเน้น + การออกเสียง + ข้อห้าม + สคริปต์”
Template พร้อมใช้
“อ่านสคริปต์ต่อไปนี้เป็นภาษา [ภาษา] ใช้เสียง [บุคลิกผู้พูด] น้ำเสียง [ลักษณะน้ำเสียง] ให้ความรู้สึก [อารมณ์] พูดด้วยความเร็ว [ระดับความเร็ว] เว้นช่วง [รูปแบบการเว้นจังหวะ] เน้นคำว่า [คำสำคัญ] ออกเสียง [ชื่อเฉพาะหรือคำศัพท์] ว่า [คำอ่าน] ห้ามเพิ่ม ลบ สรุป หรือเปลี่ยนข้อความ อ่านตามสคริปต์ทุกคำ”
“อ่านเป็นภาษาไทยมาตรฐานด้วยเสียงผู้ชายวัยผู้ใหญ่ที่เป็นมิตรและน่าเชื่อถือ รูปแบบเหมือนผู้ดำเนินรายการ YouTube ด้านเทคโนโลยี ความเร็วกระชับแต่ไม่รีบ เน้นประโยคเปิดเพื่อดึงดูดความสนใจ เว้นช่วงก่อนเริ่มหัวข้อใหม่ และลดน้ำเสียงในตอนสรุป ห้ามเพิ่มหรือลดข้อความ”
“อ่านเป็นภาษาไทยด้วยเสียงผู้หญิงสดใส เป็นธรรมชาติ และมีพลัง พูดเร็วกว่าปกติเล็กน้อย ให้ประโยคแรกดึงดูดความสนใจทันที เน้นตัวเลขและคำสำคัญ เว้นช่วงน้อยเพื่อให้เหมาะกับคลิปสั้น แต่ออกเสียงทุกคำให้ชัด ห้ามตะโกนและห้ามเพิ่มข้อความ”
“อ่านเป็นภาษาไทยด้วยเสียงผู้ชายที่อบอุ่น ผ่อนคลาย และเป็นกันเอง รูปแบบเหมือนผู้ดำเนินรายการ Podcast พูดกับผู้ฟังเพียงคนเดียว ความเร็วปานกลาง เว้นจังหวะตามธรรมชาติ เน้นคำถามและใจความสำคัญ ไม่อ่านเหมือนผู้ประกาศข่าว และห้ามเปลี่ยนสคริปต์”
“อ่านเป็นภาษาไทยด้วยเสียงผู้หญิงวัยทำงานที่มั่นใจและเป็นมิตร น้ำเสียงโฆษณาสมัยใหม่ มีพลังแต่ไม่ตะโกน ความเร็วปานกลาง เน้นชื่อสินค้า ราคา และประโยชน์หลัก ออกเสียงเงื่อนไขให้ชัดเจน ห้ามเพิ่มคำกล่าวอ้างนอกเหนือจากสคริปต์”
“อ่านเป็นภาษาไทยมาตรฐานด้วยเสียงผู้ชายที่สงบ ชัดเจน และเหมือนครูอธิบายให้ผู้เริ่มต้นฟัง ความเร็วช้ากว่าปกติเล็กน้อย เว้นช่วงหลังคำจำกัดความและตัวอย่าง เน้นคำศัพท์สำคัญ และออกเสียงคำภาษาอังกฤษช้า ห้ามสรุปหรือแก้ไขข้อความ”
“อ่านเป็นภาษาไทยด้วยเสียงผู้หญิงที่อบอุ่นและเป็นธรรมชาติ รูปแบบหนังสือเสียง ใช้จังหวะช้าเล็กน้อย เปลี่ยนอารมณ์ตามเหตุการณ์โดยไม่แสดงมากเกินไป เว้นช่วงระหว่างย่อหน้า ลดเสียงในประโยคที่ตัวละครกระซิบ และรักษาความดังให้สม่ำเสมอ ห้ามตัดหรือเพิ่มเนื้อหา”
“อ่านเป็นภาษาไทยมาตรฐานด้วยน้ำเสียงผู้ประกาศข่าวที่เป็นกลาง ชัดเจน และน่าเชื่อถือ ความเร็วปานกลาง รักษาระดับเสียงให้สม่ำเสมอ เน้นชื่อบุคคล สถานที่ วันที่ และตัวเลข ห้ามแสดงความเห็นหรือเพิ่มอารมณ์เกินเนื้อหา”
“อ่านเป็นภาษาไทยด้วยเสียงผู้หญิงวัยผู้ใหญ่ที่เป็นมืออาชีพ มั่นใจ และอบอุ่น ความเร็วปานกลาง เน้นชื่อบริษัท วิสัยทัศน์ และตัวเลขสำคัญ เว้นช่วงระหว่างหัวข้อ ให้ความรู้สึกทันสมัยและน่าเชื่อถือ ไม่อ่านแบบโฆษณาเกินจริง”
“อ่านเป็นภาษาไทยด้วยเสียงที่สดใส อ่อนโยน และเป็นมิตร เหมาะกับเด็กอายุ 5–8 ปี พูดช้า ใช้จังหวะสนุก เน้นคำสำคัญและตัวเลข หลีกเลี่ยงเสียงดังหรือน่ากลัว เว้นช่วงให้เด็กสามารถพูดตามได้”
Gemini TTS รองรับ Multi-Speaker สูงสุดสองคน เหมาะกับ
ขั้นตอนคือ
ตัวอย่าง Prompt
“สร้างบทสนทนาภาษาไทยระหว่างผู้ดำเนินรายการและผู้เชี่ยวชาญ
ผู้ดำเนินรายการ: ใช้เสียงอบอุ่น เป็นมิตร และพูดด้วยความเร็วปานกลาง
ผู้เชี่ยวชาญ: ใช้เสียงเป็นผู้ใหญ่ ชัดเจน และน่าเชื่อถือ
ผู้ดำเนินรายการ: วันนี้เราจะมาคุยกันว่า AI ช่วยธุรกิจขนาดเล็กได้อย่างไร
ผู้เชี่ยวชาญ: จุดเริ่มต้นที่ง่ายที่สุด คือการนำ AI มาช่วยลดงานที่ต้องทำซ้ำทุกวัน”
ชื่อผู้พูดในสคริปต์ต้องตรงกับชื่อในส่วนตั้งค่าเสียง มิฉะนั้นระบบอาจสลับเสียงหรือไม่สามารถแยกผู้พูดได้
แทนที่จะเขียนว่า
“ราคา 1,590 บาท”
ให้เขียนว่า
“ราคาหนึ่งพันห้าร้อยเก้าสิบบาท”
“ชื่อ COMSIAM ให้ออกเสียงว่า ‘คอม-สยาม’ แต่ให้อ่านเฉพาะชื่อ COMSIAM เพียงครั้งเดียว”
“ลดความเร็วในการอ่านลงประมาณ 10 เปอร์เซ็นต์ และเว้นช่วงก่อนชื่อเฉพาะ”
หากประโยคยาวเกินไป ให้แบ่งเป็นสองหรือสามประโยค เพื่อให้เสียงอ่านและลงจังหวะเป็นธรรมชาติขึ้น
ใช้คำสั่งภาษาธรรมชาติ เช่น
เครื่องหมายจุด จุลภาค คำถาม และการขึ้นบรรทัดใหม่มีผลต่อจังหวะการอ่าน จึงควรจัดสคริปต์ให้เหมาะกับเสียงพูด
สามารถระบุการเปลี่ยนอารมณ์ภายใน Prompt เช่น
“เริ่มต้นด้วยน้ำเสียงสงบและลึกลับ เมื่อถึงประโยค ‘แต่สิ่งที่เกิดขึ้นต่อจากนั้น ไม่มีใครคาดคิด’ ให้เว้นช่วงและเพิ่มความตื่นเต้น จากนั้นกลับมาใช้น้ำเสียงจริงจังในตอนสรุป”
ควรเปลี่ยนอารมณ์เฉพาะช่วงสำคัญ หากกำหนดอารมณ์ใหม่ทุกประโยค เสียงอาจฟังไม่เป็นธรรมชาติ
ข้อความควรเหมือนสิ่งที่คนจริงพูด ไม่ควรเต็มไปด้วยประโยคทางการและคำซ้อนยาวๆ
หนึ่งประโยคควรมีใจความหลักหนึ่งอย่าง ช่วยให้ผู้ฟังเข้าใจและทำให้ระบบลงจังหวะง่ายขึ้น
ไม่ควรวางตาราง สัญลักษณ์ หรือข้อมูลหลายคอลัมน์ให้ TTS อ่านโดยตรง ควรเรียบเรียงเป็นข้อความก่อน
หนังสือเสียงหรือบทเรียนยาวควรแบ่งไฟล์ตามบทหรือหัวข้อ แล้วใช้เสียงและ Prompt เดิมทุกตอน
ควรเก็บสคริปต์ Prompt ชื่อเสียง รุ่นโมเดล วันที่สร้าง และชื่อไฟล์ไว้ด้วยกัน
ให้แก้ทีละประเด็น เช่น
หากผิดเพียงประโยคเดียว ให้สร้างเสียงใหม่เฉพาะประโยคนั้นแล้วนำไปแทนในโปรแกรมตัดต่อ ไม่จำเป็นต้องสร้างไฟล์ทั้งหมดใหม่
เมื่อสร้างเสร็จแล้ว ให้กด Download หรือ Export
หากได้ไฟล์ WAV สามารถนำไปตัดต่อโดยตรง หรือแปลงเป็น MP3 ภายหลัง
แนวทางที่เหมาะสมคือเก็บ WAV เป็น Master และสร้าง MP3 อีกไฟล์สำหรับนำไปใช้งาน
หากเสียงสั้นหรือยาวกว่าภาพ ควรแก้จังหวะภาพหรือสร้างเสียงใหม่ด้วยความเร็วที่เหมาะสม ไม่ควรเร่งเสียงมากจนฟังผิดธรรมชาติ
เสียงที่สร้างด้วยโมเดลเสียงของ Google มี SynthID ฝังอยู่ในสัญญาณเสียง เพื่อช่วยตรวจสอบว่าเป็นสื่อที่สร้างด้วย AI โดยทั่วไปผู้ฟังจะไม่ได้ยินลายน้ำดังกล่าว
ไม่ควรพยายามลบหรือหลีกเลี่ยงการตรวจสอบ และควรแจ้งว่าเป็นเสียง AI เมื่อสื่ออาจทำให้ผู้ฟังเข้าใจผิดว่าเป็นเสียงของบุคคลจริง
Gemini TTS ใช้เสียงสำเร็จรูป ไม่ควรถูกนำไปใช้เป็นเครื่องมือเลียนแบบหรือโคลนเสียงบุคคลจริงโดยไม่ได้รับอนุญาต
หาก Gemini TTS ไม่สร้างเสียง ให้ตรวจสอบตามลำดับนี้
หากใช้ API และได้รับ Error เกี่ยวกับ Rate Limit ให้รอ ลดจำนวนคำขอ หรือตรวจโควตาของโปรเจกต์
ได้ Gemini TTS รองรับภาษาไทย แต่ควรตรวจชื่อเฉพาะ ตัวเลข คำย่อ และคำภาษาอังกฤษ
ได้ สามารถทดลองและสร้างเสียงผ่าน Google AI Studio
โมเดล TTS มีเสียงสำเร็จรูปประมาณ 30 ตัวเลือก แต่จำนวนและรายชื่ออาจเปลี่ยนตามโมเดล
ได้ Multi-Speaker รองรับผู้พูดสูงสุดสองคน โดยต้องกำหนดชื่อและเสียงให้ตรงกับสคริปต์
ได้ สามารถดาวน์โหลดหรือ Export ผลลัพธ์จาก Google AI Studio แล้วนำไปตัดต่อหรือแปลงรูปแบบไฟล์ได้
TTS ถูกออกแบบให้อ่านข้อความตามสคริปต์ แต่ยังควรตรวจทุกประโยค เพราะอาจออกเสียงหรือเว้นจังหวะผิดได้
ไม่เหมาะ Gemini Live ใช้สำหรับสนทนาแบบเรียลไทม์ ส่วน TTS ใช้สร้างเสียงจากสคริปต์และดาวน์โหลดไฟล์
Audio Overview เหมาะกับการสรุปเอกสารเป็นรายการเสียง แต่ไม่รับประกันว่าจะอ่านข้อความต้นฉบับทุกคำ
ได้ สามารถนำไป Export เป็น MP3 ด้วยโปรแกรมตัดต่อเสียง โดยควรเก็บ WAV เป็นไฟล์ต้นฉบับคุณภาพสูง
วิธีสร้างเสียงบรรยายด้วย Gemini Text-to-Speech คือเปิด Google AI Studio เลือกโมเดล TTS กำหนดผู้พูด เลือกเสียง วางสคริปต์ แล้วเขียน Prompt ควบคุมภาษา น้ำเสียง อารมณ์ ความเร็ว และการเว้นจังหวะ
Gemini TTS รองรับภาษาไทย เสียงผู้พูดคนเดียว และบทสนทนาสองคน เหมาะสำหรับวิดีโอ Podcast หนังสือเสียง บทเรียนออนไลน์ และโฆษณา
ก่อนนำไฟล์ไปใช้งานควรฟังตรวจทุกประโยค โดยเฉพาะชื่อบุคคล ชื่อสินค้า ตัวเลข และคำย่อ หากเป็นเนื้อหายาว ควรแบ่งสคริปต์เป็นตอนและใช้เสียงกับ Prompt ชุดเดิม เพื่อรักษาบุคลิกของผู้บรรยายให้สม่ำเสมอ