วิธีสร้างวิดีโอพร้อมเสียงด้วย Gemini

Google Gemini สามารถสร้าง วิดีโอพร้อมเสียงในขั้นตอนเดียว ได้ ไม่จำเป็นต้องสร้างภาพเคลื่อนไหวก่อนแล้วค่อยนำไปใส่เสียงในโปรแกรมอื่นเสมอไป ผู้ใช้สามารถเขียน Prompt กำหนดทั้งภาพ การเคลื่อนไหวของกล้อง เสียงบรรยากาศ Sound Effect และเสียงพูดที่ต้องการได้

ปัจจุบัน Gemini Apps ใช้ Gemini Omni เป็นโมเดลสร้างวิดีโอรุ่นล่าสุด โดย Google ระบุชัดว่าผู้ใช้สามารถขอให้ Gemini สร้าง Audio พร้อมกับวิดีโอ ได้ และ Omni สามารถทำงานร่วมกับข้อความ รูปภาพ และวิดีโอ Reference รวมถึงแก้งานต่อด้วยการสนทนาได้ด้วย

ตัวอย่าง Prompt ง่าย ๆ:

“สร้างวิดีโอ Cinematic ของรถสปอร์ตสีดำวิ่งผ่านอุโมงค์ตอนกลางคืน ใช้ Low-angle Tracking Shot พร้อมเสียงเครื่องยนต์สมจริง เสียงยางสัมผัสถนน และเสียงก้องของอุโมงค์ ไม่มีเพลงและไม่มีเสียงพูด”

Gemini จะพยายามสร้าง

ภาพ
Movement
Camera
Lighting
Sound Effects
Ambient Sound

ให้อยู่ในคลิปเดียวกัน

🎬 Gemini สร้างวิดีโอพร้อมเสียงได้ไหม

ได้

Google Gemini Help ปัจจุบันระบุโดยตรงว่า เมื่อสร้าง Video ใน Gemini Apps ผู้ใช้สามารถขอให้ Gemini สร้าง เสียงประกอบวิดีโอ ได้ด้วย

จึงสามารถสร้างเสียงประเภทต่าง ๆ เช่น

เสียงฝน
เสียงลม
เสียงทะเล
เสียงเครื่องยนต์
เสียงฝีเท้า
เสียงเมือง
เสียงร้านกาแฟ
เสียงสัตว์
เสียงพูด
เสียงดนตรีตาม Mood

ได้ตาม Prompt และความสามารถของระบบในขณะนั้น

🧠 Gemini ใช้อะไรสร้างวิดีโอพร้อมเสียง

โมเดลปัจจุบันคือ

Gemini Omni

Google เปิดตัว Gemini Omni ในเดือนพฤษภาคม 2026 โดยอธิบายว่าเป็นโมเดลที่สามารถสร้าง Content จาก Input หลายประเภท และเริ่มต้นด้วยความสามารถด้าน Video Generation

Gemini Omni สามารถนำ

Text
Image
Video
Audio

มาใช้ร่วมกันเพื่อสร้าง Video Output และสามารถแก้วิดีโอด้วยการสนทนาต่อเนื่องได้

จุดสำคัญคือ Gemini ไม่ได้คิดเฉพาะ “ภาพเคลื่อนไหว” แต่สามารถพิจารณาความสัมพันธ์ระหว่าง

ภาพ
Action
Timing
เสียง

ภายใน Scene เดียวกัน

🚀 วิธีสร้างวิดีโอพร้อมเสียงด้วย Gemini

บนคอมพิวเตอร์ทำตามนี้

① เปิด Gemini

เข้าสู่ Gemini ด้วยบัญชีที่มีสิทธิใช้ Video Generation

② เปิด Sidebar

เลือก

Create video

③ เลือก Template ถ้าต้องการ

ขั้นตอนนี้ไม่บังคับ

④ เขียน Prompt

ระบุทั้งภาพและเสียง

ตัวอย่าง:

“สร้างวิดีโอร้านกาแฟ Modern Minimal ช่วงเช้า กล้อง Slow Dolly In ไปยังแก้วกาแฟบนโต๊ะไม้ มี Soft Natural Light พร้อมเสียงเครื่องชงกาแฟ เสียงคนพูดคุยเบา ๆ และเสียงช้อนกระทบแก้ว ไม่มีเพลง”

⑤ เพิ่ม Reference ถ้าต้องการ

สามารถเพิ่ม

รูปภาพ

หรือ

วิดีโอ

เพื่อใช้เป็น Reference ได้

⑥ กด Submit

จากนั้น Gemini จะเริ่ม Generate Video

Google ระบุว่าสามารถอัปโหลดได้ 1 วิดีโอและสูงสุด 5 รูปภาพ ใน Video Creation Workflow ปัจจุบัน

📱 วิธีสร้างบน Android

เปิด

Gemini App

หรือ

Gemini Web

จากนั้น

Menu → Videos → เขียน Prompt → Submit

หากมี Reference สามารถเพิ่มรูปหรือวิดีโอเข้าไปก่อน Generate ได้เช่นกัน

🔊 ต้องเขียน Prompt เรื่องเสียงอย่างไร

อย่าเขียนเพียง

“ใส่เสียงด้วย”

เพราะ Gemini จะต้องเดาว่าต้องการเสียงอะไร

ควรระบุ

เสียงอะไร + เกิดเมื่อไร + ดังแค่ไหน + อยู่ตรงไหน + มีอะไรที่ไม่ต้องการ

ตัวอย่าง:

“มีเสียงฝนตกเบา ๆ ตลอดคลิป เสียงรถวิ่งผ่านเป็นครั้งคราว และเสียงฟ้าร้องเบา ๆ จากระยะไกล ไม่มีเพลง”

Prompt นี้ควบคุม Audio Direction ได้ดีกว่า

“ทำเสียงให้สมจริง”

🧩 สูตร Prompt วิดีโอพร้อมเสียง

ใช้สูตร

Subject + Action + Scene + Camera + Movement + Lighting + Audio + Style + Restrictions

หรือจำง่าย ๆ ว่า

ใคร + ทำอะไร + ที่ไหน + กล้อง + การเคลื่อน + แสง + เสียง + Style + ห้ามอะไร

ตัวอย่าง:

“สร้างวิดีโอ Cinematic Photorealistic ของผู้ชายเดินบนถนนในโตเกียวตอนกลางคืนหลังฝนตก ใช้ Medium Tracking Shot จากด้านหน้า มี Neon Reflection บนพื้น พร้อมเสียงฝน เสียงฝีเท้า และ Ambient City Sound เบา ๆ ไม่มีเพลง ไม่มีคำพูดและไม่มีข้อความ”

① 🌧️ วิธีสร้างเสียงบรรยากาศ

Ambient Sound คือเสียงพื้นหลังของสถานที่

เช่น

เมือง → รถ ผู้คน ลม

ร้านกาแฟ → เครื่องชงกาแฟ คนคุยกัน

ชายหาด → คลื่น ลม นก

ป่า → ลม ใบไม้ นก แมลง

ตัวอย่าง Prompt:

“เพิ่มเสียงคลื่นทะเลเบา ๆ เสียงลมพัดและเสียงนกทะเลอยู่ไกล ๆ ให้เสียงเป็นธรรมชาติ ไม่มีเพลง”

ช่วยทำให้ Video มีความรู้สึกสมจริงขึ้น

② 🚗 วิธีสร้าง Sound Effect

สามารถกำหนด Sound Effect ที่สัมพันธ์กับ Action

เช่น

ประตูเปิด → เสียงประตู

รถเร่ง → เสียงเครื่องยนต์

รองเท้าเดิน → Footsteps

แก้วตก → เสียงกระแทก

Prompt:

“เมื่อรถเริ่มเร่ง ให้เสียงเครื่องยนต์สูงขึ้นตามความเร็ว และมีเสียงยางสัมผัสพื้นถนนเปียกอย่างสมจริง”

รายละเอียดเรื่อง Timing ทำให้ Prompt ดีกว่าการสั่ง

“ใส่เสียงรถ”

③ 👣 ทำเสียงฝีเท้าให้ตรงกับการเดิน

ตัวอย่าง Prompt:

“ให้เสียง Footsteps ตรงกับจังหวะการเดินของตัวละคร และเปลี่ยนลักษณะเสียงตามพื้นหินที่ตัวละครกำลังเดินอยู่”

หลักสำคัญคือระบุ

Action

Surface

Timing

เพราะเสียงรองเท้าบน

ไม้
คอนกรีต
หญ้า
น้ำ

ควรไม่เหมือนกัน

④ 🌧️ Prompt วิดีโอฝนตกพร้อมเสียง

“สร้างวิดีโอ Cinematic ของถนนในเมืองตอนกลางคืนหลังฝนตก กล้อง Slow Push Forward มีฝนตกปานกลาง พร้อมเสียงฝนกระทบพื้น เสียงรถบนถนนเปียก และเสียงฟ้าร้องเบา ๆ จากระยะไกล ไม่มีเพลง”

Prompt นี้กำหนดทั้ง

ภาพฝน
เสียงฝน
รถ
ระยะของฟ้าร้อง

⑤ 🚘 Prompt รถพร้อมเสียงเครื่องยนต์

“สร้างวิดีโอรถสปอร์ตสีดำวิ่งผ่านอุโมงค์ ใช้ Low-angle Tracking Shot มีเสียงเครื่องยนต์สมจริงที่เปลี่ยนตามการเร่ง เสียงยางบนถนน และ Natural Tunnel Reverb ไม่มีเพลง”

คำว่า

Natural Tunnel Reverb

ช่วยบอกว่าเสียงควรสะท้อนตาม Environment

⑥ ☕ Prompt ร้านกาแฟพร้อมเสียง

“สร้างวิดีโอ Cinematic ภายในร้านกาแฟ Modern Minimal ช่วงเช้า กล้อง Slow Dolly In ไปยัง Barista ที่กำลังทำ Latte Art มีเสียงเครื่องชง Espresso เสียงเทนม เสียงแก้วและช้อนเบา ๆ พร้อม Ambient Conversation จากลูกค้าอยู่ไกล ๆ ไม่มีเพลง”

เหมาะกับ

Restaurant Content
Social Media
B-roll
Advertising Concept

⑦ 🌊 Prompt ทะเลพร้อมเสียง

“สร้างวิดีโอ Drone Cinematic บินเหนือชายหาดช่วง Golden Hour มีเสียงคลื่นกระทบชายฝั่ง เสียงลมทะเล และเสียงนกเล็กน้อยจากระยะไกล ไม่มีเพลงหรือเสียงพูด”

⑧ 🌲 Prompt ป่าพร้อมเสียง

“สร้างวิดีโอ Cinematic เดินผ่านป่าเขียวชื้นช่วงเช้า กล้องเคลื่อน Forward อย่างช้า ๆ มีเสียงใบไม้ เสียงนก เสียงลม และเสียงน้ำไหลอยู่ไกล ๆ ไม่มีดนตรี”

🗣️ Gemini สร้างวิดีโอมีเสียงพูดได้ไหม

สามารถกำหนด Audio และ Dialogue ใน Prompt ของวิดีโอได้

ถ้าต้องการประโยคเฉพาะ ควรเขียน ข้อความที่ต้องพูดตรง ๆ

เช่น

“ผู้หญิงหันมามองกล้องแล้วพูดภาษาไทยว่า ‘ยินดีต้อนรับค่ะ’ ด้วยน้ำเสียงเป็นมิตร จากนั้นยิ้มเล็กน้อย”

ดีกว่า

“ให้ผู้หญิงพูดต้อนรับ”

เพราะ Prompt แรกกำหนดทั้ง

ผู้พูด
ภาษา
ประโยค
Tone
Action หลังพูด

🇹🇭 สร้างเสียงพูดภาษาไทยได้ไหม

สามารถลองกำหนด Dialogue ภาษาไทยใน Prompt ได้

ตัวอย่าง:

“ผู้ชายพูดภาษาไทยอย่างเป็นธรรมชาติว่า ‘วันนี้เราจะพาไปดูเทคโนโลยีใหม่กันครับ’ ด้วยน้ำเสียงกระตือรือร้นแต่ไม่เร็วเกินไป”

หลังสร้างต้องตรวจ

คำพูด
การออกเสียง
จังหวะ
Lip Sync
ความหมาย

ทุกครั้ง

โดยเฉพาะ Video ที่จะนำไปใช้เผยแพร่จริง

👄 Lip Sync ตรง 100% ไหม

ไม่ควรคาดหวังว่า Generative AI จะตรง 100% ทุกครั้ง

แม้ระบบสร้าง

ภาพ
เสียง
Dialogue

ร่วมกันได้ แต่ยังอาจเกิด

ปากไม่ตรงคำ
คำพูดหาย
เสียงผิด
จังหวะไม่ตรง
เสียงเปลี่ยน

ได้

หาก Dialogue สำคัญควรตรวจ Clip อย่างละเอียด

🎭 ระบุอารมณ์เสียงได้อย่างไร

สามารถเขียน Tone เช่น

friendly
calm
excited
serious
confident
warm
soft
energetic

ตัวอย่าง:

“พูดด้วยน้ำเสียง Calm, Warm และเป็นธรรมชาติ ไม่เหมือนเสียงโฆษณา”

หรือ

“พูดด้วยน้ำเสียงตื่นเต้นและรวดเร็วเล็กน้อยเหมือน Presenter Technology”

🔉 ระบุความดังของเสียงได้ไหม

สามารถอธิบายระดับเชิงสัมพัทธ์ใน Prompt เช่น

“เสียงเพลงเบากว่า Dialogue”

“Ambient Sound เบามาก”

“เสียงเครื่องยนต์เด่นกว่าเสียงเมือง”

ตัวอย่าง:

“ให้เสียงพูดเป็นเสียงหลัก เสียงร้านกาแฟอยู่ด้านหลังเบา ๆ และดนตรีเบากว่า Dialogue อย่างชัดเจน”

แม้ AI อาจไม่ได้ควบคุม Decibel แบบ DAW โดยตรง แต่ช่วยบอก Audio Priority ได้

🎵 สร้างวิดีโอพร้อมเพลงได้ไหม

สามารถขอ Music Mood ใน Prompt ได้ เช่น

Cinematic
Ambient
Upbeat
Electronic
Calm
Dramatic

ตัวอย่าง:

“เพิ่ม Background Music แบบ Cinematic Ambient เบา ๆ โดยไม่กลบเสียงรถและเสียงฝน”

แต่หากต้องการ

เพลงเฉพาะ
Mixing ละเอียด
เพลง Full-length
Mastering

เครื่องมือ Audio หรือ Video Editor เฉพาะทางยังควบคุมได้ดีกว่า

⚠️ อย่าสั่งให้เลียนแบบเพลงที่มีลิขสิทธิ์แบบตรงตัว

สำหรับงานที่เผยแพร่หรือใช้เชิงพาณิชย์ ควรสั่งเป็น

Mood
Genre
Tempo
Instrumentation

แทนการพยายามสร้างเพลงที่เลียนแบบเพลงหรือผลงานเฉพาะของผู้อื่นอย่างตรงตัว

ตัวอย่าง:

“ดนตรี Electronic Instrumental จังหวะเร็ว มี Synth และ Bass แบบ Futuristic”

ชัดและใช้งานได้มากกว่า

“ทำเหมือนเพลง X ทุกอย่าง”

🎼 Prompt ดนตรีประกอบ Technology Video

“เพิ่ม Electronic Ambient Music แบบ Futuristic Tempo ปานกลาง ใช้ Soft Synth, Deep Bass และ Subtle Pulse ให้เพลงอยู่ด้านหลังและไม่กลบ Sound Effects”

🎬 ภาพกับเสียง Sync กันได้ไหม

Gemini Omni ถูกออกแบบให้ทำงานกับข้อมูลหลายรูปแบบร่วมกัน และ Google ระบุว่า Omni สามารถผสม Image, Audio, Video และ Text เพื่อสร้างวิดีโอที่มีความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น

ดังนั้น Prompt สามารถระบุ Timing ได้ เช่น

“ตอนประตูเปิด ให้มีเสียงกระดิ่งทันที”

“เมื่อรถเร่ง ให้เสียงเครื่องยนต์สูงขึ้น”

“เมื่อฝนเริ่มแรง ให้เสียงฝนดังขึ้น”

“เมื่อไฟกระพริบ ให้ Sound Effect เกิดพร้อมกัน”

ยิ่งบอกเหตุการณ์สัมพันธ์กับเสียงชัด Gemini ยิ่งเข้าใจ Intent ได้ง่ายขึ้น

⏱️ วิธีระบุ Timing ของเสียง

ใช้ภาษาธรรมดา เช่น

At the beginning

When…

As soon as…

During…

At the end

ตัวอย่าง:

“At the beginning มีเสียงเมืองเบา ๆ เมื่อรถเริ่มเร่งให้เสียงเครื่องยนต์ดังขึ้น และช่วงท้ายลดเสียงทั้งหมดลงอย่างนุ่มนวล”

🎬 Prompt พร้อมเสียงแบบมีลำดับเหตุการณ์

“เริ่ม Video ด้วยเสียงฝนเบา ๆ และ Wide Shot ของเมือง หลังจาก 2 วินาที รถสีดำขับเข้ามา ให้เสียงเครื่องยนต์ค่อย ๆ ดังขึ้น จากนั้นกล้อง Tracking ตามรถ และช่วงท้ายให้เสียงรถค่อย ๆ หายไปตามระยะทาง”

ช่วยสร้าง Audio Narrative ที่มีทิศทาง

📷 Camera กับเสียงควรสัมพันธ์กันหรือไม่

ควร

ตัวอย่าง

ถ้า Camera เข้าใกล้รถ

เสียงเครื่องยนต์อาจควรชัดขึ้น

ถ้ากล้องถอยห่างจากนักดนตรี

เสียงอาจรู้สึกไกลขึ้น

Prompt:

“ขณะที่ Camera Dolly In เข้าใกล้ Piano ให้เสียง Piano ชัดและใกล้ขึ้นอย่างเป็นธรรมชาติ”

ช่วยเพิ่ม Spatial Feeling ให้คลิป

🔊 Spatial Audio สั่งได้อย่างไร

สามารถอธิบายตำแหน่งเสียง เช่น

ด้านซ้าย
ด้านขวา
ด้านหลัง
ไกลออกไป

ตัวอย่าง:

“มีเสียงรถวิ่งผ่านจากด้านซ้ายไปด้านขวา และเสียงคนพูดคุยอยู่ด้านหลังห่าง ๆ”

AI อาจไม่ใช่ระบบ Post-production Spatial Mixing เต็มรูปแบบ แต่การระบุตำแหน่งช่วยสื่อ Intent

🖼️ สร้างวิดีโอจากรูปพร้อมเสียงได้ไหม

ได้

สามารถ Upload Image Reference แล้วกำหนดทั้ง Motion และ Audio

ตัวอย่าง:

“ใช้ภาพชายหาดนี้เป็น Reference รักษา Composition และ Landscape เดิม ทำให้คลื่นเคลื่อนไหวและต้นมะพร้าวพัดตามลม เพิ่มเสียงคลื่น เสียงลมและนกทะเลเบา ๆ”

Gemini Video Workflow รองรับการเพิ่มรูปภาพ Reference และ Google ระบุว่าสามารถขอเสียงพร้อม Video ได้ในขั้นตอนเดียวกัน

👤 ทำรูปคนให้พูดได้อย่างไร

ตัวอย่าง Prompt:

“ใช้บุคคลจากภาพนี้เป็น Master Identity รักษาใบหน้า ทรงผม เสื้อผ้าและอายุเดิม ให้บุคคลมองกล้องและพูดภาษาไทยว่า ‘สวัสดีครับ ยินดีต้อนรับ’ ด้วยน้ำเสียงเป็นธรรมชาติ จากนั้นยิ้มเล็กน้อย Background และ Camera คงเดิม”

ควรให้ Movement เรียบง่ายก่อนถ้าต้องการรักษาหน้า

🛍️ สร้าง Product Video พร้อมเสียง

“ใช้สินค้าใน Reference เป็น Master Product รักษา Shape, Logo, Label, Color และ Packaging เดิม กล้อง Slow Orbit รอบสินค้าใน Premium Black Studio เพิ่ม Soft Mechanical Sound Effect และ Cinematic Ambient Music เบา ๆ ไม่มีเสียงพูด”

สำหรับสินค้าจริงต้องตรวจ

Logo
Label
Packaging
สี
รูปทรง

ในหลาย Frame

เพราะ Generative Video ยังสามารถเปลี่ยนรายละเอียดบางอย่างได้

📢 Prompt Video Ads พร้อมเสียง

“สร้างวิดีโอโฆษณาสินค้า 16:9 สไตล์ Premium เริ่ม Close-up ที่สินค้า จากนั้น Slow Orbit รอบสินค้า ใช้ Black Background และ Golden Rim Light มี Cinematic Impact Sound ตอนสินค้าเปิดเผยเต็ม Frame ตามด้วย Ambient Music เบา ๆ ไม่มี Dialogue และไม่มีข้อความ”

📱 Prompt Reels/TikTok พร้อมเสียง

“สร้าง Vertical Video 9:16 ของผู้หญิงเดินผ่านเมืองช่วง Golden Hour ใช้ Smooth Tracking Shot มีเสียงฝีเท้า Ambient City และ Upbeat Instrumental Music เบา ๆ เว้น Safe Area สำหรับ Caption และไม่มีข้อความในภาพ”

▶️ Prompt YouTube B-roll พร้อมเสียง

“สร้าง Cinematic B-roll 16:9 ภายใน Data Center กล้อง Slow Dolly Forward ผ่าน Server Rack มีเสียงพัดลม Server, subtle electronic hum และ Ambient Technology Music เบามาก ไม่มีเสียงพูด ไม่มีข้อความ”

🎮 Prompt Game Style Video

“สร้างวิดีโอ Futuristic Cyberpunk City Chase มุมกล้อง Dynamic Tracking มีเสียงเครื่องยนต์ เสียงฝน เสียง Neon Electrical Hum และ Cinematic Electronic Music ที่เพิ่มความเข้มตาม Action”

🌌 Prompt Sci-Fi พร้อมเสียง

“สร้างวิดีโอ Cinematic ของยานอวกาศเข้าสู่วงโคจรดาวเคราะห์ ใช้ Wide Shot มี Deep Mechanical Rumble, subtle spacecraft ambience และ Epic Atmospheric Music เบา ๆ ไม่มีเสียงพูด”

🔄 หลังสร้างแล้วแก้เฉพาะเสียงได้ไหม

Gemini Omni รองรับการแก้ Video ผ่าน Natural Conversation และ Google DeepMind แนะนำให้แก้เฉพาะส่วนที่ต้องการโดยไม่ต้อง Prompt Scene ใหม่ทั้งหมด

ดังนั้นสามารถพิมพ์ต่อ เช่น

“ภาพถูกต้องแล้ว รักษา Visual ทั้งหมดไว้ เพิ่มเฉพาะเสียงฝน”

หรือ

“รักษาภาพเดิมทั้งหมด ลบเพลง Background”

หรือ

“เสียงเครื่องยนต์ดังเกินไป ลดลงและให้เสียงฝนเด่นขึ้น”

🎯 สูตรแก้เสียงหลัง Generate

ใช้

PRESERVE VISUAL + CHANGE ONLY AUDIO

ตัวอย่าง:

“รักษาภาพ Camera, Movement และ Timing เดิมทั้งหมด เปลี่ยนเฉพาะ Audio ให้มีเสียงคลื่นทะเลและลมธรรมชาติ ไม่มีเพลง”

ง่ายและชัดกว่าการ Prompt Video ใหม่ทั้งหมด

🔄 เปลี่ยนเพลงโดยไม่เปลี่ยนภาพ

Prompt:

“Keep all visuals exactly as consistent as possible. Change only the background music to a calm cinematic ambient track. Preserve all sound effects.”

🔇 ลบเพลงแต่เก็บ Sound Effects

“รักษาวิดีโอและ Sound Effects เดิมทั้งหมด ลบเฉพาะ Background Music และคงเสียงฝนกับเสียงฝีเท้าไว้”

🗣️ เปลี่ยน Dialogue อย่างเดียว

“รักษา Visual และ Camera เดิม เปลี่ยนเฉพาะ Dialogue ของผู้หญิงเป็น ‘ขอบคุณที่รับชมค่ะ’ ด้วยน้ำเสียงเป็นมิตร”

หลัง Generate ต้องตรวจ Lip Sync ใหม่ เพราะการเปลี่ยน Dialogue อาจทำให้ส่วนของภาพถูก Generate ใหม่บางส่วน

🧠 Multi-turn Editing ช่วยงานเสียงอย่างไร

Gemini Omni รองรับ Multi-turn Editing ทำให้ Workflow สามารถเป็น

รอบ 1 → สร้าง Video

รอบ 2 → เพิ่มเสียง

รอบ 3 → ลด Music

รอบ 4 → เปลี่ยน Dialogue

รอบ 5 → ปรับ Camera

โดยไม่ต้องเริ่มต้นใหม่ทุกครั้ง

Google DeepMind ระบุว่า Omni จะพยายามรักษาส่วนที่ทำงานดีอยู่แล้วขณะผู้ใช้แก้เฉพาะส่วนที่ต้องการ

🎯 แก้ทีละอย่างดีที่สุด

ถ้าคลิปมีปัญหา

เสียงพูดผิด
เพลงดัง
เสียงฝนเบา
Camera เร็ว

อย่าแก้ทั้งหมดพร้อมกันถ้าไม่จำเป็น

ทำ

รอบ 1 → Dialogue

ตรวจ

รอบ 2 → Music

ตรวจ

รอบ 3 → Rain

ตรวจ

ทำให้รู้ว่า Edit รอบใดส่งผลกับคลิป

📋 สูตร Audio Prompt แบบเป็นหมวด

สามารถเขียนแบบนี้

Visual:
รถสปอร์ตสีดำวิ่งในอุโมงค์

Camera:
Low-angle tracking shot

Sound Effects:
เสียงเครื่องยนต์ เสียงยาง

Environment:
Tunnel reverb

Music:
ไม่มีเพลง

Dialogue:
ไม่มี

ช่วยให้ Prompt อ่านง่ายและแก้เฉพาะ Audio ได้สะดวก

🔥 Template วิดีโอพร้อมเสียง

“สร้างวิดีโอ [STYLE] ของ [SUBJECT] กำลัง [ACTION] ที่ [LOCATION]

Camera:
[SHOT + MOVEMENT]

Lighting:
[LIGHTING]

Sound effects:
[SFX]

Ambient audio:
[ENVIRONMENT]

Dialogue:
[DIALOGUE หรือ NONE]

Music:
[MUSIC หรือ NONE]

Do not:
[RESTRICTIONS]”

🎙️ Template Dialogue

“ตัวละคร [ใคร] พูดภาษา [ภาษา] ว่า ‘[ประโยค]’ ด้วยน้ำเสียง [TONE] ในขณะที่ [ACTION] รักษาเสียง Background ไว้เบากว่า Dialogue และห้ามเพิ่มคำพูดอื่น”

🎧 Template Ambient Sound

“สร้าง Ambient Audio ที่สัมพันธ์กับ Scene ได้แก่ [เสียง 1], [เสียง 2], [เสียง 3] ให้ระดับเสียงเป็นธรรมชาติ ไม่มีเพลงและไม่มีเสียงพูด”

🥁 Template Music + SFX

“เพิ่ม Background Music แบบ [GENRE/MOOD] ระดับเบา พร้อม Sound Effects [SFX] ให้ Sound Effects สัมพันธ์กับ Action และไม่ให้เพลงกลบเสียงสำคัญ”

⚠️ สิ่งที่ควรตรวจหลังสร้างวิดีโอพร้อมเสียง

① ภาพกับเสียงตรงกันไหม

ตัวอย่างเสียงประตูเกิดตอนเปิดจริงหรือไม่

② Dialogue ถูกไหม

ทุกคำถูกหรือไม่

③ Lip Sync

ปากตรงเสียงหรือไม่

④ เสียงคนคงที่ไหม

เสียงเปลี่ยนระหว่างประโยคหรือไม่

⑤ Ambient Sound

เหมาะกับ Environment ไหม

⑥ Music

ดังเกินไปหรือไม่

⑦ Sound Effects

เกิดถูกเวลาไหม

⑧ Noise

มีเสียงแปลกที่ไม่ได้ขอหรือไม่

⑨ Continuity

เสียงขาดหรือเปลี่ยนกะทันหันหรือไม่

⑩ Rights

มีสิ่งที่อาจเกี่ยวข้องกับสิทธิบุคคลอื่นหรือไม่

⚠️ Gemini แทนโปรแกรมตัดต่อเสียงได้ทั้งหมดไหม

ยังไม่ควรมองแบบนั้น

Gemini เหมาะมากกับ

สร้าง Concept
สร้าง SFX
สร้าง Ambient
ทำ Dialogue
สร้าง Video + Audio ในครั้งเดียว
แก้ด้วย Prompt

แต่หากต้องการงาน Final ที่ต้องมี

Mixing แม่นยำ
Noise Reduction ละเอียด
EQ
Compression
Loudness Standard
Multitrack
Mastering

โปรแกรม Audio/Video Editing เฉพาะทางยังเหมาะกว่า

Workflow ที่ดีอาจเป็น

Gemini → Generate Video + Audio → ตรวจ → Video/Audio Editor → Final

💳 ต้องเสียเงินไหม

สำหรับ Personal Google Account ปัจจุบัน Google Help ระบุว่าต้องมี Google AI Plan เพื่อใช้ Video Generation ใน Gemini Apps

Work/School Account ต้องมี Workspace License ที่เข้าเกณฑ์ และ Feature นี้ยังไม่พร้อมให้ผู้ใช้อายุต่ำกว่า 18 ปี

สิทธิและ Limit สามารถเปลี่ยนแปลงได้ จึงควรตรวจสถานะของบัญชีเมื่อใช้งานจริง

⏳ สร้างวิดีโอพร้อมเสียงนานไหม

Google ระบุว่าการสร้าง Video อาจใช้เวลาหลายนาที และระหว่างที่กำลังสร้าง จะไม่สามารถโต้ตอบกับ Chat เดิมได้ แต่สามารถเปิด Chat ใหม่แล้วกลับมาดูผลภายหลังได้

งานที่มีทั้ง

Video
Movement
Dialogue
Sound Effects
Music

อาจมีความซับซ้อนมากกว่าวิดีโอพื้นฐาน

📥 ดาวน์โหลดวิดีโอพร้อมเสียงอย่างไร

หลังสร้างเสร็จ

เลือก

Share

จากนั้นเลือกบันทึกหรือ

Download video

และใน Workflow ที่รองรับสามารถแชร์ไป YouTube ได้ด้วย

ควรใช้ไฟล์ดาวน์โหลดโดยตรงแทน Screen Record

🧬 วิดีโอจาก Gemini มี SynthID หรือไม่

Google ระบุว่า Video ที่สร้างด้วย Gemini Omni มี SynthID Digital Watermark แบบมองไม่เห็น เพื่อช่วยระบุ Content ที่สร้างด้วย Google AI

ดังนั้นแม้ไม่มีลายน้ำขนาดใหญ่บนภาพ ก็ไม่ได้หมายความว่าไม่มีระบบ Provenance อยู่ภายใน

⚖️ ใช้เสียงและวิดีโอเชิงพาณิชย์ได้ไหม

การนำ Output ไปใช้ต้องคำนึงถึง

Copyright
Trademark
Privacy
Publicity Rights
Platform Rules

รวมถึงสิทธิของ Reference ที่อัปโหลด

Google Help เตือนให้ Upload เฉพาะรูปที่ผู้ใช้มีสิทธิใช้งาน และการสร้าง Video อยู่ภายใต้ Terms of Service และ Prohibited Use Policy

ดังนั้น AI สร้าง Content ให้ ไม่ได้แปลว่าสิทธิของบุคคลอื่นหายไป

🚫 อย่าใช้เสียง AI เพื่อทำให้คนอื่นเข้าใจผิด

โดยเฉพาะถ้าเกี่ยวข้องกับบุคคลจริง

ควรระมัดระวังการสร้าง

เสียงพูดปลอม
คำพูดที่บุคคลนั้นไม่เคยพูด
เหตุการณ์ที่ดูเหมือนจริง

แล้วนำเสนอเหมือนเป็น Footage จริง

ควรเปิดเผยบริบทของ AI-generated Content เมื่อมีโอกาสทำให้ผู้ชมเข้าใจผิด

❌ Prompt เสียงที่ไม่ดี

“ทำเสียงให้ดี”

กว้างเกินไป

✅ Prompt ที่ดีกว่า

“เพิ่มเสียงฝนปานกลาง เสียงรถจากระยะไกล และ Footsteps ที่สัมพันธ์กับจังหวะเดิน ไม่มีเพลง และให้ Ambient Sound เบากว่า Dialogue”

❌ Prompt Music ที่ไม่ชัด

“ใส่เพลงเท่ ๆ”

✅ Prompt ที่ชัดกว่า

“เพิ่ม Electronic Cinematic Instrumental Tempo ปานกลาง มี Soft Synth และ Deep Bass ระดับเสียงเบา และไม่ให้เพลงกลบเสียงเครื่องยนต์”

❌ Prompt Dialogue ที่ไม่ชัด

“ให้เขาพูดทักทาย”

✅ Prompt Dialogue ที่ดีกว่า

“ให้ผู้ชายมองกล้องแล้วพูดภาษาไทยว่า ‘สวัสดีครับ ยินดีต้อนรับ’ ด้วยน้ำเสียงเป็นธรรมชาติและเป็นมิตร จากนั้นหยุดพูดและยิ้มเล็กน้อย”

🥇 Workflow สร้าง Video พร้อมเสียงที่แนะนำ

① กำหนด Visual

ต้องการเห็นอะไร

② กำหนด Action

อะไรเคลื่อนไหว

③ กำหนด Camera

Shot และ Movement

④ กำหนด Sound Effects

เสียงที่สัมพันธ์กับ Action

⑤ กำหนด Ambient

เสียงของ Environment

⑥ กำหนด Dialogue

ถ้ามี

⑦ กำหนด Music

ถ้าต้องการ

⑧ Generate

⑨ ตรวจภาพและเสียง

⑩ Edit เฉพาะจุด

นี่ควบคุมง่ายกว่าการสั่งเพียง

“สร้าง Video พร้อมเสียงสมจริง”

📊 ตารางเลือกเสียงให้เหมาะกับวิดีโอ

Videoเสียงที่ควรพิจารณา
รถEngine, Tire, Road, Wind
ร้านกาแฟEspresso, Cups, Conversation
ฝนRain, Thunder, Wet Road
ทะเลWaves, Wind, Birds
ป่าBirds, Leaves, Water, Insects
เมืองTraffic, Footsteps, Crowd
สินค้าSFX, Ambient Music
คนพูดDialogue, Room Tone
TechnologyElectronic Hum, UI Sound
ActionImpact, Movement, Environment

❓ คำถามที่พบบ่อยเกี่ยวกับวิดีโอพร้อมเสียงใน Gemini

① Gemini สร้างวิดีโอพร้อมเสียงได้ไหม

ได้ Google Gemini Help ระบุโดยตรงว่าสามารถขอให้ Gemini สร้าง Audio พร้อมกับ Video ได้

② Gemini ใช้โมเดลอะไรสร้าง Video

Gemini Apps ปัจจุบันใช้ Gemini Omni ซึ่งเป็นโมเดลสร้างวิดีโอ AI ล่าสุดของ Gemini

③ สร้างเสียงฝน เสียงรถ หรือเสียงธรรมชาติได้ไหม

สามารถระบุเสียงเหล่านี้ใน Prompt ได้ ควรอธิบายว่าเสียงเกิดจากอะไร ดังแค่ไหน และสัมพันธ์กับ Scene อย่างไร

④ สร้างเสียงพูดได้ไหม

สามารถระบุ Dialogue เป็นส่วนหนึ่งของ Prompt Video ได้ แต่ควรตรวจคำพูด การออกเสียงและ Lip Sync หลัง Generate

⑤ พูดภาษาไทยได้ไหม

สามารถสั่ง Dialogue ภาษาไทยและระบุประโยคที่ต้องการได้ แต่ Output ควรได้รับการตรวจทุกครั้ง

⑥ ใส่เพลงได้ไหม

สามารถขอ Music Mood หรือ Background Music ใน Prompt ได้ แต่สำหรับงาน Final ที่ต้องการ Mixing แม่นยำอาจต้องใช้ Audio Editor เพิ่มเติม

⑦ สร้าง Video จากรูปพร้อมเสียงได้ไหม

ได้ สามารถเพิ่ม Image Reference และขอ Audio ร่วมกับวิดีโอใน Prompt เดียวกัน

⑧ Upload Reference ได้กี่ไฟล์

Gemini Video Workflow ปัจจุบันรองรับ Video 1 ไฟล์และรูปภาพสูงสุด 5 รูป

⑨ แก้เสียงหลังสร้าง Video แล้วได้ไหม

Gemini Omni รองรับ Iterative Editing ผ่าน Natural Conversation จึงสามารถขอ Specific Update โดยไม่ต้อง Prompt Scene ใหม่ทั้งหมด

⑩ วิดีโอพร้อมเสียงสร้างนานไหม

Google ระบุว่า Video Generation อาจใช้เวลาหลายนาที

⑪ Gemini Video ต้องเสียเงินไหม

สำหรับ Personal Account ปัจจุบันต้องมี Google AI Plan ส่วน Work/School ต้องมี Workspace License ที่เข้าเกณฑ์

⑫ วิดีโอจาก Gemini มี SynthID ไหม

มี Google ระบุว่า Video ที่สร้างด้วย Gemini Omni มี SynthID Digital Watermark แบบมองไม่เห็น

✅ สรุป วิธีสร้างวิดีโอพร้อมเสียงด้วย Gemini

การสร้างวิดีโอพร้อมเสียงด้วย Google Gemini ทำได้โดยเปิด

Gemini → Create video → เขียน Prompt → Submit

แล้วระบุ Audio ที่ต้องการลงไปใน Prompt ได้โดยตรง

Google Help ปัจจุบันระบุชัดว่า Gemini Apps ใช้ Gemini Omni สำหรับ Video Generation และผู้ใช้สามารถขอให้ Geminiสร้าง Audio พร้อมกับ Video ได้

สูตร Prompt ที่แนะนำคือ

Subject + Action + Scene + Camera + Movement + Lighting + Audio + Style + Restrictions

ในส่วน Audio ควรแยกคิดเป็น

Sound Effects + Ambient Sound + Dialogue + Music

เช่น

“สร้างวิดีโอ Cinematic ของรถสปอร์ตสีดำวิ่งผ่านอุโมงค์ตอนกลางคืน กล้อง Low-angle Tracking มีเสียงเครื่องยนต์ที่เปลี่ยนตามการเร่ง เสียงยางสัมผัสถนน และ Tunnel Reverb สมจริง ไม่มีเพลง ไม่มี Dialogue”

ถ้าเป็นวิดีโอคนพูด ให้ระบุประโยคตรง ๆ เช่น

“พูดภาษาไทยว่า ‘ยินดีต้อนรับค่ะ’ ด้วยน้ำเสียงเป็นมิตร”

หาก Video แรกดีแล้วแต่เสียงยังไม่ถูก ไม่ต้องเริ่ม Generate ใหม่ทั้งหมด

ใช้ความสามารถ Multi-turn Editing ของ Gemini Omni แล้วสั่ง

“รักษาภาพเดิมทั้งหมด เปลี่ยนเฉพาะ Audio…”

Google DeepMind ระบุว่า Omni ถูกออกแบบให้แก้ Specific Update ผ่าน Natural Conversation และพยายามรักษาส่วนของวิดีโอที่ทำงานดีอยู่แล้วระหว่างการแก้หลายรอบ

ดังนั้น Workflow ที่เหมาะที่สุดคือ

สร้าง Visual → ใส่ Audio Requirement → Generate → ตรวจ → แก้เสียงเฉพาะจุด → Final

และสิ่งสำคัญที่สุดก่อนเผยแพร่คือการตรวจ

ภาพตรงเสียงหรือไม่
Dialogue ถูกหรือไม่
Lip Sync เป็นธรรมชาติหรือไม่
เสียงดังเบาเหมาะสมหรือไม่
มีเสียงที่ไม่ได้ขอหรือไม่
มีประเด็นด้าน Copyright หรือสิทธิบุคคลหรือไม่

เมื่อเขียน Prompt โดยแยกภาพและเสียงออกเป็นองค์ประกอบชัดเจน Gemini จะสามารถสร้างวิดีโอที่มีทั้ง Visual และ Audio สัมพันธ์กันได้ดีกว่าการสั่งสั้น ๆ ว่า “สร้างวิดีโอพร้อมเสียง” อย่างมาก