Contact
Line : comsiam
Contact
Line : comsiam

Google Gemini สามารถสร้าง วิดีโอพร้อมเสียงในขั้นตอนเดียว ได้ ไม่จำเป็นต้องสร้างภาพเคลื่อนไหวก่อนแล้วค่อยนำไปใส่เสียงในโปรแกรมอื่นเสมอไป ผู้ใช้สามารถเขียน Prompt กำหนดทั้งภาพ การเคลื่อนไหวของกล้อง เสียงบรรยากาศ Sound Effect และเสียงพูดที่ต้องการได้
ปัจจุบัน Gemini Apps ใช้ Gemini Omni เป็นโมเดลสร้างวิดีโอรุ่นล่าสุด โดย Google ระบุชัดว่าผู้ใช้สามารถขอให้ Gemini สร้าง Audio พร้อมกับวิดีโอ ได้ และ Omni สามารถทำงานร่วมกับข้อความ รูปภาพ และวิดีโอ Reference รวมถึงแก้งานต่อด้วยการสนทนาได้ด้วย
ตัวอย่าง Prompt ง่าย ๆ:
“สร้างวิดีโอ Cinematic ของรถสปอร์ตสีดำวิ่งผ่านอุโมงค์ตอนกลางคืน ใช้ Low-angle Tracking Shot พร้อมเสียงเครื่องยนต์สมจริง เสียงยางสัมผัสถนน และเสียงก้องของอุโมงค์ ไม่มีเพลงและไม่มีเสียงพูด”
Gemini จะพยายามสร้าง
ภาพ
Movement
Camera
Lighting
Sound Effects
Ambient Sound
ให้อยู่ในคลิปเดียวกัน
ได้
Google Gemini Help ปัจจุบันระบุโดยตรงว่า เมื่อสร้าง Video ใน Gemini Apps ผู้ใช้สามารถขอให้ Gemini สร้าง เสียงประกอบวิดีโอ ได้ด้วย
จึงสามารถสร้างเสียงประเภทต่าง ๆ เช่น
เสียงฝน
เสียงลม
เสียงทะเล
เสียงเครื่องยนต์
เสียงฝีเท้า
เสียงเมือง
เสียงร้านกาแฟ
เสียงสัตว์
เสียงพูด
เสียงดนตรีตาม Mood
ได้ตาม Prompt และความสามารถของระบบในขณะนั้น
โมเดลปัจจุบันคือ
Gemini Omni
Google เปิดตัว Gemini Omni ในเดือนพฤษภาคม 2026 โดยอธิบายว่าเป็นโมเดลที่สามารถสร้าง Content จาก Input หลายประเภท และเริ่มต้นด้วยความสามารถด้าน Video Generation
Gemini Omni สามารถนำ
Text
Image
Video
Audio
มาใช้ร่วมกันเพื่อสร้าง Video Output และสามารถแก้วิดีโอด้วยการสนทนาต่อเนื่องได้
จุดสำคัญคือ Gemini ไม่ได้คิดเฉพาะ “ภาพเคลื่อนไหว” แต่สามารถพิจารณาความสัมพันธ์ระหว่าง
ภาพ
Action
Timing
เสียง
ภายใน Scene เดียวกัน
บนคอมพิวเตอร์ทำตามนี้
เข้าสู่ Gemini ด้วยบัญชีที่มีสิทธิใช้ Video Generation
เลือก
Create video
ขั้นตอนนี้ไม่บังคับ
ระบุทั้งภาพและเสียง
ตัวอย่าง:
“สร้างวิดีโอร้านกาแฟ Modern Minimal ช่วงเช้า กล้อง Slow Dolly In ไปยังแก้วกาแฟบนโต๊ะไม้ มี Soft Natural Light พร้อมเสียงเครื่องชงกาแฟ เสียงคนพูดคุยเบา ๆ และเสียงช้อนกระทบแก้ว ไม่มีเพลง”
สามารถเพิ่ม
รูปภาพ
หรือ
วิดีโอ
เพื่อใช้เป็น Reference ได้
จากนั้น Gemini จะเริ่ม Generate Video
Google ระบุว่าสามารถอัปโหลดได้ 1 วิดีโอและสูงสุด 5 รูปภาพ ใน Video Creation Workflow ปัจจุบัน
เปิด
Gemini App
หรือ
Gemini Web
จากนั้น
Menu → Videos → เขียน Prompt → Submit
หากมี Reference สามารถเพิ่มรูปหรือวิดีโอเข้าไปก่อน Generate ได้เช่นกัน
อย่าเขียนเพียง
“ใส่เสียงด้วย”
เพราะ Gemini จะต้องเดาว่าต้องการเสียงอะไร
ควรระบุ
เสียงอะไร + เกิดเมื่อไร + ดังแค่ไหน + อยู่ตรงไหน + มีอะไรที่ไม่ต้องการ
ตัวอย่าง:
“มีเสียงฝนตกเบา ๆ ตลอดคลิป เสียงรถวิ่งผ่านเป็นครั้งคราว และเสียงฟ้าร้องเบา ๆ จากระยะไกล ไม่มีเพลง”
Prompt นี้ควบคุม Audio Direction ได้ดีกว่า
“ทำเสียงให้สมจริง”
ใช้สูตร
Subject + Action + Scene + Camera + Movement + Lighting + Audio + Style + Restrictions
หรือจำง่าย ๆ ว่า
ใคร + ทำอะไร + ที่ไหน + กล้อง + การเคลื่อน + แสง + เสียง + Style + ห้ามอะไร
ตัวอย่าง:
“สร้างวิดีโอ Cinematic Photorealistic ของผู้ชายเดินบนถนนในโตเกียวตอนกลางคืนหลังฝนตก ใช้ Medium Tracking Shot จากด้านหน้า มี Neon Reflection บนพื้น พร้อมเสียงฝน เสียงฝีเท้า และ Ambient City Sound เบา ๆ ไม่มีเพลง ไม่มีคำพูดและไม่มีข้อความ”
Ambient Sound คือเสียงพื้นหลังของสถานที่
เช่น
เมือง → รถ ผู้คน ลม
ร้านกาแฟ → เครื่องชงกาแฟ คนคุยกัน
ชายหาด → คลื่น ลม นก
ป่า → ลม ใบไม้ นก แมลง
ตัวอย่าง Prompt:
“เพิ่มเสียงคลื่นทะเลเบา ๆ เสียงลมพัดและเสียงนกทะเลอยู่ไกล ๆ ให้เสียงเป็นธรรมชาติ ไม่มีเพลง”
ช่วยทำให้ Video มีความรู้สึกสมจริงขึ้น
สามารถกำหนด Sound Effect ที่สัมพันธ์กับ Action
เช่น
ประตูเปิด → เสียงประตู
รถเร่ง → เสียงเครื่องยนต์
รองเท้าเดิน → Footsteps
แก้วตก → เสียงกระแทก
Prompt:
“เมื่อรถเริ่มเร่ง ให้เสียงเครื่องยนต์สูงขึ้นตามความเร็ว และมีเสียงยางสัมผัสพื้นถนนเปียกอย่างสมจริง”
รายละเอียดเรื่อง Timing ทำให้ Prompt ดีกว่าการสั่ง
“ใส่เสียงรถ”
ตัวอย่าง Prompt:
“ให้เสียง Footsteps ตรงกับจังหวะการเดินของตัวละคร และเปลี่ยนลักษณะเสียงตามพื้นหินที่ตัวละครกำลังเดินอยู่”
หลักสำคัญคือระบุ
Action
Surface
Timing
เพราะเสียงรองเท้าบน
ไม้
คอนกรีต
หญ้า
น้ำ
ควรไม่เหมือนกัน
“สร้างวิดีโอ Cinematic ของถนนในเมืองตอนกลางคืนหลังฝนตก กล้อง Slow Push Forward มีฝนตกปานกลาง พร้อมเสียงฝนกระทบพื้น เสียงรถบนถนนเปียก และเสียงฟ้าร้องเบา ๆ จากระยะไกล ไม่มีเพลง”
Prompt นี้กำหนดทั้ง
ภาพฝน
เสียงฝน
รถ
ระยะของฟ้าร้อง
“สร้างวิดีโอรถสปอร์ตสีดำวิ่งผ่านอุโมงค์ ใช้ Low-angle Tracking Shot มีเสียงเครื่องยนต์สมจริงที่เปลี่ยนตามการเร่ง เสียงยางบนถนน และ Natural Tunnel Reverb ไม่มีเพลง”
คำว่า
Natural Tunnel Reverb
ช่วยบอกว่าเสียงควรสะท้อนตาม Environment
“สร้างวิดีโอ Cinematic ภายในร้านกาแฟ Modern Minimal ช่วงเช้า กล้อง Slow Dolly In ไปยัง Barista ที่กำลังทำ Latte Art มีเสียงเครื่องชง Espresso เสียงเทนม เสียงแก้วและช้อนเบา ๆ พร้อม Ambient Conversation จากลูกค้าอยู่ไกล ๆ ไม่มีเพลง”
เหมาะกับ
Restaurant Content
Social Media
B-roll
Advertising Concept
“สร้างวิดีโอ Drone Cinematic บินเหนือชายหาดช่วง Golden Hour มีเสียงคลื่นกระทบชายฝั่ง เสียงลมทะเล และเสียงนกเล็กน้อยจากระยะไกล ไม่มีเพลงหรือเสียงพูด”
“สร้างวิดีโอ Cinematic เดินผ่านป่าเขียวชื้นช่วงเช้า กล้องเคลื่อน Forward อย่างช้า ๆ มีเสียงใบไม้ เสียงนก เสียงลม และเสียงน้ำไหลอยู่ไกล ๆ ไม่มีดนตรี”
สามารถกำหนด Audio และ Dialogue ใน Prompt ของวิดีโอได้
ถ้าต้องการประโยคเฉพาะ ควรเขียน ข้อความที่ต้องพูดตรง ๆ
เช่น
“ผู้หญิงหันมามองกล้องแล้วพูดภาษาไทยว่า ‘ยินดีต้อนรับค่ะ’ ด้วยน้ำเสียงเป็นมิตร จากนั้นยิ้มเล็กน้อย”
ดีกว่า
“ให้ผู้หญิงพูดต้อนรับ”
เพราะ Prompt แรกกำหนดทั้ง
ผู้พูด
ภาษา
ประโยค
Tone
Action หลังพูด
สามารถลองกำหนด Dialogue ภาษาไทยใน Prompt ได้
ตัวอย่าง:
“ผู้ชายพูดภาษาไทยอย่างเป็นธรรมชาติว่า ‘วันนี้เราจะพาไปดูเทคโนโลยีใหม่กันครับ’ ด้วยน้ำเสียงกระตือรือร้นแต่ไม่เร็วเกินไป”
หลังสร้างต้องตรวจ
คำพูด
การออกเสียง
จังหวะ
Lip Sync
ความหมาย
ทุกครั้ง
โดยเฉพาะ Video ที่จะนำไปใช้เผยแพร่จริง
ไม่ควรคาดหวังว่า Generative AI จะตรง 100% ทุกครั้ง
แม้ระบบสร้าง
ภาพ
เสียง
Dialogue
ร่วมกันได้ แต่ยังอาจเกิด
ปากไม่ตรงคำ
คำพูดหาย
เสียงผิด
จังหวะไม่ตรง
เสียงเปลี่ยน
ได้
หาก Dialogue สำคัญควรตรวจ Clip อย่างละเอียด
สามารถเขียน Tone เช่น
friendly
calm
excited
serious
confident
warm
soft
energetic
ตัวอย่าง:
“พูดด้วยน้ำเสียง Calm, Warm และเป็นธรรมชาติ ไม่เหมือนเสียงโฆษณา”
หรือ
“พูดด้วยน้ำเสียงตื่นเต้นและรวดเร็วเล็กน้อยเหมือน Presenter Technology”
สามารถอธิบายระดับเชิงสัมพัทธ์ใน Prompt เช่น
“เสียงเพลงเบากว่า Dialogue”
“Ambient Sound เบามาก”
“เสียงเครื่องยนต์เด่นกว่าเสียงเมือง”
ตัวอย่าง:
“ให้เสียงพูดเป็นเสียงหลัก เสียงร้านกาแฟอยู่ด้านหลังเบา ๆ และดนตรีเบากว่า Dialogue อย่างชัดเจน”
แม้ AI อาจไม่ได้ควบคุม Decibel แบบ DAW โดยตรง แต่ช่วยบอก Audio Priority ได้
สามารถขอ Music Mood ใน Prompt ได้ เช่น
Cinematic
Ambient
Upbeat
Electronic
Calm
Dramatic
ตัวอย่าง:
“เพิ่ม Background Music แบบ Cinematic Ambient เบา ๆ โดยไม่กลบเสียงรถและเสียงฝน”
แต่หากต้องการ
เพลงเฉพาะ
Mixing ละเอียด
เพลง Full-length
Mastering
เครื่องมือ Audio หรือ Video Editor เฉพาะทางยังควบคุมได้ดีกว่า
สำหรับงานที่เผยแพร่หรือใช้เชิงพาณิชย์ ควรสั่งเป็น
Mood
Genre
Tempo
Instrumentation
แทนการพยายามสร้างเพลงที่เลียนแบบเพลงหรือผลงานเฉพาะของผู้อื่นอย่างตรงตัว
ตัวอย่าง:
“ดนตรี Electronic Instrumental จังหวะเร็ว มี Synth และ Bass แบบ Futuristic”
ชัดและใช้งานได้มากกว่า
“ทำเหมือนเพลง X ทุกอย่าง”
“เพิ่ม Electronic Ambient Music แบบ Futuristic Tempo ปานกลาง ใช้ Soft Synth, Deep Bass และ Subtle Pulse ให้เพลงอยู่ด้านหลังและไม่กลบ Sound Effects”
Gemini Omni ถูกออกแบบให้ทำงานกับข้อมูลหลายรูปแบบร่วมกัน และ Google ระบุว่า Omni สามารถผสม Image, Audio, Video และ Text เพื่อสร้างวิดีโอที่มีความสัมพันธ์ระหว่างองค์ประกอบเหล่านั้น
ดังนั้น Prompt สามารถระบุ Timing ได้ เช่น
“ตอนประตูเปิด ให้มีเสียงกระดิ่งทันที”
“เมื่อรถเร่ง ให้เสียงเครื่องยนต์สูงขึ้น”
“เมื่อฝนเริ่มแรง ให้เสียงฝนดังขึ้น”
“เมื่อไฟกระพริบ ให้ Sound Effect เกิดพร้อมกัน”
ยิ่งบอกเหตุการณ์สัมพันธ์กับเสียงชัด Gemini ยิ่งเข้าใจ Intent ได้ง่ายขึ้น
ใช้ภาษาธรรมดา เช่น
At the beginning
When…
As soon as…
During…
At the end
ตัวอย่าง:
“At the beginning มีเสียงเมืองเบา ๆ เมื่อรถเริ่มเร่งให้เสียงเครื่องยนต์ดังขึ้น และช่วงท้ายลดเสียงทั้งหมดลงอย่างนุ่มนวล”
“เริ่ม Video ด้วยเสียงฝนเบา ๆ และ Wide Shot ของเมือง หลังจาก 2 วินาที รถสีดำขับเข้ามา ให้เสียงเครื่องยนต์ค่อย ๆ ดังขึ้น จากนั้นกล้อง Tracking ตามรถ และช่วงท้ายให้เสียงรถค่อย ๆ หายไปตามระยะทาง”
ช่วยสร้าง Audio Narrative ที่มีทิศทาง
ควร
ตัวอย่าง
ถ้า Camera เข้าใกล้รถ
เสียงเครื่องยนต์อาจควรชัดขึ้น
ถ้ากล้องถอยห่างจากนักดนตรี
เสียงอาจรู้สึกไกลขึ้น
Prompt:
“ขณะที่ Camera Dolly In เข้าใกล้ Piano ให้เสียง Piano ชัดและใกล้ขึ้นอย่างเป็นธรรมชาติ”
ช่วยเพิ่ม Spatial Feeling ให้คลิป
สามารถอธิบายตำแหน่งเสียง เช่น
ด้านซ้าย
ด้านขวา
ด้านหลัง
ไกลออกไป
ตัวอย่าง:
“มีเสียงรถวิ่งผ่านจากด้านซ้ายไปด้านขวา และเสียงคนพูดคุยอยู่ด้านหลังห่าง ๆ”
AI อาจไม่ใช่ระบบ Post-production Spatial Mixing เต็มรูปแบบ แต่การระบุตำแหน่งช่วยสื่อ Intent
ได้
สามารถ Upload Image Reference แล้วกำหนดทั้ง Motion และ Audio
ตัวอย่าง:
“ใช้ภาพชายหาดนี้เป็น Reference รักษา Composition และ Landscape เดิม ทำให้คลื่นเคลื่อนไหวและต้นมะพร้าวพัดตามลม เพิ่มเสียงคลื่น เสียงลมและนกทะเลเบา ๆ”
Gemini Video Workflow รองรับการเพิ่มรูปภาพ Reference และ Google ระบุว่าสามารถขอเสียงพร้อม Video ได้ในขั้นตอนเดียวกัน
ตัวอย่าง Prompt:
“ใช้บุคคลจากภาพนี้เป็น Master Identity รักษาใบหน้า ทรงผม เสื้อผ้าและอายุเดิม ให้บุคคลมองกล้องและพูดภาษาไทยว่า ‘สวัสดีครับ ยินดีต้อนรับ’ ด้วยน้ำเสียงเป็นธรรมชาติ จากนั้นยิ้มเล็กน้อย Background และ Camera คงเดิม”
ควรให้ Movement เรียบง่ายก่อนถ้าต้องการรักษาหน้า
“ใช้สินค้าใน Reference เป็น Master Product รักษา Shape, Logo, Label, Color และ Packaging เดิม กล้อง Slow Orbit รอบสินค้าใน Premium Black Studio เพิ่ม Soft Mechanical Sound Effect และ Cinematic Ambient Music เบา ๆ ไม่มีเสียงพูด”
สำหรับสินค้าจริงต้องตรวจ
Logo
Label
Packaging
สี
รูปทรง
ในหลาย Frame
เพราะ Generative Video ยังสามารถเปลี่ยนรายละเอียดบางอย่างได้
“สร้างวิดีโอโฆษณาสินค้า 16:9 สไตล์ Premium เริ่ม Close-up ที่สินค้า จากนั้น Slow Orbit รอบสินค้า ใช้ Black Background และ Golden Rim Light มี Cinematic Impact Sound ตอนสินค้าเปิดเผยเต็ม Frame ตามด้วย Ambient Music เบา ๆ ไม่มี Dialogue และไม่มีข้อความ”
“สร้าง Vertical Video 9:16 ของผู้หญิงเดินผ่านเมืองช่วง Golden Hour ใช้ Smooth Tracking Shot มีเสียงฝีเท้า Ambient City และ Upbeat Instrumental Music เบา ๆ เว้น Safe Area สำหรับ Caption และไม่มีข้อความในภาพ”
“สร้าง Cinematic B-roll 16:9 ภายใน Data Center กล้อง Slow Dolly Forward ผ่าน Server Rack มีเสียงพัดลม Server, subtle electronic hum และ Ambient Technology Music เบามาก ไม่มีเสียงพูด ไม่มีข้อความ”
“สร้างวิดีโอ Futuristic Cyberpunk City Chase มุมกล้อง Dynamic Tracking มีเสียงเครื่องยนต์ เสียงฝน เสียง Neon Electrical Hum และ Cinematic Electronic Music ที่เพิ่มความเข้มตาม Action”
“สร้างวิดีโอ Cinematic ของยานอวกาศเข้าสู่วงโคจรดาวเคราะห์ ใช้ Wide Shot มี Deep Mechanical Rumble, subtle spacecraft ambience และ Epic Atmospheric Music เบา ๆ ไม่มีเสียงพูด”
Gemini Omni รองรับการแก้ Video ผ่าน Natural Conversation และ Google DeepMind แนะนำให้แก้เฉพาะส่วนที่ต้องการโดยไม่ต้อง Prompt Scene ใหม่ทั้งหมด
ดังนั้นสามารถพิมพ์ต่อ เช่น
“ภาพถูกต้องแล้ว รักษา Visual ทั้งหมดไว้ เพิ่มเฉพาะเสียงฝน”
หรือ
“รักษาภาพเดิมทั้งหมด ลบเพลง Background”
หรือ
“เสียงเครื่องยนต์ดังเกินไป ลดลงและให้เสียงฝนเด่นขึ้น”
ใช้
PRESERVE VISUAL + CHANGE ONLY AUDIO
ตัวอย่าง:
“รักษาภาพ Camera, Movement และ Timing เดิมทั้งหมด เปลี่ยนเฉพาะ Audio ให้มีเสียงคลื่นทะเลและลมธรรมชาติ ไม่มีเพลง”
ง่ายและชัดกว่าการ Prompt Video ใหม่ทั้งหมด
Prompt:
“Keep all visuals exactly as consistent as possible. Change only the background music to a calm cinematic ambient track. Preserve all sound effects.”
“รักษาวิดีโอและ Sound Effects เดิมทั้งหมด ลบเฉพาะ Background Music และคงเสียงฝนกับเสียงฝีเท้าไว้”
“รักษา Visual และ Camera เดิม เปลี่ยนเฉพาะ Dialogue ของผู้หญิงเป็น ‘ขอบคุณที่รับชมค่ะ’ ด้วยน้ำเสียงเป็นมิตร”
หลัง Generate ต้องตรวจ Lip Sync ใหม่ เพราะการเปลี่ยน Dialogue อาจทำให้ส่วนของภาพถูก Generate ใหม่บางส่วน
Gemini Omni รองรับ Multi-turn Editing ทำให้ Workflow สามารถเป็น
รอบ 1 → สร้าง Video
รอบ 2 → เพิ่มเสียง
รอบ 3 → ลด Music
รอบ 4 → เปลี่ยน Dialogue
รอบ 5 → ปรับ Camera
โดยไม่ต้องเริ่มต้นใหม่ทุกครั้ง
Google DeepMind ระบุว่า Omni จะพยายามรักษาส่วนที่ทำงานดีอยู่แล้วขณะผู้ใช้แก้เฉพาะส่วนที่ต้องการ
ถ้าคลิปมีปัญหา
เสียงพูดผิด
เพลงดัง
เสียงฝนเบา
Camera เร็ว
อย่าแก้ทั้งหมดพร้อมกันถ้าไม่จำเป็น
ทำ
รอบ 1 → Dialogue
ตรวจ
รอบ 2 → Music
ตรวจ
รอบ 3 → Rain
ตรวจ
ทำให้รู้ว่า Edit รอบใดส่งผลกับคลิป
สามารถเขียนแบบนี้
Visual:
รถสปอร์ตสีดำวิ่งในอุโมงค์
Camera:
Low-angle tracking shot
Sound Effects:
เสียงเครื่องยนต์ เสียงยาง
Environment:
Tunnel reverb
Music:
ไม่มีเพลง
Dialogue:
ไม่มี
ช่วยให้ Prompt อ่านง่ายและแก้เฉพาะ Audio ได้สะดวก
“สร้างวิดีโอ [STYLE] ของ [SUBJECT] กำลัง [ACTION] ที่ [LOCATION]
Camera:
[SHOT + MOVEMENT]
Lighting:
[LIGHTING]
Sound effects:
[SFX]
Ambient audio:
[ENVIRONMENT]
Dialogue:
[DIALOGUE หรือ NONE]
Music:
[MUSIC หรือ NONE]
Do not:
[RESTRICTIONS]”
“ตัวละคร [ใคร] พูดภาษา [ภาษา] ว่า ‘[ประโยค]’ ด้วยน้ำเสียง [TONE] ในขณะที่ [ACTION] รักษาเสียง Background ไว้เบากว่า Dialogue และห้ามเพิ่มคำพูดอื่น”
“สร้าง Ambient Audio ที่สัมพันธ์กับ Scene ได้แก่ [เสียง 1], [เสียง 2], [เสียง 3] ให้ระดับเสียงเป็นธรรมชาติ ไม่มีเพลงและไม่มีเสียงพูด”
“เพิ่ม Background Music แบบ [GENRE/MOOD] ระดับเบา พร้อม Sound Effects [SFX] ให้ Sound Effects สัมพันธ์กับ Action และไม่ให้เพลงกลบเสียงสำคัญ”
ตัวอย่างเสียงประตูเกิดตอนเปิดจริงหรือไม่
ทุกคำถูกหรือไม่
ปากตรงเสียงหรือไม่
เสียงเปลี่ยนระหว่างประโยคหรือไม่
เหมาะกับ Environment ไหม
ดังเกินไปหรือไม่
เกิดถูกเวลาไหม
มีเสียงแปลกที่ไม่ได้ขอหรือไม่
เสียงขาดหรือเปลี่ยนกะทันหันหรือไม่
มีสิ่งที่อาจเกี่ยวข้องกับสิทธิบุคคลอื่นหรือไม่
ยังไม่ควรมองแบบนั้น
Gemini เหมาะมากกับ
สร้าง Concept
สร้าง SFX
สร้าง Ambient
ทำ Dialogue
สร้าง Video + Audio ในครั้งเดียว
แก้ด้วย Prompt
แต่หากต้องการงาน Final ที่ต้องมี
Mixing แม่นยำ
Noise Reduction ละเอียด
EQ
Compression
Loudness Standard
Multitrack
Mastering
โปรแกรม Audio/Video Editing เฉพาะทางยังเหมาะกว่า
Workflow ที่ดีอาจเป็น
Gemini → Generate Video + Audio → ตรวจ → Video/Audio Editor → Final
สำหรับ Personal Google Account ปัจจุบัน Google Help ระบุว่าต้องมี Google AI Plan เพื่อใช้ Video Generation ใน Gemini Apps
Work/School Account ต้องมี Workspace License ที่เข้าเกณฑ์ และ Feature นี้ยังไม่พร้อมให้ผู้ใช้อายุต่ำกว่า 18 ปี
สิทธิและ Limit สามารถเปลี่ยนแปลงได้ จึงควรตรวจสถานะของบัญชีเมื่อใช้งานจริง
Google ระบุว่าการสร้าง Video อาจใช้เวลาหลายนาที และระหว่างที่กำลังสร้าง จะไม่สามารถโต้ตอบกับ Chat เดิมได้ แต่สามารถเปิด Chat ใหม่แล้วกลับมาดูผลภายหลังได้
งานที่มีทั้ง
Video
Movement
Dialogue
Sound Effects
Music
อาจมีความซับซ้อนมากกว่าวิดีโอพื้นฐาน
หลังสร้างเสร็จ
เลือก
Share
จากนั้นเลือกบันทึกหรือ
Download video
และใน Workflow ที่รองรับสามารถแชร์ไป YouTube ได้ด้วย
ควรใช้ไฟล์ดาวน์โหลดโดยตรงแทน Screen Record
Google ระบุว่า Video ที่สร้างด้วย Gemini Omni มี SynthID Digital Watermark แบบมองไม่เห็น เพื่อช่วยระบุ Content ที่สร้างด้วย Google AI
ดังนั้นแม้ไม่มีลายน้ำขนาดใหญ่บนภาพ ก็ไม่ได้หมายความว่าไม่มีระบบ Provenance อยู่ภายใน
การนำ Output ไปใช้ต้องคำนึงถึง
Copyright
Trademark
Privacy
Publicity Rights
Platform Rules
รวมถึงสิทธิของ Reference ที่อัปโหลด
Google Help เตือนให้ Upload เฉพาะรูปที่ผู้ใช้มีสิทธิใช้งาน และการสร้าง Video อยู่ภายใต้ Terms of Service และ Prohibited Use Policy
ดังนั้น AI สร้าง Content ให้ ไม่ได้แปลว่าสิทธิของบุคคลอื่นหายไป
โดยเฉพาะถ้าเกี่ยวข้องกับบุคคลจริง
ควรระมัดระวังการสร้าง
เสียงพูดปลอม
คำพูดที่บุคคลนั้นไม่เคยพูด
เหตุการณ์ที่ดูเหมือนจริง
แล้วนำเสนอเหมือนเป็น Footage จริง
ควรเปิดเผยบริบทของ AI-generated Content เมื่อมีโอกาสทำให้ผู้ชมเข้าใจผิด
“ทำเสียงให้ดี”
กว้างเกินไป
“เพิ่มเสียงฝนปานกลาง เสียงรถจากระยะไกล และ Footsteps ที่สัมพันธ์กับจังหวะเดิน ไม่มีเพลง และให้ Ambient Sound เบากว่า Dialogue”
“ใส่เพลงเท่ ๆ”
“เพิ่ม Electronic Cinematic Instrumental Tempo ปานกลาง มี Soft Synth และ Deep Bass ระดับเสียงเบา และไม่ให้เพลงกลบเสียงเครื่องยนต์”
“ให้เขาพูดทักทาย”
“ให้ผู้ชายมองกล้องแล้วพูดภาษาไทยว่า ‘สวัสดีครับ ยินดีต้อนรับ’ ด้วยน้ำเสียงเป็นธรรมชาติและเป็นมิตร จากนั้นหยุดพูดและยิ้มเล็กน้อย”
ต้องการเห็นอะไร
อะไรเคลื่อนไหว
Shot และ Movement
เสียงที่สัมพันธ์กับ Action
เสียงของ Environment
ถ้ามี
ถ้าต้องการ
นี่ควบคุมง่ายกว่าการสั่งเพียง
“สร้าง Video พร้อมเสียงสมจริง”
| Video | เสียงที่ควรพิจารณา |
|---|---|
| รถ | Engine, Tire, Road, Wind |
| ร้านกาแฟ | Espresso, Cups, Conversation |
| ฝน | Rain, Thunder, Wet Road |
| ทะเล | Waves, Wind, Birds |
| ป่า | Birds, Leaves, Water, Insects |
| เมือง | Traffic, Footsteps, Crowd |
| สินค้า | SFX, Ambient Music |
| คนพูด | Dialogue, Room Tone |
| Technology | Electronic Hum, UI Sound |
| Action | Impact, Movement, Environment |
ได้ Google Gemini Help ระบุโดยตรงว่าสามารถขอให้ Gemini สร้าง Audio พร้อมกับ Video ได้
Gemini Apps ปัจจุบันใช้ Gemini Omni ซึ่งเป็นโมเดลสร้างวิดีโอ AI ล่าสุดของ Gemini
สามารถระบุเสียงเหล่านี้ใน Prompt ได้ ควรอธิบายว่าเสียงเกิดจากอะไร ดังแค่ไหน และสัมพันธ์กับ Scene อย่างไร
สามารถระบุ Dialogue เป็นส่วนหนึ่งของ Prompt Video ได้ แต่ควรตรวจคำพูด การออกเสียงและ Lip Sync หลัง Generate
สามารถสั่ง Dialogue ภาษาไทยและระบุประโยคที่ต้องการได้ แต่ Output ควรได้รับการตรวจทุกครั้ง
สามารถขอ Music Mood หรือ Background Music ใน Prompt ได้ แต่สำหรับงาน Final ที่ต้องการ Mixing แม่นยำอาจต้องใช้ Audio Editor เพิ่มเติม
ได้ สามารถเพิ่ม Image Reference และขอ Audio ร่วมกับวิดีโอใน Prompt เดียวกัน
Gemini Video Workflow ปัจจุบันรองรับ Video 1 ไฟล์และรูปภาพสูงสุด 5 รูป
Gemini Omni รองรับ Iterative Editing ผ่าน Natural Conversation จึงสามารถขอ Specific Update โดยไม่ต้อง Prompt Scene ใหม่ทั้งหมด
Google ระบุว่า Video Generation อาจใช้เวลาหลายนาที
สำหรับ Personal Account ปัจจุบันต้องมี Google AI Plan ส่วน Work/School ต้องมี Workspace License ที่เข้าเกณฑ์
มี Google ระบุว่า Video ที่สร้างด้วย Gemini Omni มี SynthID Digital Watermark แบบมองไม่เห็น
การสร้างวิดีโอพร้อมเสียงด้วย Google Gemini ทำได้โดยเปิด
Gemini → Create video → เขียน Prompt → Submit
แล้วระบุ Audio ที่ต้องการลงไปใน Prompt ได้โดยตรง
Google Help ปัจจุบันระบุชัดว่า Gemini Apps ใช้ Gemini Omni สำหรับ Video Generation และผู้ใช้สามารถขอให้ Geminiสร้าง Audio พร้อมกับ Video ได้
สูตร Prompt ที่แนะนำคือ
Subject + Action + Scene + Camera + Movement + Lighting + Audio + Style + Restrictions
ในส่วน Audio ควรแยกคิดเป็น
Sound Effects + Ambient Sound + Dialogue + Music
เช่น
“สร้างวิดีโอ Cinematic ของรถสปอร์ตสีดำวิ่งผ่านอุโมงค์ตอนกลางคืน กล้อง Low-angle Tracking มีเสียงเครื่องยนต์ที่เปลี่ยนตามการเร่ง เสียงยางสัมผัสถนน และ Tunnel Reverb สมจริง ไม่มีเพลง ไม่มี Dialogue”
ถ้าเป็นวิดีโอคนพูด ให้ระบุประโยคตรง ๆ เช่น
“พูดภาษาไทยว่า ‘ยินดีต้อนรับค่ะ’ ด้วยน้ำเสียงเป็นมิตร”
หาก Video แรกดีแล้วแต่เสียงยังไม่ถูก ไม่ต้องเริ่ม Generate ใหม่ทั้งหมด
ใช้ความสามารถ Multi-turn Editing ของ Gemini Omni แล้วสั่ง
“รักษาภาพเดิมทั้งหมด เปลี่ยนเฉพาะ Audio…”
Google DeepMind ระบุว่า Omni ถูกออกแบบให้แก้ Specific Update ผ่าน Natural Conversation และพยายามรักษาส่วนของวิดีโอที่ทำงานดีอยู่แล้วระหว่างการแก้หลายรอบ
ดังนั้น Workflow ที่เหมาะที่สุดคือ
สร้าง Visual → ใส่ Audio Requirement → Generate → ตรวจ → แก้เสียงเฉพาะจุด → Final
และสิ่งสำคัญที่สุดก่อนเผยแพร่คือการตรวจ
ภาพตรงเสียงหรือไม่
Dialogue ถูกหรือไม่
Lip Sync เป็นธรรมชาติหรือไม่
เสียงดังเบาเหมาะสมหรือไม่
มีเสียงที่ไม่ได้ขอหรือไม่
มีประเด็นด้าน Copyright หรือสิทธิบุคคลหรือไม่
เมื่อเขียน Prompt โดยแยกภาพและเสียงออกเป็นองค์ประกอบชัดเจน Gemini จะสามารถสร้างวิดีโอที่มีทั้ง Visual และ Audio สัมพันธ์กันได้ดีกว่าการสั่งสั้น ๆ ว่า “สร้างวิดีโอพร้อมเสียง” อย่างมาก