วิธีสร้างวิดีโอจากข้อความด้วย Gemini

การสร้างวิดีโอจากข้อความด้วย Google Gemini หรือ Text-to-Video คือการพิมพ์คำอธิบายสิ่งที่ต้องการเห็นลงไป แล้วให้ AI สร้างวิดีโอขึ้นมาใหม่โดยไม่จำเป็นต้องมีรูปหรือคลิปต้นฉบับ

ปัจจุบัน Gemini Apps ใช้ Gemini Omni เป็นโมเดลสร้างวิดีโอ AI รุ่นล่าสุดของ Google โดยผู้ใช้สามารถเปิดเมนู Create video แล้วพิมพ์ Prompt เพื่อสร้างวิดีโอได้โดยตรง นอกจากนี้ยังรองรับการแก้ไขวิดีโอต่อเนื่องด้วยการสนทนา การควบคุม Aspect Ratio และการสร้างเสียงพร้อมกับวิดีโอด้วย

วิธีพื้นฐานที่สุดคือ

Gemini → Create video → พิมพ์ Prompt → Submit

ตัวอย่าง Prompt:

“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ตสีดำวิ่งบนถนนโตเกียวตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot มีแสง Neon สะท้อนบนถนน พร้อมเสียงเครื่องยนต์และเสียงฝน ไม่มีข้อความหรือ Logo”

เพียงเท่านี้ Gemini จะตีความ

ตัวแบบ
การเคลื่อนไหว
สถานที่
มุมกล้อง
แสง
Style
เสียง

แล้วสร้างเป็นวิดีโอให้

🎬 Text-to-Video คืออะไร

Text-to-Video คือเทคโนโลยีที่เปลี่ยน

ข้อความ → วิดีโอ

ตัวอย่างเช่นคุณพิมพ์ว่า

“แมวสีส้มวิ่งบนชายหาดช่วงพระอาทิตย์ตก”

AI จะต้องสร้างขึ้นใหม่ทั้ง

แมว
ชายหาด
ท้องฟ้า
การวิ่ง
กล้อง
แสง
เงา
การเคลื่อนไหว

โดยไม่จำเป็นต้องมีภาพต้นฉบับ

ต่างจาก Image-to-Video ที่เริ่มต้นจากรูปภาพที่ผู้ใช้อัปโหลด

🧠 Gemini ใช้อะไรสร้างวิดีโอจากข้อความ

ใน Gemini Apps ปัจจุบัน Google ระบุว่าใช้ Gemini Omni ซึ่งเป็น Advanced Video Generator รุ่นล่าสุดของ Gemini

Google DeepMind ระบุว่า Gemini Omni ทำผลงานได้ทั้ง

Text-to-Video
Image-to-Video
Reference-to-Video
Video Editing

และสามารถแก้ไขงานผ่านการสนทนาต่อเนื่องได้

ดังนั้น Gemini ไม่ได้เป็นเพียงเครื่องมือที่รับ Prompt แล้วสร้างคลิปครั้งเดียว แต่สามารถใช้เป็น Workflow แบบ

สร้าง → ดู → แก้ → ดู → แก้อีกครั้ง

ได้

🚀 วิธีสร้างวิดีโอจากข้อความด้วย Gemini บนคอมพิวเตอร์

Google ระบุขั้นตอนปัจจุบันดังนี้

① เปิด Gemini

เข้าสู่ Gemini ด้วย Google Account ที่มีสิทธิใช้ Video Generation

② เปิด Sidebar

กดเมนูด้านซ้าย

③ เลือก Create video

เข้าสู่พื้นที่สร้างวิดีโอ

④ เลือก Template ถ้าต้องการ

ขั้นตอนนี้ไม่บังคับ

หากต้องการสร้างจาก Prompt ทั้งหมดสามารถข้ามได้

⑤ พิมพ์ Prompt

เช่น

“สร้างวิดีโอ Drone Shot บินเหนือภูเขาและทะเลหมอกช่วงพระอาทิตย์ขึ้น ใช้ Golden Morning Light และเสียงลมธรรมชาติ”

⑥ กด Submit

Gemini จะเริ่ม Generate Video

Google ระบุว่าการสร้างอาจใช้เวลาหลายนาที และระหว่างประมวลผล Chat เดิมจะไม่สามารถโต้ตอบได้ แต่ผู้ใช้สามารถเปิด Chat ใหม่และกลับมาดูงานภายหลังได้

📱 วิธีสร้าง Text-to-Video บนมือถือ

บน Android สามารถเปิด

Gemini App

หรือ

Gemini Web

จากนั้น

Menu → Videos → ใส่ Prompt → Submit

Google ระบุขั้นตอนนี้โดยตรงใน Gemini Apps Help สำหรับ Android

Interface อาจมีการปรับตำแหน่งตาม Version ของแอป แต่หลักการคือเข้า Video Creation แล้วพิมพ์ Prompt ที่ต้องการ

💳 ต้องมี Google AI Plan หรือไม่

สำหรับ Personal Google Account ปัจจุบัน Google ระบุว่าต้องมี Google AI Plan จึงจะใช้ Video Generation ใน Gemini Apps ได้

ส่วนบัญชี Work หรือ School ต้องมี Workspace License ที่เข้าเกณฑ์ และฟีเจอร์นี้ยังไม่เปิดให้ผู้ใช้อายุต่ำกว่า 18 ปี

ดังนั้นหากหาเมนู Create video ไม่เจอ ควรตรวจ

บัญชีที่ Login
Google AI Plan
Workspace License
อายุบัญชี

ก่อน

📝 วิธีเริ่ม Prompt Text-to-Video สำหรับมือใหม่

เริ่มจาก 5 อย่างก่อน

ใคร + ทำอะไร + ที่ไหน + กล้องแบบไหน + Style แบบไหน

ตัวอย่าง

“ผู้หญิงกำลังเดินในโตเกียวตอนกลางคืน กล้อง Tracking จากด้านหน้า สไตล์ Cinematic Photorealistic”

จากนั้นค่อยเพิ่ม

Lighting
เสียง
สี
Movement
ข้อห้าม

เมื่อเข้าใจพื้นฐานแล้ว

🧩 สูตร Prompt Text-to-Video ที่แนะนำ

สูตรที่ใช้ได้กับงานส่วนใหญ่คือ

Subject + Action + Location + Camera + Movement + Lighting + Style + Audio + Restrictions

หรือจำแบบไทยง่าย ๆ ว่า

ใคร + ทำอะไร + ที่ไหน + กล้อง + เคลื่อนยังไง + แสง + Style + เสียง + ห้ามอะไร

Google DeepMind แนะนำให้ Prompt ระบุองค์ประกอบอย่าง Shot Framing, Motion, Style, Lighting, Location และ Action เพื่อเพิ่มการควบคุมผลลัพธ์

① 👤 Subject — บอกว่าใครหรืออะไรเป็นตัวหลัก

ตัวอย่างไม่ชัด

“สร้างคนเดิน”

ตัวอย่างชัดกว่า

“สร้างผู้ชายวัยประมาณ 30 ปี ใส่สูทสีกรมท่าและเสื้อเชิ้ตสีขาว เดินอยู่ในสำนักงานสมัยใหม่”

AI จึงไม่ต้องเดาว่า

เพศ
อายุ
เสื้อผ้า
ลักษณะ

ควรเป็นอย่างไร

② 🏃 Action — กำลังทำอะไร

Video แตกต่างจากภาพนิ่งเพราะต้องมีการเคลื่อนไหว

อย่าบอกเพียง

“ผู้ชายอยู่ในสำนักงาน”

ถ้าต้องการ Movement ให้เขียน

“ผู้ชายเดินเข้าหากล้องด้วยความเร็วธรรมชาติ แขนแกว่งเล็กน้อยตามจังหวะการเดิน”

หรือ

“ผู้หญิงค่อย ๆ ยกแก้วกาแฟขึ้นจิบ แล้วมองออกไปนอกหน้าต่าง”

Google แนะนำให้ระบุว่า Character หรือ Object กำลังทำอะไรและมีปฏิสัมพันธ์กันอย่างไร

③ 🌍 Location — ฉากอยู่ที่ไหน

ตัวอย่าง

ถนนโตเกียวตอนกลางคืน
สำนักงาน Modern Minimal
ชายหาดช่วง Golden Hour
Data Center
ร้านกาแฟ
ภูเขา
ตลาดกลางคืน

Location ช่วย Gemini กำหนด

Environment
Background
Lighting
Mood
Object รอบข้าง

ได้

④ 📷 Shot — เลือกระยะภาพ

คำที่ใช้บ่อย ได้แก่

Extreme Close-up

Close-up

Medium Shot

Full Shot

Wide Shot

Extreme Wide Shot

ตัวอย่าง

“ใช้ Close-up Shot ของ Barista กำลังเท Latte Art”

หรือ

“ใช้ Wide Shot แสดงรถกำลังวิ่งผ่านเมืองและเห็นตึกสองฝั่งถนน”

Shot ที่ต่างกันทำให้อารมณ์ของ Video ต่างกันมาก

⑤ 🎥 Camera Movement — สำคัญมาก

Google DeepMind แนะนำให้กำหนดทั้ง Framing และ Camera Motion เพราะเป็นส่วนสำคัญของ Video Prompt

คำที่ใช้บ่อย เช่น

Tracking Shot
Dolly In
Dolly Out
Push In
Pan Left
Pan Right
Tilt Up
Tilt Down
Orbit Shot
Drone Shot
Handheld
Static
Locked-off

🎯 ตัวอย่าง Tracking Shot

“Tracking Shot ตามรถจากด้านหลัง กล้องเคลื่อนด้วยความเร็วเท่ากับรถ”

เหมาะกับ

รถ
คนเดิน
สัตว์วิ่ง

🔍 ตัวอย่าง Dolly In

“Slow Dolly In เข้าหาขวดน้ำหอมบนแท่นสีดำ”

เหมาะกับ Product Reveal

🌀 ตัวอย่าง Orbit Shot

“กล้อง Orbit รอบนาฬิกา 180 องศาอย่างช้า ๆ”

เหมาะกับ

สินค้า
รถ
วัตถุ 3D

🚁 ตัวอย่าง Drone Shot

“Drone Shot บินเหนือภูเขาและทะเลหมอก แล้วค่อย ๆ เคลื่อนเข้าไปยังหมู่บ้าน”

เหมาะกับ

Travel
Landscape
Establishing Shot

🎬 ถ้าต้องการ One Take ต้องเขียนอย่างไร

Google DeepMind แนะนำคำว่า

one continuous shot

หรือ

oner

เมื่ออยากได้วิดีโอที่ไม่ตัด Scene

ตัวอย่าง

“สร้างเป็น one continuous shot กล้องเดินตามผู้ชายจากหน้าร้านกาแฟเข้าไปจนถึงโต๊ะด้านใน ไม่มีการตัด”

⑥ 💡 Lighting — บอกแสงให้ชัด

Lighting ช่วยกำหนด Mood ของวิดีโอ

คำที่ใช้บ่อย

Golden Hour
Soft Natural Light
Studio Light
Neon Light
Moonlight
Window Light
Rim Light
Candlelight
Dramatic Lighting

ตัวอย่าง

“ใช้ Golden Hour Light จากด้านหลัง ทำให้เกิด Soft Rim Light รอบเส้นผม”

หรือ

“ใช้ Blue และ Pink Neon Light สะท้อนบนถนนเปียก”

Google DeepMind แนะนำให้บอกทั้งแหล่งกำเนิดแสงและ Effect ของแสงต่อ Scene

⑦ 🎨 Style — วิดีโอควรหน้าตาแบบไหน

ตัวอย่าง

Photorealistic
Cinematic
Documentary
Anime
3D Animation
Claymation
Watercolor
Vintage Film
Smartphone Video
Webcam Style

Prompt เช่น

“Photorealistic Cinematic”

จะให้ทิศทางต่างจาก

“Anime Animation”

อย่างมาก

⚠️ อย่าใส่ Style ที่ขัดกันมากเกินไป

เช่น

“Photorealistic Flat Cartoon Watercolor Claymation”

หากไม่มีเหตุผลชัด อาจทำให้ผลลัพธ์ไม่ตรง Intent

เลือก Visual Language หลักก่อน

⑧ 🔊 Audio — Gemini สร้างเสียงพร้อมวิดีโอได้

Google Help ปัจจุบันระบุว่าสามารถขอให้ Gemini สร้าง Audio พร้อมกับ Video ได้

จึงสามารถใส่ใน Prompt เช่น

เสียงฝน
เสียงรถ
เสียงคนเดิน
เสียงลม
เสียงร้านกาแฟ
Ambient Sound
Dialogue
Music Mood

🌧️ ตัวอย่าง Prompt เสียง

“พร้อมเสียงฝนตกเบา ๆ เสียงรถวิ่งบนถนนเปียก และ Ambient City Sound ไม่มีเพลง”

หรือ

“มีเสียงเครื่องยนต์สปอร์ตสมจริงและ Tunnel Reverb”

🗣️ สร้างเสียงพูดได้ไหม

สามารถขอ Audio ร่วมกับ Video ได้ และหากต้องการ Dialogue ควรเขียนข้อความที่ต้องการให้ชัด

ตัวอย่าง

“ผู้หญิงพูดภาษาไทยด้วยน้ำเสียงเป็นมิตรว่า ‘ยินดีต้อนรับค่ะ’ จากนั้นยิ้มให้กล้อง”

หลังสร้างควรตรวจ

ข้อความ
เสียง
Lip Sync
จังหวะ

อีกครั้ง

⑨ 🚫 Restrictions — บอกสิ่งที่ไม่ต้องการ

ตัวอย่าง

ไม่มีข้อความ
ไม่มี Logo
ไม่มีคนอื่น
ไม่มีเพลง
ไม่มี Subtitle
ห้ามเปลี่ยน Style
ห้ามตัด Scene

ตัวอย่าง Prompt

“ไม่มีข้อความ ไม่มี Logo ไม่มี Subtitle และไม่มีคนอื่นใน Scene”

รายละเอียดเหล่านี้ช่วยลดสิ่งที่ AI เพิ่มขึ้นเอง

🔥 ตัวอย่าง Prompt Text-to-Video แบบเต็ม

“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ต Coupe สีดำด้านกำลังวิ่งบนถนนโตเกียวตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot จากด้านหลัง กล้องเคลื่อนตามรถอย่างนุ่มนวล มี Blue และ Pink Neon Reflection บนถนน พร้อมเสียงเครื่องยนต์สมจริง เสียงยางสัมผัสถนนเปียก และเสียงฝนเบา ๆ ไม่มีเพลง ไม่มีข้อความ ไม่มี Logo และไม่มีรถคันอื่นบดบังตัวรถหลัก”

Prompt นี้กำหนดครบทั้ง

Subject
Action
Location
Camera
Movement
Lighting
Style
Audio
Restrictions

📱 Prompt สำหรับ TikTok, Reels และ Shorts

“สร้างวิดีโอแนวตั้ง 9:16 ของผู้หญิงกำลังเดินบนถนนในเมืองช่วง Golden Hour ใช้ Full-body Tracking Shot จากด้านหน้า Camera Movement Smooth มี Warm Cinematic Color Grade และ Ambient City Sound เว้นพื้นที่ด้านบนสำหรับ Caption และไม่มีข้อความในภาพ”

Google ระบุว่า Gemini Omni มี Aspect Ratio Control และสำหรับ Text Prompt ค่าเริ่มต้นคือ Landscape ดังนั้นหากต้องการรูปแบบเฉพาะควรเลือก Ratio ให้เหมาะกับงาน

▶️ Prompt สำหรับ YouTube

“สร้างวิดีโอ 16:9 Cinematic B-roll ของ Data Center สมัยใหม่ กล้อง Slow Dolly Forward ผ่านทางเดินที่มี Server Rack ทั้งสองด้าน มี Cool Blue Lighting และ Server Ambient Sound ไม่มีคน ไม่มีข้อความ ไม่มี Logo”

เหมาะกับ

YouTube
เว็บไซต์
Presentation
บทความเทคโนโลยี

🛍️ Prompt วิดีโอสินค้าโดยไม่ใช้ Reference

หากไม่มีรูปสินค้าจริงและต้องการ Concept

“สร้างวิดีโอ Product Commercial ของขวดน้ำหอมแก้วสีดำทรง Minimal วางบนแท่นหินสีดำ กล้อง Slow Orbit รอบสินค้า 180 องศา มี Golden Rim Light และ Realistic Reflection พร้อมเสียง Ambient Luxury เบา ๆ ไม่มี Logo ไม่มีข้อความ”

แต่ถ้าเป็น สินค้าจริง และรายละเอียดต้องตรงของจริง การใช้ Image Reference จะเหมาะกว่า Text-to-Video ล้วน

☕ Prompt ร้านกาแฟ

“สร้างวิดีโอ Cinematic Photorealistic ภายในร้านกาแฟ Modern Minimal ช่วงเช้า เริ่มจาก Wide Shot แล้ว Slow Dolly In ไปยังแก้วกาแฟร้อนบนโต๊ะไม้ มีแสงธรรมชาติจากหน้าต่าง ไอน้ำเคลื่อนไหวอย่างเป็นธรรมชาติ พร้อมเสียงเครื่องชงกาแฟและเสียงร้านเบา ๆ”

🌄 Prompt ท่องเที่ยว

“สร้างวิดีโอ Drone Cinematic บินเหนือภูเขาและทะเลหมอกช่วงพระอาทิตย์ขึ้น กล้องเคลื่อน Forward อย่างช้าและมั่นคง มี Golden Morning Light เมฆเคลื่อนตามธรรมชาติ พร้อมเสียงลมและนกอยู่ไกล ๆ”

🏙️ Prompt เมือง

“สร้างวิดีโอ Cinematic Street Scene ของกรุงเทพฯ ยามค่ำหลังฝนตก กล้องเคลื่อน Forward ช้า ๆ ตามถนน มีแสงร้านค้าและรถสะท้อนบนพื้นเปียก ผู้คนเดินตามธรรมชาติ มี Ambient City Sound ไม่มีข้อความ”

🍔 Prompt อาหาร

“สร้างวิดีโอ Food Commercial แบบ Extreme Close-up ของ Steak ร้อน ๆ ถูกวางลงบนจาน มีไอน้ำและน้ำมันสะท้อนแสง ใช้ Warm Restaurant Lighting กล้อง Slow Push In พร้อมเสียง Sizzle ชัดเจน Background เบลอ ไม่มีข้อความ”

🏠 Prompt อสังหาริมทรัพย์

“สร้างวิดีโอ Cinematic Tour ของห้องนั่งเล่น Modern Luxury เริ่ม Wide Shot จากทางเข้า จากนั้น Slow Dolly Forward ผ่านห้องไปยังหน้าต่างกระจกขนาดใหญ่ มี Soft Afternoon Sunlight ไม่มีคน ไม่มีข้อความ Camera Movement นุ่มนวล”

🤖 Prompt เทคโนโลยี

“สร้างวิดีโอ Cinematic ของห้องควบคุม AI แห่งอนาคต มีจอข้อมูลแบบ Holographic หลายจอ นักวิจัยกำลังทำงานอยู่ กล้อง Dolly Forward ผ่านกลางห้อง ใช้ Blue Ambient Lighting และเสียงอุปกรณ์อิเล็กทรอนิกส์เบา ๆ ไม่มี Logo”

📚 Prompt สำหรับ Explainer Video

“สร้างวิดีโอ Educational Explainer อธิบายแนวคิด Cloud Computing โดยแสดง Laptop ส่งข้อมูลขึ้น Cloud Server แล้วรับข้อมูลกลับมา ใช้ Modern Flat-media Animation, Layout สะอาดและ Movement เข้าใจง่าย ไม่มีข้อมูลตัวเลขที่ไม่ได้ระบุ”

Gemini Omni สามารถใช้ World Knowledge เพื่อช่วยเติมรายละเอียดของ Scene โดย Google DeepMind ระบุว่าไม่จำเป็นต้องอธิบายทุก Frame หาก Intent ชัดเจน

อย่างไรก็ตาม หากเป็นข้อมูลสำคัญควรตรวจ Fact ก่อนเผยแพร่

🧠 ต้องเขียน Prompt ละเอียดทุก Frame ไหม

ไม่จำเป็น

Google DeepMind อธิบายว่า Gemini Omni ใช้ World Understanding และ Reasoning จึงสามารถเข้าใจ Intent ที่ซับซ้อนโดยไม่จำเป็นต้อง Micromanage ทุก Frame เหมือน Workflow Video Generation บางรุ่นก่อนหน้า

แนวทางที่ดีกว่าคือ

ละเอียดเฉพาะสิ่งที่สำคัญกับคุณ

เช่น

Camera
Character
Lighting
Action
Audio

แล้วปล่อยรายละเอียดเล็กน้อยให้โมเดลจัดการ

⚖️ Prompt ยิ่งยาวยิ่งดีไหม

ไม่เสมอ

Prompt ยาวแต่ขัดกันเองอาจทำให้ผลแย่ลง

ตัวอย่าง

“กลางวันแต่ต้องมืดสนิท มีแสงแดดแรงแต่ไม่มีแสง”

มี Requirement ขัดกัน

Prompt ที่ดีควร

ชัด
สอดคล้อง
มี Visual Direction
ไม่มีเงื่อนไขเกินจำเป็น

🏆 Prompt สั้นที่ดี

“Cinematic close-up ของ Barista กำลังเท Latte Art ใช้ Soft Morning Window Light กล้อง Slow Push In มีเสียงร้านกาแฟ ไม่มีเพลง”

สั้นแต่กำหนด

Subject
Action
Shot
Lighting
Camera
Audio

ครบ

📐 วิดีโอจาก Text เป็นแนวนอนหรือแนวตั้ง

Google ระบุว่า Text Prompt มี Landscape เป็นค่าเริ่มต้น และ Gemini Omni รองรับ Aspect Ratio Control ก่อนสร้างวิดีโอ

ดังนั้นถ้าจะทำ

YouTube → ใช้ Landscape

Reels/TikTok/Shorts → เลือก Vertical

Social Ads → เลือก Ratio ให้ตรง Platform

อย่ารอ Crop ทีหลังถ้าสามารถกำหนด Ratio ตั้งแต่ต้นได้

🎯 ทำไมควรเลือก Aspect Ratio ก่อนสร้าง

เพราะ Composition ต่างกัน

วิดีโอ 16:9 สามารถวางคนไว้ด้านข้างและมีพื้นที่ Environment มาก

แต่ 9:16 มีพื้นที่แนวนอนน้อยกว่า

ถ้าสร้าง 16:9 ก่อนแล้ว Crop เป็น 9:16

อาจตัด

ตัวละคร
สินค้า
ข้อความ
Background สำคัญ

ออก

🔄 ถ้าวิดีโอแรกไม่ตรงต้อง Generate ใหม่ไหม

ไม่จำเป็น

Gemini Omni รองรับ Multi-turn Editing

หลังสร้างแล้วสามารถพิมพ์ต่อว่า

“รักษาทุกอย่างเดิม เปลี่ยนเฉพาะกล้องให้ช้าลง”

“เปลี่ยนฉากเป็นกลางคืน”

“ลบคนด้านหลัง”

“เปลี่ยน Camera Angle”

Google ระบุว่าหลังสร้างสามารถแก้ Object, Character, Camera Angle และ Scene ด้วย Prompt ได้

🎯 สูตรแก้ Video

ใช้

Preserve + Change Only

ตัวอย่าง

“รักษาตัวละคร Scene, Camera Angle, Lighting และ Audio เดิมทั้งหมด เปลี่ยนเฉพาะความเร็วของ Camera Movement ให้ช้าลง”

นี่ดีกว่า Generate ใหม่ทั้งหมด เพราะส่วนที่ถูกอยู่แล้วมีโอกาสถูกเก็บไว้

🔁 Iterative Editing คืออะไร

คือการทำงานแบบ

Version 1 → ตรวจ

Version 2 → แก้กล้อง

Version 3 → แก้แสง

Version 4 → แก้เสียง

แทนการสั่งทุกอย่างใหม่ในครั้งเดียว

Google DeepMind ระบุว่า Gemini Omni ถูกออกแบบให้ Edit ผ่าน Natural Conversation และสามารถรักษาสิ่งที่ทำถูกไว้ระหว่างการปรับหลายรอบ

📷 ถ้ากล้องผิด แก้ยังไง

ตัวอย่าง

“รักษา Scene, Character, Action และ Audio เดิม เปลี่ยน Camera Angle เป็น Low Angle และใช้ Slow Tracking Shot จากด้านหน้า”

หรือ

“เปลี่ยน Close-up เป็น Medium Shot แต่รักษาทุกอย่างอื่นไว้เหมือนเดิม”

🐢 ถ้ากล้องเร็วเกินไป

ใช้

“รักษาวิดีโอเดิมทั้งหมด ลด Camera Movement ให้ช้าลงประมาณครึ่งหนึ่ง และทำ Movement ให้ Smooth มากขึ้น”

ไม่จำเป็นต้อง Prompt Video ใหม่ทั้ง Clip

🌞 ถ้าแสงไม่ตรง

ใช้

“รักษา Character, Action, Camera และ Environment เดิม เปลี่ยนเฉพาะ Lighting เป็น Golden Hour จากด้านหลัง”

🌙 เปลี่ยนกลางวันเป็นกลางคืน

“รักษาตัวละคร Scene และ Camera Movement เดิม เปลี่ยนเฉพาะเวลาเป็นกลางคืน เพิ่ม Moonlight และไฟจากอาคารอย่างสมจริง”

🔊 ถ้าเสียงไม่ดี

“รักษาภาพเดิมทั้งหมด ลดเสียงเพลงลง และเพิ่มเสียงฝนกับ Ambient Street Sound ให้เด่นขึ้น”

Google Help ยืนยันว่าสามารถขอ Audio ร่วมกับ Generated Video ได้

🚫 Text-to-Video ไม่ควรใช้ทำอะไรแบบมั่ว ๆ

หลีกเลี่ยงการให้ AI ตัดสินรายละเอียดที่ต้องตรงกับของจริงทั้งหมดโดยไม่มี Reference

เช่น

Logo สินค้าจริง
Packaging จริง
ใบหน้าบุคคลเฉพาะ
สถานที่ที่ต้องตรงทุกจุด
ข้อมูล Infographic ที่ต้องถูกต้อง

Text-to-Video เหมาะมากกับ

Concept
B-roll
Storytelling
Creative Scene
Atmosphere
Advertising Concept
Explainer

แต่เมื่อ Identity หรือรายละเอียดจริงสำคัญ ควรใช้ Reference

🎯 Text-to-Video กับ Image-to-Video เลือกอะไร

เลือก Text-to-Video เมื่อ

ไม่มีภาพต้นฉบับ
ต้องการ Concept ใหม่
ต้องการ Scene ใหม่ทั้งหมด
ต้องการให้ AI มีอิสระมาก

เลือก Image-to-Video เมื่อ

ต้องการคนเดิม
สินค้าเดิม
Character เดิม
Composition ตั้งต้น
Brand Asset

Text-to-Video ให้อิสระมากกว่า แต่ Reference ให้ Control มากกว่า

🧬 วิดีโอจาก Gemini มีเครื่องหมาย AI หรือไม่

Google ใช้ระบบ SynthID กับ AI-generated Media ของตน และ Gemini Omni อยู่ในระบบความโปร่งใสของ Content ที่สร้างด้วย Google AI

อย่างไรก็ตาม SynthID เป็น Digital Watermark ที่ไม่ได้หมายความว่าจะเห็น Logo ใหญ่บน Video ด้วยตาเปล่า

ก่อนเผยแพร่ Video AI ควรพิจารณาเรื่อง Transparency ตามบริบทของงาน

⚖️ ใช้ Text-to-Video เชิงพาณิชย์ได้ไหม

ใช้กับงานธุรกิจได้หลายรูปแบบภายใต้ข้อกำหนดและสิทธิที่เกี่ยวข้อง แต่การสร้างด้วย AI ไม่ได้ทำให้สิทธิของบุคคลอื่นหายไป

Google ระบุว่าผู้ใช้ Gemini ต้องปฏิบัติตาม Terms of Service และ Prohibited Use Policy รวมถึงไม่ละเมิด Copyright หรือ Privacy Rights ของผู้อื่น

ควรตรวจโดยเฉพาะ

เพลง
Logo
Trademark
บุคคล
Character
Brand

ก่อนนำ Output ไปใช้เชิงพาณิชย์

🚫 ทำไม Gemini ไม่สร้าง Video บาง Prompt

Gemini Apps อาจไม่สร้างหรือลบวิดีโอเมื่อระบบตรวจพบความเป็นไปได้ว่าขัดกับ Terms หรือ Prohibited Use Policy

ถ้า Prompt ทั่วไปสร้างได้ แต่ Prompt หนึ่งถูกปฏิเสธ

ควรตรวจเนื้อหาของ Prompt

ไม่ควรพยายามเปลี่ยนคำเพื่อหลบระบบ

⏳ Text-to-Video ใช้เวลานานไหม

Google ระบุว่าการสร้าง Video อาจใช้ หลายนาที และผู้ใช้ไม่สามารถโต้ตอบกับ Chat เดิมระหว่าง Generation แต่สามารถเปิด Chat ใหม่ใช้งานต่อได้

ดังนั้น Video Generation ใช้เวลามากกว่าการตอบข้อความทั่วไปเป็นเรื่องปกติ

หากค้างผิดปกติจึงค่อยตรวจ

Network
App
Browser
Quota
Prompt Complexity

💡 สามารถให้ Gemini ช่วยเขียน Prompt ก่อนสร้างได้

Google Help ระบุว่าผู้ใช้สามารถ Brainstorm และ Refine Video Prompt ใน Chat หลักของ Gemini ก่อนเริ่ม Generate ได้

ตัวอย่าง

“ช่วยปรับ Prompt นี้ให้เป็น Cinematic Video Prompt โดยเพิ่ม Camera Movement, Lighting และ Audio”

จากนั้นตรวจ Prompt ที่ Gemini เสนอ

แก้ให้ตรง Intent

แล้วค่อย Generate

🔥 Prompt Template สำหรับ Copy ไปใช้

Template พื้นฐาน

“สร้างวิดีโอ [STYLE] ของ [SUBJECT] กำลัง [ACTION] ที่ [LOCATION] ใช้ [SHOT] และ [CAMERA MOVEMENT] มี [LIGHTING] พร้อม [AUDIO] ไม่มี [RESTRICTIONS]”

Template Cinematic

“สร้างวิดีโอ Cinematic Photorealistic ของ [SUBJECT] กำลัง [ACTION] ที่ [LOCATION] ใช้ [CAMERA ANGLE] และ [CAMERA MOVEMENT] อย่างนุ่มนวล มี [LIGHTING] และ [COLOR MOOD] พร้อมเสียง [AUDIO] ไม่มีข้อความ ไม่มี Logo”

Template Social Media

“สร้างวิดีโอแนวตั้ง 9:16 สำหรับ Short-form Content มี [SUBJECT] กำลัง [ACTION] ที่ [LOCATION] ใช้ [CAMERA MOVEMENT] วาง Subject ให้อยู่ใน Safe Area ใช้ [LIGHTING] และ [STYLE] ไม่มีข้อความ”

📋 Checklist ก่อนกด Generate

ตรวจว่ามีหรือยัง

① Subject

ใครหรืออะไร

② Action

กำลังทำอะไร

③ Location

เกิดที่ไหน

④ Shot

ใกล้หรือไกล

⑤ Camera Angle

มุมไหน

⑥ Camera Movement

เคลื่อนแบบไหน

⑦ Lighting

แสงแบบไหน

⑧ Style

ภาพลักษณ์แบบไหน

⑨ Audio

มีเสียงอะไร

⑩ Restrictions

อะไรที่ไม่ต้องการ

ไม่จำเป็นต้องมีครบทุกข้อในทุก Prompt แต่ยิ่ง Requirement สำคัญ ควรยิ่งระบุชัด

🔍 Checklist หลัง Generate

ตรวจ

Movement
Camera
ใบหน้า
มือ
Physics
Lighting
Text
Audio
Lip Sync
Continuity
Object Shape
Logo

หากผิด 1–2 จุด ให้ Edit เฉพาะจุดแทน Generate ใหม่ทั้งหมด

❌ ตัวอย่าง Prompt ที่ไม่ดี

“สร้างรถเท่ ๆ วิ่งเร็ว ๆ”

ปัญหาคือไม่บอก

รถแบบไหน
สีอะไร
สถานที่
เวลา
Camera
Style
Audio

✅ Prompt ที่ดีกว่า

“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ต Coupe สีดำด้าน วิ่งบนถนนในเมืองตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot กล้องตามรถจากด้านหลัง มี Blue Neon Reflection บนถนน พร้อมเสียงเครื่องยนต์และเสียงยาง ไม่มีข้อความหรือ Logo”

❌ Prompt ร้านกาแฟที่กว้างเกินไป

“ทำคลิปร้านกาแฟสวย ๆ”

✅ Prompt ที่ชัดกว่า

“สร้างวิดีโอ Cinematic ของร้านกาแฟ Modern Minimal ช่วงเช้า เริ่ม Wide Shot แล้ว Slow Dolly In ไปยัง Barista ที่กำลังเท Latte Art มี Soft Window Light และ Ambient Café Sound ไม่มีข้อความ”

🥇 Workflow Text-to-Video ที่แนะนำ

① เขียน Concept 1 ประโยค

รู้ก่อนว่าอยากสื่ออะไร

② กำหนด Subject และ Action

③ เลือก Location

④ เลือก Camera

⑤ เลือก Lighting และ Style

⑥ เพิ่ม Audio

⑦ เลือก Aspect Ratio

⑧ Generate

⑨ ตรวจ Output

⑩ Edit ผ่าน Conversation

นี่มีประสิทธิภาพกว่าการพยายามเขียน Prompt ยาวสมบูรณ์แบบครั้งเดียว

❓ คำถามที่พบบ่อยเกี่ยวกับการสร้างวิดีโอจากข้อความด้วย Gemini

① Gemini สร้างวิดีโอจากข้อความได้ไหม

ได้ Gemini Apps ปัจจุบันใช้ Gemini Omni สำหรับ Video Generation และสามารถพิมพ์ Prompt เพื่อสร้าง Video ใหม่ได้โดยตรง

② วิธีสร้าง Text-to-Video ใน Gemini ทำอย่างไร

เปิด Gemini → Sidebar → Create video → พิมพ์ Prompt → Submit โดยไม่ต้อง Upload Image หรือ Video หากต้องการสร้างจากข้อความล้วน

③ Gemini ใช้โมเดลอะไรสร้าง Text-to-Video

Gemini Apps ปัจจุบันใช้ Gemini Omni ซึ่ง Google DeepMind ระบุว่ารองรับ Text-to-Video รวมถึง Image-to-Video, Reference-to-Video และ Video Editing

④ Prompt ควรเขียนอะไรบ้าง

ควรพิจารณา Subject, Action, Shot, Camera Motion, Lighting, Location และ Style ตามแนวทาง Prompt Guide ของ Google DeepMind

⑤ สร้างวิดีโอพร้อมเสียงได้ไหม

ได้ Google Help ระบุว่าสามารถขอให้ Gemini Generate Audio พร้อม Video ได้

⑥ Text Prompt ได้วิดีโอแนวนอนหรือแนวตั้ง

ค่าเริ่มต้นของ Text Prompt เป็น Landscape และ Gemini Omni มี Aspect Ratio Control ให้เลือกก่อนสร้าง

⑦ สร้างแล้วแก้ต่อได้ไหม

ได้ สามารถ Remove/Replace Objects หรือ Characters, เปลี่ยน Camera Angle และแก้ Scene ด้วย Prompt เพิ่มเติม

⑧ Gemini Video ใช้ฟรีไหม

สำหรับ Personal Account ใน Gemini Apps ปัจจุบัน Google ระบุว่าต้องมี Google AI Plan ส่วน Work/School ต้องมี Workspace License ที่เข้าเกณฑ์

⑨ อายุเท่าไรถึงใช้ Video Generation ได้

ปัจจุบัน Google ระบุว่า Feature นี้ยังไม่พร้อมสำหรับผู้ใช้อายุต่ำกว่า 18 ปี

⑩ สร้างวิดีโอใช้เวลานานไหม

Google ระบุว่าอาจใช้เวลาหลายนาทีในการ Generate

⑪ ดาวน์โหลดวิดีโออย่างไร

ใต้ Video เลือก Share แล้วเลือก Download video หรือ Share on YouTube ใน Workflow ที่รองรับ

⑫ Text-to-Video หรือ Image-to-Video ดีกว่า

ไม่มีตัวไหนดีกว่าทุกกรณี Text-to-Video เหมาะกับการสร้าง Scene ใหม่จากศูนย์ ส่วน Image-to-Video เหมาะเมื่อมีคน สินค้า Character หรือ Composition ที่ต้องการใช้เป็น Reference

✅ สรุป วิธีสร้างวิดีโอจากข้อความด้วย Gemini

การสร้างวิดีโอจากข้อความด้วย Gemini ปัจจุบันทำได้โดยใช้ Gemini Omni เพียงเปิด

Gemini → Create video → พิมพ์ Prompt → Submit

โดยไม่จำเป็นต้องมีรูปหรือ Video ต้นฉบับ

หัวใจของการทำ Text-to-Video ให้ได้ผลดีคืออย่าพิมพ์เพียงว่า

“สร้างวิดีโอสวย ๆ”

แต่ควรระบุสิ่งที่สำคัญต่อ Scene ให้ชัด

สูตรที่แนะนำคือ

Subject + Action + Location + Camera + Movement + Lighting + Style + Audio + Restrictions

ตัวอย่าง

“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ตสีดำวิ่งผ่านโตเกียวตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot กล้องตามรถอย่างนุ่มนวล มี Blue และ Pink Neon Reflection พร้อมเสียงเครื่องยนต์และเสียงฝน ไม่มีข้อความ ไม่มี Logo”

Google DeepMind ระบุว่าการเพิ่มรายละเอียดด้าน Shot Framing, Motion, Style, Lighting, Location และ Action ช่วยเพิ่มการควบคุม Final Output แต่ Gemini Omni ก็มี World Understanding เพียงพอที่ไม่จำเป็นต้องอธิบายทุก Frame อย่างละเอียด

หลังได้วิดีโอแรกแล้ว หากบางส่วนยังไม่ตรงใจ ไม่จำเป็นต้อง Generate ใหม่ทั้งหมด

สามารถพิมพ์ต่อว่า

“รักษาทุกอย่างเดิม เปลี่ยนเฉพาะ Camera Angle”

หรือ

“ลดความเร็วของกล้อง”

หรือ

“เปลี่ยน Background เป็นกลางคืน”

เพราะ Gemini Omni รองรับ Multi-turn Editing และการแก้ Video ผ่าน Natural Conversation

ดังนั้น Workflow ที่เหมาะที่สุดคือ

① สร้าง Concept

② เขียน Prompt

③ เลือก Aspect Ratio

④ Generate

⑤ ตรวจ Video

⑥ ระบุจุดที่ผิด

⑦ Edit เฉพาะจุด

⑧ ตรวจ Final

เมื่อใช้วิธีนี้ Text-to-Video ใน Gemini จะไม่ใช่การสุ่มสร้างคลิปหลายครั้งเพื่อหวังว่าจะเจอภาพที่ต้องการ แต่จะกลายเป็นกระบวนการสร้างวิดีโอแบบเป็นขั้นตอนที่สามารถควบคุม Camera, Movement, Lighting, Style และ Audio ผ่านคำสั่งธรรมชาติได้