Contact
Line : comsiam
Contact
Line : comsiam

การสร้างวิดีโอจากข้อความด้วย Google Gemini หรือ Text-to-Video คือการพิมพ์คำอธิบายสิ่งที่ต้องการเห็นลงไป แล้วให้ AI สร้างวิดีโอขึ้นมาใหม่โดยไม่จำเป็นต้องมีรูปหรือคลิปต้นฉบับ
ปัจจุบัน Gemini Apps ใช้ Gemini Omni เป็นโมเดลสร้างวิดีโอ AI รุ่นล่าสุดของ Google โดยผู้ใช้สามารถเปิดเมนู Create video แล้วพิมพ์ Prompt เพื่อสร้างวิดีโอได้โดยตรง นอกจากนี้ยังรองรับการแก้ไขวิดีโอต่อเนื่องด้วยการสนทนา การควบคุม Aspect Ratio และการสร้างเสียงพร้อมกับวิดีโอด้วย
วิธีพื้นฐานที่สุดคือ
Gemini → Create video → พิมพ์ Prompt → Submit
ตัวอย่าง Prompt:
“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ตสีดำวิ่งบนถนนโตเกียวตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot มีแสง Neon สะท้อนบนถนน พร้อมเสียงเครื่องยนต์และเสียงฝน ไม่มีข้อความหรือ Logo”
เพียงเท่านี้ Gemini จะตีความ
ตัวแบบ
การเคลื่อนไหว
สถานที่
มุมกล้อง
แสง
Style
เสียง
แล้วสร้างเป็นวิดีโอให้
Text-to-Video คือเทคโนโลยีที่เปลี่ยน
ข้อความ → วิดีโอ
ตัวอย่างเช่นคุณพิมพ์ว่า
“แมวสีส้มวิ่งบนชายหาดช่วงพระอาทิตย์ตก”
AI จะต้องสร้างขึ้นใหม่ทั้ง
แมว
ชายหาด
ท้องฟ้า
การวิ่ง
กล้อง
แสง
เงา
การเคลื่อนไหว
โดยไม่จำเป็นต้องมีภาพต้นฉบับ
ต่างจาก Image-to-Video ที่เริ่มต้นจากรูปภาพที่ผู้ใช้อัปโหลด
ใน Gemini Apps ปัจจุบัน Google ระบุว่าใช้ Gemini Omni ซึ่งเป็น Advanced Video Generator รุ่นล่าสุดของ Gemini
Google DeepMind ระบุว่า Gemini Omni ทำผลงานได้ทั้ง
Text-to-Video
Image-to-Video
Reference-to-Video
Video Editing
และสามารถแก้ไขงานผ่านการสนทนาต่อเนื่องได้
ดังนั้น Gemini ไม่ได้เป็นเพียงเครื่องมือที่รับ Prompt แล้วสร้างคลิปครั้งเดียว แต่สามารถใช้เป็น Workflow แบบ
สร้าง → ดู → แก้ → ดู → แก้อีกครั้ง
ได้
Google ระบุขั้นตอนปัจจุบันดังนี้
เข้าสู่ Gemini ด้วย Google Account ที่มีสิทธิใช้ Video Generation
กดเมนูด้านซ้าย
เข้าสู่พื้นที่สร้างวิดีโอ
ขั้นตอนนี้ไม่บังคับ
หากต้องการสร้างจาก Prompt ทั้งหมดสามารถข้ามได้
เช่น
“สร้างวิดีโอ Drone Shot บินเหนือภูเขาและทะเลหมอกช่วงพระอาทิตย์ขึ้น ใช้ Golden Morning Light และเสียงลมธรรมชาติ”
Gemini จะเริ่ม Generate Video
Google ระบุว่าการสร้างอาจใช้เวลาหลายนาที และระหว่างประมวลผล Chat เดิมจะไม่สามารถโต้ตอบได้ แต่ผู้ใช้สามารถเปิด Chat ใหม่และกลับมาดูงานภายหลังได้
บน Android สามารถเปิด
Gemini App
หรือ
Gemini Web
จากนั้น
Menu → Videos → ใส่ Prompt → Submit
Google ระบุขั้นตอนนี้โดยตรงใน Gemini Apps Help สำหรับ Android
Interface อาจมีการปรับตำแหน่งตาม Version ของแอป แต่หลักการคือเข้า Video Creation แล้วพิมพ์ Prompt ที่ต้องการ
สำหรับ Personal Google Account ปัจจุบัน Google ระบุว่าต้องมี Google AI Plan จึงจะใช้ Video Generation ใน Gemini Apps ได้
ส่วนบัญชี Work หรือ School ต้องมี Workspace License ที่เข้าเกณฑ์ และฟีเจอร์นี้ยังไม่เปิดให้ผู้ใช้อายุต่ำกว่า 18 ปี
ดังนั้นหากหาเมนู Create video ไม่เจอ ควรตรวจ
บัญชีที่ Login
Google AI Plan
Workspace License
อายุบัญชี
ก่อน
เริ่มจาก 5 อย่างก่อน
ใคร + ทำอะไร + ที่ไหน + กล้องแบบไหน + Style แบบไหน
ตัวอย่าง
“ผู้หญิงกำลังเดินในโตเกียวตอนกลางคืน กล้อง Tracking จากด้านหน้า สไตล์ Cinematic Photorealistic”
จากนั้นค่อยเพิ่ม
Lighting
เสียง
สี
Movement
ข้อห้าม
เมื่อเข้าใจพื้นฐานแล้ว
สูตรที่ใช้ได้กับงานส่วนใหญ่คือ
Subject + Action + Location + Camera + Movement + Lighting + Style + Audio + Restrictions
หรือจำแบบไทยง่าย ๆ ว่า
ใคร + ทำอะไร + ที่ไหน + กล้อง + เคลื่อนยังไง + แสง + Style + เสียง + ห้ามอะไร
Google DeepMind แนะนำให้ Prompt ระบุองค์ประกอบอย่าง Shot Framing, Motion, Style, Lighting, Location และ Action เพื่อเพิ่มการควบคุมผลลัพธ์
ตัวอย่างไม่ชัด
“สร้างคนเดิน”
ตัวอย่างชัดกว่า
“สร้างผู้ชายวัยประมาณ 30 ปี ใส่สูทสีกรมท่าและเสื้อเชิ้ตสีขาว เดินอยู่ในสำนักงานสมัยใหม่”
AI จึงไม่ต้องเดาว่า
เพศ
อายุ
เสื้อผ้า
ลักษณะ
ควรเป็นอย่างไร
Video แตกต่างจากภาพนิ่งเพราะต้องมีการเคลื่อนไหว
อย่าบอกเพียง
“ผู้ชายอยู่ในสำนักงาน”
ถ้าต้องการ Movement ให้เขียน
“ผู้ชายเดินเข้าหากล้องด้วยความเร็วธรรมชาติ แขนแกว่งเล็กน้อยตามจังหวะการเดิน”
หรือ
“ผู้หญิงค่อย ๆ ยกแก้วกาแฟขึ้นจิบ แล้วมองออกไปนอกหน้าต่าง”
Google แนะนำให้ระบุว่า Character หรือ Object กำลังทำอะไรและมีปฏิสัมพันธ์กันอย่างไร
ตัวอย่าง
ถนนโตเกียวตอนกลางคืน
สำนักงาน Modern Minimal
ชายหาดช่วง Golden Hour
Data Center
ร้านกาแฟ
ภูเขา
ตลาดกลางคืน
Location ช่วย Gemini กำหนด
Environment
Background
Lighting
Mood
Object รอบข้าง
ได้
คำที่ใช้บ่อย ได้แก่
Extreme Close-up
Close-up
Medium Shot
Full Shot
Wide Shot
Extreme Wide Shot
ตัวอย่าง
“ใช้ Close-up Shot ของ Barista กำลังเท Latte Art”
หรือ
“ใช้ Wide Shot แสดงรถกำลังวิ่งผ่านเมืองและเห็นตึกสองฝั่งถนน”
Shot ที่ต่างกันทำให้อารมณ์ของ Video ต่างกันมาก
Google DeepMind แนะนำให้กำหนดทั้ง Framing และ Camera Motion เพราะเป็นส่วนสำคัญของ Video Prompt
คำที่ใช้บ่อย เช่น
Tracking Shot
Dolly In
Dolly Out
Push In
Pan Left
Pan Right
Tilt Up
Tilt Down
Orbit Shot
Drone Shot
Handheld
Static
Locked-off
“Tracking Shot ตามรถจากด้านหลัง กล้องเคลื่อนด้วยความเร็วเท่ากับรถ”
เหมาะกับ
รถ
คนเดิน
สัตว์วิ่ง
“Slow Dolly In เข้าหาขวดน้ำหอมบนแท่นสีดำ”
เหมาะกับ Product Reveal
“กล้อง Orbit รอบนาฬิกา 180 องศาอย่างช้า ๆ”
เหมาะกับ
สินค้า
รถ
วัตถุ 3D
“Drone Shot บินเหนือภูเขาและทะเลหมอก แล้วค่อย ๆ เคลื่อนเข้าไปยังหมู่บ้าน”
เหมาะกับ
Travel
Landscape
Establishing Shot
Google DeepMind แนะนำคำว่า
one continuous shot
หรือ
oner
เมื่ออยากได้วิดีโอที่ไม่ตัด Scene
ตัวอย่าง
“สร้างเป็น one continuous shot กล้องเดินตามผู้ชายจากหน้าร้านกาแฟเข้าไปจนถึงโต๊ะด้านใน ไม่มีการตัด”
Lighting ช่วยกำหนด Mood ของวิดีโอ
คำที่ใช้บ่อย
Golden Hour
Soft Natural Light
Studio Light
Neon Light
Moonlight
Window Light
Rim Light
Candlelight
Dramatic Lighting
ตัวอย่าง
“ใช้ Golden Hour Light จากด้านหลัง ทำให้เกิด Soft Rim Light รอบเส้นผม”
หรือ
“ใช้ Blue และ Pink Neon Light สะท้อนบนถนนเปียก”
Google DeepMind แนะนำให้บอกทั้งแหล่งกำเนิดแสงและ Effect ของแสงต่อ Scene
ตัวอย่าง
Photorealistic
Cinematic
Documentary
Anime
3D Animation
Claymation
Watercolor
Vintage Film
Smartphone Video
Webcam Style
Prompt เช่น
“Photorealistic Cinematic”
จะให้ทิศทางต่างจาก
“Anime Animation”
อย่างมาก
เช่น
“Photorealistic Flat Cartoon Watercolor Claymation”
หากไม่มีเหตุผลชัด อาจทำให้ผลลัพธ์ไม่ตรง Intent
เลือก Visual Language หลักก่อน
Google Help ปัจจุบันระบุว่าสามารถขอให้ Gemini สร้าง Audio พร้อมกับ Video ได้
จึงสามารถใส่ใน Prompt เช่น
เสียงฝน
เสียงรถ
เสียงคนเดิน
เสียงลม
เสียงร้านกาแฟ
Ambient Sound
Dialogue
Music Mood
“พร้อมเสียงฝนตกเบา ๆ เสียงรถวิ่งบนถนนเปียก และ Ambient City Sound ไม่มีเพลง”
หรือ
“มีเสียงเครื่องยนต์สปอร์ตสมจริงและ Tunnel Reverb”
สามารถขอ Audio ร่วมกับ Video ได้ และหากต้องการ Dialogue ควรเขียนข้อความที่ต้องการให้ชัด
ตัวอย่าง
“ผู้หญิงพูดภาษาไทยด้วยน้ำเสียงเป็นมิตรว่า ‘ยินดีต้อนรับค่ะ’ จากนั้นยิ้มให้กล้อง”
หลังสร้างควรตรวจ
ข้อความ
เสียง
Lip Sync
จังหวะ
อีกครั้ง
ตัวอย่าง
ไม่มีข้อความ
ไม่มี Logo
ไม่มีคนอื่น
ไม่มีเพลง
ไม่มี Subtitle
ห้ามเปลี่ยน Style
ห้ามตัด Scene
ตัวอย่าง Prompt
“ไม่มีข้อความ ไม่มี Logo ไม่มี Subtitle และไม่มีคนอื่นใน Scene”
รายละเอียดเหล่านี้ช่วยลดสิ่งที่ AI เพิ่มขึ้นเอง
“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ต Coupe สีดำด้านกำลังวิ่งบนถนนโตเกียวตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot จากด้านหลัง กล้องเคลื่อนตามรถอย่างนุ่มนวล มี Blue และ Pink Neon Reflection บนถนน พร้อมเสียงเครื่องยนต์สมจริง เสียงยางสัมผัสถนนเปียก และเสียงฝนเบา ๆ ไม่มีเพลง ไม่มีข้อความ ไม่มี Logo และไม่มีรถคันอื่นบดบังตัวรถหลัก”
Prompt นี้กำหนดครบทั้ง
Subject
Action
Location
Camera
Movement
Lighting
Style
Audio
Restrictions
“สร้างวิดีโอแนวตั้ง 9:16 ของผู้หญิงกำลังเดินบนถนนในเมืองช่วง Golden Hour ใช้ Full-body Tracking Shot จากด้านหน้า Camera Movement Smooth มี Warm Cinematic Color Grade และ Ambient City Sound เว้นพื้นที่ด้านบนสำหรับ Caption และไม่มีข้อความในภาพ”
Google ระบุว่า Gemini Omni มี Aspect Ratio Control และสำหรับ Text Prompt ค่าเริ่มต้นคือ Landscape ดังนั้นหากต้องการรูปแบบเฉพาะควรเลือก Ratio ให้เหมาะกับงาน
“สร้างวิดีโอ 16:9 Cinematic B-roll ของ Data Center สมัยใหม่ กล้อง Slow Dolly Forward ผ่านทางเดินที่มี Server Rack ทั้งสองด้าน มี Cool Blue Lighting และ Server Ambient Sound ไม่มีคน ไม่มีข้อความ ไม่มี Logo”
เหมาะกับ
YouTube
เว็บไซต์
Presentation
บทความเทคโนโลยี
หากไม่มีรูปสินค้าจริงและต้องการ Concept
“สร้างวิดีโอ Product Commercial ของขวดน้ำหอมแก้วสีดำทรง Minimal วางบนแท่นหินสีดำ กล้อง Slow Orbit รอบสินค้า 180 องศา มี Golden Rim Light และ Realistic Reflection พร้อมเสียง Ambient Luxury เบา ๆ ไม่มี Logo ไม่มีข้อความ”
แต่ถ้าเป็น สินค้าจริง และรายละเอียดต้องตรงของจริง การใช้ Image Reference จะเหมาะกว่า Text-to-Video ล้วน
“สร้างวิดีโอ Cinematic Photorealistic ภายในร้านกาแฟ Modern Minimal ช่วงเช้า เริ่มจาก Wide Shot แล้ว Slow Dolly In ไปยังแก้วกาแฟร้อนบนโต๊ะไม้ มีแสงธรรมชาติจากหน้าต่าง ไอน้ำเคลื่อนไหวอย่างเป็นธรรมชาติ พร้อมเสียงเครื่องชงกาแฟและเสียงร้านเบา ๆ”
“สร้างวิดีโอ Drone Cinematic บินเหนือภูเขาและทะเลหมอกช่วงพระอาทิตย์ขึ้น กล้องเคลื่อน Forward อย่างช้าและมั่นคง มี Golden Morning Light เมฆเคลื่อนตามธรรมชาติ พร้อมเสียงลมและนกอยู่ไกล ๆ”
“สร้างวิดีโอ Cinematic Street Scene ของกรุงเทพฯ ยามค่ำหลังฝนตก กล้องเคลื่อน Forward ช้า ๆ ตามถนน มีแสงร้านค้าและรถสะท้อนบนพื้นเปียก ผู้คนเดินตามธรรมชาติ มี Ambient City Sound ไม่มีข้อความ”
“สร้างวิดีโอ Food Commercial แบบ Extreme Close-up ของ Steak ร้อน ๆ ถูกวางลงบนจาน มีไอน้ำและน้ำมันสะท้อนแสง ใช้ Warm Restaurant Lighting กล้อง Slow Push In พร้อมเสียง Sizzle ชัดเจน Background เบลอ ไม่มีข้อความ”
“สร้างวิดีโอ Cinematic Tour ของห้องนั่งเล่น Modern Luxury เริ่ม Wide Shot จากทางเข้า จากนั้น Slow Dolly Forward ผ่านห้องไปยังหน้าต่างกระจกขนาดใหญ่ มี Soft Afternoon Sunlight ไม่มีคน ไม่มีข้อความ Camera Movement นุ่มนวล”
“สร้างวิดีโอ Cinematic ของห้องควบคุม AI แห่งอนาคต มีจอข้อมูลแบบ Holographic หลายจอ นักวิจัยกำลังทำงานอยู่ กล้อง Dolly Forward ผ่านกลางห้อง ใช้ Blue Ambient Lighting และเสียงอุปกรณ์อิเล็กทรอนิกส์เบา ๆ ไม่มี Logo”
“สร้างวิดีโอ Educational Explainer อธิบายแนวคิด Cloud Computing โดยแสดง Laptop ส่งข้อมูลขึ้น Cloud Server แล้วรับข้อมูลกลับมา ใช้ Modern Flat-media Animation, Layout สะอาดและ Movement เข้าใจง่าย ไม่มีข้อมูลตัวเลขที่ไม่ได้ระบุ”
Gemini Omni สามารถใช้ World Knowledge เพื่อช่วยเติมรายละเอียดของ Scene โดย Google DeepMind ระบุว่าไม่จำเป็นต้องอธิบายทุก Frame หาก Intent ชัดเจน
อย่างไรก็ตาม หากเป็นข้อมูลสำคัญควรตรวจ Fact ก่อนเผยแพร่
ไม่จำเป็น
Google DeepMind อธิบายว่า Gemini Omni ใช้ World Understanding และ Reasoning จึงสามารถเข้าใจ Intent ที่ซับซ้อนโดยไม่จำเป็นต้อง Micromanage ทุก Frame เหมือน Workflow Video Generation บางรุ่นก่อนหน้า
แนวทางที่ดีกว่าคือ
ละเอียดเฉพาะสิ่งที่สำคัญกับคุณ
เช่น
Camera
Character
Lighting
Action
Audio
แล้วปล่อยรายละเอียดเล็กน้อยให้โมเดลจัดการ
ไม่เสมอ
Prompt ยาวแต่ขัดกันเองอาจทำให้ผลแย่ลง
ตัวอย่าง
“กลางวันแต่ต้องมืดสนิท มีแสงแดดแรงแต่ไม่มีแสง”
มี Requirement ขัดกัน
Prompt ที่ดีควร
ชัด
สอดคล้อง
มี Visual Direction
ไม่มีเงื่อนไขเกินจำเป็น
“Cinematic close-up ของ Barista กำลังเท Latte Art ใช้ Soft Morning Window Light กล้อง Slow Push In มีเสียงร้านกาแฟ ไม่มีเพลง”
สั้นแต่กำหนด
Subject
Action
Shot
Lighting
Camera
Audio
ครบ
Google ระบุว่า Text Prompt มี Landscape เป็นค่าเริ่มต้น และ Gemini Omni รองรับ Aspect Ratio Control ก่อนสร้างวิดีโอ
ดังนั้นถ้าจะทำ
YouTube → ใช้ Landscape
Reels/TikTok/Shorts → เลือก Vertical
Social Ads → เลือก Ratio ให้ตรง Platform
อย่ารอ Crop ทีหลังถ้าสามารถกำหนด Ratio ตั้งแต่ต้นได้
เพราะ Composition ต่างกัน
วิดีโอ 16:9 สามารถวางคนไว้ด้านข้างและมีพื้นที่ Environment มาก
แต่ 9:16 มีพื้นที่แนวนอนน้อยกว่า
ถ้าสร้าง 16:9 ก่อนแล้ว Crop เป็น 9:16
อาจตัด
ตัวละคร
สินค้า
ข้อความ
Background สำคัญ
ออก
ไม่จำเป็น
Gemini Omni รองรับ Multi-turn Editing
หลังสร้างแล้วสามารถพิมพ์ต่อว่า
“รักษาทุกอย่างเดิม เปลี่ยนเฉพาะกล้องให้ช้าลง”
“เปลี่ยนฉากเป็นกลางคืน”
“ลบคนด้านหลัง”
“เปลี่ยน Camera Angle”
Google ระบุว่าหลังสร้างสามารถแก้ Object, Character, Camera Angle และ Scene ด้วย Prompt ได้
ใช้
Preserve + Change Only
ตัวอย่าง
“รักษาตัวละคร Scene, Camera Angle, Lighting และ Audio เดิมทั้งหมด เปลี่ยนเฉพาะความเร็วของ Camera Movement ให้ช้าลง”
นี่ดีกว่า Generate ใหม่ทั้งหมด เพราะส่วนที่ถูกอยู่แล้วมีโอกาสถูกเก็บไว้
คือการทำงานแบบ
Version 1 → ตรวจ
Version 2 → แก้กล้อง
Version 3 → แก้แสง
Version 4 → แก้เสียง
แทนการสั่งทุกอย่างใหม่ในครั้งเดียว
Google DeepMind ระบุว่า Gemini Omni ถูกออกแบบให้ Edit ผ่าน Natural Conversation และสามารถรักษาสิ่งที่ทำถูกไว้ระหว่างการปรับหลายรอบ
ตัวอย่าง
“รักษา Scene, Character, Action และ Audio เดิม เปลี่ยน Camera Angle เป็น Low Angle และใช้ Slow Tracking Shot จากด้านหน้า”
หรือ
“เปลี่ยน Close-up เป็น Medium Shot แต่รักษาทุกอย่างอื่นไว้เหมือนเดิม”
ใช้
“รักษาวิดีโอเดิมทั้งหมด ลด Camera Movement ให้ช้าลงประมาณครึ่งหนึ่ง และทำ Movement ให้ Smooth มากขึ้น”
ไม่จำเป็นต้อง Prompt Video ใหม่ทั้ง Clip
ใช้
“รักษา Character, Action, Camera และ Environment เดิม เปลี่ยนเฉพาะ Lighting เป็น Golden Hour จากด้านหลัง”
“รักษาตัวละคร Scene และ Camera Movement เดิม เปลี่ยนเฉพาะเวลาเป็นกลางคืน เพิ่ม Moonlight และไฟจากอาคารอย่างสมจริง”
“รักษาภาพเดิมทั้งหมด ลดเสียงเพลงลง และเพิ่มเสียงฝนกับ Ambient Street Sound ให้เด่นขึ้น”
Google Help ยืนยันว่าสามารถขอ Audio ร่วมกับ Generated Video ได้
หลีกเลี่ยงการให้ AI ตัดสินรายละเอียดที่ต้องตรงกับของจริงทั้งหมดโดยไม่มี Reference
เช่น
Logo สินค้าจริง
Packaging จริง
ใบหน้าบุคคลเฉพาะ
สถานที่ที่ต้องตรงทุกจุด
ข้อมูล Infographic ที่ต้องถูกต้อง
Text-to-Video เหมาะมากกับ
Concept
B-roll
Storytelling
Creative Scene
Atmosphere
Advertising Concept
Explainer
แต่เมื่อ Identity หรือรายละเอียดจริงสำคัญ ควรใช้ Reference
ไม่มีภาพต้นฉบับ
ต้องการ Concept ใหม่
ต้องการ Scene ใหม่ทั้งหมด
ต้องการให้ AI มีอิสระมาก
ต้องการคนเดิม
สินค้าเดิม
Character เดิม
Composition ตั้งต้น
Brand Asset
Text-to-Video ให้อิสระมากกว่า แต่ Reference ให้ Control มากกว่า
Google ใช้ระบบ SynthID กับ AI-generated Media ของตน และ Gemini Omni อยู่ในระบบความโปร่งใสของ Content ที่สร้างด้วย Google AI
อย่างไรก็ตาม SynthID เป็น Digital Watermark ที่ไม่ได้หมายความว่าจะเห็น Logo ใหญ่บน Video ด้วยตาเปล่า
ก่อนเผยแพร่ Video AI ควรพิจารณาเรื่อง Transparency ตามบริบทของงาน
ใช้กับงานธุรกิจได้หลายรูปแบบภายใต้ข้อกำหนดและสิทธิที่เกี่ยวข้อง แต่การสร้างด้วย AI ไม่ได้ทำให้สิทธิของบุคคลอื่นหายไป
Google ระบุว่าผู้ใช้ Gemini ต้องปฏิบัติตาม Terms of Service และ Prohibited Use Policy รวมถึงไม่ละเมิด Copyright หรือ Privacy Rights ของผู้อื่น
ควรตรวจโดยเฉพาะ
เพลง
Logo
Trademark
บุคคล
Character
Brand
ก่อนนำ Output ไปใช้เชิงพาณิชย์
Gemini Apps อาจไม่สร้างหรือลบวิดีโอเมื่อระบบตรวจพบความเป็นไปได้ว่าขัดกับ Terms หรือ Prohibited Use Policy
ถ้า Prompt ทั่วไปสร้างได้ แต่ Prompt หนึ่งถูกปฏิเสธ
ควรตรวจเนื้อหาของ Prompt
ไม่ควรพยายามเปลี่ยนคำเพื่อหลบระบบ
Google ระบุว่าการสร้าง Video อาจใช้ หลายนาที และผู้ใช้ไม่สามารถโต้ตอบกับ Chat เดิมระหว่าง Generation แต่สามารถเปิด Chat ใหม่ใช้งานต่อได้
ดังนั้น Video Generation ใช้เวลามากกว่าการตอบข้อความทั่วไปเป็นเรื่องปกติ
หากค้างผิดปกติจึงค่อยตรวจ
Network
App
Browser
Quota
Prompt Complexity
Google Help ระบุว่าผู้ใช้สามารถ Brainstorm และ Refine Video Prompt ใน Chat หลักของ Gemini ก่อนเริ่ม Generate ได้
ตัวอย่าง
“ช่วยปรับ Prompt นี้ให้เป็น Cinematic Video Prompt โดยเพิ่ม Camera Movement, Lighting และ Audio”
จากนั้นตรวจ Prompt ที่ Gemini เสนอ
แก้ให้ตรง Intent
แล้วค่อย Generate
“สร้างวิดีโอ [STYLE] ของ [SUBJECT] กำลัง [ACTION] ที่ [LOCATION] ใช้ [SHOT] และ [CAMERA MOVEMENT] มี [LIGHTING] พร้อม [AUDIO] ไม่มี [RESTRICTIONS]”
“สร้างวิดีโอ Cinematic Photorealistic ของ [SUBJECT] กำลัง [ACTION] ที่ [LOCATION] ใช้ [CAMERA ANGLE] และ [CAMERA MOVEMENT] อย่างนุ่มนวล มี [LIGHTING] และ [COLOR MOOD] พร้อมเสียง [AUDIO] ไม่มีข้อความ ไม่มี Logo”
“สร้างวิดีโอแนวตั้ง 9:16 สำหรับ Short-form Content มี [SUBJECT] กำลัง [ACTION] ที่ [LOCATION] ใช้ [CAMERA MOVEMENT] วาง Subject ให้อยู่ใน Safe Area ใช้ [LIGHTING] และ [STYLE] ไม่มีข้อความ”
ตรวจว่ามีหรือยัง
ใครหรืออะไร
กำลังทำอะไร
เกิดที่ไหน
ใกล้หรือไกล
มุมไหน
เคลื่อนแบบไหน
แสงแบบไหน
ภาพลักษณ์แบบไหน
มีเสียงอะไร
อะไรที่ไม่ต้องการ
ไม่จำเป็นต้องมีครบทุกข้อในทุก Prompt แต่ยิ่ง Requirement สำคัญ ควรยิ่งระบุชัด
ตรวจ
Movement
Camera
ใบหน้า
มือ
Physics
Lighting
Text
Audio
Lip Sync
Continuity
Object Shape
Logo
หากผิด 1–2 จุด ให้ Edit เฉพาะจุดแทน Generate ใหม่ทั้งหมด
“สร้างรถเท่ ๆ วิ่งเร็ว ๆ”
ปัญหาคือไม่บอก
รถแบบไหน
สีอะไร
สถานที่
เวลา
Camera
Style
Audio
“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ต Coupe สีดำด้าน วิ่งบนถนนในเมืองตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot กล้องตามรถจากด้านหลัง มี Blue Neon Reflection บนถนน พร้อมเสียงเครื่องยนต์และเสียงยาง ไม่มีข้อความหรือ Logo”
“ทำคลิปร้านกาแฟสวย ๆ”
“สร้างวิดีโอ Cinematic ของร้านกาแฟ Modern Minimal ช่วงเช้า เริ่ม Wide Shot แล้ว Slow Dolly In ไปยัง Barista ที่กำลังเท Latte Art มี Soft Window Light และ Ambient Café Sound ไม่มีข้อความ”
รู้ก่อนว่าอยากสื่ออะไร
นี่มีประสิทธิภาพกว่าการพยายามเขียน Prompt ยาวสมบูรณ์แบบครั้งเดียว
ได้ Gemini Apps ปัจจุบันใช้ Gemini Omni สำหรับ Video Generation และสามารถพิมพ์ Prompt เพื่อสร้าง Video ใหม่ได้โดยตรง
เปิด Gemini → Sidebar → Create video → พิมพ์ Prompt → Submit โดยไม่ต้อง Upload Image หรือ Video หากต้องการสร้างจากข้อความล้วน
Gemini Apps ปัจจุบันใช้ Gemini Omni ซึ่ง Google DeepMind ระบุว่ารองรับ Text-to-Video รวมถึง Image-to-Video, Reference-to-Video และ Video Editing
ควรพิจารณา Subject, Action, Shot, Camera Motion, Lighting, Location และ Style ตามแนวทาง Prompt Guide ของ Google DeepMind
ได้ Google Help ระบุว่าสามารถขอให้ Gemini Generate Audio พร้อม Video ได้
ค่าเริ่มต้นของ Text Prompt เป็น Landscape และ Gemini Omni มี Aspect Ratio Control ให้เลือกก่อนสร้าง
ได้ สามารถ Remove/Replace Objects หรือ Characters, เปลี่ยน Camera Angle และแก้ Scene ด้วย Prompt เพิ่มเติม
สำหรับ Personal Account ใน Gemini Apps ปัจจุบัน Google ระบุว่าต้องมี Google AI Plan ส่วน Work/School ต้องมี Workspace License ที่เข้าเกณฑ์
ปัจจุบัน Google ระบุว่า Feature นี้ยังไม่พร้อมสำหรับผู้ใช้อายุต่ำกว่า 18 ปี
Google ระบุว่าอาจใช้เวลาหลายนาทีในการ Generate
ใต้ Video เลือก Share แล้วเลือก Download video หรือ Share on YouTube ใน Workflow ที่รองรับ
ไม่มีตัวไหนดีกว่าทุกกรณี Text-to-Video เหมาะกับการสร้าง Scene ใหม่จากศูนย์ ส่วน Image-to-Video เหมาะเมื่อมีคน สินค้า Character หรือ Composition ที่ต้องการใช้เป็น Reference
การสร้างวิดีโอจากข้อความด้วย Gemini ปัจจุบันทำได้โดยใช้ Gemini Omni เพียงเปิด
Gemini → Create video → พิมพ์ Prompt → Submit
โดยไม่จำเป็นต้องมีรูปหรือ Video ต้นฉบับ
หัวใจของการทำ Text-to-Video ให้ได้ผลดีคืออย่าพิมพ์เพียงว่า
“สร้างวิดีโอสวย ๆ”
แต่ควรระบุสิ่งที่สำคัญต่อ Scene ให้ชัด
สูตรที่แนะนำคือ
Subject + Action + Location + Camera + Movement + Lighting + Style + Audio + Restrictions
ตัวอย่าง
“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ตสีดำวิ่งผ่านโตเกียวตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot กล้องตามรถอย่างนุ่มนวล มี Blue และ Pink Neon Reflection พร้อมเสียงเครื่องยนต์และเสียงฝน ไม่มีข้อความ ไม่มี Logo”
Google DeepMind ระบุว่าการเพิ่มรายละเอียดด้าน Shot Framing, Motion, Style, Lighting, Location และ Action ช่วยเพิ่มการควบคุม Final Output แต่ Gemini Omni ก็มี World Understanding เพียงพอที่ไม่จำเป็นต้องอธิบายทุก Frame อย่างละเอียด
หลังได้วิดีโอแรกแล้ว หากบางส่วนยังไม่ตรงใจ ไม่จำเป็นต้อง Generate ใหม่ทั้งหมด
สามารถพิมพ์ต่อว่า
“รักษาทุกอย่างเดิม เปลี่ยนเฉพาะ Camera Angle”
หรือ
“ลดความเร็วของกล้อง”
หรือ
“เปลี่ยน Background เป็นกลางคืน”
เพราะ Gemini Omni รองรับ Multi-turn Editing และการแก้ Video ผ่าน Natural Conversation
ดังนั้น Workflow ที่เหมาะที่สุดคือ
① สร้าง Concept
② เขียน Prompt
③ เลือก Aspect Ratio
④ Generate
⑤ ตรวจ Video
⑥ ระบุจุดที่ผิด
⑦ Edit เฉพาะจุด
⑧ ตรวจ Final
เมื่อใช้วิธีนี้ Text-to-Video ใน Gemini จะไม่ใช่การสุ่มสร้างคลิปหลายครั้งเพื่อหวังว่าจะเจอภาพที่ต้องการ แต่จะกลายเป็นกระบวนการสร้างวิดีโอแบบเป็นขั้นตอนที่สามารถควบคุม Camera, Movement, Lighting, Style และ Audio ผ่านคำสั่งธรรมชาติได้