Contact
Line : comsiam
Contact
Line : comsiam

การเปลี่ยนรูปเป็นวิดีโอด้วย Google Gemini หรือ Image-to-Video ทำได้โดยอัปโหลดรูปภาพเข้า Gemini แล้วพิมพ์ Prompt บอกว่าอยากให้คน สัตว์ สินค้า หรือฉากในรูปเคลื่อนไหวอย่างไร จากนั้น Gemini จะใช้ Gemini Omni สร้างวิดีโอจากภาพต้นฉบับให้
ปัจจุบัน Google ระบุว่า Gemini Omni รองรับทั้ง Text-to-Video, Image-to-Video, Reference-to-Video และการแก้ไขวิดีโอผ่านการสนทนา สามารถนำรูปภาพมาใช้เป็น Reference เพื่อควบคุม Character, Object, Environment, Style และ Movement ของวิดีโอได้
วิธีพื้นฐานคือ
Gemini → Create video → Add image → เลือกรูป → เขียน Prompt → Submit
ตัวอย่าง Prompt:
“ใช้บุคคลจากรูปนี้เป็นตัวแบบ รักษาใบหน้า ทรงผม เสื้อผ้า และรูปร่างเดิม ให้บุคคลเดินเข้าหากล้องอย่างช้า ๆ กล้อง Tracking ถอยหลังอย่างนุ่มนวล มีลมพัดเส้นผมเล็กน้อย ใช้แสงธรรมชาติแบบ Cinematic”
เพียงเท่านี้ Gemini ก็สามารถนำภาพนิ่งมาสร้างเป็นวิดีโอเคลื่อนไหวได้
Image-to-Video คือการใช้
รูปภาพ + Prompt → วิดีโอ
ต่างจาก Text-to-Video ที่เริ่มจากข้อความเพียงอย่างเดียว
Image-to-Video เหมาะกับงานที่ต้องการควบคุมสิ่งสำคัญ เช่น
ใบหน้าคน
สินค้า
ตัวละคร
เสื้อผ้า
สถานที่
Composition
Style
เพราะ AI มีภาพต้นฉบับเป็น Reference แทนการสร้างทุกอย่างขึ้นใหม่จากคำอธิบาย
Gemini Apps ปัจจุบันใช้ Gemini Omni เป็น Advanced Video Generator
Google ระบุว่า Omni สามารถผสม
ข้อความ
รูปภาพ
วิดีโอ
เข้าด้วยกันเพื่อสร้างวิดีโอ และสามารถแก้ผลลัพธ์ต่อเนื่องใน Conversation เดิมได้
นี่ทำให้ Workflow ไม่ได้จบแค่
รูป → วิดีโอ
แต่สามารถต่อเป็น
รูป → วิดีโอ → แก้กล้อง → เปลี่ยนฉาก → เพิ่มเสียง → แก้อีกครั้ง
ได้
ขั้นตอนปัจจุบันของ Google คือ
เข้าสู่ Gemini ด้วยบัญชี Google ที่มีสิทธิใช้ Video Generation
เลือกเมนูด้านซ้าย
เข้าสู่พื้นที่สร้างวิดีโอ
เลือกรูปที่ต้องการใช้เป็นต้นฉบับ
บอก Gemini ว่า
อะไรต้องเคลื่อนไหว
เคลื่อนไหวอย่างไร
กล้องอยู่ตรงไหน
กล้องเคลื่อนอย่างไร
อะไรต้องรักษาไว้
ต้องการเสียงหรือไม่
Gemini จะเริ่มสร้างวิดีโอ
Google ระบุว่าการ Generation อาจใช้เวลาหลายนาที
Google ระบุว่าสามารถใช้งานผ่าน Gemini App หรือ Gemini Web บน Android ได้
ขั้นตอนคือ
① เปิด Gemini
② Menu → Videos
③ เลือก Template ถ้าต้องการ
④ แตะ Add image
⑤ เลือกรูป
⑥ เขียน Prompt
⑦ แตะ Submit
หลักการเหมือนบนคอมพิวเตอร์
Google Help ปัจจุบันระบุว่าใน Video Creation Workflow สามารถอัปโหลดได้สูงสุด
1 วิดีโอ + 5 รูปภาพ
ดังนั้นสามารถใช้หลาย Reference ได้ เช่น
รูปที่ 1 → บุคคล
รูปที่ 2 → เสื้อ
รูปที่ 3 → รถ
รูปที่ 4 → สถานที่
รูปที่ 5 → Style
แล้วเขียน Prompt ระบุหน้าที่ของแต่ละรูป
ถ้ามีรูปบุคคล 1 รูป
Prompt ตัวอย่าง:
“ใช้บุคคลจากภาพนี้เป็น Master Reference รักษา Facial Identity, hairstyle, clothing และ body proportions เดิม ให้บุคคลหันหน้าไปทางขวาช้า ๆ แล้วยิ้มเล็กน้อย กล้อง Static และใช้ Soft Natural Light”
ถ้าเป็นรูปสินค้า
“ใช้สินค้าจากภาพนี้เป็น Master Product รักษารูปร่าง สี Logo, Label และ Packaging เดิม ให้กล้อง Orbit รอบสินค้า 180 องศาอย่างช้า ๆ โดยสินค้ายังคงอยู่กับที่”
ถ้าต้องการเปลี่ยนรูปคนเป็นวิดีโอ ควรกำหนด 4 เรื่อง
Identity
รักษาหน้าเดิม
Action
คนทำอะไร
Camera
กล้องอยู่ตรงไหน
Movement
กล้องหรือคนเคลื่อนไหวยังไง
ตัวอย่าง:
“ใช้บุคคลในภาพเป็น Reference หลัก รักษาใบหน้า สีผิว ทรงผม เสื้อผ้า และรูปร่างเดิม ให้บุคคลเดินตรงเข้าหากล้องด้วยความเร็วธรรมชาติ แขนแกว่งเล็กน้อย กล้อง Tracking ถอยหลังอย่างนุ่มนวล ไม่มีการเปลี่ยนใบหน้าระหว่างวิดีโอ”
ใช้ Prompt ลักษณะ
Preserve Identity
เช่น
“Preserve the original facial identity, eyes, eyebrows, nose, lips, face shape, skin tone, hairstyle and age throughout the video.”
หรือภาษาไทย
“รักษาใบหน้า ดวงตา คิ้ว จมูก ริมฝีปาก รูปหน้า สีผิว ทรงผม และอายุเดิมตลอดทั้งวิดีโอ”
การมี Reference ช่วยเพิ่ม Consistency ของ Character หรือ Object ตามแนวทาง Prompt ของ Google DeepMind
ไม่ควรคาดหวังแบบ Pixel-perfect ทุก Frame
เพราะ AI ต้องสร้าง
มุมใหม่
แสงใหม่
สีหน้า
Movement
ส่วนของใบหน้าที่ภาพต้นฉบับไม่มี
ขึ้นมา
โดยเฉพาะเมื่อสั่ง
หันหน้ามาก
เปลี่ยนมุมกล้องมาก
เปลี่ยนอายุ
เปลี่ยนทรงผม
เปลี่ยนสีหน้าแรง
โอกาสที่ Identity จะเปลี่ยนจะสูงขึ้น
ถ้าหน้าสำคัญ ควรให้ Movement ในครั้งแรกไม่รุนแรงเกินไป
“Use the uploaded image as the master identity reference. Keep the same face, hairstyle, clothing and body proportions. Make the person walk naturally toward the camera. Use a smooth front-facing tracking shot. Add subtle natural clothing and hair movement.”
“รักษาบุคคลในภาพเดิมทั้งหมด ให้บุคคลค่อย ๆ ยิ้ม หันศีรษะไปทางซ้ายเล็กน้อย และกะพริบตาตามธรรมชาติ กล้องอยู่กับที่ ห้ามเปลี่ยนใบหน้า เสื้อผ้าหรือ Background”
เหมาะกับ Portrait ที่ไม่ต้องการ Movement มาก
“รักษาบุคคลเดิม ให้มีลมเบา ๆ พัดจากด้านซ้าย ทำให้เส้นผมและชายเสื้อเคลื่อนไหวอย่างเป็นธรรมชาติ โดยห้ามเปลี่ยนใบหน้า Pose และ Environment”
Image-to-Video เหมาะกับ Product Video มาก เพราะสามารถใช้สินค้าจริงเป็น Reference ได้
Prompt:
“ใช้สินค้าในภาพเป็น Master Product รักษา Shape, Logo, Label, Packaging, Color และ Material เดิม กล้อง Slow Orbit รอบสินค้า 180 องศาใน Premium Studio Background สีดำ มี Golden Rim Light และ Reflection แบบสมจริง”
เหมาะกับ
สินค้าออนไลน์
Social Ads
Product Teaser
Presentation
Concept Advertising
Generative Video อาจทำให้
Logo เปลี่ยน
Label เปลี่ยน
ปุ่มเพิ่ม/หาย
รูปทรงเปลี่ยน
ข้อความบน Packaging ผิด
ดังนั้นถ้าเป็นสินค้าจริง ควรตรวจ Frame สำคัญก่อนนำไปใช้เชิงพาณิชย์
Prompt:
“ใช้รถจาก Reference เป็นรถคันเดิม รักษารูปทรง สี ล้อ ไฟหน้า และรายละเอียดตัวถัง ให้รถเริ่มเคลื่อนที่ไปข้างหน้าอย่างช้า ๆ บนถนนกลางคืน กล้อง Low-angle Tracking จากด้านหน้า มี Neon Reflection บนพื้นถนน”
Prompt:
“ใช้ภาพบ้านนี้เป็น Reference หลัก รักษาโครงสร้าง อาคาร ประตู หน้าต่าง และสวนเดิม กล้อง Slow Dolly Forward จากหน้าทางเข้าไปยังตัวบ้าน ใช้แสง Golden Hour และต้นไม้เคลื่อนไหวเบา ๆ ตามลม”
เหมาะกับ
Property Concept
Real Estate Presentation
Architecture Visualization
แต่หากใช้เพื่อขายอสังหาริมทรัพย์จริง ควรระบุให้ชัดว่าเป็น AI Visualization หากวิดีโอไม่ได้สะท้อนสภาพจริงทั้งหมด
Prompt:
“ใช้จานอาหารในภาพเป็น Reference รักษารูปร่างและการจัดจานเดิม เพิ่มไอน้ำลอยขึ้นอย่างเป็นธรรมชาติ กล้อง Slow Push In ไปยังอาหาร มี Warm Restaurant Lighting และเสียง Sizzle เบา ๆ”
เหมาะกับ Food Content และ Restaurant Promotion
ได้
Google DeepMind แสดงความสามารถของ Gemini Omni ในการนำ Drawing หรือ Sketch มาเป็น Guide แล้วเปลี่ยนให้เป็นวิดีโอสมจริง โดยสามารถใช้ภาพวาดเป็นแนวทางด้าน Movement ได้
ตัวอย่าง Prompt:
“ใช้ภาพวาดนี้เป็น Guide สำหรับ Composition และ Movement สร้างเป็น Realistic Cinematic Footage และอย่าแสดงเส้นวาดใน Final Video”
เหมาะกับ
Storyboard
Animation Concept
Architecture Concept
Creative Planning
ได้
Prompt:
“ใช้ Character จากภาพนี้เป็นตัวละครหลัก รักษาสี เสื้อผ้า รูปหน้า และ Style เดิม ให้ Character เดินผ่านสวนแล้วโบกมือให้กล้อง ใช้ Animation Style เดียวกับภาพ Reference”
Reference ช่วยรักษา Character และ Visual Style ได้ดีกว่าการอธิบายด้วยข้อความเพียงอย่างเดียว
Gemini Omni สามารถใช้ Reference เพื่อรักษาหรือถ่ายทอด Style และยังรองรับการเปลี่ยน Style ผ่าน Prompt เช่น Anime, Claymation หรือ Watercolor
ตัวอย่าง:
“ใช้ภาพนี้เป็น Character Reference แต่สร้างวิดีโอในรูปแบบ Claymation โดยรักษา Movement, Clothing Color และ Identity เดิม”
ควร Label แต่ละภาพ
ตัวอย่าง
Image 1 = คน
Image 2 = เสื้อ
Image 3 = รถ
Image 4 = Location
แล้วเขียน
“ใช้บุคคลจาก Image 1 เป็นตัวละครหลัก ใช้เสื้อจาก Image 2 รถจาก Image 3 และ Environment จาก Image 4 รักษา Facial Identity ของ Image 1 ตลอด Video”
ดีกว่า
“ใช้รูปทั้งหมดนี้ทำ Video”
เพราะ Gemini รู้ว่าข้อมูลจากแต่ละ Reference มีหน้าที่อะไร
Google DeepMind ระบุว่า Omni สามารถ Reference และ Combine Inputs หลายชนิด เพื่อสร้าง Output เดียว รวมถึง Image, Video, Text และ Audio
จึงเหมาะกับงานที่ต้องการ
คนจากรูปหนึ่ง
Style จากอีกรูป
Movement จากวิดีโอ
เสียงจาก Audio Reference
มารวมกัน
ได้ใน Workflow ที่รองรับ Reference หลายประเภท
Google DeepMind ยกตัวอย่างการนำ Movement จาก Video หนึ่งไปใช้กับ Character จาก Image Reference อีกภาพ
เช่น
“ใช้ Character จาก Image Reference แต่ใช้ Pose และ Movement จาก Video Reference”
นี่มีประโยชน์กับ
Animation
Character Video
Dance Concept
Fashion
Storytelling
รูปมี Composition อยู่แล้ว
สิ่งที่ต้องเพิ่มเมื่อทำ Video คือ
กล้องจะเคลื่อนอย่างไร
คำที่ใช้ได้ เช่น
Static
Tracking Shot
Dolly In
Dolly Out
Push In
Pan Left
Pan Right
Orbit Shot
Drone Shot
Handheld
Google DeepMind แนะนำให้ระบุ Shot Framing และ Camera Motion เพื่อเพิ่ม Control ต่อวิดีโอ
เหมาะกับ Portrait หรือสินค้า
Prompt:
“Slow Push In toward the subject while keeping the subject centered.”
เหมาะกับสินค้า รถ หรือ Character
“Slow 180-degree orbit around the product while the product remains fixed.”
เหมาะกับคนเดินหรือรถเคลื่อน
“Smooth tracking shot following the character from the front.”
ถ้าต้องการไม่ให้มีการตัด
ใช้
one continuous shot
หรือ
oner
ซึ่ง Google DeepMind แนะนำไว้ใน Prompt Guide ของ Omni
ตัวอย่าง:
“สร้างเป็น one continuous shot กล้องติดตามคนในภาพเดินจากหน้าร้านเข้าไปด้านในโดยไม่มีการตัด”
ควร หาก Mood สำคัญ
ตัวอย่าง
Soft Natural Light
Golden Hour
Neon Light
Studio Light
Moonlight
Rim Light
Window Light
Prompt:
“รักษาคนและสถานที่เดิม เพิ่ม Golden Hour sunlight จากด้านหลังพร้อม Soft Rim Light รอบตัวบุคคล”
Google แนะนำให้ระบุทั้งแหล่งกำเนิดแสงและผลของแสงต่อ Scene
ได้
Google Help ระบุว่าสามารถขอให้ Gemini สร้าง Audio พร้อมกับ Video ได้
ตัวอย่าง
“ให้มีเสียงฝนเบา ๆ และ Ambient City Sound”
“เพิ่มเสียงเครื่องยนต์รถสมจริง”
“เพิ่มเสียงลมและนกจากระยะไกล”
“ไม่มีเพลง”
สามารถใส่ Audio Requirement ใน Prompt เดียวกับ Image-to-Video ได้
สามารถขอ Dialogue ใน Generated Video ได้ใน Workflow ที่รองรับ Audio
ตัวอย่าง
“ใช้บุคคลในภาพเป็นตัวละครหลัก รักษาใบหน้าเดิม ให้บุคคลมองกล้องแล้วพูดภาษาไทยว่า ‘ยินดีต้อนรับค่ะ’ ด้วยน้ำเสียงเป็นมิตร จากนั้นยิ้มเล็กน้อย”
ควรตรวจ
คำพูด
เสียง
Lip Sync
Identity
หลังสร้าง
Google Help ปัจจุบันระบุว่า หากอัปโหลด Image หรือ Video Reference Aspect Ratio ของ Output จะตรงกับ Content ที่อัปโหลด
ดังนั้น
รูป 9:16 → เหมาะกับ Vertical Video
รูป 16:9 → เหมาะกับ Landscape
รูป 1:1 → Output จะอิงรูปแบบ Reference ดังกล่าวใน Workflow ปัจจุบัน
นี่เป็นเหตุผลว่าทำไมควรเตรียมรูปต้นฉบับให้ใกล้กับ Ratio ที่ต้องการใช้งานจริง
ถ้าเป้าหมายคือ
TikTok
Instagram Reels
YouTube Shorts
ควรใช้ Reference แนวตั้งตั้งแต่ต้น
เช่น 9:16
เพื่อให้ Composition เหมาะกับมือถือ
แทนที่จะสร้างจากรูปแนวนอนแล้วค่อย Crop
ใช้ Reference แนวนอน เช่น 16:9
โดยจัด Subject ไม่ให้ชิดขอบ
และเผื่อพื้นที่สำหรับการเคลื่อน Camera
เช่น
“ใช้ภาพนี้เป็น Reference สร้าง Video Landscape 16:9 กล้อง Dolly Forward ช้า ๆ รักษา Subject ใน Center Safe Area”
รูปที่ดีสำหรับ Image-to-Video ควร
คมชัด
Subject เห็นชัด
ไม่เบลอมาก
แสงพอเหมาะ
ไม่มีสิ่งบดบังตัวแบบมากเกินไป
มี Resolution เพียงพอ
ถ้าเป็นคน
ใบหน้าควรเห็นชัด
ถ้าเป็นสินค้า
Logo และ Packaging ควรชัด
ถ้าเป็นสถานที่
Perspective ควรสมเหตุสมผล
มี
ถ้า Reference
หน้าเบลอ
รายละเอียดสินค้าอ่านไม่ออก
ส่วนของร่างกายถูกตัด
แสงมืดมาก
AI ต้องเดารายละเอียดเพิ่มเติม
ทำให้ Video มีโอกาสเปลี่ยนจากต้นฉบับมากขึ้น
ถ้ารูปมีเพียงใบหน้า Close-up แต่ Prompt ขอ
“เดินเต็มตัว”
AI ต้องสร้าง
ลำตัว
ขา
รองเท้า
เสื้อผ้าส่วนล่าง
ขึ้นมาเองทั้งหมด
หากต้องการ Full-body Video ควรใช้ Reference ที่เห็นร่างกายครบมากกว่า
ทำได้ในเชิง Generative
แต่ส่วนที่ภาพต้นฉบับไม่มีจะถูก AI สร้างขึ้นใหม่
ดังนั้นไม่ควรคาดหวังว่า
รูปร่าง
เสื้อผ้า
ความสูง
รองเท้า
จะตรงกับบุคคลจริงโดยอัตโนมัติ
ถ้าความแม่นยำสำคัญ ควรเพิ่ม Reference เพิ่มเติม
สามารถใช้ Reference หลายภาพใน Workflow ปัจจุบันได้สูงสุด 5 ภาพ
ตัวอย่างใช้
ภาพหน้าตรง
ภาพด้านข้าง
ภาพ Full Body
เพื่อให้ Gemini มีข้อมูลเพิ่ม
แต่ควรบอกบทบาทชัด เช่น
“Images 1–3 เป็นบุคคลคนเดียวกัน ใช้ทั้งหมดเพื่อรักษา Identity และ Body Proportions”
ใช้สูตร
REFERENCE + PRESERVE + ACTION + CAMERA + MOVEMENT + LIGHTING + AUDIO + RESTRICTIONS
ตัวอย่าง:
“ใช้ภาพที่อัปโหลดเป็น Master Reference
Preserve:
ใบหน้า ทรงผม เสื้อผ้า รูปร่างและ Background
Action:
ให้บุคคลเดินช้า ๆ เข้าหากล้อง
Camera:
Medium tracking shot
Movement:
กล้องถอยหลังอย่างนุ่มนวล
Lighting:
Soft natural sunlight
Audio:
เสียงฝีเท้าและ Ambient City เบา ๆ
Do not:
ห้ามเปลี่ยนใบหน้า เสื้อผ้า หรือเพิ่มคนอื่น”
“Use the uploaded photo as the master identity reference. Preserve the facial identity, hairstyle, clothing, skin tone and body proportions. Make the person walk naturally toward the camera. Use a smooth medium tracking shot, subtle natural hair movement and soft daylight. No text, no extra characters.”
“รักษาบุคคลในรูปเดิมทั้งหมด ให้บุคคลกะพริบตาตามธรรมชาติ ยิ้มเล็กน้อย และหันหน้าทางซ้ายประมาณเล็กน้อย กล้อง Static แสงเดิม ห้ามเปลี่ยนใบหน้า ทรงผมหรือ Background”
“ใช้สินค้าจากภาพเป็น Master Product รักษา Shape, Color, Logo, Label และ Packaging เดิม ให้กล้อง Orbit รอบสินค้าอย่างช้า ๆ ใน Premium Studio มี Black Background, Golden Rim Light และ realistic reflections ไม่มีข้อความหรือสินค้าอื่น”
“ใช้รถจากภาพเป็นรถคันเดิม รักษาสี ล้อ ไฟหน้าและรูปทรงตัวรถ ให้รถเคลื่อนไปข้างหน้าบนถนนกลางคืน กล้อง Low-angle Tracking ตามจากด้านหน้า มี Neon Reflection บนพื้น พร้อมเสียงเครื่องยนต์สมจริง”
“ใช้จานอาหารจากภาพเดิม รักษาการจัดจานและส่วนประกอบอาหาร ให้มีไอน้ำลอยขึ้นตามธรรมชาติ กล้อง Slow Push In มี Warm Restaurant Light และเสียง Sizzle เบา ๆ”
“ใช้บ้านจากภาพนี้เป็น Reference รักษาโครงสร้างและการจัดสวนเดิม กล้อง Slow Dolly Forward จากหน้าทางเข้า มี Golden Hour Light ต้นไม้เคลื่อนไหวเบา ๆ ตามลม ไม่มีคนและไม่มีข้อความ”
“ใช้ Drawing นี้เป็น Guide สำหรับ Composition และ Movement สร้างเป็น Photorealistic Cinematic Video รักษาตำแหน่งหลักของวัตถุตาม Sketch แต่ไม่แสดงเส้นวาดใน Final Output”
ไม่จำเป็น
Gemini Omni รองรับ Multi-turn Editing
Google ระบุว่าสามารถแก้ Generated Video ด้วย Prompt เช่น
ลบหรือเปลี่ยน Object/Character
เปลี่ยน Camera Angle
แก้ Scene
ดังนั้นหาก Video ดีแล้ว 80–90%
ให้แก้เฉพาะจุด
“รักษาทุกอย่างเดิม ลดความเร็วการเดินลงประมาณครึ่งหนึ่ง และให้ Movement เป็นธรรมชาติมากขึ้น”
“รักษาตัวละคร Action, Lighting และ Scene เดิม เปลี่ยนเฉพาะ Camera เป็น Slow Tracking Shot จากด้านหน้า”
“รักษาบุคคล Movement และ Camera เดิม เปลี่ยนเฉพาะ Background เป็นชายหาดช่วง Golden Hour”
“รักษาภาพเดิมทั้งหมด เพิ่มเสียงลมและคลื่นทะเลเบา ๆ และไม่ต้องมีเพลง”
อย่าสั่งพร้อมกันว่า
เปลี่ยนหน้า
เปลี่ยนเสื้อ
เปลี่ยนกล้อง
เปลี่ยนฉาก
เปลี่ยนเสียง
เพิ่มวัตถุ
หากไม่จำเป็น
ให้แก้ทีละรอบ
เพราะ Gemini Omni ถูกออกแบบให้ปรับงานผ่าน Natural Conversation และรักษาส่วนที่ดีไว้ระหว่างการแก้
กลับไป Video หรือ Reference Version ที่ยังถูกต้อง
แล้วเริ่มแก้ใหม่จากจุดนั้น
อย่าแก้ต่อจาก Version ที่ Identity ผิดแล้ว
หลักเดียวกับการแก้ภาพ AI คือ
เก็บ Master Reference เสมอ
ใช้ภาพคุณภาพดี
อย่าเริ่มด้วย Action ซับซ้อนมาก
ให้ชัด
ดู Version แรก
หน้าและสินค้า
วิธีนี้ควบคุมง่ายกว่าการเขียน Prompt ทุก Requirement ในครั้งเดียว
หลังสร้าง Video เสร็จ
ใต้ Video เลือก
Share → Download video
หรือ Share on YouTube ใน Workflow ที่รองรับ
ควรดาวน์โหลดไฟล์ Output โดยตรงแทนการ Screen Record เพื่อรักษาคุณภาพ
Google ระบุว่า Video Generation อาจใช้เวลาหลายนาที
ระหว่าง Generation จะไม่สามารถโต้ตอบกับ Chat เดิมได้ แต่สามารถเปิด Chat ใหม่และกลับมาดูวิดีโอภายหลัง
ดังนั้นถ้าใช้เวลานานกว่าการสร้างภาพ ถือว่าเป็นเรื่องปกติ
สำหรับ Personal Google Account ปัจจุบัน Google ระบุว่าต้องมี Google AI Plan เพื่อใช้ Video Generation ใน Gemini Apps
Work/School Account ต้องมี Workspace License ที่เข้าเกณฑ์ และ Feature นี้ยังไม่เปิดให้ผู้ใช้อายุต่ำกว่า 18 ปี
สิทธิและ Limits สามารถเปลี่ยนได้ตาม Plan และพื้นที่ให้บริการ
Google ระบุอย่างชัดเจนว่า ควรอัปโหลดเฉพาะรูปที่คุณมีสิทธิใช้ และต้องไม่ละเมิด Copyright หรือ Privacy Rights ของบุคคลอื่น
ดังนั้นก่อนนำรูป
ลูกค้า
เพื่อน
คนดัง
ภาพจากเว็บไซต์
ภาพ Stock
Artwork
ไปทำ Image-to-Video ต้องตรวจสิทธิ์ก่อน
Google เตือนว่าไม่ควรสร้างหรือแชร์วิดีโอเพื่อ
หลอกลวง
คุกคาม
ทำร้ายผู้อื่น
และ Gemini อาจปฏิเสธหรือลบ Video ที่ระบบตรวจพบว่าอาจขัดกับข้อกำหนด
โดยเฉพาะวิดีโอจากรูปบุคคลจริง ควรระมัดระวังเรื่องบริบทและการทำให้ผู้ชมเข้าใจผิด
อาจเกิดจาก
สิทธิของบัญชี
Google AI Plan
อายุ
Prompt
Content Policy
Reference ที่มีปัญหา
ระบบชั่วคราว
ถ้ารูปหนึ่งไม่ได้
ลองรูปทั่วไป เช่น
วิวธรรมชาติ
สัตว์
สินค้า Generic
หากภาพทั่วไปสร้างได้ แต่ภาพเดิมไม่ได้ ควรตรวจเนื้อหาและสิทธิของ Reference
YouTube
Reels
TikTok
Website
เหมือนต้นฉบับไหม
ผิดรูปไหม
เป็นธรรมชาติไหม
เปลี่ยนหรือไม่
รายละเอียดตรงไหม
มีสิ่งผิดปกติไหม
สมเหตุสมผลไหม
ตรง Prompt ไหม
ตรงกับ Movement ไหม
มีสิ่งที่ไม่ได้ขอหรือไม่
“ทำรูปนี้เป็นวิดีโอ”
ปัญหาคือ Gemini ต้องเดาทั้งหมดว่า
อะไรขยับ
ขยับแค่ไหน
กล้องทำอะไร
มีเสียงหรือไม่
อะไรต้องรักษา
“ใช้บุคคลในภาพเป็น Reference หลัก รักษาใบหน้า ทรงผม เสื้อผ้าและ Background เดิม ให้บุคคลเดินช้า ๆ เข้าหากล้อง ใช้ Medium Tracking Shot กล้องถอยหลังอย่างนุ่มนวล มีลมพัดผมเบา ๆ และเสียงฝีเท้าธรรมชาติ ไม่มีข้อความ”
“ทำสินค้าให้หมุน”
“ใช้สินค้าในภาพเป็น Master Product รักษารูปร่าง สี Logo, Label และ Packaging เดิม ให้กล้อง Orbit รอบสินค้า 180 องศาอย่างช้า ๆ โดยสินค้าอยู่นิ่ง ใช้ Premium Studio Lighting และ Black Background”
สูตรคือ
REFERENCE + PRESERVE + ACTION + CAMERA + MOVEMENT + LIGHTING + AUDIO + DON’T
ตัวอย่าง
Reference
ใช้คนในรูปนี้
Preserve
รักษาหน้า เสื้อผ้า ผม
Action
เดินเข้าหากล้อง
Camera
Medium Shot
Movement
Tracking ช้า
Lighting
Soft Natural Light
Audio
เสียงฝีเท้า
Don’t
ห้ามเปลี่ยนหน้า
ได้ Gemini Omni รองรับ Image-to-Video และ Reference-to-Video โดยสามารถใช้รูปภาพเป็น Reference เพื่อสร้างวิดีโอใหม่ได้
เปิด Gemini → Create video → Add image → เลือกรูป → พิมพ์ Prompt → Submit
ได้ Gemini Apps ปัจจุบันรองรับสูงสุด 5 รูปและวิดีโอ 1 ไฟล์ใน Video Creation Workflow
ได้ สามารถกำหนด Action และ Camera Movement ด้วย Prompt แต่ควรใช้ Reference คุณภาพดีและระบุให้รักษา Facial Identity
สามารถขอ Audio พร้อม Video และระบุ Dialogue ใน Prompt ได้ใน Workflow ที่รองรับ
ได้ เหมาะกับ Product Concept และ Advertising แต่ต้องตรวจ Logo, Label, Shape และรายละเอียดสินค้าใน Output ทุกครั้ง
Google Help ระบุว่าเมื่อ Upload Image หรือ Video Reference Aspect Ratio ของ Output จะ Match กับ Content ที่อัปโหลดใน Workflow ปัจจุบัน
ได้ สามารถเปลี่ยน Object, Character, Camera Angle หรือ Scene ผ่าน Prompt เพิ่มเติมได้
Google ระบุว่าอาจใช้เวลาหลายนาที
สำหรับ Personal Account ปัจจุบันต้องมี Google AI Plan ส่วน Work/School Account ต้องมี Workspace License ที่เข้าเกณฑ์
ต้องมีสิทธิใช้ภาพที่อัปโหลด และไม่ควรละเมิด Copyright หรือ Privacy Rights ของผู้อื่น
ได้ Google DeepMind แสดงความสามารถในการนำ Drawing มาใช้เป็น Guide สำหรับสร้าง Video Footage ได้
การเปลี่ยนรูปเป็นวิดีโอด้วย Gemini ทำได้ง่ายที่สุดด้วยขั้นตอน
① เปิด Gemini
② Create video
③ Add image
④ เลือกรูป
⑤ พิมพ์ Prompt
⑥ Submit
Gemini Apps ปัจจุบันใช้ Gemini Omni ซึ่งรองรับ Image-to-Video และ Reference-to-Video รวมถึงการแก้ไข Video ต่อเนื่องด้วย Natural Conversation
หัวใจสำคัญไม่ใช่เพียง Upload รูปแล้วพิมพ์
“ทำให้ขยับ”
แต่ควรบอก Gemini ว่า
อะไรต้องรักษา + อะไรต้องเคลื่อนไหว + กล้องทำอะไร + แสงแบบไหน + มีเสียงอะไร + อะไรห้ามเปลี่ยน
สูตรที่ควรจำคือ
REFERENCE + PRESERVE + ACTION + CAMERA + MOVEMENT + LIGHTING + AUDIO + RESTRICTIONS
ตัวอย่าง:
“ใช้บุคคลจากรูปเป็น Master Reference รักษาใบหน้า ทรงผม เสื้อผ้าและรูปร่างเดิม ให้บุคคลเดินเข้าหากล้องอย่างช้า ๆ ใช้ Medium Tracking Shot กล้องถอยหลังอย่างนุ่มนวล มี Soft Natural Light และเสียงฝีเท้า ห้ามเปลี่ยน Facial Identity”
หาก Video แรกยังไม่สมบูรณ์ ไม่จำเป็นต้องเริ่มใหม่ทั้งหมด เพราะ Gemini Omni รองรับ Multi-turn Editing
สามารถพิมพ์ต่อได้ว่า
“รักษาทุกอย่างเดิม ลดความเร็วกล้อง”
“เปลี่ยนเฉพาะ Background”
“เพิ่มเสียงฝน”
“เปลี่ยน Camera Angle”
Google ระบุว่า Omni สามารถแก้ Object, Character, Camera Angle และ Scene ด้วย Prompt ต่อเนื่อง และพยายามรักษาส่วนที่ทำถูกอยู่แล้วระหว่างการแก้
ดังนั้น Workflow ที่ดีที่สุดคือ
รูปต้นฉบับดี → Prompt ชัด → Movement ไม่ซับซ้อนเกินไป → Generate → ตรวจ → แก้ทีละจุด → Download Final
เมื่อใช้วิธีนี้ Image-to-Video ใน Gemini จะให้ Control มากกว่าการสร้างจากข้อความล้วน โดยเฉพาะงานที่ต้องการรักษา คนเดิม สินค้าเดิม ตัวละครเดิม หรือ Visual Style จากภาพต้นฉบับ