Contact
Line : comsiam
Contact
Line : comsiam

การสร้างวิดีโอสมจริงด้วย Google Gemini ไม่ได้ขึ้นอยู่กับการพิมพ์คำว่า “Photorealistic” หรือ “สมจริงมาก ๆ” เพียงอย่างเดียว แต่ต้องทำให้ คน วัตถุ กล้อง แสง การเคลื่อนไหว Physics และเสียง สอดคล้องกันเหมือนวิดีโอที่ถ่ายจากโลกจริง
ปัจจุบัน Gemini Apps ใช้ Gemini Omni เป็นโมเดลสร้างวิดีโอรุ่นล่าสุด และ Google DeepMind ระบุว่า Omni ผสานความเข้าใจด้าน Physics เข้ากับ World Knowledge ของ Gemini เพื่อสร้างการเคลื่อนไหวและ Scene ที่มี Logic สมจริงมากขึ้น นอกจากนี้ยังสามารถแก้ Video ต่อหลายรอบด้วยภาษาธรรมชาติได้ด้วย
ถ้าต้องการสร้างวิดีโอสมจริง สูตรพื้นฐานที่แนะนำคือ
Subject + Natural Action + Real Location + Camera + Lighting + Physics + Audio + Restrictions
ตัวอย่าง:
“สร้างวิดีโอ Photorealistic Cinematic ของผู้ชายวัยประมาณ 30 ปีใส่เสื้อเชิ้ตสีขาว เดินบนทางเท้าในกรุงเทพฯ ช่วงเย็นหลังฝนตก ใช้ Medium Tracking Shot จากด้านหน้า กล้อง Handheld เบา ๆ แบบกล้องจริง มีแสงธรรมชาติและ Reflection จากถนนเปียก เสื้อและผมเคลื่อนไหวตามลมอย่างละเอียด พร้อมเสียงรถ เสียงฝีเท้า และเสียงเมืองตามธรรมชาติ ไม่มีข้อความ ไม่มี Logo”
Prompt แบบนี้มีโอกาสได้ผลสมจริงกว่าการเขียนเพียง
“สร้างผู้ชายเดินแบบสมจริง 8K”
อย่างมาก
วิดีโอสมจริงไม่ได้หมายถึงเพียง
ภาพคม
ผิวละเอียด
Resolution สูง
แต่หมายถึงหลายองค์ประกอบต้องทำงานร่วมกันอย่างสมเหตุสมผล
เช่น
คนเดินแล้วน้ำหนักตัวต้องเปลี่ยนตามก้าว
เสื้อเคลื่อนไหวตามการเดิน
เงาต้องสัมพันธ์กับแสง
รถต้องเคลื่อนตามถนน
Reflection ต้องสัมพันธ์กับวัตถุ
กล้องต้องมี Movement ที่เป็นไปได้จริง
เสียงฝีเท้าต้องสัมพันธ์กับการเดิน
ถ้าภาพสวยมากแต่คนลอยจากพื้น วิดีโอก็ยังดูเป็น AI
Google DeepMind ระบุว่า Gemini Omni มีความเข้าใจเชิงสัญชาตญาณเกี่ยวกับ Physics เช่น
Gravity
Kinetic Energy
Fluid Dynamics
และสามารถใช้ความรู้เกี่ยวกับ History, Science และ Cultural Context ของ Gemini เพื่อสร้าง Scene ที่มี Logic มากขึ้น
จุดนี้สำคัญมาก เพราะ Video Realism ไม่ได้เกิดจาก Texture เพียงอย่างเดียว
แต่เกิดจาก
โลกในวิดีโอต้องทำงานเหมือนโลกจริง
ขั้นตอนพื้นฐานคือ
เข้าสู่ Gemini Apps ด้วยบัญชีที่รองรับ Video Generation
บนคอมพิวเตอร์เปิด Sidebar แล้วเลือก Create video
บนมือถือเข้า Menu → Videos
Google ระบุว่า Gemini Apps ปัจจุบันใช้ Gemini Omni สำหรับการสร้างและแก้ไข Video
อธิบาย
คนหรือวัตถุ
Action
Scene
Camera
Lighting
Audio
Gemini Apps รองรับการอัปโหลด Video 1 ไฟล์และรูปภาพสูงสุด 5 รูปใน Video Creation Workflow ปัจจุบัน
กด Submit แล้วรอระบบสร้าง Video
ตรวจ Movement
หน้า
มือ
Physics
Lighting
Shadow
Reflection
Audio
หากมีบางส่วนผิด ไม่จำเป็นต้องเริ่มใหม่ทั้งหมด
Gemini Omni รองรับ Multi-turn Editing ทำให้สามารถแก้ Scene เดิมต่อด้วย Conversation ได้
ใช้สูตรนี้
WHO + ACTION + ENVIRONMENT + CAMERA + PHYSICS + LIGHT + AUDIO + REALISM RULES
ตัวอย่าง:
WHO:
ผู้ชายวัย 35 ปี ใส่เสื้อเชิ้ตสีขาว
ACTION:
เดินบนทางเท้า
ENVIRONMENT:
กรุงเทพฯ หลังฝนตก
CAMERA:
Medium handheld tracking shot
PHYSICS:
Movement และเสื้อผ้าตามธรรมชาติ
LIGHT:
Soft cloudy evening light
AUDIO:
Traffic + footsteps + ambience
REALISM:
No exaggerated motion, no artificial glow
รวมเป็น Prompt:
“สร้างวิดีโอ Photorealistic ของผู้ชายวัยประมาณ 35 ปีใส่เสื้อเชิ้ตสีขาวเดินบนทางเท้าในกรุงเทพฯ หลังฝนตก ใช้ Medium Handheld Tracking Shot จากด้านหน้า Movement ของร่างกาย เสื้อผ้าและผมต้องเป็นธรรมชาติ มี Soft Cloudy Evening Light ถนนเปียกมี Reflection ตามจริง พร้อมเสียงรถ เสียงฝีเท้าและ Ambient City ไม่มี Glow เกินจริง ไม่มี Slow Motion และไม่มีข้อความ”
ถ้าต้องการคนสมจริง อย่าอธิบายว่า
“ผู้ชายหล่อมาก Perfect Face”
เพราะอาจทำให้ภาพดูเหมือน CGI หรือ Beauty Filter
ลองใช้คำที่ Grounded มากขึ้น เช่น
natural skin texture
subtle skin imperfections
realistic facial proportions
natural expression
subtle blinking
natural breathing
ตัวอย่าง:
“ผู้หญิงวัยประมาณ 30 ปี มี Natural Skin Texture และ Expression ที่เป็นธรรมชาติ กะพริบตาเป็นครั้งคราวและหายใจตามปกติ”
รายละเอียดเล็ก ๆ เหล่านี้ทำให้ Character ดูมีชีวิตมากขึ้น
วิดีโอ AI มักดูปลอมเมื่อ
ตาจ้องค้าง
ตาเคลื่อนไม่สัมพันธ์
กะพริบผิดจังหวะ
ดังนั้นอาจระบุ
“Natural eye movement and occasional subtle blinking.”
หรือ
“สายตาติดตามสิ่งที่กำลังมองอย่างเป็นธรรมชาติ”
ถ้าต้องการ Reality
แทน
“ยิ้มกว้างมาก ตื่นเต้นสุด ๆ”
ลอง
“subtle natural smile”
หรือ
“relaxed neutral expression”
เพราะ Facial Motion ที่รุนแรงทำให้ Generative Video มีโอกาสเพี้ยนมากขึ้น
Movement เป็นสิ่งที่ทำให้ Video AI ถูกจับได้ง่ายมาก
Prompt
“ให้เขาเดิน”
ยังไม่พอ
ลอง
“ให้ผู้ชายเดินด้วยความเร็วปกติ น้ำหนักตัวเปลี่ยนจากขาหนึ่งไปอีกขาหนึ่งอย่างเป็นธรรมชาติ แขนแกว่งเล็กน้อยตามจังหวะเดิน”
ถ้าต้องการวิ่ง
“Natural running gait, realistic body weight transfer and consistent foot contact with the ground.”
ช่วยกำหนด Physics ได้ดีขึ้น
ปัญหาที่พบได้คือ
Foot Sliding
ตัวละครเดินแต่เท้าเหมือนลื่น
สามารถเขียน
“Feet maintain realistic contact with the ground with no sliding.”
ช่วยบอก Intent ให้ชัด
ถ้ามีลม
ผมต้องขยับ
ชายเสื้อต้องขยับ
ถ้าวิ่ง
เสื้อผ้าควรตอบสนองต่อความเร็ว
ตัวอย่าง
“Hair and loose clothing react subtly and consistently to the natural breeze.”
อย่าสั่ง
“ผมปลิวแรง Cinematic มาก ๆ”
ถ้า Scene มีลมเพียงเบา ๆ
เพราะจะทำให้ Physics ขัดกันเอง
Google DeepMind แนะนำให้ระบุ Location แต่ไม่จำเป็นต้องบอกรายละเอียดทุกอย่าง เพราะ Gemini Omni สามารถใช้ Intent และ World Knowledge เติมรายละเอียดที่สัมพันธ์กับ Scene ได้
ตัวอย่าง
“ถนนในกรุงเทพฯ ช่วงเย็นหลังฝนตก”
ดีกว่า
“เมืองสวย ๆ”
เพราะมี Context ชัด
เรื่อง
ถนน
สภาพอากาศ
เวลา
Environment
Prompt สมจริง:
“ฝนตกเบา ๆ เม็ดฝนเคลื่อนตามแรงโน้มถ่วง กระทบพื้นและสร้าง Ripple เล็ก ๆ บนแอ่งน้ำ ถนนมี Reflection ที่สัมพันธ์กับแสงรถและร้านค้า”
Video จะมี Direction เชิง Physics มากกว่า
“ฝนตกสวย ๆ”
ควรกำหนด
แรงลม
Wave Size
Direction
Interaction
ตัวอย่าง
“คลื่นขนาดเล็กเคลื่อนเข้าหาชายฝั่งอย่างต่อเนื่อง โฟมแตกเมื่อกระทบทรายและถอยกลับอย่างเป็นธรรมชาติ”
Google ระบุว่า Gemini Omni มีความเข้าใจเกี่ยวกับ Fluid Dynamics เพื่อช่วยสร้าง Motion ที่สมจริงขึ้น
Camera เป็นอีกสาเหตุที่ทำให้วิดีโอดู AI
ถ้ากล้อง
บินไปทุกทิศ
หมุนรอบคนเร็วเกินไป
Zoom แบบเป็นไปไม่ได้
Video จะดูไม่เหมือน Footage จริง
Google DeepMind แนะนำให้กำหนด Shot Framing และ Camera Motion อย่างชัด เช่น Static, Push In, Dolly Zoom หรือรูปแบบกล้องเฉพาะ
ใช้
“natural smartphone video”
หรือ
“subtle handheld smartphone camera”
ตัวอย่าง
“Natural smartphone footage with subtle handheld movement, realistic autofocus and normal exposure.”
ให้ Feel ต่างจาก
“Hollywood Cinematic”
มาก
ใช้
“cinematic film camera”
พร้อม Movement ที่สมเหตุผล เช่น
Slow Dolly In
Tracking
Locked-off
Google DeepMind ระบุว่าสามารถกำหนดลักษณะกล้อง เช่น Film Camera, Webcam Style หรือ Natural Smartphone Zoom ได้โดยตรง
ถ้าต้องการตรวจว่า Subject เคลื่อนไหวสมจริงหรือไม่
ลองเริ่มจาก
“Static locked-off camera.”
เพราะกล้องไม่เคลื่อน
AI ต้องจัดการ Motion หลักน้อยลง
เหมาะกับ
คนพูด
สินค้า
สัตว์
การทดลอง Physics
Google DeepMind แนะนำคำว่า
one continuous shot
หรือ
oner
เมื่ออยากให้วิดีโอต่อเนื่องโดยไม่ตัด
ตัวอย่าง:
“สร้างเป็น one continuous shot กล้องติดตามผู้ชายเดินจากถนนเข้าไปในร้าน ไม่มีการตัด Scene”
Google DeepMind แนะนำให้บอกทั้ง
แสงมาจากไหน
และ
แสงมีผลต่อ Scene อย่างไร
แทน
“แสง Cinematic สวย ๆ”
ใช้
“Soft afternoon sunlight enters from the window on the left, producing gentle directional shadows.”
หรือ
“Warm streetlights illuminate the scene from above, reflected naturally on the wet pavement.”
ใช้
Natural daylight
Soft overcast light
Window light
Afternoon sunlight
ตัวอย่าง
“Soft overcast daylight with low contrast and realistic soft shadows.”
เหมาะกับ Footage สมจริงมาก
ถ้าใช้ Golden Hour
ควรให้ Shadow และ Direction สัมพันธ์กัน
“Low warm sunlight from the right side, creating long soft shadows.”
ดีกว่าแค่
“Golden Hour Cinematic”
หลาย Prompt AI ใช้
Neon
Glow
Reflection
มากจนดู Cyberpunk ทั้งที่ต้องการ Real Life
ถ้าต้องการกลางคืนสมจริงให้ใช้
“realistic city lighting, subtle storefront lights and natural streetlamp exposure.”
แทน
“epic neon cinematic lighting everywhere”
ถ้าคนเดินผ่าน Light Source
Shadow ต้องเปลี่ยนตามตำแหน่ง
Prompt อาจเพิ่ม
“Maintain physically consistent shadows based on the direction and intensity of the light source.”
โดยเฉพาะ
Product Video
รถ
คนเดิน
ช่วยลดความรู้สึกว่าของถูกแปะลงใน Scene
ถ้ามี
กระจก
รถ
พื้นเปียก
น้ำ
Reflection เป็นจุดที่ AI ผิดง่าย
Prompt
“Reflections should accurately match the movement, position and lighting of the subject.”
ถ้ารถเคลื่อน แต่ Reflection ไม่เคลื่อนตาม Video จะดูปลอมทันที
Motion Blur มีอยู่ในกล้องจริง
แต่ไม่จำเป็นต้องใส่มาก
Prompt
“natural motion blur consistent with the camera movement and subject speed.”
ช่วยได้
อย่าใช้
“extreme motion blur”
หากเป็น Scene คนเดินธรรมดา
ต่างกันเล็กน้อยใน Intent
เน้นให้เหมือนโลกจริง
เน้นภาษาภาพยนตร์ เช่น
Lighting
Composition
Color
Camera
วิดีโอสามารถเป็นทั้งสองอย่างได้
ใช้
“photorealistic cinematic footage”
เมื่ออยากได้ความสมจริงแต่มี Composition แบบ Film
ถ้าต้องการเหมือนคนถ่ายมือถือจริง ๆ ใช้
“realistic smartphone footage”
อาจเหมาะกว่า Cinematic
Prompt แบบ
8K
16K
Ultra Hyper Detailed
Award-winning
Masterpiece
ไม่ได้แก้ปัญหา Physics
Movement
หรือ Character Consistency
โดยตรง
สิ่งที่ทำให้ Video สมจริงกว่าคือ
Movement
Camera
Light
Interaction
Sound
ที่สัมพันธ์กัน
วิดีโอที่ภาพดีมากแต่เสียงผิด Environment จะรู้สึกปลอมทันที
Gemini Apps รองรับการสร้าง Audio พร้อม Video และ Gemini Omni สามารถ Sync การเปลี่ยนแปลงของ Visual กับเสียงใน Prompt ได้
ตัวอย่าง
คนเดินบนพื้นไม้
ควรมีเสียงไม้
รถวิ่งผ่าน Tunnel
ควรมี Reverb
ชายหาด
ควรมีคลื่นและลม
Prompt
“Footstep sounds synchronized naturally with each step on concrete.”
ถ้าเดินเข้าจากไกล
เสียงควรค่อย ๆ ชัดขึ้น
“Engine sound changes naturally with acceleration and deceleration.”
ดีกว่า
“เสียงรถดังมาก”
ฝนกระทบ
หลังคา
กระจก
ถนน
จะมี Texture เสียงต่างกัน
ตัวอย่าง
“Gentle rain hitting the glass windows and wet pavement, with distant traffic ambience.”
Google DeepMind แนะนำให้เพิ่ม Reference เมื่ออยากรักษา
Character
Object
Environment
ให้ Consistent มากขึ้น
ถ้าต้องการคนจริงเดิม
ใช้ Image Reference
แล้วเขียน
“Use the uploaded image as the master identity reference.”
พร้อมบอกให้รักษา
Face
Hair
Skin tone
Body proportion
Clothing
“Use the uploaded image as the master identity reference. Preserve the same facial identity, eyes, nose, lips, face shape, skin tone, hairstyle and age throughout every frame.”
จากนั้นเพิ่ม Action แบบไม่รุนแรงก่อน
ถ้ามีรูปหน้าตรงเพียงรูปเดียว
แล้วสั่ง
ตีลังกา
หันหลัง
วิ่งเร็ว
Camera Orbit 360°
AI ต้องสร้างข้อมูลที่ Reference ไม่มีจำนวนมาก
Identity จึงมีโอกาส Drift
เริ่มจาก
เดิน
หันเล็กน้อย
ยิ้ม
แล้วค่อยเพิ่มความซับซ้อน
Product Video ต้องให้ความสำคัญกับ
Shape
Material
Logo
Label
Reflection
Shadow
Prompt:
“ใช้สินค้าใน Reference เป็น Master Product รักษารูปร่าง สัดส่วน สี Material, Logo และ Packaging เดิม กล้อง Slow Orbit 120 องศารอบสินค้า มี Studio Softbox Light จากด้านซ้ายและ Rim Light อ่อนด้านหลัง Reflection และ Shadow ต้องสัมพันธ์กับตำแหน่งสินค้า ไม่มีการเปลี่ยนรูปร่างระหว่าง Frame”
แม้ Video จะดูสมจริง
AI อาจทำ
Logo เปลี่ยน
Label เปลี่ยน
ตัวอักษรผิด
ดังนั้น Product Commercial ที่ต้องตรงของจริงควรตรวจ Frame สำคัญอย่างละเอียด
Prompt:
“สร้างวิดีโอ Photorealistic ของรถ Sedan สีดำขับด้วยความเร็วปกติบนถนนในเมืองช่วงเย็น ใช้ Low-angle Tracking Shot จากด้านหน้า ล้อหมุนสัมพันธ์กับความเร็ว Suspension ตอบสนองต่อพื้นถนนอย่างละเอียด Reflection บนตัวรถเปลี่ยนตาม Environment และมีเสียงเครื่องยนต์กับเสียงยางตามธรรมชาติ”
สังเกตว่า Prompt ไม่เน้นแค่
“รถสวย”
แต่ระบุ
ล้อ
Suspension
Reflection
Sound
“สร้างวิดีโอชายหาดสมจริง มีคลื่นขนาดเล็กเคลื่อนเข้าฝั่งตามธรรมชาติ โฟมแตกเมื่อกระทบทราย น้ำถอยกลับและสะท้อนแสงพระอาทิตย์ช่วงเย็นอย่างต่อเนื่อง มีเสียงคลื่นและลมทะเล ไม่มี Slow Motion”
Prompt:
“เปลวไฟเคลื่อนไหวแบบไม่สม่ำเสมอตามการไหลของอากาศ ให้แสงสีส้มจากไฟตกกระทบบริเวณใกล้เคียงอย่างเป็นธรรมชาติ ควันลอยขึ้นตามแรงลม”
ต้องมีทั้ง
ไฟ
แสงจากไฟ
ควัน
เพื่อให้ Scene มี Logic
Prompt:
“Close-up Photorealistic ของ Steak ร้อนบนกระทะ มีไขมันเดือดเล็กน้อย ไอน้ำลอยขึ้นตามธรรมชาติ พื้นผิวอาหารชื้นและสะท้อนแสง Warm Kitchen Light กล้อง Slow Push In พร้อมเสียง Sizzle สมจริง”
Food Video สมจริงขึ้นจาก
Heat
Steam
Surface
Sound
ไม่ใช่เพียง Resolution
“Realistic smartphone video of a busy street market in Bangkok at dusk. Subtle natural handheld motion, normal smartphone exposure, slight autofocus adjustment, realistic pedestrian movement and ambient street sound. No cinematic slow motion, no artificial glow.”
นี่เหมาะกับ Content ที่ต้องการดู
ธรรมดา
จริง
ไม่เหมือนโฆษณา
“Documentary-style footage of fishermen preparing nets beside a small boat at sunrise. Natural handheld camera, realistic ambient sound, subtle wind movement, no dramatic lighting and no exaggerated camera moves.”
เหมาะกับ
Travel
Documentary Concept
Human Interest
“Photorealistic cinematic footage of a lone traveler standing on a mountain ridge at sunrise. Medium-wide shot, slow controlled push-in, natural wind affecting clothing and hair, realistic atmospheric haze and warm sunlight from the horizon. Natural wind ambience only.”
“Photorealistic nighttime street footage in Bangkok after light rain. Cars move at normal traffic speed, pedestrians walk naturally, wet pavement reflects streetlights subtly, camera uses a gentle handheld medium shot, realistic traffic and city ambience, no exaggerated neon glow.”
“สร้างวิดีโอ Photorealistic ของผู้ชายวัยประมาณ 30 ปีใส่เสื้อยืดสีดำและกางเกงยีนส์ เดินบนทางเท้าในเมืองด้วยความเร็วปกติ ใช้ Medium Tracking Shot จากด้านหน้า การเดินต้องมี Natural Body Weight Transfer เท้าสัมผัสพื้นอย่างสมจริง แขนแกว่งเบา ๆ เสื้อเคลื่อนไหวตามการเดินและลม มี Soft Afternoon Light พร้อมเสียงฝีเท้าและเสียงเมือง ไม่มี Slow Motion ไม่มี Glow และไม่มี Movement ที่เกินจริง”
“ใช้บุคคลใน Reference เป็น Master Identity รักษาใบหน้า ทรงผม สีผิว เสื้อผ้าและสัดส่วนร่างกายเดิม ให้บุคคลเดินเข้าหากล้องด้วย Movement ที่เป็นธรรมชาติ ใช้ Medium Handheld Tracking Shot มี Subtle Blinking และ Natural Breathing ผมและเสื้อขยับตามลมเบา ๆ มี Soft Daylight และ Realistic Footstep Sound”
“ใช้สินค้าใน Reference เป็น Master Product รักษารูปร่าง สี Material, Logo และ Packaging ให้ตรงต้นฉบับ กล้อง Slow Orbit รอบสินค้า 120 องศาใน Studio จริง มี Softbox Light จากซ้ายและ Soft Rim Light ด้านหลัง Shadow และ Reflection ต้องสัมพันธ์กับตำแหน่งสินค้า ไม่มีการเปลี่ยน Shape หรือ Label ระหว่าง Frame”
“สร้างวิดีโอ Photorealistic ภายในร้านกาแฟช่วงเช้า Barista เทนมลงกาแฟอย่างเป็นธรรมชาติ ไอน้ำลอยขึ้นเบา ๆ กล้อง Handheld Medium Close-up มี Soft Window Light พร้อมเสียง Espresso Machine เสียงแก้ว และ Ambient Conversation เบา ๆ ไม่มี Cinematic Glow”
“สร้างวิดีโอถนนในเมืองช่วงฝนตกเบา ๆ เม็ดฝนตกตามแรงโน้มถ่วง กระทบพื้นและรถอย่างเป็นธรรมชาติ ถนนมีแอ่งน้ำเล็ก ๆ และ Reflection ที่สัมพันธ์กับไฟถนน รถเคลื่อนด้วยความเร็วปกติ พร้อมเสียงฝนและเสียงยางบนพื้นเปียก”
อย่า Generate ใหม่ทันที
ถามว่าอะไรดูปลอม
แก้ Facial Motion
แก้ Body Mechanics
ลด Movement
กำหนด Source
ขอให้สัมพันธ์กับ Environment
แก้ Ambient
Gemini Omni รองรับการแก้เฉพาะจุดผ่าน Conversation และ Google DeepMind แนะนำให้ทำ Iterative Editing แทนการ Prompt Scene ใหม่ทั้งหมดทุกครั้ง
ใช้
PRESERVE + FIX ONE REALISM PROBLEM
ตัวอย่าง
“รักษา Scene, Character, Camera และ Lighting เดิมทั้งหมด แก้เฉพาะการเดินให้เป็นธรรมชาติขึ้น เท้าต้องสัมผัสพื้นโดยไม่ไถล และน้ำหนักตัวต้องเปลี่ยนตามแต่ละก้าว”
หรือ
“รักษาวิดีโอเดิมทั้งหมด แก้เฉพาะ Lighting ให้มาจาก Streetlight จริงและลด Neon Glow ที่เกินจริง”
ถ้ามีปัญหา
หน้า
มือ
เดิน
แสง
เสียง
ให้เริ่มจากปัญหาหลักหนึ่งอย่าง
เพราะ Google DeepMind ระบุว่า Omni สามารถรักษาส่วนที่ทำงานดีไว้ระหว่างการแก้ต่อหลายรอบ
ลอง Prompt:
“Reduce the camera movement. Use a subtle handheld camera with realistic human-operated motion.”
หรือ
“Use a static locked-off camera.”
กล้องที่นิ่งและง่ายมักช่วยให้ Scene ดู Grounded มากขึ้น
ความสมจริงกับ Resolution เป็นคนละเรื่อง
Video 4K ที่คนเดินผิด Physics ยังดูปลอม
Video Resolution ต่ำกว่าที่
Movement
Lighting
Camera
Audio
สมจริง อาจดูเป็น Footage จริงมากกว่า
ดังนั้น Prompt ควรให้ Priority แก่
Physical Consistency
ก่อน
Resolution Buzzwords
ถ้าต้องการให้เหมือน Footage จริง
ใช้
Photorealistic
Realistic footage
Natural documentary footage
ถ้าใช้
Hyperrealistic
อาจได้งานที่เน้น Detail และ Contrast มากเกินโลกจริง
ไม่ผิด
แต่ไม่จำเป็นต้องดีที่สุดสำหรับ Real-life Look
Google DeepMind ระบุองค์ประกอบสำคัญของ Gemini Omni Prompt ได้แก่
Shot Framing และ Motion
Style
Lighting
Location
Action
และแนะนำว่ายิ่งเพิ่มรายละเอียดที่เกี่ยวข้อง ก็ยิ่งควบคุม Output ได้มากขึ้น
สำหรับ Realistic Video จึงควรให้รายละเอียดกับองค์ประกอบเหล่านี้ก่อนคำว่า
“Ultra HD”
หรือ
“Masterpiece”
Gemini Omni มี World Understanding และสามารถใช้ความรู้ของโลกจริงช่วยเติมรายละเอียดของ Scene ได้ Google DeepMind ระบุว่าผู้ใช้ไม่จำเป็นต้องอธิบายทุกเรื่องอย่างละเอียดเท่าการใช้ Video Model แบบเดิมในบาง Workflow
หลักคือ
บอกสิ่งที่สำคัญ
แล้วปล่อยรายละเอียดที่ไม่สำคัญให้ Model จัดการ
ดูเหมือนคน/วัตถุจริงหรือยัง
Movement เป็นไปได้จริงไหม
มี Context ชัดหรือไม่
เป็น Movement ที่กล้องจริงทำได้ไหม
มี Source ชัดไหม
Gravity, Wind, Water สมเหตุผลไหม
สัมพันธ์กับแสงไหม
สัมพันธ์กับ Object ไหม
สัมพันธ์กับ Scene ไหม
มีอะไรที่ไม่ต้องการ เช่น Glow หรือ Slow Motion
ตรวจ
ใบหน้า
ดวงตา
ฟัน
มือ
นิ้ว
เท้า
การเดิน
เสื้อผ้า
ผม
เงา
Reflection
Physics
Camera
เสียง
Background Continuity
ทีละข้อ
ถ้าผิดเพียงหนึ่งจุดให้ Edit จุดนั้นก่อน
ยิ่ง AI Video ดูเหมือนจริงมากเท่าไร ยิ่งต้องระมัดระวังบริบทการใช้งานมากขึ้น
Google ระบุว่าผู้ใช้ไม่ควรสร้างหรือแชร์วิดีโอเพื่อหลอกลวง คุกคาม หรือทำร้ายผู้อื่น และต้องมีสิทธิใน Media ที่ Upload รวมถึงไม่ละเมิด Copyright หรือ Privacy Rights
โดยเฉพาะ
บุคคลจริง
ข่าว
เหตุการณ์
การเมือง
หลักฐาน
โฆษณา Before/After
ควรเปิดเผยบริบท AI อย่างเหมาะสมหากมีโอกาสทำให้ผู้ชมเข้าใจผิด
Google Help ปัจจุบันระบุว่า Personal Account ต้องมี Google AI Plan เพื่อใช้ Gemini Video Generation ส่วนบัญชี Work/School ต้องมี Workspace License ที่เข้าเกณฑ์ และ Feature ยังไม่เปิดให้ผู้ใช้อายุต่ำกว่า 18 ปี
Feature และ Limits สามารถต่างกันตาม
Plan
Region
บัญชี
และช่วงเวลา
ช่วยได้มากเมื่อสิ่งที่ต้องการมีรูปลักษณ์เฉพาะ เช่น
บุคคล
สินค้า
สถานที่
Character
Google DeepMind แนะนำการใช้ Reference เพื่อรักษา Character, Object หรือ Environment ให้ Consistent มากขึ้น
แต่ Reference ไม่ได้การันตี Pixel-perfect
Human Review ยังจำเป็น
| Prompt | ผลที่มีแนวโน้ม |
|---|---|
| “สร้างคนเดินสมจริง 8K” | AI ต้องเดาเกือบทั้งหมด |
| “Natural walking with realistic body weight” | Movement ชัดขึ้น |
| “แสงสวย” | Direction ไม่ชัด |
| “Soft daylight from left, natural shadows” | Lighting มี Logic |
| “กล้อง Cinematic” | Camera ไม่ชัด |
| “Subtle handheld medium tracking shot” | Movement ชัด |
| “มีเสียงจริง” | Audio กว้าง |
| “Footsteps synced with each step” | Audio มี Timing |
| “ฝนสวย ๆ” | Physics ไม่ชัด |
| “Rain falls naturally and forms small ripples” | Scene Grounded มากขึ้น |
ได้ Gemini Omni ถูกออกแบบให้มีความเข้าใจด้าน Physics และ World Knowledge เพื่อช่วยสร้าง Movement และ Scene ที่สมเหตุสมผลมากขึ้น
ไม่จำเป็น แต่คำว่า Photorealistic ช่วยบอก Style สิ่งที่สำคัญกว่าคือ Movement, Camera, Lighting, Physics และ Audio ต้องสัมพันธ์กัน
Google DeepMind ระบุว่า Omni มีความเข้าใจเกี่ยวกับ Gravity, Kinetic Energy และ Fluid Dynamics เพื่อช่วยสร้าง Movement ที่สมจริง
ระบุ Natural Gait, Body Weight Transfer, Foot Contact และ Arm Movement และหลีกเลี่ยง Movement ที่ซับซ้อนเกินไปใน Generation แรก
ใช้ Image Reference และระบุให้รักษา Facial Identity, Face Shape, Eyes, Nose, Lips, Skin Tone และ Hairstyle ให้คงเดิม
ขึ้นอยู่กับ Intent ถ้าต้องการ Footage ธรรมดา ลอง Static, Subtle Handheld หรือ Natural Smartphone Camera ถ้าต้องการ Film Look ใช้ Controlled Dolly หรือ Tracking Shot
ได้ Gemini Apps รองรับการสร้าง Video พร้อม Audio และ Omni สามารถใช้ Action/Audio ร่วมกันใน Prompt ได้
ไม่ต้อง Omni รองรับ Multi-turn Editing และสามารถขอแก้เฉพาะ Camera, Background, Action หรือรายละเอียดอื่นโดยรักษาส่วนที่ดีไว้
Gemini Apps ปัจจุบันรองรับรูปภาพสูงสุด 5 รูปพร้อม Video 1 ไฟล์ใน Video Creation Workflow
ไม่เสมอ ความสมจริงขึ้นกับ Movement, Physics, Camera, Lighting, Character Consistency และ Audio ด้วย Resolution สูงอย่างเดียวไม่แก้ความผิดปกติเหล่านี้
ไม่จำเป็น Google DeepMind แนะนำให้เพิ่มรายละเอียดที่เกี่ยวข้อง เช่น Camera, Style, Lighting, Location และ Action แต่ไม่ต้องอธิบายรายละเอียดที่ไม่มีผลต่อ Intent ทุกอย่าง
ใช่ Google DeepMind ระบุว่า Veo 3.1 ถูกออกแบบใหม่เพื่อเพิ่ม Realism และ Fidelity พร้อมปรับ Prompt Adherence และ Creative Control ให้ดีขึ้น
การสร้างวิดีโอสมจริงด้วย Gemini ไม่ควรเริ่มจากคำว่า
8K + Ultra Realistic + Masterpiece
แล้วหวังว่าทุกอย่างจะเหมือนโลกจริงโดยอัตโนมัติ
สิ่งที่ทำให้ Video ดูสมจริงจริง ๆ คือ
① Subject มีรายละเอียดธรรมชาติ
② Movement มีน้ำหนักและ Physics
③ เท้าสัมผัสพื้นอย่างสมเหตุผล
④ ผมและเสื้อผ้าตอบสนองต่อ Action
⑤ Camera เคลื่อนแบบที่กล้องจริงทำได้
⑥ Lighting มีแหล่งกำเนิดชัด
⑦ Shadow และ Reflection สอดคล้องกับ Scene
⑧ Environment มี Logic
⑨ Audio ตรงกับ Action
⑩ Character และ Object คงที่ระหว่าง Frame
Google DeepMind ระบุว่า Gemini Omni มีความเข้าใจทั้ง Physics และ World Knowledge และ Prompt Guide แนะนำให้ควบคุม Video ผ่านองค์ประกอบอย่าง Shot Framing, Motion, Lighting, Location และ Action
สูตรที่ควรจำคือ
SUBJECT + NATURAL ACTION + REAL ENVIRONMENT + CAMERA + PHYSICS + LIGHT + AUDIO + RESTRICTIONS
ตัวอย่าง:
“สร้างวิดีโอ Photorealistic ของผู้ชายวัยประมาณ 30 ปีเดินบนทางเท้าในกรุงเทพฯ หลังฝนตก ใช้ Subtle Handheld Medium Tracking Shot การเดินมี Natural Body Weight Transfer เท้าสัมผัสพื้นอย่างสมจริง เสื้อและผมตอบสนองต่อลม มี Soft Evening Light ถนนเปียกสะท้อนแสงตามจริง พร้อมเสียงฝีเท้า รถและเสียงเมือง ไม่มี Cinematic Glow ไม่มี Slow Motion”
หลัง Generate แล้วอย่ารีบสร้างใหม่ทั้งหมด
ถ้าเดินผิด ให้แก้การเดิน
ถ้าแสงผิด ให้แก้แสง
ถ้า Camera ดูปลอม ให้ลด Movement
ถ้าเสียงไม่ตรง ให้แก้ Audio
เพราะ Gemini Omni รองรับการแก้ Video ต่อเนื่องแบบ Multi-turn และ Google แนะนำให้ขอ Specific Update โดยรักษาสิ่งที่ทำงานดีอยู่แล้ว
Workflow ที่เหมาะที่สุดจึงเป็น
Generate → Inspect → Identify One Unrealistic Detail → Fix → Inspect Again
แทน
Generate ใหม่ซ้ำ ๆ
ถ้าทำตามหลักนี้ วิดีโอจาก Gemini จะมีโอกาสดู Grounded และสมจริงขึ้นอย่างมาก เพราะเราไม่ได้สั่งเพียงให้ AI “ทำภาพให้สวย” แต่กำลังบอกให้ โลกทั้งใบในวิดีโอทำงานอย่างสมเหตุสมผล