Contact
Line : comsiam
Contact
Line : comsiam

Veo 3.1 คือโมเดลสร้างวิดีโอ AI ระดับสูงของ Google DeepMind ที่พัฒนาต่อจาก Veo 3 โดยเน้น ความสมจริง การทำตาม Prompt การควบคุมฉาก และการสร้างเสียงพร้อมวิดีโอแบบ Native
Google DeepMind ปัจจุบันเรียก Veo 3.1 ว่าเป็นหนึ่งในโมเดล Video Generation ชั้นนำของบริษัท และรองรับทั้ง Text-to-Video, Image-to-Video รวมถึงการสร้างวิดีโอพร้อมเสียง โดยเฉพาะ Sound Effects, Ambient Sound และ Dialogue
ความสามารถสำคัญของ Veo 3.1 ได้แก่
Text-to-Video
Image-to-Video
Native Audio
วิดีโอแนวตั้ง 9:16
วิดีโอแนวนอน 16:9
First Frame + Last Frame
Reference Images
Video Extension
720p, 1080p และ 4K ใน Workflow/API ที่รองรับ
แต่มีเรื่องหนึ่งที่ต้องเข้าใจให้ถูกในปี 2026 คือ Veo 3.1 กับ Video Generator ปัจจุบันใน Gemini Apps ไม่ได้เป็นคำเดียวกันเสมอไป
ช่วงต้นปี 2026 Google นำ Veo 3.1 เข้า Gemini App โดยตรง และยังขยายความสามารถ Ingredients to Video, Vertical Video และความละเอียดสูงต่อเนื่อง
แต่ข้อมูล Gemini Apps Help ล่าสุดในเดือนสิงหาคม 2026 ระบุว่า Gemini Omni เป็นโมเดลสร้างและแก้ไขวิดีโอล่าสุดใน Gemini Apps
ดังนั้นถ้าคุณเปิด Gemini วันนี้แล้วไม่เห็นปุ่มเขียนว่า “Veo 3.1” ไม่ได้หมายความว่า Veo หายไป
Veo 3.1 ยังใช้งานได้ใน Ecosystem ของ Google เช่น Gemini API และเครื่องมือสร้างสรรค์ของ Google ขณะที่ Gemini Apps รุ่นล่าสุดกำลังใช้ Gemini Omni เป็นประสบการณ์ Video Creation หลัก
สมมติคุณพิมพ์ว่า
“สร้างวิดีโอรถสปอร์ตสีดำกำลังวิ่งบนถนนโตเกียวตอนกลางคืนหลังฝนตก กล้อง Tracking ตามรถจากด้านหลัง พร้อมเสียงเครื่องยนต์ เสียงยาง และเสียงฝน”
Veo 3.1 จะพยายามสร้างขึ้นมาใหม่ทั้ง
รถ
ถนน
เมือง
Camera Movement
Lighting
Reflection
Movement
เสียงเครื่องยนต์
เสียงฝน
เป็น Video Clip เดียว
จุดสำคัญคือเสียงไม่ได้จำเป็นต้องนำมาใส่ทีหลัง เพราะ Veo 3.1 มีระบบ Native Audio
Veo 3.1 พัฒนาโดย
Google DeepMind
เป็นส่วนหนึ่งของ Ecosystem Generative Media ของ Google
ถ้าแยกตามงานแบบง่าย ๆ
Nano Banana → ภาพ
Veo → วิดีโอ
Lyria → เพลง
Gemini → Reasoning และ Multimodal AI
Gemini Omni → Multimodal Video Creation + Conversational Editing
แต่ปัจจุบันเทคโนโลยีเหล่านี้เริ่มเชื่อมกันมากขึ้นเรื่อย ๆ
Google DeepMind เน้นจุดเด่นหลักของ Veo รุ่นนี้อยู่สามด้าน
Google ระบุว่า Veo 3.1 ถูกออกแบบเพื่อเพิ่ม Realism และ Fidelity โดยอาศัยความเข้าใจเกี่ยวกับ Real-world Physics และ Audio
ตัวอย่างเช่น
น้ำ
ฝน
ควัน
แสงสะท้อน
การเคลื่อนไหวของรถ
การเคลื่อนไหวของคน
ควรดูสมเหตุสมผลขึ้น
แต่ก็ยังต้องตรวจ Output เพราะ Generative AI ไม่ได้รับประกัน Physics ถูกต้องทุก Frame
Prompt Adherence หมายถึง
AI ทำตามคำสั่งเราได้ตรงแค่ไหน
Google ระบุว่า Veo 3.1 ได้รับการปรับปรุงด้านการทำตาม Prompt ทำให้สามารถตอบสนองต่อคำอธิบาย Scene, Action และ Camera ได้แม่นขึ้น
ตัวอย่าง
แทนที่จะเขียน
“รถวิ่งสวย ๆ”
ใช้
“รถสปอร์ต Coupe สีดำด้านวิ่งผ่านถนนเปียกในโตเกียวตอนกลางคืน กล้อง Low-angle Tracking ตามจากด้านหลัง”
AI มี Direction ที่ชัดกว่า
นี่เป็นจุดเด่นใหญ่
Veo สามารถสร้าง
Sound Effects
Ambient Noise
Dialogue
ร่วมกับ Visual ได้
Google DeepMind ระบุว่า Audio สามารถสร้างแบบ Native พร้อมกับ Video ได้
ตัวอย่าง
รถเร่ง → เสียงเครื่องยนต์สูงขึ้น
ฝนตก → เสียงฝน
ชายหาด → เสียงคลื่น
ตัวละครพูด → Dialogue
ทำให้ Workflow ไม่จำเป็นต้องแยกภาพและเสียงเสมอไป
ได้
สามารถเขียนบทพูดลงใน Prompt ได้ เช่น
“ชายสูงวัยพูดด้วยน้ำเสียงสงบว่า ‘คืนนี้เมืองเงียบกว่าปกติ’”
Veo จะพยายามสร้าง
เสียง
ตัวละคร
ภาพ
Movement
ให้สัมพันธ์กัน
Google แสดงตัวอย่าง Veo ที่มี Dialogue ภายใน Prompt โดยตรงในหน้า Model ปัจจุบัน
ได้
นี่คือ Text-to-Video
ตัวอย่าง
“สร้างวิดีโอ Cinematic ของรถสปอร์ตสีดำวิ่งผ่าน Tunnel ตอนกลางคืน กล้อง Low-angle Tracking พร้อมเสียงเครื่องยนต์และ Tunnel Reverb”
ไม่จำเป็นต้องมีรูปต้นฉบับ
Veo จะ Generate Scene ใหม่จาก Text
ได้
Image-to-Video เป็นอีกความสามารถหลักของ Veo 3.1
ตัวอย่าง
Upload รูปรถ
แล้ว Prompt
“ใช้รถจากภาพเป็นรถคันเดิม ให้รถออกตัวและวิ่งไปข้างหน้าบนถนนตอนกลางคืน กล้อง Tracking ตามจากด้านหลัง รักษารูปทรงและสีของรถ”
Google ระบุ Veo 3.1 เป็นโมเดลระดับสูงทั้งด้าน Text-to-Video และ Image-to-Video
Reference Images คือการให้รูปตัวอย่างแก่ AI เพื่อบอกว่า
คนต้องหน้าตาแบบนี้
สินค้าต้องเป็นแบบนี้
รถต้องเป็นแบบนี้
Style ต้องประมาณนี้
แทนการอธิบายทุกอย่างด้วยข้อความ
ใน Gemini API ปัจจุบัน Veo 3.1 รองรับ Reference Images สูงสุด 3 ภาพ สำหรับการควบคุม Content ของวิดีโอ
ตัวอย่าง
Reference 1 = Character
Reference 2 = Product
Reference 3 = Environment
แล้ว Prompt
“ใช้ Character จาก Reference 1 ถือ Product จาก Reference 2 และเดินอยู่ใน Environment ตาม Reference 3”
ได้
Google เพิ่มการรองรับ Portrait Video ใน Veo 3.1
สามารถเลือกระหว่าง
16:9 Landscape
และ
9:16 Portrait
ใน Workflow/API ที่รองรับ
ทำให้เหมาะกับ
TikTok
Instagram Reels
YouTube Shorts
Facebook Reels
โดยไม่จำเป็นต้องสร้าง 16:9 แล้ว Crop อย่างเดียว
ถ้าสร้าง Video 16:9 แล้ว Crop ไป 9:16
อาจตัด
คน
สินค้า
ข้อความ
Environment
ออก
การสร้าง 9:16 ตั้งแต่ต้นช่วยให้ AI จัด Composition สำหรับมือถือโดยตรง
“สร้าง Vertical Video 9:16 ของผู้หญิงเดินผ่านโตเกียวช่วง Golden Hour ใช้ Full-body Tracking Shot จากด้านหน้า Camera Movement Smooth มี Ambient City Sound และเว้นพื้นที่ด้านบนสำหรับ Caption ไม่มีข้อความในวิดีโอ”
ข้อมูล Gemini API ปัจจุบันระบุว่า Veo 3.1 สามารถสร้าง Video ความยาว 8 วินาทีใน
720p
1080p
หรือ
4K
พร้อม Native Audio ใน Workflow/API ที่รองรับ
ข้อสำคัญคืออย่าสรุปว่า
“เปิด Gemini App ทุกบัญชีแล้วได้ 4K”
เพราะ Model Capability กับ App Output ไม่จำเป็นต้องเท่ากันทุก Surface
สำหรับ Gemini API ปัจจุบัน Google ระบุ Base Generation ของ Veo 3.1 ที่
8 วินาที
แต่ไม่ได้หมายความว่าวิดีโอ Veo จะยาวได้เพียง 8 วินาทีตลอดไป
เพราะ Veo 3.1 มี
Video Extension
สำหรับต่อ Video เดิมได้
Video Extension คือการต่อคลิปที่ Veo สร้างไว้แล้ว
เช่นคลิปแรกจบตอนรถถึงหน้าตึก
Prompt ต่อ
“รถจอดหน้าตึก ประตูเปิด และผู้ชายเดินลงจากรถ”
Veo สามารถต่อ Scene ออกไปอีก
Gemini API ปัจจุบันระบุว่าแต่ละ Extension เพิ่มได้ประมาณ 7 วินาที และสามารถต่อซ้ำได้สูงสุดหลายรอบ โดย Video ที่ Veo สร้างสามารถยาวได้สูงสุดประมาณ 141 วินาที ตามข้อจำกัดปัจจุบันของ API
การสร้างคลิปใหม่แยกกันอาจทำให้
Character เปลี่ยน
Lighting เปลี่ยน
รถเปลี่ยน
Camera เปลี่ยน
แต่ Extension ใช้คลิปเดิมเป็นฐาน
จึงเหมาะกับการสร้าง Story ต่อเนื่องมากกว่า
Veo 3.1 มีความสามารถพิเศษที่ช่วยให้กำหนด
ภาพเริ่มต้น
และ
ภาพสุดท้าย
ของ Video
จากนั้นให้ AI สร้าง Movement ระหว่างสองภาพ
Google Gemini API ระบุว่า Feature First/Last Frame ใช้กับ Veo 3.1 โดยเฉพาะ
First Frame
รถจอดหน้าบ้าน
Last Frame
รถอยู่ปลายถนน
Prompt
“รถเริ่มออกตัวอย่างช้า ๆ จากนั้นเร่งความเร็วไปตามถนน กล้อง Tracking จากด้านหลัง จบตรงตำแหน่งใน Last Frame”
AI จะสร้างช่วง Transition ระหว่างสองภาพ
เหมาะกับ
Product Reveal
Transformation
Character Movement
Storyboard
Shot Planning
Transition
Animation
เพราะผู้สร้าง Control ทั้งจุดเริ่มและจุดจบได้
นี่เป็นหนึ่งใน Use Case หลัก
Google ระบุว่า Veo 3.1 รองรับ Visual/Cinematic Style หลากหลายและได้รับการออกแบบสำหรับ Filmmaker และ Storyteller
สามารถกำหนด
Shot
Lens Feel
Camera Movement
Lighting
Mood
Audio
ได้ผ่าน Prompt
ตัวอย่าง
Close-up
Medium Shot
Wide Shot
Low Angle
High Angle
Tracking Shot
Dolly In
Dolly Out
Push In
Pan
Tilt
Orbit
Drone Shot
Handheld
ตัวอย่าง Prompt
“เริ่มด้วย Wide Shot ของเมือง จากนั้น Slow Dolly In ไปยังตัวละครที่ยืนอยู่กลางถนน”
ใช้สูตรนี้
Subject + Action + Environment + Shot + Camera Movement + Lighting + Style + Audio + Restrictions
ตัวอย่าง
Subject:
รถสปอร์ตสีดำ
Action:
วิ่งเร็ว
Environment:
โตเกียวกลางคืน
Shot:
Low Angle
Camera:
Tracking
Lighting:
Neon
Style:
Photorealistic Cinematic
Audio:
Engine + Rain
Restrictions:
No text, no logos
“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ต Coupe สีดำด้านวิ่งผ่านถนนโตเกียวตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot จากด้านหลัง กล้องเคลื่อนตามรถอย่างนุ่มนวล มี Blue และ Pink Neon Reflection บนถนน พร้อมเสียงเครื่องยนต์สมจริง เสียงยางบนถนนเปียกและเสียงฝน ไม่มีเพลง ไม่มีข้อความ ไม่มี Logo”
“Drone shot following a classic sports car along a winding coastal road at sunset. The car accelerates quickly while waves crash against the cliffs below. Realistic engine roar, wind and ocean ambience.”
นี่เป็นโครงสร้าง Prompt แบบเดียวกับตัวอย่าง Cinematic Realism ที่ Google ใช้ในเอกสาร Veo 3.1 API
“สร้าง Close-up Cinematic ของ Barista กำลังเท Latte Art กล้อง Slow Push In มี Soft Morning Window Light พร้อมเสียงเครื่อง Espresso เสียงนมและ Ambient Café เบา ๆ ไม่มีเพลง”
“ใช้ Product Reference เป็นสินค้าหลัก รักษารูปทรง สี และ Material กล้อง Slow Orbit รอบสินค้าใน Premium Black Studio มี Golden Rim Light และ subtle cinematic ambience”
ถ้าเป็นสินค้าจริงต้องตรวจ
Logo
Label
Packaging
Shape
อีกครั้งทุกครั้ง
“Drone Cinematic บินเหนือภูเขาและทะเลหมอกช่วงพระอาทิตย์ขึ้น กล้องเคลื่อน Forward อย่างช้าและมั่นคง มี Golden Morning Light พร้อมเสียงลมและนกในระยะไกล”
“ใช้ Character จาก Reference Image เป็นตัวละครหลัก ให้เดินผ่านตลาดกลางคืนอย่างเป็นธรรมชาติ กล้อง Medium Tracking จากด้านหน้า รักษาเสื้อผ้า สีผิว และ Visual Identity ให้สอดคล้องตลอด Video”
Veo เน้น Native Audio สำหรับ Video
สามารถสร้าง
Music Mood
Ambient Sound
Sound Effects
Dialogue
เป็นส่วนหนึ่งของ Scene ได้
แต่ถ้าจุดประสงค์คือการทำเพลงโดยเฉพาะ Google มีโมเดลตระกูล Lyria สำหรับ Music Generation
ดังนั้น
Veo → Video + Audio
Lyria → Music
เป็นการแบ่งงานที่เข้าใจง่ายกว่า
Veo รุ่นที่รองรับ Dialogue พยายามสร้างเสียงและภาพร่วมกัน
จึงสามารถสร้างตัวละครที่พูดได้
แต่ยังไม่ควรถือว่า
Lip Sync
คำพูด
Voice
ตรง 100%
โดยไม่ตรวจ
สำหรับโฆษณาหรือ Content สำคัญ ต้องดู Video Final ด้วยตัวเองทุกครั้ง
Google ระบุว่า Veo 3.1 เน้น Real-world Physics และ Realism มากขึ้น
เช่น
น้ำกระเซ็น
รถเคลื่อน
เสื้อผ้า
ควัน
Reflection
Shadow
แต่คำว่า Physics ดีขึ้นไม่ได้แปลว่าเป็น Physics Simulation สำหรับงานวิศวกรรม
ควรถือเป็น Visual Generation
ไม่ใช่เครื่องมือ Simulation ทางวิทยาศาสตร์
จุดนี้ต้องแบ่งเป็น Gemini Apps กับ Gemini API
เพราะคำว่า “Gemini” หมายถึงได้หลายอย่าง
ช่วงต้นปี 2026 Google เปิดให้ใช้ Veo 3.1 ใน Gemini App โดยมีการเพิ่ม Ingredients to Video และ Vertical Video โดยตรง
ในช่วงนั้น Workflow คือ
Gemini
→ Create video
→ Prompt
→ Image Reference ถ้ามี
→ Generate
อย่างไรก็ตาม Gemini Apps Help ล่าสุด ณ เดือนสิงหาคม 2026 ระบุว่า Gemini Omni เป็นโมเดล Video Generation ล่าสุดของ Gemini Apps
ดังนั้นผู้ใช้ปัจจุบันอาจไม่เห็นตัวเลือกชื่อ Veo 3.1 ใน Gemini App แล้ว
ไม่จำเป็น
นี่เป็นเรื่องสำคัญมาก
ข้อมูล Google ช่วงมกราคม 2026 ระบุ Veo 3.1 ใช้ใน Gemini App
แต่ข้อมูล Help ปัจจุบันเดือนสิงหาคม 2026 เปลี่ยนมาระบุ Gemini Omni เป็น Latest Video Generation Model
ดังนั้น Interface สามารถเปลี่ยนได้
หากเป้าหมายคือ
“สร้าง Video ใน Gemini”
ให้ใช้เมนู
Videos / Create video
ที่บัญชีแสดง
ไม่จำเป็นต้องยึดว่าต้องเห็นคำว่า Veo 3.1
ถ้าต้องการ Veo 3.1 โดยเฉพาะ วิธีที่ชัดเจนมากคือ Gemini API
Google มีเอกสารเฉพาะชื่อ
Generate videos with Veo 3.1 in Gemini API
และปัจจุบันรองรับการเรียก Veo 3.1 โดยตรง
เหมาะสำหรับ
Developer
เว็บแอป
ระบบสร้าง Video
Automation
Creative Tools
Production Pipeline
เอกสารปัจจุบันของ Google ใช้ตัวอย่าง Model เช่น
veo-3.1-generate-preview
ในการเรียกสร้างวิดีโอผ่าน Gemini API
ชื่อ Model และสถานะ Preview/GA สามารถเปลี่ยนได้ในอนาคต
Developer จึงควรตรวจเอกสารล่าสุดก่อน Deploy Production
ปัจจุบันรองรับ
Text-to-Video
Dialogue
Cinematic Realism
Image-to-Video
First/Last Frame
Reference Images
Video Extension
หลาย Resolution
Native Audio
ข้อมูลปัจจุบันระบุว่า Veo 3.1 รองรับ สูงสุด 3 Reference Images สำหรับ Image-based Direction
อย่าสับสนกับ Gemini Omni ใน Gemini Apps ซึ่งอาจมีจำนวนไฟล์ Upload แตกต่างกัน
เพราะเป็นคนละ Workflow
Veo ถูกออกแบบมาอย่างมากสำหรับงาน Creator และ Filmmaker
Google DeepMind มีตัวเลือก
Try in Flow
โดยตรงบนหน้า Veo
Flow เหมาะกับ
Scene
Shot
Story
Film Concept
Creative Production
มากกว่าการสร้างคลิปเดี่ยวอย่างเดียว
เลือก Flow เมื่อ
ต้องสร้างหลาย Shot
ต้องทำ Story ต่อเนื่อง
ใช้ Ingredients/References
ต้องการ Creative Control มาก
กำลังทำ Film/Advertising Workflow
ส่วน Gemini Apps เหมาะกับการสร้าง Video อย่างรวดเร็วและ Conversational Workflow
Google ประกาศในเดือนมกราคม 2026 ว่า Veo 3.1 Ingredients to Video รองรับ Vertical Video และนำไปใช้ใน
Gemini App
YouTube Shorts
Flow
Gemini API
Vertex AI
Google Vids
ดังนั้น Veo ไม่ได้จำกัดอยู่ใน Gemini อย่างเดียว
Google ระบุ Veo 3.1 เป็นส่วนหนึ่งของ Workflow สร้าง Vertical Video สำหรับ YouTube Shorts ด้วย
นี่เป็นเหตุผลที่ 9:16 มีความสำคัญมากขึ้น
Google ระบุ Google Vids เป็นอีก Surface ที่ใช้ Veo 3.1 ได้
เหมาะกับ
Business Video
Training
Presentation
Internal Communication
มากกว่างาน Film แบบเต็มรูปแบบ
Google ยังนำ Veo เข้าสู่ Vertex AI สำหรับ Developer และ Enterprise Workflow และ Google ระบุ Vertex AI เป็นหนึ่งในช่องทางที่ได้รับการอัปเดต Veo 3.1
เหมาะกับองค์กรที่ต้องการ
API
Cloud Infrastructure
Security
Production Integration
นี่เป็นคำถามที่สำคัญในปี 2026
เป็น Video Generation Model Family ของ Google DeepMind
จุดเด่นเช่น
Native Audio
First/Last Frame
Video Extension
Reference Images
Cinematic Generation
เป็น Video Creation Model/Experience รุ่นใหม่ที่ Google เน้น
Multimodal Input
Reasoning
Conversational Editing
Video-to-Video
Multi-turn Editing
ดังนั้นไม่ควรมองว่าเป็นชื่อเดียวกัน
| ความสามารถ | Veo 3.1 | Gemini Omni |
|---|---|---|
| Text-to-Video | ✅ | ✅ |
| Image-to-Video | ✅ | ✅ |
| Audio | ✅ | ✅ |
| Dialogue | ✅ | ✅ |
| First + Last Frame | ✅ เด่น | ไม่ใช่จุดขายหลัก |
| Video Extension | ✅ เด่น | Workflow ต่างกัน |
| Reference Images | ✅ | ✅ |
| Conversational Editing | ไม่ใช่จุดเน้นหลัก | ✅ เด่น |
| Multi-turn Video Editing | จำกัดกว่า | ✅ เด่น |
| Video-to-Video Conversation | ไม่ใช่จุดเด่นหลัก | ✅ |
| Gemini Apps รุ่นล่าสุด | ไม่ใช่ชื่อหลักใน Help ปัจจุบัน | ✅ |
ข้อมูล Gemini Apps Help ล่าสุดระบุ Omni เป็น Latest Video Model ขณะที่เอกสาร Gemini API ยังคงรองรับ Veo 3.1 โดยตรง
Veo 3.1 เหมาะมากเมื่อ
ต้องการ Cinematic Clip
ต้องการ Native Audio
ต้องการ First/Last Frame
ต้องการ Video Extension
ต้องการ Reference-driven Generation
ต้องการ API Integration
ต้องการ Production Pipeline ที่ใช้ Veo อยู่แล้ว
เลือก Omni เมื่อ
ต้องการสร้างแล้วคุยแก้ต่อ
เปลี่ยน Camera ด้วย Prompt
ลบ Object
เปลี่ยน Character
เปลี่ยน Scene
ใช้ Input หลายรูปแบบ
ต้องการ Multi-turn Editing
โดย Gemini Apps ปัจจุบันกำลังเน้น Workflow แบบนี้เป็นหลัก
รู้ก่อนว่า Video ต้องการสื่ออะไร
16:9 หรือ 9:16
ถ้าต้องรักษา Character/Product
กำหนด Subject, Action, Camera และ Audio
ใช้ Video Editor หากต้องการ Timeline/Audio ที่แม่นยำ
ตัวหลักคืออะไร
กำลังทำอะไร
อยู่ที่ไหน
Shot ไหน
กล้องเคลื่อนอย่างไร
แสงแบบไหน
มีเสียงอะไร
16:9 หรือ 9:16
ต้องใช้หรือไม่
จำเป็นหรือไม่
ตรวจ
ใบหน้า
มือ
Movement
Physics
Camera
Shadow
Reflection
เสียง
Dialogue
Lip Sync
Text
Product Details
ก่อนเผยแพร่
แม้โมเดลจะมีคุณภาพสูง แต่ยังสามารถเกิด
คนเปลี่ยนหน้า
มือผิด
วัตถุเปลี่ยนรูป
Text ผิด
Physics ผิด
เสียงแปลก
Dialogue ไม่ตรง
Lip Sync ไม่สมบูรณ์
ได้
ดังนั้น Human Review ยังจำเป็น
ควรใช้เฉพาะ Reference ที่คุณมีสิทธิใช้งาน
ต้องระวัง
Copyright
Privacy
Publicity Rights
Trademark
และไม่ควรใช้เพื่อสร้าง Content ที่ทำให้คนเข้าใจผิดหรือสร้างความเสียหาย
การมี AI สร้าง Output ไม่ได้ทำให้สิทธิของเจ้าของต้นฉบับหายไป
Google ใช้ SynthID สำหรับ Content ที่สร้างด้วย Generative AI หลายประเภท รวมถึง Video เพื่อช่วยระบุ AI-generated Content
SynthID เป็น Digital Watermark ซึ่งไม่ได้หมายความว่าจะมี Logo ขนาดใหญ่ติดอยู่บนภาพ
ขึ้นอยู่กับ Surface ที่ใช้
Gemini
Flow
Gemini API
Vertex AI
Google Vids
แต่ละช่องทางมี
Plan
Quota
Credit
และ Pricing
แตกต่างกัน
ดังนั้นไม่ควรจำตัวเลขจากช่องทางหนึ่งไปใช้กับทุกบริการ
Veo 3.1 คือโมเดล Video Generation ของ Google DeepMind ที่รองรับ Text-to-Video, Image-to-Video และ Native Audio พร้อม Creative Control ระดับสูง
ได้ รองรับเสียงที่สร้างแบบ Native พร้อม Video เช่น Dialogue, Sound Effects และ Ambient Audio
Gemini API ปัจจุบันรองรับ 720p, 1080p และ 4K ใน Workflow ที่รองรับ
Base Generation ใน Gemini API ปัจจุบันคือ 8 วินาที
ได้ Veo 3.1 รองรับ Video Extension เพิ่มครั้งละประมาณ 7 วินาที และสามารถต่อซ้ำได้ภายใต้ข้อจำกัดปัจจุบัน
ได้ First/Last Frame Generation เป็นความสามารถเฉพาะของ Veo 3.1 ใน Gemini API ปัจจุบัน
Gemini API ปัจจุบันรองรับ Reference Images สูงสุด 3 รูปสำหรับ Image-based Direction
ได้ Veo 3.1 รองรับ Portrait 9:16 และ Landscape 16:9 ใน Workflow ที่รองรับ
ได้ใน Ecosystem ของ Gemini โดยเฉพาะ Gemini API และในช่วงต้นปี 2026 Veo 3.1 ถูกใช้งานใน Gemini App โดยตรง แต่ Gemini Apps Help ล่าสุดในเดือนสิงหาคม 2026 ระบุ Gemini Omni เป็นโมเดล Video Generation ล่าสุดของ App
เพราะ UI และโมเดลเบื้องหลังเปลี่ยนได้ ปัจจุบัน Gemini Apps ระบุ Gemini Omni เป็น Latest Video Generator จึงไม่ควรคาดหวังว่าจะมีปุ่มชื่อ Veo 3.1 ในทุกบัญชี
ใช้ Gemini API ซึ่ง Google มีเอกสารและ Model สำหรับ Veo 3.1 โดยตรง หรือใช้ Surface อื่นของ Google ที่รองรับ Veo เช่น Flow
ไม่เหมือนกัน Veo เป็น Video Generation Model Family ส่วน Omni เป็น Video Creation/Editing Model รุ่นใหม่ที่ Gemini Apps ใช้ในปัจจุบัน โดยเด่นด้าน Multimodal และ Conversational Editing
Veo 3.1 คือ โมเดลสร้างวิดีโอระดับสูงของ Google DeepMind ที่เน้น
Text-to-Video
Image-to-Video
Native Audio
Prompt Adherence
Realism
Reference Images
First/Last Frame
Video Extension
9:16 และ 16:9
และใน Gemini API ปัจจุบันสามารถสร้าง Video ความยาวพื้นฐาน 8 วินาทีที่ 720p, 1080p หรือ 4K ใน Configuration ที่รองรับ
หากต้องการเริ่มสร้าง Video ด้วย Veo Prompt สามารถใช้สูตร
Subject + Action + Scene + Camera + Movement + Lighting + Style + Audio
เช่น
“สร้างวิดีโอ Cinematic Photorealistic ของรถสปอร์ตสีดำวิ่งผ่านโตเกียวตอนกลางคืนหลังฝนตก ใช้ Low-angle Tracking Shot พร้อมเสียงเครื่องยนต์ เสียงยางและเสียงฝน”
สำหรับการใช้งานใน Gemini ต้องแยกสถานการณ์ตามช่วงเวลาให้ชัด
ต้นปี 2026: Google นำ Veo 3.1 และ Ingredients to Video เข้าสู่ Gemini App โดยตรง
ข้อมูลล่าสุดเดือนสิงหาคม 2026: Gemini Apps Help ระบุ Gemini Omni เป็นโมเดล Video Creation และ Editing รุ่นล่าสุดของ Gemini Apps
ดังนั้นถ้าเปิด Gemini วันนี้แล้วไม่เห็นคำว่า
Veo 3.1
ไม่ควรสรุปว่า Feature หาย
ให้เข้า
Gemini → Videos / Create video
และใช้ Video Generator ที่บัญชีปัจจุบันแสดง
แต่ถ้าต้องการ Veo 3.1 โดยเฉพาะ เช่น ต้องการ
First/Last Frame
Video Extension
Reference Images
1080p/4K
หรือ API Integration
สามารถใช้ Veo 3.1 ผ่าน Gemini API ได้โดยตรง ซึ่ง Google ยังคงมีเอกสารและ Model สำหรับ Veo 3.1 อย่างชัดเจน
สรุปให้จำง่ายที่สุดคือ
Veo 3.1 = โมเดลสร้างวิดีโอของ Google DeepMind ที่เด่นด้าน Cinematic Generation, Native Audio และ Production Control
ส่วน
Gemini Omni = Video AI รุ่นใหม่ใน Gemini Apps ที่เด่นด้านการสร้างและแก้วิดีโอแบบสนทนา
ทั้งสองจึงไม่ได้เป็นคู่แข่งที่ต้องเหลือเพียงตัวเดียว แต่เป็นส่วนต่าง ๆ ของ Ecosystem Video AI ของ Google และควรเลือกใช้ตาม Workflow ที่ต้องการ