GPT
O

Ovi

קוד פתוח

chetwinlow1apache-2.02025-09-30

  • ovi
  • safetensors
  • image-to-video
  • en

מודל שמייצר וידאו יחד עם סאונד מסונכרן מתמונות או טקסט. במקום להדביק אודיו בנפרד, הוא בונה את שני הערוצים במקביל עם ענף קול ייעודי.

  • 12Bפרמטרים
  • 65.2 GBמשקל הקבצים
  • 79הורדות בחודש
  • 299לייקים

מה זה

הפיתוח הזה מגיע ממהנדסים ב־Character AI ומשלב בין יצירת וידאו לסאונד מקורי בתהליך אחד. ענף הווידאו מבוסס על Wan2.2, וענף האודיו, שכולל 5 מיליארד פרמטרים, אומן מאפס על מאגרי שמע פנימיים. יחד עם רכיבים נוספים המערכת מגיעה לסך של כמעט 12 מיליארד פרמטרים. השילוב הזה מאפשר לייצר קליפים שבהם הדיבור והאפקטים הקוליים יושבים על התנועה בלי עריכה ידנית.

התוצר הסופי מגיע באורכים של חמש או עשר שניות בקצב של 24 פריימים לשנייה וברזולוציה מקורית של 960 על 960, עם תמיכה ביחסי תצוגה שונים כמו 16:9 או 9:16. המדידות מראות שרינדור של סרטון בסיסי בן 121 פריימים לוקח בין 40 שניות על שמונה כרטיסי מסך במקביל לבין כמעט שתי דקות וחצי על כרטיס יחיד עם פריקה למעבד. המשמעות היא שלא מדובר בכלי מהיר, אלא בכזה שמכוון לאיכות תוכן כבדה.

מתאים ל

  • הנפשת דמויות מדברות

    מייצר דיבור מסונכרן מתמונה וטקסט בזכות תגיות הדיבור המובנות וענף האודיו הייעודי.

  • סרטוני מוצר לאפליקציות

    מאפשר לייצר קליפים קצרים של עשר שניות ביחסי מסך מגוונים כולל סאונד מותאם ישירות מתמונת מוצר.

  • מחקר על שילוב מודלים

    הקוד פתוח לחלוטין ומציג ארכיטקטורה של מיזוג שני מודלים שונים לווידאו ולאודיו בו זמנית.

איפה זה נופל

הבעיה המרכזית כרגע היא הדרישות הטכניות הכבדות. זמני הרינדור ארוכים מאוד, וכרטיסי מסך ביתיים רגילים פשוט לא יחזיקו אותו ללא כימות ופריקה אגרסיבית למעבד שמאיטה את התהליך עוד יותר.

בנוסף, יצירת קול מבוסס דגימה עדיין אינה נתמכת והיא מופיעה ברשימת המשימות הפתוחות בלבד. אין סקריפטים לאימון עצמאי של המודל, והתמיכה בריצה מקבילית עדיין דורשת ייעול לפי המפתחים. הפורמט לטקסט קשיח למדי ומחייב תגיות מיוחדות לדיבור לצד תיאור סאונד בסוף הטקסט בלבד, כך שכל סטייה קטנה פוגעת בתוצאה.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי של 16 גיגה?

לא. הדרישה המינימלית ביותר היא 24 גיגה זיכרון בכרטיס מסך, וגם זה אפשרי רק באמצעות שימוש בכימות ל־fp8 או qint8 והפעלת פריקה למעבד. בפועל, לכרטיסים נפוצים פחות מזה אין מספיק מקום בזיכרון לטעון את המשקולות.

איך גורמים לדמות לדבר בסרטון?

הטקסט שמזינים למודל דורש מבנה ספציפי. את המילים שהדמות צריכה לומר סוגרים בין תגיות מיוחדות של אותיות גדולות, ואת תיאור רעשי הרקע או הסביבה כותבים בסוף המחרוזת לפי הפורמט המוגדר.

איך מריצים

כדי להריץ אותו מקומית תצטרכו לפחות 32 גיגה זיכרון בכרטיס המסך, וגם זה רק אם תפעילו פריקה לזיכרון המעבד. אם תרצו להריץ אותו ללא פריקה למעבד, תזדקקו לכרטיס עם 80 גיגה זיכרון. קיימות גרסאות בכימות ל־fp8 או qint8 שמאפשרות לרדת לנפח של 24 גיגה זיכרון בכרטיס מסך, אך הדבר גורר ירידה מסוימת באיכות התמונה.

יש תמיכה בממשק Gradio, הרצה מרובת כרטיסים באמצעות torchrun, ושילוב קיים בתוך ComfyUI. קבצי המשקולות שוקלים מעל 65 גיגה, וצריך להוריד בנפרד מקודדי VAE ומשקלי T5. אם אין לכם חומרה כבדה או ענן ייעודי עם A100 או H100, עדיף לבדוק אותו דרך הממשקים של HuggingFace Spaces או wavespeed.ai שמוזכרים בתיעוד.

pip install -U huggingface_hub
hf download chetwinlow1/Ovi

הקבצים

7 קבצים במאגר, 65.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. אין כאן הגבלת שימוש מסחרית מצד הרישיון עצמו, מה שמאפשר שילוב ישיר בתוך מוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗