GPT
O

OpenSora-VAE-v1.2

קוד פתוח

hpcai-techapache-2.02024-06-17

  • transformers
  • safetensors
  • VideoAutoencoderPipeline
  • endpoints_compatible

זה רכיב דחיסה ושחזור וידאו שחוסך משאבים בצינור היצירה. מורידים אותו כשבונים מודלי וידאו ורוצים לעבוד במרחב הלטנטי במקום על פיקסלים גולמיים.

  • 393Mפרמטרים
  • 1.5 GBמשקל הקבצים
  • 2,820הורדות בחודש
  • 57לייקים

מה זה

מדובר באוטואנקודר שמיועד לעיבוד וידאו, ומכיל כ־393 מיליון פרמטרים בדיוק float32. הוא לא מייצר סרטונים מטקסט בעצמו, אלא דוחס פריימים למרחב ייצוג קומפקטי ומשחזר אותם חזרה לתמונה מלאה. הרכיב הזה שוחרר כחלק מגרסה 1.2 של פרויקט Open-Sora הפתוח.

הגודל שלו, כ־1.5 גיגה בייט בלבד, הופך אותו לחלק קל יחסית במערך יצירת וידאו, שבו מודלי הדיפוזיה עצמם כבדים בהרבה. במקום להמציא מנגנון קידוד וידאו מאפס, מקבלים פה בלוק מוכן שמותאם לעבודה רציפה על פני זמן ומאפשר לאמן מודלים על גבי ייצוגים יעילים.

מתאים ל

  • דחיסת פריימים לאימון

    המרת קובצי וידאו גולמיים לייצוג לטנטי קומפקטי כדי לחסוך זיכרון ומשאבי חישוב באימון מודלים.

  • שחזור פלט מדיפוזיה

    פענוח המרחב הלטנטי חזרה לווידאו ברזולוציה מלאה בסוף תהליך היצירה של מודל הווידאו.

  • שילוב בפרויקט Open-Sora

    עבודה ישירה עם המשקולות הרשמיות של גרסה 1.2 בתוך הקוד המקורי של הפרויקט.

איפה זה נופל

זה רק VAE, לא מודל שלם ליצירת וידאו, ולכן אין מה לעשות איתו לבד בלי מודל דיפוזיה שמייצר את הלטנטים. מעבר לזה, הכרטיס לא מספק נתוני ביצועים, מדדי שחזור, רזולוציות נתמכות או קצב פריימים מקסימלי, כך שצריך לבדוק ידנית אם הדחיסה מייצרת עיוותים או מריחות בתנועה מהירה לפני שמשלבים אותו בעבודה רצינית.

שאלות
נפוצות

אפשר לייצר עם המודל הזה סרטון ישירות מטקסט?

לא. זה רק רכיב שמקודד ומשחזר וידאו קיים, ואין לו שום הבנה של טקסט או יכולת ליצור תוכן חדש בלי מודל דיפוזיה תומך.

צריך מחשב חזק במיוחד כדי להפעיל אותו?

לא עבור הרכיב הזה לבדו. הקבצים שוקלים 1.5 גיגה בייט בלבד, כך שכל חומרה סבירה עם כרטיס מסך בסיסי תספיק להרצה מקומית.

איך מריצים

המשקל הכולל יושב על 1.5 גיגה בייט בארבעה קבצים, כך שכל כרטיס מסך מודרני פשוט עם כמה גיגות בודדות של זיכרון יטען אותו בלי בעיה. ההתקנה דורשת משיכה ישירה של מאגר opensora מגיטהאב, ולאחר מכן טוענים את VideoAutoencoderPipeline ישירות עם המזהה מהרשת.

אם אתם רק רוצים לבדוק איך הדור השלם של הווידאו נראה בלי לגעת בקוד או להרים שרת, יש להם דמו ב־Gradio. מי שבונה מנוע הפקה או מאמן מודל דיפוזיה עצמאי חייב להריץ את הבלוק הזה אצלו מקומית כחלק מהצינור.

from transformers import pipeline

pipe = pipeline("text-generation", model="hpcai-tech/OpenSora-VAE-v1.2")
print(pipe("שלום"))

הקבצים

4 קבצים במאגר, 1.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל פיתוח מסחרי והפצה במוצרים סגורים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗