GPT
B

ByteDance/Bernini-R

קוד פתוח

ByteDanceapache-2.02026-06-01

  • safetensors
  • bernini_renderer
  • image-text-to-video

מרנדר וידאו ותמונה שמיועד לעריכה מדויקת ומבוסס תכנון סמנטי. הוא פונה למי שרוצה לשנות תנועה או להחליף אלמנטים בווידאו קיים עם משקולות פתוחות לחלוטין.

  • 157 GBמשקל הקבצים
  • 115הורדות בחודש
  • 297לייקים

מה זה

הפיתוח הזה משמש כמרכיב הרינדור בתוך מסגרת עבודה רחבה יותר שמשלבת מודל שפה ויזואלי לתכנון ומודל דיפוזיה מבוסס DiT ליצירה. הוא נשען על מודל הבסיס Wan2.2-T2V-A14B ומכיל סטים של משקולות לרמות רעש שונות. התפקיד שלו הוא לקחת הנחיות טקסט, תמונות מקור או וידאו, ולייצר פלט ערוך לפי סוגי משימות מוגדרים מראש.

החוזק העיקרי כאן הוא עריכת וידאו ולא רק יצירה מאפס. התיעוד מציג מערך שבו בוחנים אנושיים דירגו עריכות בהשוואות עיוורות מול מודלים מסחריים סגורים, והתוצאות מציבות אותו ברף העליון בקטגוריית העריכה. המערכת יודעת להפריד בין עריכות ששומרות על התנועה המקורית של האובייקט לבין שינויים שמכתיבים תנועה חדשה לגמרי, לצד היכולת להלביש פריט מתמונת רפרנס ישירות לתוך הווידאו.

מתאים ל

  • עריכת וידאו מונחית רפרנס

    החלפת פריטי לבוש או מוצרים בווידאו קיים לפי תמונת מוצר מדויקת.

  • שינוי תנועה בסרטון

    שינוי פעולת הדמות המקורית, כמו מעבר מעמידה לכריעה, באותה סצנה.

  • שתילת אלמנטים בסצנה

    הוספת דמויות או עצמים לתוך וידאו מצולם תוך שמירה על הרקע.

איפה זה נופל

ההפעלה שלו מסורבלת ומחייבת כמעט תמיד תלות במודל שפה חיצוני לצורך שיפור הפרומפטים כדי להגיע לתוצאות טובות. מעבר לדרישות החומרה הקיצוניות של שמונה מעבדים גרפיים לווידאו, ברירת המחדל מוציאה רזולוציה בסיסית של 480p בקצב של 16 פריימים לשנייה, כך שכל ניסיון לעלות ל־720p דורש משאבים כבדים בהרבה ומגדיל את זמני הרינדור. בנוסף, חובה להגדיר ידנית את סוג המשימה וההנחיה המתאימה כדי שהאלגוריתם יבין אם לשמור על תנועת הסובייקט או לשנות אותה.

שאלות
נפוצות

האם אפשר להריץ יצירת וידאו על כרטיס גרפי ביתי אחד?

לא. יצירת וידאו דורשת הרצה מבוזרת על שמונה כרטיסים מקצועיים עם חלוקת רצף. כרטיס בודד מתאים בתיעוד רק להפקת תמונות בודדות.

האם המודל עובד בצורה עצמאית לחלוטין?

הוא יודע לעבוד לבד, אך המפתחים מציינים במפורש שאיכות התוצאות תלויה בחיבור ל־API חיצוני עם מודל ראייה שמרחיב ומשפר את הטקסט לפני הרינדור.

איך מריצים

משקל הקבצים הוא 157 גיגה בייט, כך שמדובר במפלצת שדורשת תשתית ייעודית וכבדה. המפתחים בדקו ופיתחו אותו על כרטיס H100 עם פייתון 3.11.2 וגרסאות ספציפיות מאוד של ספריות הדיפוזיה והלמידה. הפעלת משימות וידאו דורשת בפועל שרת עם שמונה כרטיסים ומקביליות מסוג Ulysses באמצעות VeOmni, בעוד תמונות בודדות יכולות לרוץ על כרטיס בודד.

אפשר להוריד את המשקולות בנפרד מעל הבסיס של Wan2.2 או לקחת גרסה מאוחדת בפורמט diffusers שחוסכת הורדות נוספות. אם אין לכם קלאסטר כזה בהישג יד, אין מה לנסות להרים אותו מקומית לפרויקט צדדי, ומוטב להמתין לשירותי ענן שיציעו גישה מנוהלת.

pip install -U huggingface_hub
hf download ByteDance/Bernini-R

הקבצים

44 קבצים במאגר, 157 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות שוחררו תחת רישיון Apache 2.0 המוכר. מותר להשתמש בהם לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗