GPT
L

lingbot-video-moe-30b-a3b

קוד פתוח

robbyantapache-2.02026-07-08

  • diffusers
  • safetensors

מודל פתוח ליצירת וידאו שמכוון לתנועה פיזיקלית ואינטראקציה בעולם האמיתי. ארכיטקטורת מומחים מקצרת את זמני הריצה ומציגה ציונים מובילים במשימות רובוטיקה מורכבות.

  • 30Bפרמטרים
  • 121 GBמשקל הקבצים
  • 14,295הורדות בחודש
  • 133לייקים

מה זה

במקום להתמקד רק באסתטיקה קולנועית, האימון כאן התבסס על מעל שבעים אלף שעות של תוכן מעוגן פיזיקה לצד סרטוני רשת רגילים. השילוב הזה נותן תוצאות עקביות יותר באינטראקציות של זרועות רובוטיות, הולכים על ארבע ודמויות אנושיות, כפי שמשתקף בציון המוביל במבחן RBench מול מודלים פתוחים וסגורים כאחד.

המבנה של המודל מחלק שלושים מיליארד פרמטרים לרשת מומחים שבה רק חלק קטן מופעל בכל צעד. החלוקה הזו מאיצה את מהירות ההסקה פי שלושה בהשוואה למודלים מלאים בגודל דומה, ומספקת יכולות של הפיכת טקסט או תמונה לסרטון מלא יחד עם שלב חידוד ייעודי לשיפור פרטים.

מתאים ל

  • סימולציה לרובוטיקה

    אימון ובדיקה של תנועות מורכבות בזכות ציונים גבוהים בתנועת זרועות והולכים על ארבע.

  • הנפשת תמונות מוצר

    יצירת סרטוני הדגמה מתמונה בודדת ששומרים על גבולות פיזיקליים של תנועה במרחב.

  • הפקת וידאו מובנה

    בניית צינורות תוכן אוטומטיים שמסתמכים על קלט מוגדר היטב ולא על טקסט חופשי.

איפה זה נופל

הנקודה הרגישה ביותר היא שהמודל לא מבין פרומפטים רגילים בשפה חופשית. חייבים להריץ שכתוב דו שלבי למבנה JSON מורכב כדי לקבל תוצאות טובות, מה שמוסיף עיכוב וסיבוך לכל קריאה. בנוסף, בתוצאות הבנצ'מרק רואים ביצועים חלשים יותר בתרחישים שמכילים ריבוי ישויות עצמאיות במקביל, שם הציון יורד משמעותית לעומת המשימות האחרות.

שאלות
נפוצות

אפשר להריץ אותו על מחשב פיתוח רגיל עם כרטיס בודד?

לא מומלץ למודל המלא. המשקל הכולל דורש כמות זיכרון עצומה שלא נכנסת בכרטיסים ביתיים, ולכן תצטרכו שרת מרובה מעבדים גרפיים או שתעברו לגרסת הבסיס הקטנה יותר.

אפשר פשוט לשלוח לו טקסט רגיל ולקבל וידאו?

לא ישירות. המודל בנוי לקבל תיאור מובנה בפורמט JSON, ולכן חובה להעביר את הטקסט של המשתמש דרך מודל שפה מקדים שמנסח אותו מחדש יחד עם הגדרת הנחיות שלילה מותאמות.

איך מריצים

המשקל הכולל של הקבצים עומד על מאה עשרים ואחד גיגה בייט, מה שמחייב זיכרון מערכת נרחב רק כדי לטעון אותם לפני החלוקה בין כרטיסים. להרצה מלאה תצטרכו שרת מרובה כרטיסי מסך חזקים עם תמיכה בפיצול זיכרון ועיבוד מבוזר, או שימוש בסביבת ההסקה הייעודית של SGLang כדי לעבוד בפורמט שמונה ביט.

הצינור דורש שלב מקדים של שכתוב הפרומפט למבנה נתונים מוגדר דרך מודל שפה נפרד. אם אתם בונים רק בדיקת היתכנות מקומית בלי חומרת שרתים כבדה, עדיף בהרבה להשתמש בגרסת הדחיסה הקטנה יותר או לפנות לשרת מרוחק במקום לנסות להחזיק את כל המשקלים לבד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("robbyant/lingbot-video-moe-30b-a3b")
img = pipe("a photo").images[0]

הקבצים

63 קבצים במאגר, 121 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים נקודה אפס, שמאפשר שימוש מסחרי מלא, שינוי קוד והפצה פנימית או חיצונית במוצר שלכם. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים ומסמך הרישיון המקורי בקבצי החלוקה, בלי לשלם תמלוגים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗