GPT
L

Lance

קוד פתוח

bytedance-researchapache-2.02026-05-15

  • Lance
  • safetensors
  • multimodal
  • image-generation
  • video-generation

מודל מאוחד עם שלושה מיליארד פרמטרים שמייצר, עורך ומבין תמונות ווידאו באותה ארכיטקטורה. מתאים למי שחייב מודל פתוח אחד שעושה משימות מולטימודל מגוונות בלי להחזיק צבר מודלים כבד.

  • 28.7 GBמשקל הקבצים
  • 405הורדות בחודש
  • 1,060לייקים

מה זה

מדובר במודל שפותח כדי לרכז הבנה, יצירה ועריכה של תמונה ווידאו תחת מסגרת עבודה יחידה. במקום להחזיק מודל ייעודי ליצירת וידאו, מודל דיפוזיה נפרד לתמונות ומודל ויז'ואל נפרד לשאלות ותשובות, הוא מריץ את הכל ישירות. האימון שלו נעשה מאפס על גבי עד 128 מעבדי A100 בתהליך רב-שלבי, בלי להסתמך על שלד קיים.

היתרון המרכזי שלו הוא היחס בין הגודל לביצועים. במבחן DPG-Bench הוא משיג ציון כולל של 84.67, שגובר על SDXL שעומד על 74.65, וקרוב מאוד למודלים מאוחדים גדולים בהרבה כמו Janus-Pro-7B שקיבל 84.19. נקודת החוזק הבולטת שלו במדידות היא תפיסת יחסים בין אלמנטים (Relation) עם ציון של 93.38, גבוה מ־FLUX.1-dev שנעצר על 90.87. המשמעות בפועל היא שהוא עוקב יפה אחרי מיקומים וקשרים מורכבים בטקסט, למרות ממדיו הצנועים יחסית.

מתאים ל

  • עריכת תמונות מונחית טקסט

    מבצע שינויים ממוקדים בתמונות קיימות באמצעות הוראות כתובות, בלי צורך במודל אינפיינטינג ייעודי.

  • הפקת טיוטות וידאו קצרות

    יוצר קליפים קצרים של 480p ב־12 פריימים לשנייה שמתאימים לבדיקות רעיון מהירות וסטוריבורד.

  • תשאול משולב על וידאו

    מנתח סרטונים ומשיב על שאלות לגבי התוכן שלהם דרך משימת x2t_video באותו המודל.

איפה זה נופל

היוצרים מגדירים אותו כפרויקט מחקר ולא כמוצר מוגמר. הוא הוגבל באימון לייצור תמונות ברזולוציה של 768 על 768 פיקסלים, ווידאו ברזולוציה נמוכה של 480p בקצב של 12 פריימים לשנייה בלבד. אם המוצר שלכם דורש וידאו חלק ב־HD, הוא פשוט לא שם. איכות הפלט אינה יציבה ויורדת באופן מורגש ברגע שמנסים להפיק תנועות מורכבות או בעריכות מרובות שלבים. בנוסף, במבחן ה־DPG-Bench הוא קיבל ציון נמוך של 80.80 בקטגוריית Other, מה שמצביע על קושי בהבנת הנחיות שחורגות מפורמט התיאור הסטנדרטי.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס RTX 3090 או 4090?

לא. דרישת הסף של המפתחים היא כרטיס עם 40 גיגה-בייט VRAM לפחות. כרטיסים ביתיים עם 24 גיגה-בייט ייכשלו בהקצאת זיכרון.

באיזו שפה כדאי להזין את הפרומפטים?

באנגלית בלבד. דוגמאות הקוד והבנצ'מרקים מבוססים על אנגלית, והכרטיס מדגיש ששימוש בפורמט הדוגמאות הנתון הכרחי לקבלת תוצאות טובות.

האם הוא תומך בהמרת תמונה לווידאו?

עדיין לא. מפת המודל מציגה תמיכה ב־image-to-video כמשימה פתוחה שטרם שוחררה עבורו, לצד קוד הפיין-טיונינג שעדיין חסר.

איך מריצים

בשביל להריץ אותו צריך כרטיס מסך עם לפחות 40 גיגה-בייט של זיכרון גרפי, סביבת פייתון 3.10 ומעלה, CUDA 12.4 לפחות וספריית flash-attn. המשקל הכולל של הקבצים עומד על 28.7 גיגה-בייט והוא מחולק בפועל למשקלים של גרסת התמונות וגרסת הווידאו. ההרצה דורשת תסריטי Shell ייעודיים עם הגדרות ספציפיות למשימות יצירה או עריכה, או הפעלת ממשק Gradio מקומי.

אם אין לכם כרטיס תעשייתי זמין כמו A100, אין טעם לנסות להרים אותו על מחשב אישי רגיל. במקרה כזה עדיף לגשת לדמו שרץ בהאגינג פייס או לחכות לספק חיצוני שיציע גישת ענן במקום להסתבך עם התקנת ספריות ייעודיות.

pip install -U huggingface_hub
hf download bytedance-research/Lance

הקבצים

87 קבצים במאגר, 28.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. הוא מתיר שימוש מסחרי חופשי, שינוי קוד והפצה של המודל כחלק ממוצרים עצמאיים. הדרישה העיקרית היא שמירה על זכויות היוצרים והודעת הרישיון המקורית. המשמעות היא שאתם יכולים לשלב אותו בשרתים שלכם או באפליקציות פנימיות בלי חשש מתביעות רישוי, כל עוד עומדים בתנאי הקרדיט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗