GPT
L

Lumina-Image-2.0

קוד פתוח

Alpha-VLLMapache-2.02025-01-22

  • diffusers
  • safetensors
  • text-to-image

מודל גנרטיבי ליצירת תמונות מטקסט שמבוסס על ארכיטקטורת diffusion transformer. הוא מציע שילוב של דיוק ויעילות בנפח של 2.6 מיליארד פרמטרים.

  • 2.6Bפרמטרים
  • 29.5 GBמשקל הקבצים
  • 1,072הורדות בחודש
  • 374לייקים

מה זה

מדובר במודל שיוצר תמונות מתיאורי טקסט ונשען על ארכיטקטורת flow-based diffusion transformer. המפתחים שלו מציגים אותו כחלופה ממוקדת שמנסה לתת מענה שלם ויעיל ליצירת תמונות בלי להתנפח לממדי ענק של עשרות מיליארדי פרמטרים. הפרויקט הזה מבוסס ישירות על מאמר מחקרי רשמי שפורסם סביבו, והוא נבנה כך שיתממשק באופן טבעי עם ספריית diffusers המוכרת, מה שמקל מאוד על הבדיקה שלו בסביבות עבודה קיימות.

המשקל שלו עומד על 2.6 מיליארד פרמטרים, גודל ביניים שמנסה לאזן בין איכות ויזואלית לבין דרישות חישוב סבירות. המפרסמים לא שיתפו בכרטיס המודל תוצאות של מבחני ביצועים, מדדי איכות מספריים או השוואות ישירות מול מודלים מתחרים. המשמעות היא שאתם צריכים לבחון בעצמכם איך הוא מתמודד בפועל עם הבנת פרומפטים מורכבים והאם התוצאה הוויזואלית שלו עומדת ברף שאתם צריכים לפרויקט שלכם.

מתאים ל

  • יצירת תמונות מפרומפטים

    מתאים למי שרוצה לייצר תמונות מטקסט בעזרת מודל diffusion transformer בנפח של 2.6B פרמטרים.

  • אינטגרציה עם diffusers

    נוח לצוותים שכבר מחזיקים פייפליין מבוסס diffusers ורוצים לבדוק ארכיטקטורה חדשה בלי לשנות תשתית.

  • מחקר וניסויי יצירה

    רלוונטי לחוקרים שרוצים לבחון את המימוש של המאמר המקורי על חומרה מקומית או בשרת עצמאי.

איפה זה נופל

כרטיס המודל לקוני מאוד ולא חושף מגבלות ידועות, כשלים בהבנת טקסט או בעיות של דיוק באנטומיה ופרטים קטנים. אין בו גם מידע על תמיכה בשפות שאינן אנגלית, ולכן הנחת העבודה היא שעברית לא תעבוד כאן ישירות בלי תרגום מוקדם. מעבר לזה, חוסר הפירוט על נתוני האימון מחייב אתכם לבדוק טוב הטיות וסינוני תוכן לפני שמחברים אותו למערכת פעילה מול משתמשים.

שאלות
נפוצות

אפשר להריץ את המודל על מחשב נייד רגיל בלי כרטיס מסך ייעודי?

לא מומלץ לנסות בכלל. המודל דורש כמעט 30 גיגה-בייט של קבצים בזיכרון ועיבוד כבד שמחייב כרטיס מסך חזק. על מחשב רגיל בלי מעבד גרפי מתאים התהליך פשוט יקרוס מחוסר זיכרון.

יש דרך לבדוק את המודל בלי להוריד את כל המשקלים שלו?

כן, המפתחים העמידו שרת עם הדגמת Gradio פעילה בכתובת רשת ייעודית. אפשר להיכנס לדמו הזה ישירות מהדפדפן, לשלוח פרומפטים ולראות את איכות התמונות עוד לפני שמתחילים להוריד קבצים.

איך מריצים

כדי להריץ אותו אצלכם תצטרכו להוריד 29.5 גיגה-בייט של קבצים ולהשתמש בספריית diffusers של פייתון. נפח כזה דורש כרטיס מסך חזק עם זיכרון וידאו משמעותי, אחרת תיתקלו בצווארי בקבוק חמורים בטעינה וביצירת התמונות. אם אין לכם חומרה ייעודית כזו בענן או במחשב מקומי, שווה לבדוק את הדמו הרשמי של Gradio שהמפתחים העלו לשרת חיצוני, במקום להרים תשתית יקרה רק כדי לראות אם הוא מתאים לכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Alpha-VLLM/Lumina-Image-2.0")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד ושילוב שלו במוצרים סגורים. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗